{"id":687,"date":"2024-02-23T17:24:55","date_gmt":"2024-02-23T20:24:55","guid":{"rendered":"https:\/\/portal7ia.com.br\/?p=687"},"modified":"2024-03-08T11:05:07","modified_gmt":"2024-03-08T14:05:07","slug":"mixtral-8x7b","status":"publish","type":"post","link":"https:\/\/portal7ia.com.br\/index.php\/2024\/02\/23\/mixtral-8x7b\/","title":{"rendered":"Mixtral 8x7B"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">Este artigo \u00e9 uma tradu\u00e7\u00e3o do conte\u00fado do site oficial da Mistral AI.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Mistral AI continua sua miss\u00e3o de entregar os melhores modelos abertos \u00e0 comunidade de desenvolvedores.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Hoje, 11 de dezembro de 2023, a equipe tem o orgulho de lan\u00e7ar o <strong>Mixtral 8x7B<\/strong>, <strong>um modelo de mistura esparsa de especialistas (SMoE) de alta qualidade com pesos abertos.&nbsp;Licenciado sob Apache 2.0.&nbsp;Mixtral supera o Llama 2 70B na maioria dos benchmarks com infer\u00eancia 6x mais r\u00e1pida.&nbsp;\u00c9 o modelo aberto mais forte com uma licen\u00e7a permissiva e o melhor modelo geral em rela\u00e7\u00e3o \u00e0s compensa\u00e7\u00f5es custo\/desempenho.&nbsp;Em particular, ele corresponde ou supera o GPT3.5 na maioria dos benchmarks padr\u00e3o.<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Mixtral tem os seguintes recursos.<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Ele lida normalmente com um <strong>contexto de 32 mil tokens<\/strong>.<\/li>\n\n\n\n<li>Ele lida com ingl\u00eas, franc\u00eas, italiano, alem\u00e3o e espanhol.<\/li>\n\n\n\n<li>Mostra <strong>forte desempenho na gera\u00e7\u00e3o de c\u00f3digo<\/strong>.<\/li>\n\n\n\n<li>Ele pode ser ajustado em um modelo de seguimento de instru\u00e7\u00f5es que atinge uma pontua\u00e7\u00e3o de 8,3 no MT-Bench.<\/li>\n<\/ul>\n\n\n\n<h4 class=\"wp-block-heading\" id=\"pushing-the-frontier-of-open-models-with-sparse-architectures\">Empurrando a fronteira de modelos abertos com arquiteturas esparsas<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\">Mixtral \u00e9 uma rede esparsa de mistura de especialistas.&nbsp;\u00c9 um modelo somente decodificador onde o bloco feedforward escolhe um conjunto de 8 grupos distintos de par\u00e2metros.&nbsp;Em cada camada, para cada token, uma rede de roteadores escolhe dois desses grupos (os \u201cespecialistas\u201d) para processar o token e combinar sua sa\u00edda de forma aditiva.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Essa t\u00e9cnica aumenta o n\u00famero de par\u00e2metros de um modelo enquanto controla o custo e a lat\u00eancia, pois o modelo usa apenas uma fra\u00e7\u00e3o do conjunto total de par\u00e2metros por token.&nbsp;Concretamente, o Mixtral tem um total de <strong>46,7 bilh\u00f5es de par\u00e2metros<\/strong>, mas usa apenas <strong>12,9 bilh\u00f5es de par\u00e2metros<\/strong> por token.&nbsp;<strong>Portanto, ele processa entradas e gera sa\u00eddas na mesma velocidade e pelo mesmo custo que um modelo 12,9B<\/strong>.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>A Mixtral \u00e9 pr\u00e9-treinada com dados extra\u00eddos da Web aberta<\/strong> \u2013 treinamos especialistas e roteadores simultaneamente.<\/p>\n\n\n\n<h4 class=\"wp-block-heading\" id=\"performance\">Desempenho<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\">Comparamos o Mixtral com a fam\u00edlia Llama 2 e o modelo b\u00e1sico GPT3.5.&nbsp;Mixtral iguala ou supera Llama 2 70B, bem como GPT3.5, na maioria dos benchmarks.<\/p>\n\n\n\n<figure class=\"wp-block-image\"><img decoding=\"async\" src=\"https:\/\/mistral.ai\/images\/news\/mixtral-of-experts\/overview.png\" alt=\"Vis\u00e3o geral do desempenho\"\/><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Na figura a seguir, medimos a compensa\u00e7\u00e3o entre qualidade e or\u00e7amento de infer\u00eancia.&nbsp;<strong>Mistral 7B<\/strong> e <strong>Mixtral 8x7B<\/strong> pertencem a uma fam\u00edlia de modelos altamente eficientes em compara\u00e7\u00e3o com os modelos Llama 2.<\/p>\n\n\n\n<figure class=\"wp-block-image\"><img decoding=\"async\" src=\"https:\/\/mistral.ai\/images\/news\/mixtral-of-experts\/scaling.png\" alt=\"Dimensionamento de performances\"\/><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">A tabela a seguir fornece resultados detalhados da figura acima.<\/p>\n\n\n\n<figure class=\"wp-block-image\"><img decoding=\"async\" src=\"https:\/\/mistral.ai\/images\/news\/mixtral-of-experts\/open_models.png\" alt=\"Refer\u00eancias detalhadas\"\/><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Alucina\u00e7\u00f5es e preconceitos.&nbsp;<\/strong>Para identificar poss\u00edveis falhas a serem corrigidas por meio de ajuste fino\/modelagem de prefer\u00eancia, medimos o desempenho do modelo&nbsp;<em>base<\/em>&nbsp;em BBQ\/BOLD.<\/p>\n\n\n\n<figure class=\"wp-block-image\"><img decoding=\"async\" src=\"https:\/\/mistral.ai\/images\/news\/mixtral-of-experts\/bbq_bold.png\" alt=\"Refer\u00eancias BBQ BOLD\"\/><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Comparado ao Llama 2, o Mixtral apresenta menos vi\u00e9s no benchmark BBQ.&nbsp;No geral, o Mixtral exibe sentimentos mais positivos do que o Llama 2 no BOLD, com varia\u00e7\u00f5es semelhantes dentro de cada dimens\u00e3o.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Linguagem.&nbsp;<\/strong>Mixtral 8x7B domina franc\u00eas, alem\u00e3o, espanhol, italiano e ingl\u00eas.<\/p>\n\n\n\n<figure class=\"wp-block-image\"><img decoding=\"async\" src=\"https:\/\/mistral.ai\/images\/news\/mixtral-of-experts\/multilingual.png\" alt=\"Refer\u00eancias multil\u00edngues\"\/><\/figure>\n\n\n\n<h4 class=\"wp-block-heading\" id=\"instructed-models\">Modelos instru\u00eddos<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\">Lan\u00e7amos o<strong> Mixtral 8x7B Instruct<\/strong> junto com o <strong>Mixtral 8x7B<\/strong>.&nbsp;Este modelo foi otimizado por meio de ajuste fino supervisionado e otimiza\u00e7\u00e3o de prefer\u00eancia direta (DPO) para acompanhamento cuidadoso das instru\u00e7\u00f5es.&nbsp;No MT-Bench, atinge pontua\u00e7\u00e3o de 8,30, tornando-se o melhor modelo open source, com desempenho compar\u00e1vel ao GPT3.5.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Nota: Mixtral pode ser solicitado a proibir algumas sa\u00eddas da constru\u00e7\u00e3o de aplicativos que exigem um forte n\u00edvel de modera\u00e7\u00e3o, como exemplificado&nbsp;<a href=\"https:\/\/docs.mistral.ai\/platform\/guardrailing\">aqui<\/a>&nbsp;.&nbsp;Um ajuste de prefer\u00eancia adequado tamb\u00e9m pode servir a esse prop\u00f3sito.&nbsp;Lembre-se de que, sem esse aviso, o modelo apenas seguir\u00e1 as instru\u00e7\u00f5es fornecidas.<\/p>\n\n\n\n<h4 class=\"wp-block-heading\" id=\"deploy-mixtral-with-an-open-source-deployment-stack\">Implante o Mixtral com uma pilha de implanta\u00e7\u00e3o de c\u00f3digo aberto<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\">Para permitir que a comunidade execute Mixtral com uma pilha totalmente de c\u00f3digo aberto, enviamos altera\u00e7\u00f5es ao projeto vLLM, que integra kernels Megablocks CUDA para infer\u00eancia eficiente.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Skypilot permite a implanta\u00e7\u00e3o de endpoints vLLM em qualquer inst\u00e2ncia na nuvem.<\/p>\n\n\n\n<h4 class=\"wp-block-heading\" id=\"use-mixtral-on-our-platform\">Use Mixtral<\/h4>\n\n\n\n<p class=\"wp-block-paragraph\">Atualmente estamos usando Mixtral 8x7B por tr\u00e1s de nosso endpoint&nbsp;<em>mistral-small<\/em>&nbsp;, que est\u00e1&nbsp;<a href=\"https:\/\/mistral.ai\/news\/la-plateforme\/\">dispon\u00edvel em beta<\/a>&nbsp;.&nbsp;<a href=\"https:\/\/console.mistral.ai\/\">Registre-se<\/a>&nbsp;para obter acesso antecipado a todos os endpoints generativos e incorporados.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><\/p>\n\n\n\n<p class=\"has-small-font-size wp-block-paragraph\">_________<br><em>Fonte: https:\/\/mistral.ai\/news\/mixtral-of-experts\/<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Este artigo \u00e9 uma tradu\u00e7\u00e3o do conte\u00fado do site oficial da Mistral AI. Mistral AI continua sua miss\u00e3o de entregar os melhores modelos abertos \u00e0 comunidade de desenvolvedores. Hoje, 11 de dezembro de 2023, a equipe tem o orgulho de lan\u00e7ar o Mixtral 8x7B, um modelo de mistura esparsa de especialistas (SMoE) de alta qualidade [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":688,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[30],"tags":[90,89],"class_list":["post-687","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-llms","tag-mixtral","tag-open-source"],"blocksy_meta":[],"brizy_media":[],"_links":{"self":[{"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/posts\/687","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/comments?post=687"}],"version-history":[{"count":3,"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/posts\/687\/revisions"}],"predecessor-version":[{"id":777,"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/posts\/687\/revisions\/777"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/media\/688"}],"wp:attachment":[{"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/media?parent=687"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/categories?post=687"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/tags?post=687"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}