{"id":1771,"date":"2025-03-01T16:19:55","date_gmt":"2025-03-01T19:19:55","guid":{"rendered":"https:\/\/portal7ia.com.br\/?p=1771"},"modified":"2025-03-01T16:21:34","modified_gmt":"2025-03-01T19:21:34","slug":"apresentando-mercury-o-primeiro-modelo-de-linguagem-grande-por-difusao-em-escala-comercial","status":"publish","type":"post","link":"https:\/\/portal7ia.com.br\/index.php\/2025\/03\/01\/apresentando-mercury-o-primeiro-modelo-de-linguagem-grande-por-difusao-em-escala-comercial\/","title":{"rendered":"Apresentando Mercury, o primeiro modelo de linguagem grande por difus\u00e3o em escala comercial"},"content":{"rendered":"\n<h2 class=\"wp-block-heading\">Veja essa publica\u00e7\u00e3o da Inception, falando sobre os dLLMs.<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Treinamos modelos de linguagem grandes por difus\u00e3o que s\u00e3o at\u00e9 10 vezes mais r\u00e1pidos e baratos do que os LLMs atuais, expandindo a fronteira da intelig\u00eancia e velocidade para modelos de linguagem.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Principais conclus\u00f5es<\/h2>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Estamos anunciando a fam\u00edlia Mercury de modelos de linguagem grandes por difus\u00e3o (dLLMs), uma nova gera\u00e7\u00e3o de LLMs que expande a fronteira da gera\u00e7\u00e3o de texto r\u00e1pida e de alta qualidade.<br><\/li>\n\n\n\n<li>Mercury \u00e9 at\u00e9 10 vezes mais r\u00e1pido do que os LLMs de fronteira otimizados para velocidade. Nossos modelos rodam a mais de 1000 tokens\/seg em NVIDIA H100s, uma velocidade anteriormente poss\u00edvel apenas com chips personalizados.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">O modelo de gera\u00e7\u00e3o de c\u00f3digo, Mercury Coder, est\u00e1 dispon\u00edvel para teste em um playground. Oferecemos aos clientes empresariais acesso a modelos de c\u00f3digo e generalistas atrav\u00e9s de uma API e implanta\u00e7\u00f5es locais.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Nossa Vis\u00e3o \u2014 LLMs de Pr\u00f3xima Gera\u00e7\u00e3o Impulsionados por Difus\u00e3o<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Os modelos de linguagem grandes atuais s\u00e3o auto-regressivos, o que significa que eles geram texto da esquerda para a direita, um token de cada vez. A gera\u00e7\u00e3o \u00e9 inerentemente sequencial \u2014 um token n\u00e3o pode ser gerado at\u00e9 que todo o texto que o precede tenha sido gerado \u2014 e gerar cada token requer a avalia\u00e7\u00e3o de uma rede neural com bilh\u00f5es de par\u00e2metros.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Empresas de LLMs de fronteira est\u00e3o apostando na computa\u00e7\u00e3o em tempo de teste para aumentar as capacidades de racioc\u00ednio e corre\u00e7\u00e3o de erros, mas gerar longos rastros de racioc\u00ednio tem como pre\u00e7o custos de infer\u00eancia exorbitantes e lat\u00eancia inutiliz\u00e1vel.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Uma mudan\u00e7a de paradigma \u00e9 necess\u00e1ria para tornar as solu\u00e7\u00f5es de IA de alta qualidade verdadeiramente acess\u00edveis.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Modelos de difus\u00e3o proporcionam tal mudan\u00e7a de paradigma. Estes modelos operam com um processo de gera\u00e7\u00e3o \u201cgrosseiro para fino\u201d, onde a sa\u00edda \u00e9 refinada a partir de ru\u00eddo puro ao longo de alguns passos de \u201cremo\u00e7\u00e3o de ru\u00eddo\u201d.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Como os modelos de difus\u00e3o n\u00e3o s\u00e3o restritos a considerar apenas a sa\u00edda anterior, eles s\u00e3o melhores em racioc\u00ednio e em estruturar suas respostas. E como os modelos de difus\u00e3o podem refinar continuamente suas sa\u00eddas, eles podem corrigir erros e alucina\u00e7\u00f5es.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Por estas raz\u00f5es, a difus\u00e3o impulsiona todas as solu\u00e7\u00f5es de IA mais proeminentes para gera\u00e7\u00e3o de v\u00eddeo, imagem e \u00e1udio, incluindo Sora, Midjourney e Riffusion. No entanto, as aplica\u00e7\u00f5es da difus\u00e3o a dados discretos, como texto e c\u00f3digo, nunca foram bem-sucedidas. At\u00e9 agora.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Mercury Coder \u2014 Intelig\u00eancia de Fronteira a Mais de 1000 Tokens por Segundo<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Mercury Coder<\/strong> expande a fronteira das capacidades de IA: \u00e9 5 a 10 vezes mais r\u00e1pido do que a gera\u00e7\u00e3o atual de LLMs, fornecendo respostas de alta qualidade a baixos custos.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Nosso trabalho se baseia em pesquisas inovadoras de nossos fundadores \u2013 que foram pioneiros nos primeiros modelos de difus\u00e3o para imagens \u2013 e que co-inventaram t\u00e9cnicas essenciais de IA generativa, como Otimiza\u00e7\u00e3o Direta de Prefer\u00eancia, Flash Attention e Decision Transformers.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Um dLLM \u00e9 um substituto direto para um LLM auto-regressivo t\u00edpico, suportando todos os seus casos de uso, incluindo RAG, uso de ferramentas e fluxos de trabalho agentivos.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Quando solicitado com uma consulta, em vez de produzir a resposta um token de cada vez, a resposta \u00e9 gerada de forma grosseira para fina. Melhorias s\u00e3o sugeridas por uma rede neural \u2013 no nosso caso, um modelo Transformer \u2013 que \u00e9 treinada em grandes quantidades de dados para melhorar globalmente a qualidade da resposta, modificando v\u00e1rios tokens em paralelo.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Mercury Coder<\/strong> \u00e9 um dLLM especificamente otimizado para gera\u00e7\u00e3o de c\u00f3digo. Quando avaliado em benchmarks de codifica\u00e7\u00e3o padr\u00e3o, <strong>Mercury Coder<\/strong> atinge excelente qualidade em in\u00fameros benchmarks, muitas vezes superando o desempenho de modelos auto-regressivos otimizados para velocidade como GPT-4o Mini e Claude 3.5 Haiku, sendo at\u00e9 10 vezes mais r\u00e1pido.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">O que diferencia os dLLMs \u00e9 a sua velocidade. Enquanto mesmo os modelos auto-regressivos otimizados para velocidade rodam no m\u00e1ximo a 200 tokens por segundo, podemos servir <strong>Mercury Coder<\/strong> em NVIDIA H100s comuns a velocidades de mais de 1000 tokens por segundo, um aumento de 5x.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Comparado com alguns modelos de fronteira, que podem rodar a menos de 50 tokens por segundo, oferecemos uma acelera\u00e7\u00e3o de mais de 20X.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">A taxa de transfer\u00eancia alcan\u00e7ada por dLLMs era anteriormente alcan\u00e7\u00e1vel apenas usando hardware especializado, como Groq, Cerebras e SambaNova. Nossas melhorias algor\u00edtmicas s\u00e3o ortogonais \u00e0 acelera\u00e7\u00e3o de hardware e os ganhos de velocidade se somariam em chips mais r\u00e1pidos.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Compara\u00e7\u00e3o de velocidade; Tokens de sa\u00edda por segundo; Carga de trabalho de codifica\u00e7\u00e3o<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Tamb\u00e9m estamos entusiasmados em relatar que desenvolvedores preferem as conclus\u00f5es de c\u00f3digo do Mercury em compara\u00e7\u00e3o com os modelos de c\u00f3digo existentes. Quando comparado no Copilot Arena, (<a href=\"https:\/\/lmarena.ai\/?leaderboard\">https:\/\/lmarena.ai\/?leaderboard<\/a>), <strong>Mercury Coder Mini<\/strong> est\u00e1 empatado em segundo lugar, superando o desempenho de modelos otimizados para velocidade como GPT-4o Mini e Gemini-1.5-Flash e at\u00e9 mesmo de modelos maiores como GPT-4o.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Ao mesmo tempo, \u00e9 o modelo mais r\u00e1pido, cerca de 4 vezes mais r\u00e1pido que o GPT-4o Mini. Convidamos voc\u00ea a explorar as capacidades de nossos modelos em primeira m\u00e3o em nosso playground(<a href=\"https:\/\/chat.inceptionlabs.ai\">https:\/\/chat.inceptionlabs.ai<\/a>), hospedado em parceria com a Lambda Labs. Experimente a precis\u00e3o do <strong>Mercury Coder<\/strong> na gera\u00e7\u00e3o de c\u00f3digo de alta qualidade em uma fra\u00e7\u00e3o do tempo.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">O que isso significa para as aplica\u00e7\u00f5es de IA<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Nossos primeiros clientes, que incluem l\u00edderes de mercado em \u00e1reas como suporte ao cliente, gera\u00e7\u00e3o de c\u00f3digo e automa\u00e7\u00e3o empresarial, est\u00e3o substituindo com sucesso modelos base auto-regressivos padr\u00e3o por nossos dLLMs como substitutos diretos. Isso se traduz em melhores experi\u00eancias de usu\u00e1rio e custos reduzidos.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Em aplica\u00e7\u00f5es sens\u00edveis \u00e0 lat\u00eancia, nossos parceiros eram frequentemente limitados a usar modelos menores e menos capazes para atender aos requisitos rigorosos de lat\u00eancia. Gra\u00e7as ao desempenho superior dos dLLMs, esses parceiros agora podem usar modelos maiores e mais capazes, mantendo seus requisitos originais de custo e velocidade.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Oferecemos acesso aos nossos modelos atrav\u00e9s de uma API e via implanta\u00e7\u00f5es locais. Nossos modelos s\u00e3o totalmente compat\u00edveis com hardware, conjuntos de dados e pipelines de ajuste fino supervisionado (SFT) e alinhamento (RLHF) existentes. Suporte para ajuste fino est\u00e1 dispon\u00edvel para ambas as op\u00e7\u00f5es de implanta\u00e7\u00e3o.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">O que vem a seguir?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Mercury Coder<\/strong> \u00e9 o primeiro de uma s\u00e9rie de pr\u00f3ximos dLLMs. Um modelo projetado para aplica\u00e7\u00f5es de chat est\u00e1 em beta fechado.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Modelos de linguagem de difus\u00e3o desbloquear\u00e3o um novo conjunto de capacidades para LLMs, incluindo:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Agentes aprimorados<\/strong> \u2014 A velocidade e efici\u00eancia dos dLLMs os tornam ideais para aplica\u00e7\u00f5es agentivas que requerem planejamento extensivo e gera\u00e7\u00e3o longa.<\/li>\n\n\n\n<li><strong>Racioc\u00ednio avan\u00e7ado<\/strong> \u2014 dLLMs podem alavancar a corre\u00e7\u00e3o de erros para corrigir alucina\u00e7\u00f5es e melhorar as respostas, pensando ainda em segundos, ao contr\u00e1rio dos atuais modelos de racioc\u00ednio auto-regressivos que levam minutos.<\/li>\n\n\n\n<li><strong>Gera\u00e7\u00e3o control\u00e1vel<\/strong> \u2014 dLLMs podem editar sua sa\u00edda e gerar tokens em qualquer ordem, permitindo que os usu\u00e1rios preencham texto, alinhem as sa\u00eddas com objetivos como seguran\u00e7a ou produzam sa\u00eddas que estejam em conformidade confi\u00e1vel com formatos especificados pelo usu\u00e1rio.<\/li>\n\n\n\n<li><strong>Aplica\u00e7\u00f5es de borda<\/strong> \u2013 Dada a sua efici\u00eancia, os dLLMs se destacam em ambientes com recursos limitados, como implanta\u00e7\u00f5es de borda em telefones e laptops.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Mercury Coder<\/strong> est\u00e1 dispon\u00edvel para testes em nosso playground.<br>VISITAR PLAYGROUND: <a href=\"https:\/\/chat.inceptionlabs.ai\/\">https:\/\/chat.inceptionlabs.ai\/<\/a><\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Refer\u00eancias:<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Comece por aqui: <a href=\"https:\/\/share.hsforms.com\/1GYg8v9p2SjGC-tTtTD23pAc5yjb\">https:\/\/share.hsforms.com\/1GYg8v9p2SjGC-tTtTD23pAc5yjb<\/a><br>PLAYGROUND: <a href=\"https:\/\/chat.inceptionlabs.ai\/\">https:\/\/chat.inceptionlabs.ai\/<\/a><\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><a href=\"https:\/\/x.com\/inceptionAILabs\">https:\/\/x.com\/inceptionAILabs<\/a><br><a href=\"https:\/\/www.linkedin.com\/company\/inception-labs-a\">https:\/\/www.linkedin.com\/company\/inception-labs-a<\/a><br><a href=\"https:\/\/bsky.app\/profile\/inceptionlabs.bsky.social\">https:\/\/bsky.app\/profile\/inceptionlabs.bsky.social<\/a><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Para obter acesso antecipado \u00e0 API e entre em contato atrav\u00e9s do email sales@inceptionlabs.ai para discutir como os dLLMs podem transformar suas aplica\u00e7\u00f5es AI.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Para ter acesso \u00e0 API, inscreva-se aqui: <a href=\"https:\/\/share.hsforms.com\/10qZzL8XjSbC3y8YmblLMeAc5yjb\">https:\/\/share.hsforms.com\/10qZzL8XjSbC3y8YmblLMeAc5yjb<\/a><\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<p class=\"has-small-font-size wp-block-paragraph\"><em>Pesquisa, Edi\u00e7\u00e3o, formata\u00e7\u00e3o e finaliza\u00e7\u00e3o:<\/em><br><em>Werney A. Lima, s\u00e1bado, 1 de mar\u00e7o de 2025 \u2013 16:11 (s\u00e1bado)<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Veja essa publica\u00e7\u00e3o da Inception, falando sobre os dLLMs. Treinamos modelos de linguagem grandes por difus\u00e3o que s\u00e3o at\u00e9 10 vezes mais r\u00e1pidos e baratos do que os LLMs atuais, expandindo a fronteira da intelig\u00eancia e velocidade para modelos de linguagem. Principais conclus\u00f5es O modelo de gera\u00e7\u00e3o de c\u00f3digo, Mercury Coder, est\u00e1 dispon\u00edvel para teste [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":1772,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[30,33],"tags":[169,542,543,10],"class_list":["post-1771","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-llms","category-news","tag-inovacao","tag-dllm","tag-inception","tag-inteligencia-artificial"],"blocksy_meta":[],"brizy_media":[],"_links":{"self":[{"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/posts\/1771","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/comments?post=1771"}],"version-history":[{"count":2,"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/posts\/1771\/revisions"}],"predecessor-version":[{"id":1774,"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/posts\/1771\/revisions\/1774"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/media\/1772"}],"wp:attachment":[{"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/media?parent=1771"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/categories?post=1771"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/tags?post=1771"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}