{"id":1625,"date":"2025-02-03T09:11:39","date_gmt":"2025-02-03T12:11:39","guid":{"rendered":"https:\/\/portal7ia.com.br\/?p=1625"},"modified":"2025-02-03T10:49:23","modified_gmt":"2025-02-03T13:49:23","slug":"jiayi-pan-reproduz-momento-aha-do-deepseek-por-apenas-30","status":"publish","type":"post","link":"https:\/\/portal7ia.com.br\/index.php\/2025\/02\/03\/jiayi-pan-reproduz-momento-aha-do-deepseek-por-apenas-30\/","title":{"rendered":"Jiayi Pan Reproduz &#8220;Momento Aha&#8221; do DeepSeek por Apenas $30"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">Veja o que Jiayi Pan disse no X:<\/p>\n\n\n\n<blockquote class=\"wp-block-quote is-layout-flow wp-block-quote-is-layout-flow\">\n<p class=\"wp-block-paragraph\"><em>&#8220;N\u00f3s reproduzimos o DeepSeek R1-Zero no jogo CountDown, e simplesmente funciona!&#8221;<\/em><\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><em>&#8220;Atrav\u00e9s do aprendizado por refor\u00e7o (RL), o modelo base de 3 bilh\u00f5es de par\u00e2metros desenvolve habilidades de auto-verifica\u00e7\u00e3o e busca por conta pr\u00f3pria.&#8221;<\/em><\/p>\n<\/blockquote>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<p class=\"wp-block-paragraph\">Em postagem posterior, afirma que foram necess\u00e1rias 10 horas de H100, somando o custo de <strong>$30<\/strong>.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Esta conquista n\u00e3o s\u00f3 democratiza o acesso a avan\u00e7os em IA, mas tamb\u00e9m lan\u00e7a luz sobre o poder do <em>aprendizado por refor\u00e7o<\/em> em modelos menores.<\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\">Momento Aha do DeepSeek-Rl-Zero<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Um fen\u00f4meno particularmente intrigante observado durante o treinamento do <em>DeepSeek-Rl-Zero<\/em> \u00e9 a ocorr\u00eancia de um <em>&#8220;momento aha&#8221;<\/em>.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Este momento ocorre em uma vers\u00e3o intermedi\u00e1ria do modelo. Durante esta fase, o DeepSeek-Rl-Zero aprende a <strong>dedicar mais tempo de pensamento<\/strong> a um problema, reavaliando sua abordagem inicial.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Esse comportamento n\u00e3o \u00e9 apenas um testemunho das crescentes habilidades de racioc\u00ednio do modelo, mas tamb\u00e9m um exemplo cativante de como o <em>aprendizado por refor\u00e7o<\/em> pode levar a resultados inesperados e sofisticados.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Este momento \u00e9 n\u00e3o apenas um <em>&#8220;momento aha&#8221;<\/em> para o modelo, mas tamb\u00e9m para os pesquisadores que observam seu comportamento.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Ele destaca o poder e a beleza do aprendizado por refor\u00e7o: em vez de ensinarmos explicitamente ao modelo como resolver um problema, simplesmente fornecemos os incentivos certos, e ele desenvolve autonomamente estrat\u00e9gias avan\u00e7adas de solu\u00e7\u00e3o de problemas.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">O <em>&#8220;momento aha&#8221;<\/em> serve como um lembrete poderoso do potencial do aprendizado por refor\u00e7o para <strong>desbloquear novos n\u00edveis de intelig\u00eancia<\/strong> em sistemas artificiais, abrindo caminho para modelos mais aut\u00f4nomos e adaptativos no futuro.<\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\">O Papel Crucial do Aprendizado por Refor\u00e7o<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">O <em>aprendizado por refor\u00e7o<\/em> (RL) tem se mostrado uma ferramenta poderosa para desenvolver habilidades avan\u00e7adas em modelos de linguagem.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Ao fornecer uma <em>fun\u00e7\u00e3o de recompensa bem definida<\/em> \u2014 como a corre\u00e7\u00e3o de respostas em tarefas matem\u00e1ticas ou l\u00f3gicas \u2014, o modelo aprende a ajustar suas respostas de forma aut\u00f4noma.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Isso permite que o modelo desenvolva um <strong>mon\u00f3logo interno<\/strong>, aprimorando habilidades de <em>autoverifica\u00e7\u00e3o<\/em> e refinamento de respostas.<\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\">A Aplica\u00e7\u00e3o Pr\u00e1tica no Jogo &#8220;Countdown&#8221;<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Jiayi Pan aplicou o aprendizado por refor\u00e7o ao jogo <em>&#8220;Countdown&#8221;<\/em>, um desafio matem\u00e1tico onde jogadores combinam n\u00fameros usando opera\u00e7\u00f5es aritm\u00e9ticas para atingir um n\u00famero alvo.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Devido \u00e0 natureza objetiva do jogo, em que h\u00e1 uma resposta correta clara, o modelo p\u00f4de receber <strong>sinais de recompensa precisos<\/strong>.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">O Processo de Treinamento<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">O processo de treinamento seguiu etapas espec\u00edficas:<\/p>\n\n\n\n<ol class=\"wp-block-list\">\n<li><strong>In\u00edcio com Sa\u00eddas Aleat\u00f3rias<\/strong>:<br>O modelo inicialmente gerava respostas incorretas ou sem sentido.<\/li>\n\n\n\n<li><strong>Desenvolvimento de Estrat\u00e9gias<\/strong>:<br>Gradualmente, come\u00e7ou a adotar t\u00e1ticas como <em>revis\u00e3o de passos<\/em> e <em>busca ativa<\/em> por solu\u00e7\u00f5es.<\/li>\n\n\n\n<li><strong>Evolu\u00e7\u00e3o Aut\u00f4noma<\/strong>:<br>Sem instru\u00e7\u00f5es expl\u00edcitas, o modelo passou a <em>autocorrigir-se<\/em>, refinando suas respostas at\u00e9 alcan\u00e7ar a solu\u00e7\u00e3o correta.<\/li>\n<\/ol>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h3 class=\"wp-block-heading\">Um Exemplo Ilustrativo<\/h3>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Usu\u00e1rio<\/strong>: &#8220;Usando os n\u00fameros 19, 36, 55 e 7, crie uma equa\u00e7\u00e3o que resulte em 65.&#8221;<\/li>\n\n\n\n<li><strong>Assistente<\/strong>:<br>&#8220;Vamos resolver passo a passo:<\/li>\n<\/ul>\n\n\n\n<ol class=\"wp-block-list\">\n<li>Subtraia 19 de 55: 55 &#8211; 19 = 36.<\/li>\n\n\n\n<li>Some 36: 36 + 36 = 72.<\/li>\n\n\n\n<li>Subtraia 7: 72 &#8211; 7 = 65. Portanto, a equa\u00e7\u00e3o \u00e9: <strong>(55 &#8211; 19) + 36 &#8211; 7 = 65.<\/strong><\/li>\n<\/ol>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\">Principais Descobertas e Implica\u00e7\u00f5es<\/h2>\n\n\n\n<ul class=\"wp-block-list\">\n<li><strong>Import\u00e2ncia do Tamanho do Modelo Base<\/strong>:<br>Modelos com <em>mais de 1,5 bilh\u00e3o de par\u00e2metros<\/em> come\u00e7aram a demonstrar habilidades avan\u00e7adas de racioc\u00ednio.<br>Modelos menores n\u00e3o alcan\u00e7aram o mesmo desempenho, destacando a import\u00e2ncia de um tamanho m\u00ednimo para emergir tais capacidades.<\/li>\n\n\n\n<li><strong>Versatilidade do Tipo de Modelo<\/strong>:<br>Tanto modelos base quanto modelos ajustados por instru\u00e7\u00f5es foram eficazes.<br>Embora os modelos ajustados por instru\u00e7\u00f5es aprendam mais rapidamente, ambos convergiram para n\u00edveis semelhantes de desempenho.<\/li>\n\n\n\n<li><strong>Independ\u00eancia do Algoritmo de Aprendizado por Refor\u00e7o<\/strong>:<br>O tipo espec\u00edfico de algoritmo de RL (como PPO, GRPO ou PRIME) n\u00e3o impactou significativamente os resultados.<br>O elemento crucial \u00e9 a aplica\u00e7\u00e3o do aprendizado por refor\u00e7o em si.<\/li>\n\n\n\n<li><strong>Adapta\u00e7\u00e3o \u00e0 Tarefa<\/strong>:<br>O modelo ajustou seu processo de racioc\u00ednio conforme a tarefa.<br>No <em>&#8220;Countdown&#8221;<\/em>, desenvolveu estrat\u00e9gias de busca e verifica\u00e7\u00e3o de solu\u00e7\u00f5es.<br>Em tarefas de multiplica\u00e7\u00e3o, dividiu problemas em etapas menores para facilitar a resolu\u00e7\u00e3o.<\/li>\n<\/ul>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\">O Futuro dos Modelos de Linguagem Pequenos e Especializados<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">As descobertas de Jiayi Pan t\u00eam implica\u00e7\u00f5es profundas para o futuro da IA.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Demonstram que modelos menores podem ser altamente eficazes em tarefas espec\u00edficas quando combinados com o aprendizado por refor\u00e7o.<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Isso abre caminho para o desenvolvimento de in\u00fameros modelos especializados, hiper ajustados para resolver problemas complexos em dom\u00ednios restritos, democratizando o acesso a tecnologias avan\u00e7adas de IA.<\/strong><\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<p class=\"wp-block-paragraph\">Esta conquista ressalta o poder do <em>open source<\/em> e como a colabora\u00e7\u00e3o e compartilhamento de conhecimento podem acelerar os avan\u00e7os na intelig\u00eancia artificial.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><\/p>\n\n\n\n<p class=\"has-small-font-size wp-block-paragraph\"><em><strong>Publica\u00e7\u00e3o no X<\/strong>:<br><a href=\"https:\/\/x.com\/jiayi_pirate\/status\/1882839370505621655?s=46\">https:\/\/x.com\/jiayi_pirate\/status\/1882839370505621655?s=46<\/a><\/em><\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<p class=\"has-small-font-size wp-block-paragraph\"><em>Pesquisa, Edi\u00e7\u00e3o, Formata\u00e7\u00e3o e Finaliza\u00e7\u00e3o:<br>Werney Lima, segunda-feira, 3 de fevereiro de 2025 &#8211; 08:07 hrs<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Veja o que Jiayi Pan disse no X: &#8220;N\u00f3s reproduzimos o DeepSeek R1-Zero no jogo CountDown, e simplesmente funciona!&#8221; &#8220;Atrav\u00e9s do aprendizado por refor\u00e7o (RL), o modelo base de 3 bilh\u00f5es de par\u00e2metros desenvolve habilidades de auto-verifica\u00e7\u00e3o e busca por conta pr\u00f3pria.&#8221; Em postagem posterior, afirma que foram necess\u00e1rias 10 horas de H100, somando o [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":1627,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[1,492],"tags":[169,156,10],"class_list":["post-1625","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-blog","category-deepseek","tag-inovacao","tag-tecnologia-2","tag-inteligencia-artificial"],"blocksy_meta":[],"brizy_media":[],"_links":{"self":[{"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/posts\/1625","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/comments?post=1625"}],"version-history":[{"count":1,"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/posts\/1625\/revisions"}],"predecessor-version":[{"id":1626,"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/posts\/1625\/revisions\/1626"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/media\/1627"}],"wp:attachment":[{"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/media?parent=1625"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/categories?post=1625"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/portal7ia.com.br\/index.php\/wp-json\/wp\/v2\/tags?post=1625"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}