← Últimos artigos
🤖 machine learning

SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning

O artigo demonstra que o método padrão de SFT seguido de RL supera as recentes técnicas de políticas mistas, revelando que estudos anteriores apresentaram resultados enganosos devido a bugs de implementação em otimizadores e na agregação de perda.

Autores originais: Alexis Limozin, Eduard Durech, Torsten Hoefler, Imanol Schlag, Valentina Pyatkin

Publicado 2026-04-28
📖 4 min de leitura☕ Leitura rápida

Autores originais: Alexis Limozin, Eduard Durech, Torsten Hoefler, Imanol Schlag, Valentina Pyatkin

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Erro nos "Treinamentos de Gênios": Por que o método antigo era melhor do que pensávamos

Imagine que você está tentando ensinar uma criança a resolver problemas complexos de matemática. Existem duas formas principais de fazer isso:

  1. O Método Tradicional (SFT-then-RL): Primeiro, você dá a ela um livro de exercícios com todas as respostas explicadas passo a passo (isso é o SFT ou Supervised Fine-Tuning). A criança aprende o "caminho das pedras". Depois que ela já entende a lógica, você a deixa resolver problemas sozinha e só dá uma nota (um "joinha" ou uma "bronca") quando ela acerta ou erra (isso é o RL ou Reinforcement Learning).
  2. O Método "Moderno" (Mixed-Policy): Em vez de ensinar primeiro, você tenta misturar as duas coisas. Você dá o livro de respostas, mas ao mesmo tempo deixa ela tentar resolver sozinha, tentando aprender a teoria e a prática ao mesmo tempo.

Recentemente, muitos cientistas de Inteligência Artificial (IA) disseram: "Ei! O método moderno é muito melhor! O método tradicional é lento e deixa a IA limitada".

Mas este novo artigo acaba de descobrir que esses cientistas estavam enganados por um motivo muito bobo: eles estavam comparando o método moderno com um "aluno" (a IA) que estava sendo ensinado de forma errada!


O Problema: O "Professor com Defeito"

Os pesquisadores descobriram que as ferramentas de software que todo mundo usa para treinar essas IAs tinham dois "bugs" (erros de programação) escondidos. É como se o professor estivesse tentando ensinar a criança, mas:

  • O Erro do Caderno de Notas (Bug do Otimizador): Imagine que o professor pede para a criança fazer 10 contas. Mas, por um erro na caneta, o professor só consegue ler a primeira conta e ignora todas as outras 9. Ele acha que a criança aprendeu tudo baseado em apenas um exemplo. Isso faz com que o aprendizado inicial (o SFT) seja muito mais fraco do que deveria ser.
  • O Erro da Média de Notas (Bug da Agregação de Perda): Imagine que a criança faz uma prova com 1 questão difícil e outra com 10 questões fáceis. O professor, por erro, dá o mesmo peso para as duas. Ele não percebe que a criança teve muito mais trabalho na segunda parte. Isso bagunça a "lógica" de aprendizado da IA.

Resultado: Como o aprendizado inicial estava sendo feito com esses erros, a IA ficava "burra" logo de cara. Quando os cientistas comparavam o método moderno com esse método tradicional "bugado", o moderno parecia ganhar de lavada.


A Grande Revelação: O Método Simples Vence!

Quando os autores deste artigo corrigiram esses erros e deram um "professor perfeito" para o método tradicional, o jogo virou completamente.

  1. O Tradicional é o Campeão: O método de "primeiro aprender com exemplos e depois praticar sozinho" (SFT \rightarrow RL) superou todos os métodos modernos em testes de matemática.
  2. Eficiência de Combustível: O método tradicional não só é melhor, como é mais rápido e gasta menos energia (menos poder de processamento de computador).
  3. O "Atalho" de 50 Passos: Eles descobriram que, se a IA tiver um bom aprendizado inicial, você nem precisa de muito treino prático. Com apenas 50 passos de prática, ela já supera os métodos modernos que tentam fazer tudo ao mesmo tempo.

Resumo da Ópera

O artigo é um lembrete importante para o mundo da tecnologia: Às vezes, a solução não é inventar um método novo e complexo, mas sim garantir que o método simples que já conhecemos esteja sendo executado sem erros.

Os cientistas achavam que tinham descoberto uma nova forma de criar gênios, mas na verdade, eles só estavam comparando um método novo com um método antigo que estava com o "professor doente". Agora que o professor está curado, o método clássico voltou ao topo!

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →