← Últimos artigos
🤖 machine learning

RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training

Este artigo desafia a prática padrão de aplicar o aprendizado por reforço (RL) apenas após o ajuste fino supervisionado (SFT) ao demonstrar que integrar o RL mais cedo no pré-treinamento, otimizar a composição de dados e fundir os objetivos de RL com os de SFT pode aumentar efetivamente as capacidades de raciocínio e expandir as distribuições do modelo, preservando as habilidades gerais.

Autores originais: Rachit Bansal, Clara Mohri, Tian Qin, David Alvarez-Melis, Sham Kakade

Publicado 2026-06-04
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Rachit Bansal, Clara Mohri, Tian Qin, David Alvarez-Melis, Sham Kakade

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está treinando um aluno brilhante, mas bruto (o modelo de IA), para resolver problemas de matemática. Durante anos, a receita padrão consistiu em três etapas:

  1. Pré-treinamento: O aluno lê milhões de livros para aprender linguagem geral e fatos.
  2. SFT (Ajuste Fino Supervisionado): Um professor dá ao aluno um livro didático com problemas e suas respostas exatas e corretas, forçando o aluno a memorizar o caminho da solução.
  3. RL (Aprendizado por Reforço): O aluno é colocado em um jogo onde ganha pontos apenas por acertar a resposta final, incentivando-o a descobrir novas maneiras de resolver problemas por conta própria.

Este artigo questiona: Será que realmente temos que esperar até que o aluno tenha lido todos os livros e memorizado o livro didático antes de deixá-lo jogar o jogo?

Aqui está o que os pesquisadores descobriram, explicado de forma simples:

1. Você pode começar o jogo cedo

A regra padrão diz: "Espere até que o aluno esteja totalmente treinado antes de dar o jogo a ele". Os pesquisadores tentaram dar o jogo (RL) ao aluno enquanto ele ainda estava lendo seus primeiros capítulos (no início do pré-treinamento).

  • O Resultado: Funcionou surpreendentemente bem! Mesmo quando o aluno tinha lido apenas uma fração minúscula dos livros, jogar o jogo ajudou-o a resolver problemas matemáticos muito melhor do que apenas ler mais livros. Na verdade, jogar o jogo cedo foi frequentemente tão bom quanto esperar até o fim e fazer toda a rotina de "Ler → Memorizar → Jogar".

2. O "Jogo" é melhor quando você não tem um livro didático

Normalmente, a etapa de "Memorizar" (SFT) exige um livro didático com as respostas corretas. Mas e se você não tiver livros didáticos suficientes?

  • A Descoberta: Se você tiver apenas um ou dois exemplos de como resolver um problema, a etapa de "Memorizar" falha. Mas o "Jogo" (RL) prospera. O aluno aprende a explorar e encontrar soluções por conta própria sem precisar de um gabarito perfeito. O jogo é um professor muito mais forte quando você tem poucos exemplos.

3. O ingrediente secreto é o Tipo de Livros, não o Tamanho do Aluno

As pessoas costumam pensar: "Se o aluno for maior (mais poderoso), ele aprenderá melhor". Os pesquisadores testaram isso tornando o aluno maior.

  • A Reviravolta: Tornar o aluno maior não o ajudou a aprender o jogo mais rápido. No entanto, dar a ele mais livros de matemática especificamente durante sua fase inicial de leitura ajudou.
  • A Lição: Se você quer que o aluno seja bom em matemática, alimente-o com histórias de matemática desde cedo. O conteúdo do que eles leem importa mais do que o tamanho do seu céreamente.

4. O Mito do "Aprimoramento" vs. "Expansão"

Existe um debate recente: O "Jogo" (RL) apenas torna as respostas existentes do aluno mais afiadas e confiantes, ou ele realmente ensina novas maneiras de pensar?

  • A Visão Antiga: Muitos pensavam que o RL apenas "afiava" o aluno, tornando-o confiante, mas não necessariamente mais inteligente.
  • A Nova Descoberta: Os pesquisadores descobriram que o efeito de "afiar" acontece, na verdade, devido à etapa de "Memorizar" (SFT). Quando você força um aluno a memorizar um livro didático primeiro, ele para de explorar.
  • A Real Magia: Se você deixar o aluno jogar o jogo diretamente sem memorizar o livro didático primeiro, ele realmente expande seu pensamento. Ele tenta muitos caminhos diferentes e descobre novas soluções que nunca conheceu antes. A etapa de "Memorizar" é o que realmente limita sua criatividade, não o jogo em si.

5. A Receita do "Super-Aluno"

Os pesquisadores combinaram o melhor de ambos os mundos. Em vez de fazer "Memorizar" e depois "Jogar", eles fizeram o aluno fazer ambos ao mesmo tempo.

  • Como funciona: Imagine o aluno resolvendo um problema. Uma parte do seu cérebro está checando o livro didático (SFT) e outra parte está experimentando novas ideias (RL). Eles fazem a média dos conselhos de ambas as partes para atualizar o cérebro.
  • O Resultado: Este "Super-Aluno" (Média Paralela) tornou-se o melhor em resolver problemas. Eles acertaram as respostas com mais frequência do que qualquer outro e, ao contrário dos alunos que apenas memorizaram o livro didático, não esqueceram como fazer outras coisas (como conversação geral).

Resumo das Grandes Conclusões

  • Não espere: Você pode usar o Aprendizado por Reforço (o jogo) muito cedo na vida de um modelo, mesmo antes de ele ter terminado sua fase de "leitura".
  • Dados importam mais do que tamanho: Alimentar o modelo com tipos específicos de dados (como matemática) durante o pré-treinamento é mais importante do que apenas tornar o modelo maior.
  • O RL não é o vilão: O RL não estraga as habilidades gerais de um modelo ou apenas o "afia". Esses efeitos negativos vêm da etapa de "Memorizar" (SFT). O RL ajuda os modelos a explorar e encontrar novas soluções.
  • Faça juntos: Os melhores resultados vêm de misturar as etapas de "Memorizar" e "Jogar" simultaneamente, em vez de fazê-las uma após a outra.

Em suma, o artigo sugere que devemos parar de tratar o Aprendizado por Reforço como um polimento final ao final do processo. Em vez disso, devemos tecê-lo no processo de treinamento muito mais cedo e misturá-lo com outros métodos para obter modelos mais inteligentes e capazes.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →