← Últimos artigos
🤖 machine learning

Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning

Este artigo apresenta o Framework de Teto de Plasticidade para demonstrar que um pipeline sequencial de SFT seguido por RL, iniciado no regime estável ou levemente sobreajustado do SFT com dados em larga escala, supera abordagens sincronizadas e refuta a hipótese "Menos é Mais" para maximizar as capacidades de raciocínio matemático em LLMs.

Autores originais: Bowen Ding, Yuhan Chen, Jiayang Lyv, Jiyao Yuan, Qi Zhu, Shuangshuang Tian, Dantong Zhu, Futing Wang, Heyuan Deng, Fei Mi, Lifeng Shang, Tao Lin

Publicado 2026-05-12
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Bowen Ding, Yuhan Chen, Jiayang Lyv, Jiyao Yuan, Qi Zhu, Shuangshuang Tian, Dantong Zhu, Futing Wang, Heyuan Deng, Fei Mi, Lifeng Shang, Tao Lin

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando treinar um aluno brilhante para se tornar um mestre em matemática. Você tem duas ferramentas principais: um livro didático (Ajuste Fino Supervisionado, ou SFT) e uma academia de resolução de problemas (Aprendizado por Reforço, ou RL).

Este artigo é um estudo sobre a melhor maneira de usar essas ferramentas para transformar um aluno inteligente em um gênio da matemática. Os pesquisadores descobriram que a ordem em que você as utiliza, o tempo que dedica ao livro didático e a dificuldade dos problemas que escolhe são as chaves para o sucesso.

Abaixo está a análise detalhada de suas descobertas usando analogias simples:

1. A Regra "Livro Didático Primeiro, Academia Depois"

O Problema: Algumas pessoas pensavam que era possível misturar o livro didático e a academia ao mesmo tempo (chamado de "SFT-RL Sincronizado"). Elas esperavam que isso fosse mais rápido.
A Descoberta: O artigo mostra que essa é uma má ideia. É como tentar ler um capítulo de um livro de matemática enquanto corre simultaneamente em uma esteira; você acaba confuso e não avança muito.
O Vencedor: O melhor método é Sequencial: Leia todo o livro didático primeiro até compreender realmente os conceitos, depois vá para a academia praticar a resolução de problemas sozinho. Essa abordagem "Livro Didático Primeiro" constrói uma base sólida que permite ao aluno alcançar um nível muito mais alto de habilidade posteriormente.

2. O "Ponto Ideal" para a Transição

O Problema: Quando você deve parar de ler o livro didático e começar a academia?
A Descoberta: Você não deve mudar muito cedo (quando ainda está confuso) nem muito tarde (quando memorizou o livro tão bem que não consegue mais pensar criativamente).
A Analogia: Imagine a curva de aprendizado do livro didático como uma colina.

  • Muito Cedo (Regime Adaptativo): Você ainda está no fundo, tropeçando. Se mudar para a academia agora, você carece das habilidades básicas para treinar eficazmente.
  • Muito Tarde (Sobreajuste Severo): Você memorizou o livro tão perfeitamente que não consegue lidar com novos problemas. Você se tornou um robô que só conhece as respostas do livro.
  • O Ponto Ideal (Regime Estável): Você atingiu o topo da colina. Você compreende o material profundamente, mas ainda não se transformou em um robô rígido. Este é o momento perfeito para mudar para a academia. O artigo prova que parar exatamente quando o aprendizado do livro didático "estabiliza" produz os melhores resultados.

3. Volume vs. Dificuldade (O Mito "Menos é Mais")

O Problema: Alguns especialistas afirmavam que usar uma quantidade minúscula de problemas muito difíceis e de alta qualidade era melhor do que usar uma pilha enorme de problemas ("Menos é Mais").
A Descoberta: O artigo diz Não.
A Analogia:

  • Escala de Dados (Volume): Pense nisso como o tamanho da academia. Uma academia pequena (conjunto de dados pequeno) pode ser fácil de preencher, mas limita o quão forte você pode ficar. Uma academia massiva (conjunto de dados enorme) oferece espaço para construir força imensa. O artigo descobriu que quanto maior, melhor. O tamanho do seu conjunto de dados é a principal coisa que determina seu teto final.
  • Dificuldade dos Dados: Pense nisso como o peso na barra. Uma vez que você tem uma academia grande, adicionar pesos mais pesados (problemas mais difíceis) ajuda você a ficar ainda mais forte. Mas se você tiver apenas uma academia minúscula, pesos pesados não ajudarão você a chegar ao topo.
  • Conclusão: Primeiro, consiga uma academia enorme (muitos dados). Depois, torne os pesos mais pesados (dados mais difíceis) para otimizar seu treinamento.

4. O Indicador "Bola de Cristal"

O Problema: Como saber se você escolheu o livro didático certo e o momento certo para mudar sem realizar testes caros?
A Descoberta: Os pesquisadores encontraram uma métrica simples: O ponto mais baixo da sua "Perda de Validação".
A Analogia: Imagine que você está dirigindo um carro subindo uma montanha. Você não precisa dirigir até o pico para saber o quão alta é a montanha. Você só precisa olhar para a maior depressão na estrada (o mínimo da perda de validação) durante seu estudo com o livro didático. Se essa depressão for muito baixa, isso prevê que você será capaz de alcançar um pico muito alto na academia posteriormente. É uma bola de cristal confiável para seu potencial final.

Resumo do Framework "Teto-Plasticidade"

Os autores criaram um framework chamado Teto-Plasticidade:

  • O Teto: A pontuação mais alta possível que seu modelo pode alcançar.
  • Plasticidade: Quanto espaço para melhoria resta após você terminar o livro didático.

A Grande Lição:
Para obter o teto mais alto, você deve:

  1. Usar o método Sequencial (Livro Didático, depois Academia).
  2. Parar o livro didático exatamente quando atingir o Regime Estável (nem muito cedo, nem muito tarde).
  3. Usar um Conjunto de Dados Enorme (Volume é rei).
  4. Usar Problemas Mais Difíceis como um multiplicador bônus.

Isso transforma o processo de treinamento de IA de um jogo de "tentativa e erro" em uma receita científica e previsível.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →