← Últimos artigos
💻 computer science

SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR

Este artigo demonstra que o Ajuste Fino Supervisionado (SFT) excessivo pode comprimir a distribuição de rollout, causando um colapso de entropia que leva à inversão de ranking e à degradação do desempenho no treinamento subsequente de Otimização de Política Relativa de Grupo (GRPO), um modo de falha que pode ser previsto e mitigado monitorando a entropia pré-RL e a dinâmica inicial do GRPO.

Autores originais: Siddharth Aphale, Kelly Liu

Publicado 2026-06-19
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Siddharth Aphale, Kelly Liu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Visão Geral: A Armadilha do "Perfeito Demais"

Imagine que você está treinando um robô para escrever código. A receita padrão consiste em duas etapas:

  1. Ajuste Fino Supervisionado (SFT): Você mostra ao robô milhares de exemplos de código correto para que ele aprenda os padrões.
  2. Aprendizado por Reforço (RL): Você deixa o robô tentar resolver novos problemas por conta própria. Se ele acertar, ele ganha um prêmio (uma recompensa); se falhar, não ganha nada.

O Problema: O artigo descobriu que, se você treinar o robô demais na Etapa 1 (Overtraining de SFT), ele acaba ficando pior na Etapa 2.

Geralmente, pensamos: "Quanto mais exemplos o robô memorizar na Etapa 1, melhor ele será". Os autores descobriram o oposto: O robô que memoriza mais na Etapa 1 é, na verdade, o que tem o pior desempenho na Etapa 2. De fato, o robô que memoriza o mínimo acaba sendo o campeão.

A Metáfora: O Dançarino Rígido vs. O Dançarino Flexível

Para entender por que isso acontece, imagine dois dançarinos se preparando para uma competição onde devem improvisar uma rotina baseada em músicas aleatórias.

  • O Dançarino "Overtreinando" (SFT Profundo): Este dançarino praticou as mesmas 10 rotinas perfeitas milhares de vezes. Ele é incrivelmente preciso. Mas quando a música muda, ele congela. Ele só conhece aqueles 10 movimentos. Ele não tem ideia de como se mover de qualquer outra forma.
  • O Dançarino "Na Medida Certa" (SFT Raso): Este dançarino praticou o básico, mas manteve seu corpo solto e flexível. Ele conhece as regras, mas ainda consegue se contorcer, girar e tentar coisas novas quando a música muda.

A Competição (RL):
A competição exige que os dançarinos tentem muitos movimentos de uma vez para ver qual funciona melhor.

  • O Dançarino Overtreinando tenta fazer exatamente o mesmo movimento perfeito todas as vezes. Como todos parecem iguais, os juízes (o algoritmo) não conseguem distinguir qual movimento é melhor. O dançarino fica travado e não consegue aprender nada novo.
  • O Dançarino Flexível tenta uma grande variedade de movimentos. Os juízes conseguem ver: "Ah, este movimento funcionou, aquele não!". E o dançarino aprende rapidamente.

O "Porquê" Técnico: Colapso de Entropia

O artigo usa uma palavra sofisticada para "variedade" ou "flexibilidade": Entropia.

  1. Colapso de Entropia: Quando o robô é treinado demais, sua "mente" torna-se muito estreita. Ele para de explorar diferentes possibilidades e apenas repete as mesmas poucas respostas. Nos termos do artigo, sua entropia colapsa.
  2. O Sinal Morre: O algoritmo de aprendizado (chamado GRPO) funciona comparando diferentes respostas. Se o robô der a mesma resposta 8 vezes seguidas, o algoritmo fica confuso. Ele não consegue calcular um "gradiente" (uma direção para melhorar) porque não há diferença para comparar. É como tentar dirigir um carro quando o volante está travado reto à frente.
  3. A Inversão de Ranking: Isso leva a um resultado estranho chamado Inversão de Ranking.
    • Antes da segunda fase de treinamento, o robô overtreinado parece um gênio (ele acerta a resposta 100% das vezes no teste de prática).
    • Depois da segunda fase de treinamento, ele se torna um desastre.
    • Enquanto isso, o robô "menos perfeito", que parecia um pouco pior no início, torna-se o superastro.

Os Dois Modelos: Um Conto de Duas Cidades

Os autores testaram isso em dois cérebros de robô diferentes (modelos):

  1. Qwen (A Vítima): Este modelo caiu na armadilha. Quanto mais o treinavam na Etapa 1, mais ele ficava rígido. O checkpoint "melhor" (com a pontuação mais alta) acabou sendo o pior ponto de partida para a próxima fase.
  2. DeepSeek (O Sobrevivente): Este modelo era naturalmente mais flexível. Mesmo após um treinamento pesado, ele não ficou rígido. Ele permaneceu na "zona de segurança" onde ainda podia aprender. Isso provou que o problema não era a segunda fase de treinamento em si, mas especificamente como a primeira fase arruinou a flexibilidade do modelo Qwen.

A Solução: Um Check-up de Duas Etapas

Os autores não apenas encontraram o problema; eles construíram uma ferramenta de diagnóstico para detectar isso antes de desperdiçar tempo e dinheiro.

  • Etapa 1: O Teste de "Alongamento" (Entropia Pré-RL): Antes de iniciar a segunda fase de treinamento, eles verificam o quão "solta" é a mente do robô. Se o robô for muito rígido (baixa entropia), eles o sinalizam como de alto risco.
  • Etapa 2: O Monitor de "Alerta Precoce": Se eles iniciarem a segunda fase, eles monitoram os primeiros minutos. Se o robô parar de tentar coisas novas e começar a se repetir imediatamente, eles interrompem o treinamento precocemente para economizar recursos.

O Que Não Funcionou?

Os autores tentaram consertar o robô quebrado com truques padrão, como:

  • Adicionar uma penalidade: "Não se desvie muito do seu treinamento original". (Isso o tornou pior).
  • Suavização de rótulos (Smoothing labels): "Seja um pouco menos certo sobre suas respostas". (Isso fez o robô parecer confiante novamente, mas ele ainda falhou na competição).

A Conclusão: Você não pode consertar um dançarino rígido dizendo para ele "se esforçar mais" durante a competição. Você tem que parar de treiná-lo tão rigidamente desde o início. O artigo prova que a variedade (entropia) é mais importante do que a perfeição quando você quer que um modelo continue aprendendo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →