SR-OPSD: Self-Referenced On-Policy Self-Distillation
O artigo propõe o SR-OPSD, um novo framework de autodestilação on-policy autorreferenciada que estabiliza o treinamento ao desacoplar o alvo de destilação adaptativo da geometria de projeção por meio de uma caracterização variacional ao nível de token e divergência de Rényi, alcançando desempenho de estado da arte em diversas tarefas de LLM.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está ensinando um robô a escrever uma história ou a resolver um problema de matemática. Você não quer apenas que o robô acerte a resposta final; você quer que ele aprenda como pensar passo a passo. No mundo da Inteligência Artificial, isso é frequentemente feito deixando o robô tentar, falhar e, então, receber uma pequena "recompensa" ou "punição" ao final de tudo. Mas isso é como um aluno fazendo uma prova e só descobrir que tirou um "B" depois de terminar, sem ter ideia de qual frase ou cálculo específico causou o erro. Para corrigir isso, pesquisadores usam um truque chamado "autodestilação". Pense nisso como o robô desempenhando dois papéis ao mesmo tempo: um "Estudante", que tenta resolver o problema, e um "Professor" (que é, na verdade, o próprio robô, mas com uma ajuda extra ou uma "solução verificada") que observa o trabalho do Estudante e fornece feedback sobre cada palavra. O Estudante então tenta copiar as escolhas do Professor.
O problema é que este Professor não é um guia estático e perfeito. À medida que o Estudante melhora, o Professor também muda, porque ambos fazem parte do mesmo cérebro em evolução. É como tentar atingir um alvo móvel enquanto o vento também está mudando. Se o Estudante tentar copiar o Professor de forma muito rígida, eles podem ficar presos em um loop, repetindo os mesmos erros ou tornando seu pensamento excessivamente estreito. Este artigo apresenta uma nova maneira de lidar com essa dança, chamada SR-OPSD. É um método que ajuda o Estudante a aprender com o Professor sem se confundir com o alvo móvel, usando uma "bússola" matemática especial para manter o aprendizado estável e eficaz.
O Problema do Alvo Móvel
Em muitos métodos de treinamento de IA, o objetivo é tornar a IA mais inteligente fazendo-a aprender com seus próprios sucessos. O artigo começa analisando um método chamado "Destilação Autopolítica On-Policy" (OPSD). Imagine um estudante fazendo uma prova. No OPSD, o estudante escreve uma resposta e, em seguida, um "auto-professor" (que é o próprio estudante, mas olhando para a resposta com uma pista da solução correta) diz: "Ei, você fez esta parte corretamente, mas aquela palavra ficou um pouco fora do lugar". O estudante então tenta ajustar suas respostas futuras para corresponder ao professor.
No entanto, há um detalte: o professor não é um livro fixo; é uma versão do estudante que está constantemente mudando. À medida que o estudante aprende, o professor também muda. Se você tentar copiar um professor que está mudando de posição constantemente, pode acabar oscilando, sem conseguir se estabelecer em uma boa resposta. O artigo sugere que simplesmente tentar corresponder a este professor móvel com ferramentas matemáticas padrão frequentemente leva à instabilidade. O estudante pode se tornar focado demais em uma única forma de pensar (perdendo a criatividade) ou ficar confuso com as mudanças constantes.
A Nova Solução: Uma Âncora Fixa e uma Bússola Flexível
Os autores propõem um novo método chamado SR-OPSD (Self-Referenced On-Policy Self-Distillation). Eles perceberam que, para interromper essa oscilação, você precisa de duas coisas: um ponto fixo para se segurar e uma maneira flexível de se mover em direção ao objetivo.
- A Âncora Fixa (Política de Referência): Em vez de apenas olhar para o Professor móvel, o estudante também mantém o olhar em uma "Referência". Pense nisso como o seu eu original, pré-treinado — a versão de antes de começar este treinamento específico. Esta Referência atua como um farol. Mesmo que o Professor (o alvo móvel) derive, o estudante sabe que não deve se afastar demais de sua fundação original e sólida. O novo método mistura o conselho do Professor com esta Referência, criando um "alvo" que é estável, mas ainda assim útil.
- A Bússola Flexível (Divergência de Rényi): Uma vez definido o alvo, o estudante precisa de uma maneira de se mover em direção a ele. O artigo utiliza uma ferramenta matemática chamada divergência de Rényi. Você pode pensar nisso como um tipo especial de "ímã" ou "bússola" que controla o quão fortemente o estudante é atraído pelo alvo.
- Se o ímã for forte demais, o estudante pode saltar para o alvo rápido demais e perder sua própria voz.
- Se for fraco demais, eles não aprenderão nada.
- A beleza da ferramenta de Rényi é que ela possui um "botão de ajuste" (chamado ordem ) que permite aos pesquisadores sintonizar exatamente como o estudante reage às diferenças entre sua resposta atual e o alvo. Ela permite que o estudante seja sensível a pequenos detalhes ou ignore-os, dependendo do que a tarefa exige.
O Que Eles Descobriram
Os pesquisadores testaram este novo método em três tipos de tarefas muito diferentes:
- Questões de Ciências: Respondendo a perguntas complexas sobre química, física e biologia.
- Raciocínio Matemático: Resolvendo problemas matemáticos difíceis onde os passos importam tanto quanto a resposta.
- Programação (Coding): Escrevendo programas de computador que realmente funcionam.
Eles compararam seu novo método (SR-OPSD) contra métodos mais antigos, como o "Reverse KL" padrão (que é como um professor muito rigoroso) e a "Divergência de Jensen-Shannon" (um professor mais equilibrado, mas às vezes instável).
Os Resultados:
- Estabilidade: Nos testes de ciências e matemática, os métodos antigos muitas vezes começavam fortes, mas depois pioravam com o tempo, como um corredor que corre rápido demais e depois desaba. O SR-OPSD, no entanto, continuou melhorando de forma constante. Por exemplo, em um benchmark de física, o novo método alcançou uma precisão de 81,1 (usando uma métia específica chamada Avg@16), enquanto os métodos antigos orbitavam em torno de 79,4 ou menos.
- Domínio Matemático: Em competições matemáticas difíceis (como AIME e HMMT), o novo método ajudou a IA a resolver mais problemas corretamente. Por exemplo, no teste AIME 2025, o novo método melhorou a taxa de "Pass" (acertar a resposta) em 6,7 pontos percentuais em comparação com um método de base popular chamado GRPO.
- Programação: Ao ensinar a IA a escrever código, o novo método funcionou melhor à medida que os modelos de IA ficavam maiores. Para o maior modelo testado (Qwen3-8B), o novo método alcançou uma pontuação de 50,1, superando o melhor anterior de 48,8.
Por Que Isso Importa
O artigo sugere que o segredo para fazer a IA aprender com seus próprios erros não é apenas ter um professor melhor; é sobre como você conecta o estudante a esse professor. Ao ancorar o processo de aprendizado a uma "Referência" estável e usar uma "Bússola" ajustável (a divergência de Rényi), a IA pode aprender habilidades complexas sem se confundir ou perder o caminho.
Os autores descobriram que simplesmente adicionar um ponto de referência não era suficiente por si só; na verdade, tornava as coisas piores se combinado com as ferramentas matemáticas erradas. Mas quando combinaram a referência com sua nova bússola flexível, os resultados foram consistentemente melhores em ciência, matemática e programação. Isso sugere que, para a IA realmente dominar o raciocínio complexo, ela precisa de um método de treinamento que equilibre o entusiasmo do novo feedback com a estabilidade de seu conhecimento original.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.