← Últimos artigos
🤖 machine learning

Complementing reinforcement learning with SFT through logit averaging in the post training of LLMs

Este artigo apresenta um novo método de pós-treinamento para modelos de linguagem de grande escala que aprimora a Otimização de Política Relativa em Grupo (GRPO) ao calcular a média dos logits de uma política de referência SFT congelada e de uma política treinável, eliminando assim a necessidade de regularização KL ou de um crítico, enquanto combina efetivamente as capacidades de raciocínio do RL com a estabilidade de formatação do SFT.

Autores originais: Xingwei Gan, Ying Zhu

Publicado 2026-05-21
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Xingwei Gan, Ying Zhu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Visão Geral: Dois Professores, Um Aluno

Imagine que você está treinando um grande modelo de linguagem (uma IA) para resolver problemas de matemática. Você tem dois "professores" distintos tentando ensiná-lo:

  1. O Professor de Formatação (SFT): Este professor é excelente em ensinar à IA como escrever respostas de forma organizada, usar os símbolos corretos e seguir regras estritas (como colocar a resposta final entre colchetes). No entanto, este professor às vezes comete erros na lógica matemática real.
  2. O Professor de Raciocínio (RL): Este professor é um gênio da matemática que pode resolver equações complexas perfeitamente. Mas, este professor é desorganizado; frequentemente esquece de colocar a resposta entre colchetes, pula etapas ou escreve em um formato estranho que não corresponde ao exigido pelo exame.

O Problema:
Tradicionalmente, quando você tenta combinar esses dois, usa um método chamado "Regularização KL". Pense nisso como um elástico amarrando o Professor de Raciocínio ao Professor de Formatação. O elástico força o Professor de Raciocínio a permanecer próximo ao estilo do Professor de Formatação.

  • O Pulo do Gato: Se o Professor de Formatação cometer um erro matemático, o elástico puxa o Professor de Raciocínio para o mesmo erro. A IA fica presa tentando ser "organizada", mas falha em ser "inteligente".

A Nova Solução: Média de Logits
Os autores deste artigo propõem uma nova maneira de combinar esses professores. Em vez de amarrá-los juntos com um elástico, eles criam uma Voz Fundida.

Imagine que a IA é um coral. Em vez de forçar os cantores a permanecerem em perfeita uníssono (o que limita seu alcance), o novo método mistura suas vozes antes de cantarem.

  • Se o Professor de Formatação diz "Coloque a resposta entre colchetes" e o Professor de Raciocínio diz "A resposta é 5", a Voz Fundida diz "Coloque a resposta entre colchetes: 5".
  • Se o Professor de Formatação cometer um erro matemático (dizendo que a resposta é 6), mas o Professor de Raciocínio sabe que é 5, a Voz Fundida se apoia fortemente na matemática do Professor de Raciocínio, mantendo a instrução do Professor de Formatação de "colocar entre colchetes".

Como Funciona (A Magia dos "Logits")

Em termos de IA, a "voz" do modelo é composta por números chamados logits (que representam a probabilidade de o modelo escolher uma palavra ou número específico a seguir).

  1. A Mistura: Os pesquisadores pegam os números do Professor de Formatação e do Professor de Raciocínio e os calculam em média matematicamente.
  2. O Resultado: Isso cria uma nova "Política Fundida" temporária.
  3. O Treinamento: A IA aprende praticando sobre essa Política Fundida. Ela recebe a recompensa (pontos) se a resposta final estiver correta.
    • Como o Professor de Formatação faz parte da mistura, a IA nunca esquece como escrever de forma organizada.
    • Como o Professor de Raciocínio faz parte da mistura, a IA tem liberdade para corrigir os erros matemáticos do Professor de Formatação.

Por Que Isso É Melhor (O "Produto de Especialistas")

O artigo usa um conceito chamado "Produto de Especialistas". Pense nisso como uma decisão de comitê:

  • Se o Especialista A (Formatação) tem certeza sobre o estilo, e o Especialista B (Raciocínio) tem certeza sobre a matemática, a decisão final é forte em ambos os aspectos.
  • Se o Especialista A está errado sobre a matemática, a confiança do Especialista B a supera, mas a confiança do Especialista A sobre o estilo permanece.

O artigo descobriu que essa abordagem de "Voz Fundida" funciona melhor do que o antigo método de "elástico". A IA aprendeu a resolver problemas de matemática corretamente e manteve sua formatação organizada, enquanto o método antigo frequentemente fazia a IA esquecer como formatar corretamente ou ficar presa nos erros matemáticos do Professor de Formatação.

Os Experimentos

Os pesquisadores testaram isso em três diferentes "exames" (conjuntos de dados):

  1. MATH: Problemas matemáticos difíceis.
  2. cn-k12: Matemática do ensino médio e fundamental chinês.
  3. MMLU: Conhecimento geral e raciocínio.

Eles testaram em três tamanhos diferentes de modelos de IA (pequeno, médio e grande).

Os Resultados:

  • Em quase todos os casos, o novo método de "Voz Fundida" obteve pontuações mais altas do que o método tradicional.
  • Foi especialmente bom em corrigir um problema específico: o método tradicional frequentemente fazia a IA "esquecer" como formatar respostas à medida que aprendia a resolver matemática mais difícil. O novo método manteve as habilidades de formatação intactas enquanto melhorava as habilidades matemáticas.

Um Exemplo Concreto do Artigo

O artigo dá um exemplo específico de um problema de geometria:

  • O Professor de Formatação (SFT): Configura corretamente a equação, mas comete um erro matemático, concluindo que o raio é 6. Ele coloca a resposta entre colchetes de forma organizada.
  • O Professor de Raciocínio (RL): Calcula corretamente a matemática, descobrindo que o raio é 5, mas esquece de colocar a resposta entre colchetes ou escrevê-la no formato final.
  • A Voz Fundida: Ela pega a matemática correta (5) do Professor de Raciocínio e a instrução organizada de colocar entre colchetes do Professor de Formatação. A saída final é um 5 organizado entre colchetes.

Resumo

O artigo apresenta uma maneira de treinar modelos de IA que atua como uma equipe colaborativa em vez de uma hierarquia estrita. Ao calcular matematicamente a média dos "pensamentos" (logits) de um professor organizado-mas-desorganizado e um professor inteligente-mas-desorganizado, a IA aprende a ser tanto inteligente quanto organizada, evitando as armadilhas de forçar um a seguir estritamente o outro.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →