Weight-Space Geometry of Offline Reasoning Training
Este artigo analisa a geometria do espaço de pesos de seis métodos de treinamento de raciocínio offline em um modelo Qwen3-4B, revelando que, enquanto o SFT, RFT e RIFT convergem para atualizações quase colineares com precisão semelhante, o DPO adota um subespaço distinto e quase ortogonal que alcança um desempenho significativamente superior nos benchmarks GSM8K e AIME26, ao passo que o Offline GRPO introduz um componente ortogonal substancial permanecendo dentro da bacia de perda do SFT.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem um tutor de matemática brilhante e gigante (o "Professor") que consegue resolver problemas complexos. Você quer ensinar um aluno menor e mais barato (o "Aluno") a pensar como esse tutor. Você fornece ao aluno as soluções passo a passo do Professor (chamadas de "rollouts") e pede que o aluno aprenda com elas.
O artigo faz uma pergunta simples, mas profunda: Importa como dizemos ao aluno para aprender?
Existem muitas diferentes "fórmulas de ensino" (funções de perda) que os pesquisadores usam. Alguns dizem: "Apenas olhe para as respostas corretas". Outros dizem: "Olhe para todas as respostas, mas dê crédito extra às boas". Outros dizem: "Compare as boas respostas com as ruins".
Os autores queriam saber: Essas diferentes fórmulas fazem o cérebro do aluno (os pesos do computador) mudar da mesma forma ou criam tipos de pensadores completamente diferentes?
Aqui está a divisão de suas descobertas, usando analogias simples:
1. O Grupo "Copiador" (SFT, RFT, RIFT)
A Analogia: Imagine três alunos tentando copiar um desenho.
- Aluno A copia cada linha.
- Aluno B apenas copia as linhas que são perfeitas.
- Aluno C copia todas as linhas, mas desenha as perfeitas de forma um pouco mais escura.
A Descoberta: Mesmo que usem regras ligeiramente diferentes, todos acabam desenhando quase a mesma imagem.
- Matematicamente, as mudanças em seus cérebros são quase idênticas (97% de similaridade).
- Todos obtêm aproximadamente a mesma pontuação em testes de matemática (cerca de 87–88%).
- Conclusão: Se você quer apenas que um aluno imite o raciocínio do professor, não importa muito qual dessas três fórmulas específicas você use. Eles estão, efetivamente, fazendo a mesma coisa.
2. O "Autoajustável" (DFT)
A Analogia: Este aluno usa o mesmo papel que o Aluno A, mas tem um hábito estranho: ele automaticamente torna a caneta mais clara quando já está confiante e mais escura quando está incerto.
A Descoberta: Esse pequeno ajuste muda significamente a direção do desenho. O cérebro deste aluno muda de uma forma muito diferente da do grupo Copiador, embora eles não tenham usado pontuações de "recompensa" para guiá-los. É um caminho único, mas não leva necessariamente a uma pontuação melhor.
3. O "Desvio Lateral" (Offline GRPO)
A Analogia: Este aluno olha para o trabalho do professor, mas decide dar um grande passo para o lado. Eles ainda permanecem na mesma vizinhança geral (a "bacia de perda"), mas estão percorrendo um caminho diferente.
A Descoberta: Este método empurra o cérebro do aluno em uma direção que é 67% diferente da do grupo Copiador. Nas camadas posteriores do céreão (os "pensamentos finais"), essa diferença cresce para quase 86%.
- No entanto, eles ainda terminam com uma pontuação semelhante (cerca de 87%).
- Conclusão: Este método explora uma nova direção, mas não parece desbloquear um "superpoder" em termos de precisão comparado aos Copiadores.
4. O "Outlier" (DPO)
A Analogia: Enquanto todos os outros estão desenhando na mesma folha de papel na mesma sala, este aluno está desenhando em uma tela completamente diferente, em uma sala diferente, usando um estilo totalmente diferente.
A Descoberta:
- Geometria: As mudanças no cérebro deste aluno são quase 90 graus (ortogonais) às de todos os outros. Eles estão fazendo algo fundamentalmente diferente.
- A Barreira: Se você tentasse misturar o cérebro deste aluno com o do Copiador (uma "interpolação linear"), o resultado quebraria. Eles estão em "universos" de soluções diferentes.
- A Pontuação: Apesar de serem tão diferentes, este aluno obteve as maiores pontuações (93,5% em matemática, 30% em quebra-cabeças difíceis).
- A Ressalva: Este aluno foi treinado com uma taxa de aprendizado 10x menor (eles deram passos muito menores e mais cuidadosos). Os autores alertam que não podemos ter 100% de certeza se a alta pontuação é por causa da fórmula ou apenas porque eles deram passos menores e mais precisos.
5. A Surpresa "Ao Vivo vs. Gravado"
O artigo também observou o que acontece se o aluno aprende com a prática ao vivo (Online) versus prática gravada (Offline).
- Offline: Ao aprender com um conjunto fixo de respostas gravadas do professor, o aluno do "Desvio Lateral" (Offline GRPO) permanece relativamente próximo dos Copiadores.
- Online: Quando o aluno gera seus próprios problemas de prática (Online GRPO), eles se tornam completamente ortogonais (totalmente diferentes) dos Copiadores.
- Conclusão: O fato de os métodos "Offline" parecerem semelhantes aos dos Copiadores é, em parte, porque todos estão encarando exatamente o mesmo conjunto fixo de respostas do professor. Se você os deixar gerar sua própria prática, eles divergem drasticamente.
Resumo
- A maioria dos métodos (SFT, RFT, RIFT) são apenas formas diferentes de dizer "Copie o professor". Eles resultam na mesma estrutura cerebral e pontuações semelhantes.
- DPO é o outlier. Ele constrói uma estrutura cerebral completamente diferente. Ele obtém as melhores pontuações, mas o faz com um estilo de treinamento muito específico e cauteloso (taxa de aprendizado pequena) que torna difícil a comparação direta com os outros.
- A natureza "Offline" dos dados de treinamento é uma razão importante pela qual muitos desses métodos acabam parecendo tão semelhantes entre si.
O artigo essencialmente mapeia a "geografia" desses métodos de aprendizado, mostrando quais são vizinhos e quais vivem em planetas diferentes.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.