← Últimos artigos
🤖 machine learning

Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level

Este artigo propõe a Destilação Assimétrica em Política (AOPD), um novo quadro de treinamento que aborda as fraquezas estruturais da destilação em política padrão ao substituir o reforço negativo ineficaz pela minimização de divergência localizada, alcançando assim desempenho superior no raciocínio matemático e na adaptação ao uso de ferramentas, ao mesmo tempo em que mantém maior entropia da política.

Autores originais: Nan Jia, Haojin Yang, Xing Ma, Jiesong Lian, Shuailiang Zhang, Weipeng Zhang, Ke Zeng, Xunliang Cai, Zequn Sun

Publicado 2026-05-08
📖 4 min de leitura☕ Leitura rápida

Autores originais: Nan Jia, Haojin Yang, Xing Ma, Jiesong Lian, Shuailiang Zhang, Weipeng Zhang, Ke Zeng, Xunliang Cai, Zequn Sun

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um jovem aprendiz (a IA "aluno") a resolver quebra-cabeças matemáticos complexos observando um grande mestre (a IA "professor").

Por muito tempo, a maneira padrão de fazer isso era deixar o aprendiz tentar resolver o quebra-cabeça sozinho. Se ele acertasse um passo, o professor dava um "toca aqui". Se errasse um passo, o professor dava um "não" severo. Isso é chamado de Distilação On-Policy.

No entanto, os autores deste artigo descobriram que esse sistema de "toca aqui ou não" tem três falhas principais que tornam o aprendizado lento e frustrante:

  1. O Problema do "Grito" (Alta Variância): Quando o aprendiz comete um erro muito grave, o "não" do professor é tão alto e duro (matematicamente falando, o sinal é enorme e ilimitado) que assusta o aprendiz. Em vez de aprender uma correção específica, o aprendiz fica confuso e faz saltos selvagens e imprevisíveis em seu raciocínio.
  2. O Problema do "Silêncio" (Gradientes Desvanecidos): Na maioria das vezes, os passos do aprendiz são apenas "ok" — nem ótimos, nem terríveis. No sistema antigo, o professor dá um sinal neutro de "tá". Como esse sinal é tão fraco, o aprendiz não aprende nada nesses momentos, mesmo que o professor tenha, na verdade, uma maneira melhor de fazer. O processo de aprendizado trava.
  3. O Problema do "Ponto Cego" (Buracos Negros de Exploração): Se o aprendiz ficar preso em um beco sem saída, o sistema antigo apenas diz a ele para não ir por aquele caminho. Não diz a ele para onde ir em vez disso. O aprendiz fica girando em círculos, adivinhando novos caminhos às cegas, porque não sabe que o caminho correto existe.

A Solução: AOPD (A Abordagem do "Tutor Inteligente")

O artigo propõe um novo método chamado Distilação On-Policy Assimétrica (AOPD). Pense nisso como um tutor que muda de estilo de ensino dependendo da situação.

Em vez de usar a mesma regra de "toca aqui/não" para tudo, a AOPD usa dois modos diferentes:

  • Modo 1: O Torcedor (Exploração): Quando o aprendiz está fazendo algo que o professor gosta (um passo "positivo"), o sistema age como o método antigo. Diz: "Ótimo trabalho! Continue fazendo exatamente isso!" Isso reforça o bom comportamento.
  • Modo 2: O GPS (Imitação): Quando o aprendiz está preso, cometendo um erro ou apenas fazendo algo "ok" (passos não positivos), o sistema para o duro "não" e o fraco "tá". Em vez disso, ele imediatamente traz um mapa. Diz: "Pare de adivinhar. Olhe para o mapa do professor. Aqui está o caminho exato que o professor seguiria a partir deste ponto específico."

Por Que Isso Funciona Melhor

Os autores testaram isso em competições matemáticas difíceis (como AIME e HMMT) usando diferentes tamanhos de modelos de IA. Eis o que descobriram:

  • Aprendizado Mais Inteligente: Ao mudar para o modo "GPS" quando as coisas ficam difíceis, o aprendiz não fica assustado por erros enormes ou entediado por neutros. Ele recebe direções precisas e úteis exatamente quando precisa delas.
  • Mais Rápido e Mais Forte: O novo método venceu consistentemente o antigo método de "toca aqui/não". Na verdade, quando o aprendiz começou com habilidades mais fracas (uma "inicialização fraca"), o novo método ajudou-o a recuperar o atraso muito mais rápido, ganhando cerca de 8% de respostas corretas a mais do que o método antigo.
  • Melhor Memória: Quando o aprendiz aprendeu uma nova habilidade (como usar ferramentas) após dominar a matemática, o método antigo fez com que ele esquecesse suas habilidades matemáticas. O novo método (AOPD) foi como uma esponja flexível; aprendeu a nova habilidade de ferramenta sem lavar a conhecimento matemático que já tinha.

O Quadro Geral

Em termos simples, o artigo argumenta que você não deve tratar cada momento de aprendizado da mesma forma.

  • Quando as coisas estão indo bem, incentive o aluno a continuar explorando por conta própria.
  • Quando as coisas estão indo mal ou são apenas "tá", pare o jogo de adivinhação e mostre diretamente ao aluno a maneira melhor do professor.

Ao misturar "deixá-los tentar" com "mostrar-lhes a resposta" nos momentos certos, a IA aprende mais rápido, comete menos erros e lembra melhor do que aprendeu.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →