← Últimos artigos
🤖 machine learning

Co-Evolving Policy Distillation

Este artigo propõe a Distilação de Políticas Coevolutiva (CoPD), um paradigma de treinamento inovador que integra o treinamento paralelo de especialistas com a distilação de políticas online bidirecional para superar a perda de capacidade e as lacunas comportamentais, alcançando desempenho superior em raciocínio unificado de texto, imagem e vídeo em comparação com os métodos existentes de RLVR e distilação.

Autores originais: Naibin Gu, Chenxu Yang, Qingyi Si, Chuanyu Qin, Dingyu Yao, Peng Fu, Zheng Lin, Weiping Wang, Nan Duan, Jiaqi Wang

Publicado 2026-05-01
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Naibin Gu, Chenxu Yang, Qingyi Si, Chuanyu Qin, Dingyu Yao, Peng Fu, Zheng Lin, Weiping Wang, Nan Duan, Jiaqi Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando treinar um único aluno superinteligente para se tornar um especialista em três áreas muito diferentes: Matemática, Arte e Análise de Vídeo.

No passado, os pesquisadores tentaram duas maneiras principais de fazer isso, mas ambas tinham uma falha grave. Este artigo apresenta um novo método chamado Destilação de Política Coevolutiva (CoPD) que corrige essas falhas fazendo com que o aluno aprenda em uma parceria única, "semelhante a uma dança".

Veja como o artigo explica o problema e a solução, usando analogias simples:

O Problema: O "Tira-Teima" e a Lacuna "Demais-Afastada"

1. O "Tira-Teima" (RLVR Misto)
Imagine tentar ensinar ao seu aluno Matemática e Arte exatamente ao mesmo tempo, na mesma sala de aula, com o mesmo professor.

  • O Problema: Matemática exige lógica e regras estritas, enquanto Arte exige criatividade e quebrar regras. Quando você as mistura, o aluno fica confuso. O artigo chama isso de "divergência de capacidade". É como um tira-teima onde a lição de Matemática puxa o aluno para um lado, e a lição de Arte puxa-o para o outro. O aluno acaba ficando medíocre em ambas, porque as lições se anulam mutuamente.

2. A Lacuna "Demais-Afastada" (OPD Estática)
Então, os pesquisadores tentaram uma abordagem diferente: "Vamos treinar um especialista em Matemática primeiro, depois treinar um especialista em Arte separadamente, e então fazer com que eles ensinem um novo aluno."

  • O Problema: Na hora em que o especialista em Matemática termina o treinamento, ele mudou tanto que já não está mais falando a mesma "língua" que o novo aluno. O aluno é um iniciante; o especialista é um grande mestre.
  • A Analogia: Imagine um grande mestre de xadrez tentando ensinar uma criança pequena. O grande mestre faz movimentos complexos demais para a criança entender. A criança (o aluno) olha para os movimentos do grande mestre (o professor) e pensa: "Não faço ideia do que você está fazendo." O conhecimento se perde porque eles estão muito distantes em seus padrões de pensamento. O artigo chama isso de "lacuna de padrão comportamental".

A Solução: A "Dança Coevolutiva" (CoPD)

Os autores propõem o CoPD, que muda completamente o cronograma de treinamento. Em vez de treinar um especialista primeiro e ensinar depois, eles treinam dois alunos simultaneamente que ensinam e aprendem constantemente um com o outro.

Veja como a dança funciona:

Passo 1: O Treino Solo (Fase RLVR)

  • O "Aluno de Matemática" pratica apenas problemas de Matemática.
  • O "Aluno de Arte" pratica apenas problemas de Arte.
  • Por quê? Isso permite que eles se tornem muito bons em suas habilidades específicas e descubram novas técnicas avançadas. Eles começam a se afastar em seus pensamentos, o que é bom porque significa que eles têm novas coisas para ensinar um ao outro.

Passo 2: A Troca de Parceiros de Dança (Fase OPD Mútua)

  • Antes que se afastem demais, eles param e trocam de papéis.
  • O Aluno de Matemática tenta resolver problemas de Arte, e o Aluno de Arte observa e dá feedback.
  • O Aluno de Arte tenta resolver problemas de Matemática, e o Aluno de Matemática observa e dá feedback.
  • Por quê? Porque eles acabaram de praticar juntos, ainda estão próximos o suficiente em seus padrões de pensamento para se entenderem. O Aluno de Matemática pode dizer: "Vejo que você está tentando fazer X, mas aqui há uma maneira melhor", e o Aluno de Arte realmente entende, porque ainda estão na mesma página.

Passo 3: Repetir

  • Eles voltam ao Passo 1 para aprender truques ainda mais avançados, depois trocam novamente no Passo 2.
  • Esse ciclo se repete constantemente.

Por Que Isso Funciona Melhor

O artigo afirma que este método é superior por três razões principais:

  1. Sem Tira-Teima: Como eles praticam suas habilidades específicas separadamente por um tempo, não ficam confusos ao misturar regras de Matemática e Arte.
  2. Sem Lacuna "Demais-Afastada": Como eles trocam de papéis durante o treinamento (e não depois), nunca se afastam tanto a ponto de não conseguirem se entender. Eles permanecem em um "ponto ideal" onde o professor é avançado o suficiente para ensinar, mas próximo o suficiente para ser entendido.
  3. Crescimento Mútuo: Eles não são apenas um professor e um aluno; eles estão coevoluindo. Eles crescem juntos. O artigo descobriu que o resultado final é um único modelo que é, na verdade, melhor tanto em Matemática quanto em Arte do que os "especialistas" individuais eram sozinhos.

Os Resultados

Os pesquisadores testaram isso em um modelo que precisava lidar com texto (Matemática), imagens (Arte) e vídeos.

  • Métodos Antigos: O modelo ficava confuso (treinamento misto) ou perdia conhecimento (ensino estático).
  • CoPD: O modelo dominou as três áreas. Na verdade, o modelo final "tudo-em-um" teve desempenho melhor do que os especialistas especializados dos quais foi construído.

Resumo

Pense no CoPD não como uma escola onde você se gradua em uma matéria antes de começar a próxima, mas como uma academia onde dois atletas treinam juntos. Eles fazem seus próprios exercícios para ficar mais fortes, depois imediatamente se auxiliam para compartilhar dicas enquanto ainda estão aquecidos e sincronizados. Quando terminam, ambos estão mais fortes do que estariam se tivessem treinado sozinhos ou em isolamento.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →