← Últimos artigos
🤖 machine learning

On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity

Este artigo revela que, embora a autodestilação on-policy com demonstrações amostradas alcance uma forte acurácia pass@1, ela inadvertidamente reduz a diversidade de saída e achata o desempenho pass@k ao amplificar vieses existentes do modelo através de feedback cumulativo, limitando, em última análise, a capacidade do modelo de gerar estratégias diversas para tarefas fora da distribuição.

Autores originais: Andrei Liviu Nicolicioiu, Mohammad Pezeshki, Aaron Courville

Publicado 2026-06-25
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Andrei Liviu Nicolicioiu, Mohammad Pezeshki, Aaron Courville

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Ideia: O Efeito "Câmara de Eco"

Imagine que você está tentando aprender a resolver um labirinto. Você tem um professor que é, na verdade, apenas uma versão sua um pouco mais velha.

Em uma configuração de aprendizado padrão (chamada de Aprendizado por Reforço ou RL), se você encontrar qualquer caminho correto pelo labirinto, o professor diz: "Bom trabalho!" e te dá uma recompensa. Não importa se você pegou o caminho longo, sinuoso e panorâmico ou a rodovia curta e direta. Contanto que você tenha chegado à saída, você recebe o mesmo "toca aqui". Isso incentiva você a tentar muitos caminhos diferentes.

No método que este artigo estuda, chamado Autodestilação com Demonstrações Amostradas (SDSD), o professor trabalha de forma diferente. Antes de você começar, o professor escolhe um caminho correto específico que você (ou outra pessoa) encontrou anteriormente e diz: "Ok, eu quero que você tente resolver o labirinto exatamente como este caminho específico".

O artigo argumenta que, embora esse método ajude você a acertar a resposta com muita frequência (alta precisão), ele secretamente te torna preguiçoso e repetitivo. Você para de explorar novos caminhos porque o professor só te elogia quando você imita o caminho específico que ele está segurando.

O Problema Central: "O Rico Fica Mais Rico"

Os autores descobriram um custo oculto para este método: Perda de Diversidade.

Pense nisso como uma música popular no rádio.

  • RL Padrão: Se uma música nova é boa, o DJ a toca. Se outra música nova também for boa, ele toca ela também. Você recebe uma mistura de sucessos.
  • Autodestilação (SDSD): O DJ escolhe a única música que já está tocando mais vezes. Eles dizem à banda: "Toque exatamente como aquela música".
    • Se a banda toca uma música que soa nem que seja ligeiramente parecida com o sucesso, o professor adora e reforça isso.
    • Se a banda toca uma música completamente diferente (mas ainda correta), o professor fica confuso ou menos entusiasmado porque ela não combina com a "demonstração amostrada" que ele está segurando.

Com o tempo, a banda para de tocar algo novo. Eles apenas tocam variações daquele único sucesso. Eles se tornam incrivelmente bons naquela única música, mas se a estação de rádio pedir um gênero diferente, eles falham.

O Que o Artigo Descobriu (A Evidência)

Os pesquisadores testaram isso em duas coisas principais:

1. O Jogo do "Labirinto de Grafos"
Eles criaram um jogo onde uma IA tinha que encontrar um caminho através de um grafo feito de diferentes conceitos (como pássaros, frutas ou formas).

  • A Armadilha: Alguns caminhos eram curtos e fáceis; outros eram longos e difíceis.
  • O Resultado: Os modelos SDSD encontraram os caminhos fáceis muito rapidamente e obtiveram pontuações altas. No entanto, eles ignoraram completamente os caminhos longos e difíceis.
  • A Falha: Quando os pesquisadores mudaram as regras (tornando todos os caminhos longos), os modelos SDSD colapsaram. Eles haviam aprendido a confiar no "hábito do caminho fácil" e não conseguiram se adaptar. Os modelos de RL, tendo praticado muitas rotas diferentes, lidaram facilmente com as novas regras.

2. Questões de Ciências
Eles testaram os modelos em questões de ciências (Biologia, Química, Física).

  • A Métrica: Eles observaram o pass@k. Isso pergunta: "Se pedirmos para a IA gerar 16 respostas diferentes, quantas delas estão corretas?"
  • A Descoberta: Os modelos SDSD foram ótimos em acertar a primeira resposta (pass@1). Mas quando solicitados a gerar 16 respostas, quase todas as 16 eram a mesma resposta, apenas escrita de forma ligeiramente diferente.
  • O Contraste: Os modelos de RL geraram 16 respostas corretas diferentes. Se a primeira estivesse errada, a 16ª poderia estar certa. Os modelos SDSD não ofereciam planos de contingência.

Por Que Isso Acontece? (A Balança "Inclinada")

O artigo usa matemática pesada para explicar por que, mas aqui está a versão simples:

Imagine uma balança equilibrando diferentes soluções.

  • O RL Padrão trata todas as soluções corretas como iguais. Se a Solução A e a Solução B forem ambas corretas, a balança permanece equilibrada.
  • A Autodestilação inclina a balança. Ela olha para a "demonstração" (o caminho de exemplo) e pergunta: "O quanto a Solução A se parece com o exemplo?". Se a Solução A se parece um pouco com o exemplo, a balança inclina fortemente a seu favor. Se a Solução B for diferente, a balança inclina contra ela.

Como a IA está constantemente vendo suas próprias respostas "populares" como os exemplos, ela inclina a balança cada vez mais em direção a essas respostas populares. As respostas "não populares", mas ainda assim corretas, são esmagadas. Isso é chamado de Colapso de Modo (Mode Collapse) — a IA colapsa em uma única forma de pensar.

A Armadilha da "Entropia"

O artigo também aponta um problema de medição sutil. Geralmente, os cientistas medem a "diversidade" contando quantos termos diferentes a IA usa (Entropia de Tokens).

  • O artigo descobriu que os modelos SDSD ainda podem usar uma grande variedade de palavras (alta diversidade de palavras) enquanto ainda pensam da exata mesma maneira (baixa diversidade semântica).
  • É como duas pessoas escrevendo ensaios. Uma escreve sobre "gatos" e a outra sobre "cachorros". Elas usam palavras diferentes, mas se ambas argumentarem exatamente o mesmo ponto e na exata mesma estrutura, elas não são realmente diversas em seu pensamento. Os modelos SDSD fazem isso: eles embaralham as palavras, mas mantêm a mesma estratégia rígida.

A Conclusão

O artigo conclui que a Autodestilação com Demonstrações Amostradas é uma faca de dois gumes.

  • O Bom: Torna os modelos muito precisos ao acertar a resposta correta na primeira tentativa para problemas que eles já viram antes.
  • O Ruim: Destrói a capacidade do modelo de pensar criativamente ou tentar estratégias diferentes. Se o problema mudar ligeiramente, ou se a primeira tentativa estiver errada, o modelo não tem um plano de reserva.

Os autores sugerem que, se quisermos que a IA seja robusta e adaptável, não podemos apenas observar com que frequência ela acerta a resposta. Temos que verificar se ela está realmente tentando abordagens diferentes ou se está apenas repetindo o mesmo truque repetidamente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →