← Últimos artigos
💬 NLP

Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning

O Agon introduz um framework competitivo de aprendizado por reforço entre modelos onde dois modelos atuam como avaliadores mútuos ao elaborarem e resolverem problemas iterativamente um contra o outro, recompensando implicitamente o raciocínio superior sem rótulos de processo e superando significativamente as abordagens padrão de RL de modelo único em tarefas de raciocínio complexas.

Autores originais: Vladislav Beliaev

Publicado 2026-07-09
📖 4 min de leitura☕ Leitura rápida

Autores originais: Vladislav Beliaev

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um aluno a resolver problemas matemáticos incrivelmente difíceis.

O Jeito Antigo: O Treinador do "Apenas a Resposta"
Atualmente, o método padrão (chamado GRPO) é como um treinador que olha apenas para a resposta final na prova.

  • Se o aluno acerta a resposta, ele ganha uma estrela dourada.
  • Se ele erra, recebe um X vermelho.
  • O Problema: O treinador nunca olha para como o aluno chegou lá. Se o aluno escrever um ensaio de 10 páginas de divagações confusas, palpites e retrocessos apenas para, por acidente, tropeçar na resposta certa, ele ainda assim ganhará a estrela dourada.
  • O Resultado: O aluno aprende a escrever mais palavras, não a pensar melhor. Eles começam a preencher suas páginas com "Hum, deixe-me pensar..." e "Espere, talvez..." apenas para aumentar suas chances de acertar por sorte. Eles se tornam verbosos, mas não necessariamente mais inteligentes.

O Novo Jeito: Agon (O "Clube de Debate")
Um artigo apresenta um novo método chamado Agon (do grego "concurso"). Em vez de um aluno trabalhar sozinho, o Agon coloca dois alunos em uma sala para resolver o mesmo problema juntos, mas com um toque: eles estão competindo para ver quem consegue superar o raciocínio do outro.

Aqui está como o jogo "Agon" funciona:

  1. O Draft: O Aluno A tenta resolver o problema primeiro. Ele escreve seu raciocínio e um resumo de seus passos (mas esconde a resposta final).
  2. O Desafio: O Aluno B lê o resumo do Aluno A. O objetivo do Aluno B é resolver o problema melhor que o Aluno A.
    • Se o Aluno A cometeu um erro (como um erro de sinal em uma equação), o Aluno B o detecta, corrige e obtém a resposta certa. O Aluno B vence.
    • Se o Aluno A estava certo, o Aluno B tenta encontrar uma maneira mais curta e limpa de provar isso.
  3. A Troca: Na rodada seguinte, eles trocam de papéis. O Aluno B faz o draft, e o Aluno A desafia.

Por que Isso Funca (A Magia da "Avaliação por Rivalidade")
No método antigo, o aluno tinha que adivinhar como era um "bom pensamento", porque ninguém o dizia. No Agon, o rival faz a avaliação.

  • Feedback Implícito: Se o raciocínio do Aluno A estiver cheio de lacunas, o Aluno B o vencerá facilmente. Isso ensina ao Aluno A que "divagar" e usar "enchimento" não funciona, porque um rival inteligente irá pegá-lo.
  • Sem Necessidade de Rótulos: Não precisamos de um professor humano para dizer: "Este passo foi brilhante, este passo foi encheção de linguiça". O fato de um aluno ter vencido o outro é a prova de que o raciocínio foi melhor.
  • A "Corrida Armamentista": Como ambos os alunos estão ficando mais inteligentes ao mesmo tempo, o nível continua subindo. O Aluno A não pode apenas dar palpites; ele precisa realmente raciocinar bem para vencer o Aluno B, que também está ficando mais inteligente.

Os Resultados
Os pesquisadores testaram isso em problemas matemáticos muito difíceis (usando um modelo chamado Qwen3).

  • Método Padrão: O modelo acertou cerca de 30% dos problemas difíceis, mas escreveu explicações enormes e longas para conseguir.
  • Método Agon: Os dois modelos competindo acertaram cerca de 61% dos problemas.
  • Bônus: As explicações foram, na verdade, mais curtas. Como os modelos estavam competindo para serem eficientes e detectar erros, eles pararam de escrever bobagens desnecessárias.

O Truque das "Duas Etapas"
Quando o sistema é usado para resolver um problema para um usuário, ele funciona como uma corrida de revezamento:

  1. O Modelo A escreve um rascunho da solução.
  2. O Modelo B lê esse rascunho, verifica erros e escreve a resposta final.
    Isso acontece automaticamente. O artigo mostra que treinar dois modelos para lutarem entre si desta forma é muito mais eficaz do que ter dois modelos trabalhando bem juntos (cooperando) ou ter um modelo tentando corrigir seus próprios erros.

Em Resumo
O Agon impede que os modelos de IA fiquem "conversando" para ter sorte. Em vez disso, força-os a serem aguçados, concisos e precisos, colocando-os contra um rival que está constantemente procurando por seus erros. Ele transforma o processo de treinamento de uma sessão de prática solo em um debate de alto nível onde a única maneira de vencer é pensar com clareza.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →