← Últimos artigos
💬 NLP

CANTANTE: Optimizing Agentic Systems via Contrastive Credit Attribution

CANTANTE é um novo framework que otimiza sistemas multiagente baseados em LLMs resolvendo o problema de atribuição de crédito por meio de atribuição contrastiva de recompensas em nível de sistema a agentes individuais, alcançando desempenho de última geração na otimização de prompts em diversos benchmarks ao mesmo tempo que reduz os custos de inferência.

Autores originais: Tom Zehle

Publicado 2026-05-14
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Tom Zehle

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma equipe de três especialistas trabalhando juntos para resolver um quebra-cabeça difícil: um Planejador que mapeia os passos, um Codificador que escreve a solução e um Validador que verifica se ela funciona. É isso que o artigo chama de "Sistema Multi-Agente".

O problema identificado pelos autores, liderados por Tom Zehle, é o seguinte: quando a equipe falha, você recebe uma única nota para todo o grupo (por exemplo, "Você tirou C"). Mas você não sabe quem errou. Será que o Planejador deu instruções ruins? Será que o Codificador cometeu um erro de digitação? Ou será que o Validador deixou passar um erro?

No aprendizado de máquina tradicional, toda a equipe recebe a mesma nota, e todos tentam mudar seu comportamento com base nessa única pontuação. É como um professor dizer a uma equipe de futebol: "Vocês perderam o jogo" e, em seguida, pedir ao goleiro, ao atacante e ao árbitro que mudem todas as suas estratégias com base naquela única frase. É ineficiente e confuso.

A Solução: CANTANTE

Os autores apresentam um novo framework chamado CANTANTE. Pense no CANTANTE como um Analista Esportivo superinteligente que observa a equipe jogando o mesmo jogo várias vezes com estratégias ligeiramente diferentes e, em seguida, detalha exatamente quem contribuiu para a vitória ou para a derrota.

Veja como funciona, usando uma analogia simples:

1. O Jogo "E Se?" (Atribuição Contrastiva)

Em vez de apenas dar uma nota à equipe uma vez, o CANTANTE faz a equipe passar pelo mesmo quebra-cabeça três ou quatro vezes seguidas.

  • Execução A: O Planejador usa um tom rigoroso, o Codificador usa um estilo rápido.
  • Execução B: O Planejador usa um tom amigável, o Codificador usa o mesmo estilo rápido.
  • Execução C: O Planejador usa um tom rigoroso, o Codificador usa um estilo lento.

Após essas execuções, a equipe recebe uma pontuação para cada uma. Agora, o Atribuidor (o Analista) entra em ação. Ele analisa as diferenças:

  • "Na Execução A e na Execução B, o Codificador foi o mesmo, mas o Planejador mudou. A pontuação subiu. Portanto, o novo tom do Planejador foi útil!"
  • "Na Execução A e na Execução C, o Planejador foi o mesmo, mas o Codificador mudou. A pontuação caiu. Portanto, o novo estilo do Codificador foi prejudicial."

Isso é chamado de Atribuição Contrastiva. Isola a contribuição de cada pessoa comparando-as entre si, em vez de olhar apenas para a pontuação final.

2. A "Pontuação de Crédito" para Cada Agente

Uma vez que o Analista descobre quem ajudou e quem prejudicou a equipe, ele atribui a cada agente uma Pontuação de Crédito específica (variando de -1 a +1).

  • Se o Planejador receber +0,8, o sistema sabe que deve ajustar as instruções do Planejador para se assemelhar mais a essa versão bem-sucedida.
  • Se o Codificador receber -0,5, o sistema sabe que deve afastar o Codificador desse estilo específico.

Crucialmente, o artigo afirma que isso é melhor do que apenas copiar a pontuação global. Na maneira antiga, se a equipe falhasse, o Planejador poderia ser culpado, mesmo que o Planejador tivesse feito um ótimo trabalho e o problema fosse o Codificador. O CANTANTE corrige isso dizendo: "O Planejador fez bem; o Codificador precisa mudar".

3. Os Resultados: Equipes Mais Inteligentes, Menos Desperdício

Os autores testaram isso em três tipos muito diferentes de "quebra-cabeças":

  1. Codificação (MBPP): Escrever programas de computador.
  2. Matemática (GSM8K): Resolver problemas de texto.
  3. Pesquisa (HotpotQA): Responder a perguntas complexas que exigem consultar informações em vários lugares.

As Descobertas:

  • Melhores Pontuações: O CANTANTE superou consistentemente outros métodos. Na tarefa de codificação, melhorou a precisão em quase 19% em comparação com o próximo melhor método. Na tarefa de matemática, melhorou em 12,5%.
  • Mais Barato de Executar: Surpreendentemente, as equipes otimizadas pelo CANTANTE não precisaram "pensar" por mais tempo ou usar mais poder de computador para obter a resposta correta. Na verdade, nas tarefas de codificação e matemática, usaram menos recursos (tokens) do que as equipes não otimizadas.
  • Estabilidade: O método não teve apenas sorte uma vez; funcionou consistentemente em diferentes inícios aleatórios.

Por Que Isso Importa (Segundo o Artigo)

O artigo argumenta que construir essas equipes de IA não deve ser um jogo de "adivinhar e verificar" onde humanos ajustam manualmente os prompts. Em vez disso, deve ser uma ciência de Atribuição de Crédito.

Assim como um treinador não grita com toda a equipe quando um jogador erra um chute, o CANTANTE garante que o sistema de IA aprenda exatamente qual parte da equipe precisa melhorar. Ele transforma a "caixa preta" de um sistema multi-agente em uma máquina transparente onde cada agente sabe exatamente como melhorar.

Em resumo: O CANTANTE é um método que permite que equipes de IA aprendam com seus erros perguntando: "Quem especificamente causou esse resultado?" em vez de apenas dizer: "Falhamos, tentem mais". Isso leva a sistemas de IA mais inteligentes, mais eficientes e mais precisos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →