← Últimos artigos
🤖 AI

MAR:Multi-Agent Reflexion Improves Reasoning Abilities in LLMs

O artigo propõe o MAR (Multi-Agent Reflexion), um método que emprega debatedores de múltiplas personas para gerar reflexões diversas e superar a degeneração de pensamento observada na autorreflexão de agente único, melhorando significavelmente o desempenho de raciocínio em tarefas como HotPot QA e HumanEval.

Autores originais: Onat Ozer, Yuchen Wang, Grace Wu, Daniel Dosti, Honghao Zhang, Vivi De La Rue

Publicado 2026-06-09
📖 4 min de leitura☕ Leitura rápida

Autores originais: Onat Ozer, Yuchen Wang, Grace Wu, Daniel Dosti, Honghao Zhang, Vivi De La Rue

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: A "Câmara de Eco" da IA

Imagine que você está tentando resolver um quebra-cabeça muito difícil. Você comete um erro, mas em vez de pedir ajuda a um amigo, é forçado a olhar para o seu próprio erro, escrever uma nota para si mesmo sobre o que deu errado e tentar novamente.

É assim que o sistema Reflexion original funciona. É como um aluno fazendo uma prova sozinho em uma sala. Se ele erra uma questão, ele escreve uma nota dizendo: "Errei isso porque deixei passar um detalhe", e então tenta novamente.

Os pesquisadores descobriram uma falha importante nessa abordagem: o aluno está preso demais no seu próprio modo de pensar.

  • Se o aluno errou porque entendeu mal as regras, sua nota de autoavaliação muitas vezes apenas repete esse mesmo mal-entendido.
  • Eles acabam em uma "câmara de eco", onde continuam cometendo exatamente o mesmo erro repetidamente, justificando-o com palavras ligeiramente diferentes.
  • Em termos técnicos do artigo, isso é chamado de "degeneração do pensamento". A IA fica presa em um ciclo de raciocínio equivocado.

A Solução: O "Painel de Especialistas"

Para corrigir isso, os autores criaram o Multi-Agent Reflexion (MAR).

Em vez de um único aluno falando consigo mesmo, imagine que a IA agora é uma equipe de especialistas sentada ao redor de uma mesa para resolver o problema. Quando a equipe comete um erro, eles não apenas escrevem uma nota; eles realizam um debate estruturado.

Aqui está como o novo sistema funciona, passo a passo:

  1. O Ator (O Executor): Uma IA tenta resolver o problema primeiro.
  2. A Falha: Se a resposta estiver errada, o sistema não pede apenas ao "Executor" para consertar.
  3. O Debate (Os Críticos): O sistema convoca uma equipe de diferentes "personas" (personagens de IA especializados). Pense neles como:
    • O Cético: Alguém que duvida de tudo e procura por armadilhas ocultas.
    • O Lógico: Alguém que verifica se as etapas realmente fazem sentido matematicamente.
    • O Criativo: Alguém que sugere ideias alternativas e ousadas.
    • O Verificador: Alguém que checa se a resposta corresponde exatamente às regras.
  4. O Juiz: Uma IA "Juiz" ouve todos esses diferentes especialistas argumentarem. Ele não apenas escolhe um vencedor; ele sintetiza os argumentos deles em uma lição clara e de alta qualidade.
  5. A Tentativa de Novo: O "Executor" recebe essa nova lição rica e tenta novamente. Como a lição veio de um grupo diversificado, é muito mais provável que ela identifique o erro real, em vez de apenas repetir o erro antigo.

Os Resultados: Isso Funciona?

Os pesquisadores testaram isso em dois tipos de desafios muito diferentes:

  • O Teste do "Detetive" (HotPotQA): Isso envolve responder perguntas que exigem conectar pistas de vários documentos diferentes.

    • O Resultado: O sistema de IA única (Reflexion) acertou cerca de 44% das respostas. O novo sistema de "Painel de Especialistas" (MAR) acertou 47%.
    • Nota: Os autores admitem que esse progresso foi menor do que o esperado, em parte porque o sistema de avaliação para essas questões é muito rigoroso quanto a detalhes minúsculos de formatação (como um ponto final ausente), o que às vezes penalizou o raciocínio correto.
  • O Teste do "Programador" (HumanEval): Isso envolve escrever código de computador que deve passar em testes ocultos.

    • O Resultado: O sistema de IA única fez 76,4% do código funcionar. O novo sistema de "Painel de Especialistas" fez 82,6% funcionar.
    • Por que funcionou melhor aqui: Erros de programação são frequentemente loops lógicos ou erros de contagem (off-by-one). As personas "Cético" e "Lógico" foram muito boas em detectar esses tipos específicos de erros que uma IA única continuava perdendo.

A Pegadinha: Custa Mais Caro

O artigo é honesto sobre o lado negativo.

  • O Preço do Debate: Ter toda uma equipe argumentando exige muito mais energia e tempo do que uma pessoa pensando sozinha.
  • O Custo: O novo sistema utiliza cerca de 3 vezes mais poder computacional (e custa 3 vezes mais em taxas de API) do que o sistema original, porque precisa executar múltiplos modelos de IA para realizar o debate.

A Conclusão

O artigo argumenta que, embora a IA esteja ficando mais inteligente, ela ainda tem dificuldade em aprender com seus próprios erros porque fica presa em seus próprios hábitos. Ao forçar a IA a argumentar com diferentes versões de si mesma, ela rompe esses maus hábitos, encontra melhores soluções e torna-se mais confiável — embora o faça a um custo mais elevado.

É a diferença entre um artista solo tentando consertar uma pintura sozinho versus uma equipe inteira de crítica de arte apontando exatamente o que está errado e como consertar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →