← Últimos artigos
🤖 AI

DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems

O DoVer é um framework de auto-depuração orientado por intervenção para sistemas multiagentes de LLM que supera as limitações da localização de falhas baseada apenas em logs ao verificar ativamente hipóteses por meio de intervenções direcionadas e medir o sucesso via recuperação de tarefas e progresso, em vez de precisão de atribuição.

Autores originais: Ming Ma, Jue Zhang, Fangkai Yang, Yu Kang, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

Publicado 2026-02-03
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Ming Ma, Jue Zhang, Fangkai Yang, Yu Kang, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma equipe de assistentes digitais (agentes de IA) trabalhando juntos para resolver um quebra-cabeça complexo, como encontrar um fato histórico específico na internet ou resolver um problema matemático difícil. Às vezes, a equipe fica travada ou dá a resposta errada. Isso é chamado de "falha".

Por muito tempo, quando essas equipes falhavam, os desenvolvedores tentavam consertá-las lendo o "diário" do que aconteceu (os logs) e perguntando a uma IA inteligente para adivinhar quem cometeu o erro e quando. É como assistir ao filme de um acidente de carro e tentar apontar o segundo exato em que o motorista deu um golpe no volante.

O artigo argumenta que esse "jogo de adivinhação" é falho por dois motivos principais:

  1. O diário é confuso: Frequentemente, não há apenas um erro claro. A equipe pode tentar a Estratégia A, falhar, depois tentar a Estratégia B e falhar novamente. Identificar um único "vilão" é muitas vezes impossível porque todo o processo é bagunçado.
  2. Adivinhar não é suficiente: Mesmo que você adivinhe a pessoa certa, você não sabe se está certo até realmente tentar consertar.

A Solução: DoVer (Do-then-Verify / Fazer-então-Verificar)

Os autores introduzem um novo sistema chamado DoVer. Em vez de apenas adivinhar quem está errado, o DoVer diz: "Vamos tentar consertar e ver se funciona".

Pense no DoVer como um mecânico com uma máquina do tempo que não apenas olha para o carro quebrado; eles realmente voltam no tempo, ajustam o motor e dirigem novamente para ver se ele funciona.

Aqui está como o DoVer funciona, passo a passo, usando uma analogia simples:

1. Dividindo a História em Capítulos (Segmentação de Tentativas)

Quando a equipe de IA falha, eles geralmente passam por várias "tentativas" ou "capítulos". No primeiro capítulo, eles tentam encontrar a resposta rolando uma página da web. No segundo capítulo, percebem que aquilo não funcionou e tentam usar uma ferramenta de calendário.

  • O movimento do DoVer: Ele corta a história longa e bagunçada nesses capítulos (tentativas) distintos para que possa analisar cada tentativa separadamente.

2. Fazendo um Palpite Instruído (Geração de Hipótese)

Para cada capítulo, o DoVer pergunta a uma IA inteligente: "Com base nesta história, onde as coisas deram errado?"

  • O Palpite: "Eu acho que o problema foi que o agente 'Navegador Web' tentou clicar em um botão que não existia."

3. A Parte do "Fazer": A Intervenção

Este é o passo mágico. Em vez de apenas escrever o palpite, o DoVer realmente altera a história. Ele volta àquele momento específico no "diário" e edita a instrução.

  • A Edição: Ele diz ao agente Navegador Web: "Não clique naquele botão. Em vez disso, role até o final da página."
  • A Analogia: Imagine que você está dirigindo uma peça de teatro. O ator diz a fala errada. O DoVer não escreve apenas uma nota dizendo "Você disse a fala errada". O DoVer interrompe a peça, caminha até o palco, sussurra a fala correta para o ator e diz: "Agora, diga isto em vez disso".

4. A Parte do "Verificar": Reexecutando a Peça

Após fazer a edição, o DoVer deixa a equipe de IA continuar a partir daquele ponto exato.

  • Se a equipe resolver o quebra-cabeça: O palpite estava correto! A intervenção funcionou.
  • Se a equipe ainda falhar: O palpite estava errado. Talvez o problema não fosse o botão, mas algo totalmente diferente.

O Que Eles Descobriram?

Os pesquisadores testaram isso em duas configurações diferentes de equipes de IA e em vários conjuntos de dados difíceis (como o GAIA e o AssistantBench, que são como exames difíceis para IAs).

  • Transformando Falhas em Vitórias: O DoVer conseguiu transformar de 18% a 28% das tentativas falhas em tentativas bem-sucedidas. Em um conjunto de dados matemáticos específico, ele corrigiu 49% das falhas.
  • Progredindo Mesmo Quando Não Vence: Mesmo quando não resolvia o quebra-cabeça inteiro, o DoVer frequentemente ajudava a equipe a chegar "mais longe" no caminho (como alcançar o próximo marco) do que estavam antes.
  • Testando os Palpites: O DoVer provou que cerca de 30% a 60% dos palpites iniciais sobre quem estava errado eram, de fato, corretos (ou incorretos). Isso é enorme porque significa que podemos parar de depender de palpites humanos incertos e começar a usar provas reais.

Por Que Isso Importa (Segundo o Artigo)

O artigo afirma que a intervenção (consertar e reexecutar) é uma maneira muito melhor de depurar equipes de IA do que apenas a atribuição (adivinhar quem é o culpado).

  • Jeito Antigo: "Eu acho que o Agente A errou no Passo 5." (Palpite não comprovado).
  • Jeito DoVer: "Eu mudei a instrução do Agente A no Passo 5. Agora a equipe teve sucesso. Portanto, o Agente A era o problema." (Fato comprovado).

Os autores concluem que essa abordagem de "Fazer-então-Verificar" torna os sistemas de IA mais confiáveis porque foca em resultados (funcionou?) em vez de apenas culpa (quem fez?). Isso também destaca que, às vezes, o problema não é apenas uma instrução ruim, mas uma falta de capacidade nas ferramentas que os agentes usam (como um navegador que não consegue rolar a página adequadamente), algo que o sistema agora consegue identificar.

Em resumo: O DoVer deixa de ser um jogo de "Quem Matou?" para o debug de IA e o transforma em um jogo de "Vamos Consertar e Ver".

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →