← Últimos artigos
🤖 AI

Multi-Turn Evaluation of Deep Research Agents Under Process-Level Feedback

Este artigo introduz um framework de avaliação de múltiplos turnos para agentes de pesquisa profunda usando um novo método de feedback ao nível de processo chamado Inferência de Lacuna de Pesquisa, revelando que, embora uma única rodada de feedback direcionado melhore significativamente a qualidade do relatório, turnos subsequentes falham em acumular ganhos devido ao fato de os agentes regredirem em critérios previamente satisfeitos, indicando que a melhoria confiável em múltiplos turnos permanece fora do alcance das arquiteturas atuais.

Autores originais: Rishabh Sabharwal, Hongru Wang, Amos Storkey, Jeff Z. Pan

Publicado 2026-06-09
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Rishabh Sabharwal, Hongru Wang, Amos Storkey, Jeff Z. Pan

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você contratou uma equipe de assistentes de pesquisa super inteligentes (chamados de Agentes de Pesquisa Profunda) para escrever um relatório detalhado sobre um tópico complexo, como "A história da tecnologia deepfake" ou "A saúde financeira de uma empresa específica".

Normalmente, testamos esses assistentes dando-lhes uma pergunta, deixando que escrevam um rascunho e, em seguida, avaliando esse único rascunho. Mas, na vida real, se você recebe um rascunho de um pesquisador humano, raramente apenas o aceita. Você dá feedback como: "Você esqueceu algumas leis importantes" ou "Suas fontes são muito vagas", e pede que ele reescreva.

Este artigo pergunta: Será que esses assistentes de IA conseguem realmente melhorar quando você lhes dá feedback, ou eles apenas fazem uma bagunça ao tentar consertar o próprio trabalho?

Os pesquisadores testaram isso usando duas formas diferentes de dar feedback:

1. O Teste de "Auto-Reflexão" (O Editor com Venda nos Olhos)

Neste cenário, a IA é instruída: "Olhe para o seu relatório, encontre seus próprios erros e corrija-os." Nenhum auxílio externo é fornecido.

  • O Resultado: Foi como pedir a um aluno que avaliasse a própria redação sem ter o gabarito do professor. A IA tentou com afinco, pesquisando mais na web e lendo mais fontes, mas não conseguiu entender o que estava realmente errado.
  • A Analogia: Imagine que você está tentando consertar um barco com vazamento enquanto usa uma venda nos olhos. Você pode martelar a madeira e adicionar mais tábuas (fazendo mais trabalho), mas como não consegue ver o buraco, pode acabar martelando um buraco em outro lugar por acidente. O resultado? O barco continua vazando, ou talvez esteja vazando ainda mais. A pontuação da IA mal mudou ou, às vezes, piorou.

2. O Teste de "Feedback ao Nível do Processo" (O Treinador Estratégico)

Aqui, os pesquisadores não disseram apenas "corrija isso". Eles usaram uma ferramenta especial chamada RGI (Inferência de Lacuna de Pesquisa). Esta ferramenta analisava o relatório da IA e a rubrica de avaliação para descobrir como a IA falhou.

Em vez de dizer "Adicione um fato sobre X", o feedback era mais como um treinador dizendo: "Você está olhando para o tipo errado de fontes", ou "Você está tratando este tópico de forma muito ampla e precisa mergulhar mais fundo em detalhes específicos", ou "Você esqueceu os documentos legais mais importantes".

  • O Resultado: Isso funcionou maravilhas para as primeiras rodadas de correções. A IA entendeu a estratégia, voltou à biblioteca, encontrou os livros certos e escreveu um relatório muito melhor. Suas pontuações saltaram significativamente (cerca de 8 a 15 pontos).
  • A Analogia: Isso é como um treinador dizendo a um corredor: "Você não está ficando sem energia; seus sapatos estão do tamanho errado". Uma vez que a IA teve os sapatos certos (a estratégia de pesquisa certa), ela correu muito mais rápido e melhor.

A Armadilha: O Problema da "Reescrita"

Os pesquisadores então pediram à IA para fazer isso novamente (uma terceira rodada). Eles esperavam que as pontuações continuassem melhorando.

  • O Resultado: Para a maioria dos modelos de IA, a melhoria parou. Na verdade, quando tentaram corrigir os pequenos problemas restantes, eles acidentalmente quebraram as partes que já estavam funcionando.
  • A Analogia: Imagine um chef que faz uma sopa excelente. O treinador diz: "Adicione uma pitada de sal". O chef adiciona o sal, e fica perfeita. Mas então o treinador diz: "Agora, corrija o acompanhamento". O chef, tentando ser perfeito, decide jogar fora a panela inteira e começar do zero. No processo de fazer uma nova panela, ele esquece de adicionar o sal que tinha acabado de colocar, ou estraga os vegetais que acertou da primeira vez.
  • Por quê? Os modelos de IA usados neste estudo trabalham "reescrevendo o relatório inteiro do zero" toda vez. Eles não têm memória de "o que foi bom da última vez". Portanto, quando tentam consertar uma coisa, muitas vezes perdem as coisas que já haviam consertado.

A Única Exceção: O Modelo "Cuidadoso"

Um modelo de IA específico (DeepSeek-V4-Flash) comportou-se de forma diferente. Ele não jogou a panela inteira fora. Ele manteve a maior parte da sopa boa e apenas adicionou os novos ingredientes. Ele melhorou sua pontuação novamente na terceira rodada.

  • O Custo: No entanto, este modelo "cuidadoso" era incrivelmente caro e lento. Ele usou cerca de 4 vezes mais poder computacional e levou muito mais tempo para pensar do que os outros. Era como um chef que se recusa a jogar qualquer coisa fora e verifica meticulosamente cada ingrediente, o que leva uma eternidade e custa uma fortuna.

A Conclusão

  1. A IA não consegue se consertar sozinha: Se você disser a uma IA para "corrigir seus próprios erros", ela geralmente apenas piora as coisas ou permanece igual, porque não consegue enxergar o quadro geral.
  2. Feedback estratégico funciona: Se você disser à IA como pesquisar (ex: "procure documentos oficiais, não posts de blogs"), ela pode escrever um relatório muito melhor.
  3. A falha da "Reescrita Total": As ferramentas de pesquisa de IA atuais são como artistas que apagam toda a tela toda vez que querem adicionar uma nova pincelada. Isso torna muito difícil melhorar um relatório passo a passo sem acidentalmente deletar as partes boas. Para obter melhorias verdadeiramente confiáveis e de múltiplamente etapas, precisamos de uma IA que consiga lembrar o que acertou e apenas mude o que precisa ser corrigido, em vez de começar do zero toda vez.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →