← 最新论文
🤖 AI

Multi-Turn Evaluation of Deep Research Agents Under Process-Level Feedback

本文引入了一种用于深度研究智能体的多轮评估框架,该框架采用了一种名为“研究差距推断”(Research Gap Inference)的新颖过程级反馈方法,揭示了虽然一轮针对性的反馈能显著提升报告质量,但随后的轮次却无法实现增益的复合,因为智能体会对先前已满足的标准发生退化,这表明可靠的多轮改进对于当前的架构而言仍难以实现。

原作者: Rishabh Sabharwal, Hongru Wang, Amos Storkey, Jeff Z. Pan

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Rishabh Sabharwal, Hongru Wang, Amos Storkey, Jeff Z. Pan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一支由超级聪明的研究助理(被称为深度研究智能体/Deep Research Agents)组成的团队,让他们撰写一份关于复杂话题的详细报告,比如“深度伪造技术的发展史”或“某家特定公司的财务健康状况”。

通常情况下,我们测试这些助手的方法是给他们一个问题,让他们写出一份初稿,然后对这一份初稿进行评分。但在现实生活中,如果你从人类研究员那里得到一份草案,你很少会直接接受它。你会给他们反馈,比如:“你漏掉了一些关键法律,”或者“你的来源太模糊了,”并要求他们重写。

这篇论文探讨的是:当你给这些 AI 助手提供反馈时,它们是真的能变得更好,还是在试图修复自己的工作时把事情搞砸了?

研究人员通过两种不同的反馈方式进行了测试:

1. “自我反思”测试(盲人编辑)

在这种情景下,AI 被告知:“查看你的报告,找到你自己的错误,并修复它们。” 不提供任何外部帮助。

  • 结果: 这就像是让一名学生在没有老师提供标准答案的情况下,自己给自己的作文打分。AI 努力尝试,搜索更多的网页并阅读更多的资料,但它无法弄清楚到底哪里出了问题。
  • 类比: 这就像是在蒙着眼睛试图修理一艘漏水的船。你可能会敲打木头并增加更多的木板(做了更多的工作),但因为你看不到那个洞,你可能会不小心在另一个地方敲出一个洞。结果呢?船依然在漏水,甚至可能漏得更厉害了。AI 的得分几乎没有变化,有时甚至变差了。

2. “过程级反馈”测试(战略教练)

在这里,研究人员不仅仅是说“修复这个”。他们使用了一个名为 RGI(研究差距推断/Research Gap Inference)的特殊工具。该工具观察 AI 的报告和评分标准,以确定 AI 在哪里失败了。

反馈不再是说“添加关于 X 的事实”,而是更像一位教练在说:“你正在寻找错误类型的来源,” 或者 “你把这个话题谈得太宽泛了,需要深入挖掘具体细节,” 或者 “你遗漏了最重要的法律文件。”

  • 结果: 这在第一轮修复中效果显著。AI 理解了这种策略,回到“图书馆”,找到了正确的书籍,并写出了一份好得多的报告。它们的得分大幅上升(约 8 到 15 分)。
  • 类比: 这就像一位教练告诉跑步者,“你不是因为体力耗尽而跑不动,而是你的鞋子尺寸不对。” 一旦 AI 换上了正确的鞋子(正确的研究策略),它跑得更快、更好了。

症结所在:“重写”问题

研究人员随后要求 AI 再做一次(第三轮)。他们预期分数会持续提高。

  • 结果: 对于大多数 AI 模型来说,进步停止了。事实上,当它们试图修复剩余的小问题时,它们反而破坏了原本已经运作良好的部分。
  • 类比: 想象一位厨师做了一份很棒的汤。教练说,“加一点盐。”厨师加了盐,汤完美了。但接着教练说,“现在,修整一下装饰品。”厨师为了追求完美,决定把整锅汤倒掉重新开始。在制作新的一锅的过程中,他们忘记了刚才加进去的盐,或者弄坏了之前已经处理好的蔬菜。
  • 为什么? 本研究中使用的 AI 模型工作原理是每次都“从头开始重写整个报告”。它们没有“上次哪些部分做得好”的记忆。因此,当它们试图修复一件事时,往往会弄丢那些已经修复好的东西。

唯一的例外:“谨慎型”模型

有一个特定的 AI 模型(DeepSeek-V4-Flash)表现得不同。它没有把整锅汤倒掉。它保留了大部分好喝的汤,只是添加了新的配料。它在第三轮中再次提高了得分。

  • 代价: 然而,这个“谨慎型”模型极其昂贵且缓慢。它使用了大约 4 倍的计算能力,并且比其他模型思考的时间长得多。它就像一位拒绝扔掉任何东西、并且细致检查每一件食材的厨师,这既费时又极其昂贵。

核心结论

  1. AI 无法自我修复: 如果你告诉 AI “修复你自己的错误”,它通常只会让情况变得更糟或原地踏步,因为它无法看到全局。
  2. 战略性反馈有效: 如果你告诉 AI 如何进行研究(例如,“寻找官方文件,而不是博客文章”),它可以写出更出色的报告。
  3. “全量重写”的缺陷: 现有的 AI 研究工具就像艺术家,每当想要增加一笔新笔触时,都会擦掉整张画布。这使得在不意外删除已有优秀部分的前提下,进行循序渐进的报告改进变得非常困难。要实现真正可靠、多步骤的改进,我们需要能够记住哪些地方做得对、并且只修改需要修改的部分,而不是每次都从头开始的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →