← 最新论文
🤖 AI

Why Your Deep Research Agent Fails? On Hallucination Evaluation in Full Research Trajectory

本文通过引入 PING 分类法和 DeepHalluBench 基准测试,解决了基于结果的评估在深度研究智能体中的局限性,从而实现对整个研究轨迹中幻觉现象的感知过程、细粒度审计,揭示系统性可靠性差距,并为架构改进提供可操作的见解。

原作者: Yuhao Zhan, Tianyu Fan, Linxuan Huang, Zirui Guo, Chao Huang

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuhao Zhan, Tianyu Fan, Linxuan Huang, Zirui Guo, Chao Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你雇佣了一位超级聪明的研究助理,来解答一个非常棘手的问题。你问他:“谁是唯一一位因出演自己执导的电影而获得奥斯卡表演奖的人?”他随即出发,搜索互联网,阅读文章,最后带回一份最终报告。

旧有的检查方式:
过去,如果你想了解你的助理是否称职,你只需查看最终报告。如果名字正确,他就获得一颗金星;如果名字错误,他就得到一个红叉。

问题所在:
这篇论文指出,仅凭最终答案来评判,就像只凭汤的味道来评价一位厨师,却不去观察他是如何烹饪的。也许汤味道不好是因为他忘了放盐(一个小错误),也许他使用了冰箱深处发现的一颗腐烂番茄(一个大谎言),或者也许他完全误解了你的点单,从而开始烹饪一道错误的菜肴。

作者表示,当前的“深度研究智能体”(AI 研究人员)在过程中就会犯错,但由于我们只检查最终答案,因此无法看到他们在哪里为何失败。错误往往隐藏在半途之中。

新方法:“过程侦探”

作者构建了一个名为DeepHalluBench的新系统。你可以将其想象为一个透明的厨房,我们可以在此观察助理一步步烹饪的过程。他们不仅检查汤,还检查每一种食材、每一次切配和每一次搅拌。

他们制定了一套名为PING 分类法的新规则,用于对 AI 产生困惑的不同方式进行分类。以下是 PING 所代表的含义,辅以简单的类比:

  1. P - 传播(“多米诺效应”):
    想象助理在第一步犯了一个小错误,比如认为“苹果是蓝色的”。在第二步,他们利用这个错误观念去搜索“蓝色苹果”。在第三步,他们撰写了一份关于“蓝色苹果”的报告。整个事件链条都建立在那个最初的谎言之上。这就是传播。论文发现,一旦 AI 开始撒谎,它往往会继续基于该谎言进行构建,即使后续步骤是基于错误信息“正确”执行的,最终报告也会完全错误。

  2. I - 意图(“被误解的订单”):
    你要求一份“纯素”食谱,但助理忽略了这个词,给了你一份牛排食谱。或者你要求一份"2023 年”的报告,他们却给了你一份"2010 年”的报告。助理确实做了研究,但他们没有听从的具体规则。这就是意图幻觉。

  3. N - 噪声诱导(“分心的图书管理员”):
    想象助理去图书馆找到了 100 本书。其中 99 本都是关于猫的,只有 1 本是关于你询问的那只特定狗的。助理读完了所有 99 本关于猫的书,却忽略了那本关于狗的书,因为它被埋在一堆书里。他们并没有撒谎,但却错过了最重要的线索。这就是噪声诱导幻觉。

  4. G - 归因(“虚假事实”):
    助理查看了一篇真实的文章,然后却说:“这篇文章说月亮是由奶酪做的。”实际上,这篇文章根本没有提到奶酪。助理要么是在编造内容,要么是在归咎于错误的来源。这就是归因幻觉。

他们的发现(结果)

作者利用他们新的“过程侦探”系统,在 100 个极难的问题上测试了六位著名的 AI 研究助理(包括来自 OpenAI、Google 等机构的)。

  • 所有人都在挣扎: 即使是最好的 AI 助理,在研究过程中也会犯错。没有一个是完美的。
  • “多米诺”是最大的问题: 最危险的并非仅仅撒了一个谎,而是 AI 在早期犯了一个小错误,随后整个研究都建立在这个错误之上,导致彻底失败。
  • 他们容易固守最先看到的内容: AI 倾向于过度关注它找到的前几个搜索结果(就像一个只读了一本书的第一页就自以为知道整个故事的人)。如果答案在第 50 页,AI 往往会错过它。
  • 他们偏爱“枯燥”的答案: 如果 AI 找到了五篇内容相同的文章,它会非常喜欢。如果它找到了一篇独特的、说法不同的文章,它往往会忽略它。

结论

该论文得出结论:仅仅让 AI“更聪明”或给予其更多的互联网访问权限是不够的。问题在于 AI 在搜索过程中如何思考

为了解决这个问题,我们需要构建能够:

  1. 尽早发现自身错误(在它们演变成多米诺效应之前)。
  2. 更好地倾听你给予的具体规则。
  3. 不被最先看到的内容分散注意力,而是持续寻找最佳答案的 AI。

简而言之:我们不能再仅仅给最终报告打分了。我们必须观看整部电影,才能理解 AI 为何失败。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →