Why Your Deep Research Agent Fails? On Hallucination Evaluation in Full Research Trajectory
本文通过引入 PING 分类法和 DeepHalluBench 基准测试,解决了基于结果的评估在深度研究智能体中的局限性,从而实现对整个研究轨迹中幻觉现象的感知过程、细粒度审计,揭示系统性可靠性差距,并为架构改进提供可操作的见解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你雇佣了一位超级聪明的研究助理,来解答一个非常棘手的问题。你问他:“谁是唯一一位因出演自己执导的电影而获得奥斯卡表演奖的人?”他随即出发,搜索互联网,阅读文章,最后带回一份最终报告。
旧有的检查方式:
过去,如果你想了解你的助理是否称职,你只需查看最终报告。如果名字正确,他就获得一颗金星;如果名字错误,他就得到一个红叉。
问题所在:
这篇论文指出,仅凭最终答案来评判,就像只凭汤的味道来评价一位厨师,却不去观察他是如何烹饪的。也许汤味道不好是因为他忘了放盐(一个小错误),也许他使用了冰箱深处发现的一颗腐烂番茄(一个大谎言),或者也许他完全误解了你的点单,从而开始烹饪一道错误的菜肴。
作者表示,当前的“深度研究智能体”(AI 研究人员)在过程中就会犯错,但由于我们只检查最终答案,因此无法看到他们在哪里或为何失败。错误往往隐藏在半途之中。
新方法:“过程侦探”
作者构建了一个名为DeepHalluBench的新系统。你可以将其想象为一个透明的厨房,我们可以在此观察助理一步步烹饪的过程。他们不仅检查汤,还检查每一种食材、每一次切配和每一次搅拌。
他们制定了一套名为PING 分类法的新规则,用于对 AI 产生困惑的不同方式进行分类。以下是 PING 所代表的含义,辅以简单的类比:
P - 传播(“多米诺效应”):
想象助理在第一步犯了一个小错误,比如认为“苹果是蓝色的”。在第二步,他们利用这个错误观念去搜索“蓝色苹果”。在第三步,他们撰写了一份关于“蓝色苹果”的报告。整个事件链条都建立在那个最初的谎言之上。这就是传播。论文发现,一旦 AI 开始撒谎,它往往会继续基于该谎言进行构建,即使后续步骤是基于错误信息“正确”执行的,最终报告也会完全错误。I - 意图(“被误解的订单”):
你要求一份“纯素”食谱,但助理忽略了这个词,给了你一份牛排食谱。或者你要求一份"2023 年”的报告,他们却给了你一份"2010 年”的报告。助理确实做了研究,但他们没有听从你的具体规则。这就是意图幻觉。N - 噪声诱导(“分心的图书管理员”):
想象助理去图书馆找到了 100 本书。其中 99 本都是关于猫的,只有 1 本是关于你询问的那只特定狗的。助理读完了所有 99 本关于猫的书,却忽略了那本关于狗的书,因为它被埋在一堆书里。他们并没有撒谎,但却错过了最重要的线索。这就是噪声诱导幻觉。G - 归因(“虚假事实”):
助理查看了一篇真实的文章,然后却说:“这篇文章说月亮是由奶酪做的。”实际上,这篇文章根本没有提到奶酪。助理要么是在编造内容,要么是在归咎于错误的来源。这就是归因幻觉。
他们的发现(结果)
作者利用他们新的“过程侦探”系统,在 100 个极难的问题上测试了六位著名的 AI 研究助理(包括来自 OpenAI、Google 等机构的)。
- 所有人都在挣扎: 即使是最好的 AI 助理,在研究过程中也会犯错。没有一个是完美的。
- “多米诺”是最大的问题: 最危险的并非仅仅撒了一个谎,而是 AI 在早期犯了一个小错误,随后整个研究都建立在这个错误之上,导致彻底失败。
- 他们容易固守最先看到的内容: AI 倾向于过度关注它找到的前几个搜索结果(就像一个只读了一本书的第一页就自以为知道整个故事的人)。如果答案在第 50 页,AI 往往会错过它。
- 他们偏爱“枯燥”的答案: 如果 AI 找到了五篇内容相同的文章,它会非常喜欢。如果它找到了一篇独特的、说法不同的文章,它往往会忽略它。
结论
该论文得出结论:仅仅让 AI“更聪明”或给予其更多的互联网访问权限是不够的。问题在于 AI 在搜索过程中如何思考。
为了解决这个问题,我们需要构建能够:
- 尽早发现自身错误(在它们演变成多米诺效应之前)。
- 更好地倾听你给予的具体规则。
- 不被最先看到的内容分散注意力,而是持续寻找最佳答案的 AI。
简而言之:我们不能再仅仅给最终报告打分了。我们必须观看整部电影,才能理解 AI 为何失败。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。