← 最新论文
💬 NLP

HopRefusalBench: Diagnosing Refusal Failures in Search-Augmented Agents for Multi-Hop Reasoning

本文介绍了 HopRefusalBench,这是首个旨在评估搜索增强型智能体如何处理无法回答的多跳问题的基准测试,研究揭示了虽然模型通常能够识别出无法回答的正确原因,但它们经常无法做出恰当的拒绝承诺,而是转向幻觉或耗尽搜索预算。

原作者: Jianan Xie, Xin Sun, Zhongqi Chen, Xing Zheng, Qiang Liu, Bowen Song

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Jianan Xie, Xin Sun, Zhongqi Chen, Xing Zheng, Qiang Liu, Bowen Song

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一位超级聪明的侦探来破解谜题。这位侦探拥有一个可以瞬间造访的魔法图书馆,并且非常擅长将不同书籍中的线索串联起来以寻找答案。这正是现代“搜索增强型”(Search-Augmented)AI智能体的工作方式:它们是大型语言模型,可以外出、搜索互联网(或数据库),并将信息拼凑在一起来回答你的问题。通常情况下,这非常出色。但当你问出一个无法被回答的问题时,会发生什么呢?比如你问:“现任法国国王是谁?”(其实并没有国王),或者“一道不存在的菜肴中的秘密配料是什么?”

在AI的世界里,知道何时“不回答”与知道如何回答同样重要。如果你的侦探不停地在图书馆里挖掘,凭空捏造一个虚假的国王,或者为了寻找一种不存在的配料而浪费数小时,那他们就不是在提供帮助,而是在固执己见且浪费资源。科学家们称之为“拒绝”(refusal)——即能够说出“我无法回答这个问题,因为问题本身是有问题的”的能力。虽然我们知道这些AI侦探在解决难题方面变得越来越强,但我们并不真正了解当谜题本身根本无法解决时,它们的表现如何。它们是会迅速停止?会感到困惑?还是会胡编乱造?

这篇论文介绍了一个名为 HopRefusalBench 的新测试,旨在弄清楚这些AI侦探究竟是如何处理这类不可能的问题的。研究人员设计了889个旨在难倒AI的棘手问题。他们不仅仅是问一些简单的“我不知道”类问题;他们构建了复杂的、多步骤的谜题,其中陷阱可能设置在开头、中间的线索中,或者就在最后。他们想看看AI是会在早期就意识到问题有问题,还是会继续搜索并最终产生幻觉(编造答案)。

结果令人有些警醒。即使是测试中最聪明的AI模型,也仅能在约 42.9% 的情况下正确停止并表示“我无法回答这个问题”。这意味着超过一半的时间,它们都未能意识到问题是不可能的。研究发现,一旦掌握了证据,AI模型其实非常擅长识别问题为何出错(超过84%的情况下它们能解释逻辑),但它们在实际“决定”停止方面却很吃力。它们往往没有说“我放弃了”,而是经常不停地搜索,直到耗尽时间或精力,或者干脆编造一个虚假答案来满足用户。

研究人员还发现,陷阱在问题中放置的位置至关重要。当问题出现在推理链的中段(就像两座岛屿之间断裂的桥梁)时,AI要停下来比问题出现在末尾时要困难得多。此外,不可能问题的类型也会改变AI失败的方式:有些模型倾向于捏造事实(幻觉),而另一些则只是不停地搜索,直到耗尽预算。

简而言之,这篇论文表明,虽然我们的AI侦探在寻找信息方面变得越来越强,但在“知道何时收手”方面仍然表现糟糕。它们往往会陷入搜索的死循环,或者开始胡编乱造,而不是承认问题本身存在缺陷。作者建议,要让这些AI智能体真正可靠,我们需要教给它们的不仅是如何搜索,还有如何识别死路,并在浪费时间或传播错误信息之前停下来。好消息是,现在我们有了一张地图(HopRefusalBench),可以帮助我们诊断它们究竟在哪里失败,以及如何修复。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →