← 最新论文
💬 NLP

HalluHard: A Hard Multi-Turn Hallucination Benchmark

本文介绍了 HalluHard,这是一个涵盖四个高风险领域的具有挑战性的多轮幻觉基准测试,它利用基于自动化网络搜索的评判流水线揭示了即使是最先进的语言模型在复杂的对话场景中,仍然会产生大量的无根据的事实性陈述。

原作者: Dongyang Fan, Sebastien Delsad, Nicolas Flammarion, Maksym Andriushchenko

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Dongyang Fan, Sebastien Delsad, Nicolas Flammarion, Maksym Andriushchenko

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一位才华横溢、语速极快的研究助理来帮你解决复杂的问题。你向他们提问,他们给出答案并列出一系列来源,接着你进行追问。他们会继续滔滔不绝,在之前的基础上不断深入。

问题在于?这位助理是**自信编造(confident fabrication)**的高手。他们听起来极其可信,但经常捏造事实、虚构来源或歪曲真相以符合自己的论点。这就是所谓的“幻觉”(hallucination)。

你提供的论文介绍了一个全新的、非常严苛的测试,名为 HALLUHARD,旨在观察这种问题到底有多严重,尤其是在对话变得漫长且复杂时。

以下是他们所做的工作及发现的详细拆解,使用了简单的类比:

1. 问题所在:“自信的骗子”

之前的测试就像是问助理:“法国的首都是哪里?”如果他们答对了,就算通过。但在现实世界中,对话是混乱的。你问一个问题,他们回答,你再问“为什么?”,他们再次回答。

  • 问题: 随着对话变长,助理会开始变得混乱。他们可能在第一轮对话中犯了一个小错误,然后在第二轮中,他们会基于这个错误构建出整个新答案。这就像是一场“传声筒”游戏,信息变得支离破碎,但助理却坚持认为那个支离破碎的版本就是真相。
  • 差距: 旧的测试太简单了。它们无法捕捉到这些“长期骗局”。

2. 解决方案:“HALLUHARD” 测试

研究人员构建了一个包含 950 个难题 的全新残酷考试,涵盖四个高风险领域:

  • 法律: “这份证人证词是否具有可采性?”
  • 研究: “这项特定的医学研究是如何处理数据的?”
  • 医学: “指南对这种药物是如何规定的?”
  • 编程: “编写代码来实现 X。”

转折点: 助理在声称每一个事实时,必须 提供引证(来源)。

  • 陷阱: 研究人员不仅检查引证看起来是否真实。他们构建了一个特殊的“裁判机器人”,该机器人实际上会去寻找完整的文档(甚至是 PDF!),阅读文档,并核实:来源是否真的如助理所言?

3. “裁判机器人”(新工具)

想象一个不仅仅只看书名或摘要,而是深入了解内容的图书管理员。

  • 旧的裁判: 他们只看一段简短的片段(比如 Google 搜索的预览)。如果片段大致匹配,他们就会说:“看起来不错!”
  • HALLUHARD 裁判: 它会打开整本书,阅读特定的章节,并检查细节。
    • 场景: 助理说:“第 45 页说 X。” 裁判打开 PDF,翻到第 45 页,发现上面的文字实际上是“Y”。
    • 结果: 即使助理引用了一本真实的图书,也会被抓到在撒谎。

4. 他们的发现(结果)

他们测试了目前最智能的 AI 模型(如 GPT-5、Claude Opus 等)。坏消息是:即使是最智能的模型仍然经常撒谎。

  • “网页搜索”的神话: 人们曾认为:“如果我们让 AI 使用 Google 搜索,它就会停止撒谎。”

    • 现实: 即便使用了网页搜索,最好的模型仍有约 30% 的时间在产生幻觉。如果不使用搜索,这一比例为 60%
    • 原因: AI 找到了正确的书,但仍然读错了书中的特定段落。这就像是找到了正确的教科书,却记错了那一页的内容。
  • “长对话”陷阱:

    • 在第一轮对话中,AI 表现尚可。
    • 到第三轮时,幻觉率上升。AI 开始“受其自身早期错误的影响(conditioning on its own earlier mistakes)”。这就像一名侦探破解了一起案件,找错了嫌疑人,然后用余下的调查时间试图证明那个错误的嫌疑人是有罪的。
  • “思考”有帮助,但并非万能:

    • 在回答前会先“思考”(反应更慢、更谨慎)的模型,幻觉较少。
    • 然而,仅仅让它们“多思考”并不能解决所有问题。有时,思考过度只会导致更长、更详尽的谎言。
  • “小众领域”问题:

    • 如果你问一些完全虚构的东西(比如一座虚构的山),AI 通常会承认:“我不知道。”
    • 但如果你问一些真实但冷门的东西(比如一篇只有 10 次引用的论文),AI 会尝试猜测并自信地撒谎。它们处于一个“危险区”——它们觉得自己可能知道,所以就开始编造。

5. 结论

论文得出结论,我们目前还不能简单地信任这些 AI 模型作为事实核查员。

  • 能力并不等于可靠性: 更大、更智能的模型仍然会撒谎。
  • 工具并非灵丹妙药: 给它们配备搜索引擎确实有帮助,但它们在正确阅读全文方面仍然存在困难。
  • 未来方向: 我们需要知道何时“自己不知道”的 AI。目前的 AI 太过渴望去猜测,尤其是在事实难以寻觅的时候。

简而言之:HALLUHARD 是一项压力测试,它表明我们最先进的 AI 助手仍然容易编造事实,尤其是在长对话中,而且仅仅靠“查找资料”并不能阻止它们在细节上出错。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →