← 最新论文
💬 NLP

On the Fundamental Impossibility of Hallucination Control in Large Language Models

本文认为,由于在聚合内部知识时存在固有的权衡,大型语言模型的幻觉现象从根本上是不可避免的,这证明了虽然外部证据可以验证对答案的支持,但没有任何内部机制能够保证事实真相或解决导致虚假信息的语义失衡。

原作者: Michał P. Karpowicz

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Michał P. Karpowicz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图解决一个巨大的拼图游戏,但参与的不是一个人,而是一支专家团队围坐在桌旁。每位专家手中只有几块图像碎片,他们无法看到完整的图像。为了完成拼图,他们必须大声说出他们对最终画面最合理的猜测,然后对答案进行投票。这基本上就是现代人工智能(特别是大语言模型,LLMs)的工作方式。这些模型就像是庞大的数字“专家”团队(被称为组件或注意力头),每个专家都握着一小块知识碎片。当你向 AI 提问时,所有这些碎片都会通过竞争来塑造最终的答案。

长期以来,科学家和工程师一直试图修复一个令人恼火的问题:这些 AI 团队有时会编造事实。它们可能会极其自信地告诉你一个假事实,这种故障被称为“幻觉”(hallucination)。人们曾尝试通过给 AI 提供更好的训练、更多的数据,或者让它检查自己的工作来修复这个问题。但如果问题不仅仅是一个可以修补的漏洞呢?如果问题的根源在于 AI 构建的方式本身,使得它不可能同时做到完美真实、完美自信且完美具有创造力呢?这就是 Michal P. Karpowicz 在一篇新论文中探讨的核心问题。该论文指出,幻觉不仅仅是一个错误;它是一种基本的权衡,就像想要鱼与熊掌兼得一样。

伟大的创意拍卖会

论文将 AI 的大脑想象成一个繁忙的市场,称为“创意拍卖会”。在这个拍卖会上,AI 的每一个微小部分(例如特定的注意力头或电路)都是一名竞标者。每位竞标者都握有一件秘密知识,并试图说服团队,证明他们版本的答案才是最好的。他们通过发送信号来影响最终输出,以此进行“竞价”。

作者证明,有时这种拍卖会会撞上南墙。想象一下,两名竞标者正在为一个事实争论不休。一个说:“天空是蓝色的”,另一个说:“天空是绿色的”。如果 AI 试图将这两个对立的观点合并为一个单一且自信的答案,它就会陷入数学上的不可能。论文表明,你无法让一个系统同时实现以下四件事:

  1. 讲述真相(诚实地报告它所知道的内容)。
  2. 保护信息(不凭空捏造新的事实)。
  3. 让每个人参与(利用它拥有的每一个相关知识片段)。
  4. 给出最佳答案(针对用户的满意度进行优化)。

论文证明,如果竞标者们在同一个事实上发生争执,系统就必须在其中一个目标上失败。这就像一个魔术,如果你原本只有两只兔子,你就无法从帽子里变出三只兔子。你必须做出选择:要么 AI 撒谎(为了使故事完整而编造细节),要么它变得过于谨慎并承认自己不知道,或者它忽略了它实际拥有的某些知识。不存在既能完美诚实、完美自信又完美乐于助人的“免费午餐”。

置信度陷阱

论文通过一些巧妙的数学方法深入探讨了为什么会发生这种情况。它观察了 AI 如何结合来自其不同部分的“选票”。当 AI 汇总这些选票以决定答案时,它往往听起来比任何单个部分实际表现出的都要更加自信。

这就像一群天气预报员。如果预报员 A 说有 50% 的降水概率,而预报员 B 也说有 50% 的降水概率,但他们观察的是不同的云层,那么整个团队最终可能会宣布:“肯定要下雨了!” 数学表明,这种信心是“制造”出来的。这是一种额外的确定性,这种确定性在单个部分中并不存在。这就是导致幻觉的“过度自信”。AI 并不一定是故意撒谎;它只是由于组合信息的方式,自然而然地在已知信息与表现出的确定性之间制造了一个差距。

我们能修复它吗?

论文非常明确地说明了它没有说什么。它并不声称 AI 总是会撒谎,也不代表我们永远无法构建可靠的 AI。相反,它指出幻觉是一种结构性的限制,就像光速或旋转硬币的不确定性一样。如果拍卖会的条件满足,你无法仅仅通过“训练”来消除它。

然而,论文确实提供了一种管理问题的方法。它建议,与其试图让 AI 变得完美真实(这在这些条件下是不可能的),我们应该专注于可验证的支持(certifiable support)。想象一下 AI 是一名律师。我们无法总是证明律师的故事是否是绝对的真理,但我们可以检查律师的故事是否得到了其所获证据的支持。

论文显示,如果我们给 AI 一组特定的“授权证据”(例如一个受信任的数据库或一组文档),我们就可以在数学上证明 AI 的答案是否保持在这些证据的范围内。如果 AI 超出了这些范围,即使我们不知道绝对的真理,我们也知道它相对于这些证据产生了幻觉。这把问题从“这是真的吗?”(这很难)转变为“这是否有据可查?”(这是可以检查的)。

总结

这篇论文是对 AI 界的一次警示。它告诉我们,我们看到的“幻觉”并非仅仅是一个可以用更多数据或更好代码来修复的漏洞。它是这些系统聚合信息的一种基本特征。当 AI 的不同部分对同一事实产生分歧或竞争时,系统必须做出选择:是保持诚实而显得无力,还是保持自信而可能出错。

作者建议,我们不应该试图消除这种权衡,而应该开始管理它。通过理解 AI 的信心有时是由组合创意的数学逻辑“制造”出来的,我们可以构建更好的系统,让它们了解自己的极限。我们可以设计出对已知内容诚实、并能区分哪些是猜测的 AI,或者我们可以构建严格受限于我们所提供证据的系统。论文并没有承诺一个完美的 AI,但它为我们提供了一张清晰的地图,标明了边界在哪里,这样我们就可以停止在墙上撞头,转而开始建造更好的门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →