Hallucination as Commitment Failure: Larger LLMs Misfire Despite Knowing the Answer
本文挑战了幻觉仅源于知识缺失的观点,揭示出经过指令微调的大型语言模型之所以常产生幻觉,是因为它们未能将概率分布中已存在的正确概念确立为最终选择,而是由于一种随规模变化的锐化机制将概率质量分散至其他选项,该机制在提升模型有用性的同时,也导致了自信的谬误。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《幻觉即承诺失败》的解释,采用通俗易懂的语言和类比。
核心理念:问题不在于“不知道”
大多数人认为人工智能(AI)的幻觉(即 AI 编造事实)发生是因为 AI Simply 不知道答案。这种观点认为:如果 AI 知道事实,它就会说真话;如果不知道,它就会猜测。
但这篇论文指出,这种观点是错误的。
研究人员发现,AI 往往确实知道答案。在它开始说话的那一刻,正确的信息就在它的“脑海”中。然而,它仍然选择说出错误的内容。他们将此称为“承诺失败”(Commitment Failure)。
类比:紧张的厨师
想象一位才华横溢的厨师(代表 AI),有人问他:“法国的首都是哪里?”
- 旧理论:如果厨师不知道答案,他会猜“伦敦”。如果他知道,他就会说“巴黎”。
- 新理论(本文观点):厨师知道答案是巴黎。事实上,他如此强烈地想着“巴黎”,以至于他的大脑里充满了这个词。但是,因为他同时以多种不同的方式思考着“巴黎”(例如“巴黎”、"paris"、“光之城”、“法国首都”),他的大脑变得混乱。
- 他对“巴黎”有强烈的感觉,但这种感觉分散在所有这些不同的短语中。
- 与此同时,他对“伦敦”有一个非常尖锐、集中的念头(也许是因为他之前看到过大本钟的照片)。
- 尽管“巴黎”的感觉总体上更强,但“伦敦”的念头是如此尖锐和集中,以至于它在通往嘴巴的竞赛中获胜。即使他知道那是巴黎,他也会自信地脱口而出“伦敦”。
他们是如何发现这一点的
研究人员观察了 AI 模型在说话之前的“思考”过程。他们专注于 AI 生成的第一个词(即“承诺步骤”)。
他们引入了一种衡量 AI 知识的新方法,称为语义概率质量(Semantic Probability Mass)。
- 旧方法:AI 是否选对了确切的词?(例如:它是否说了“巴黎”?)
- 新方法:即使 AI 的想法分散在“巴黎”、"paris"和“光之城”之间,它是否对“巴黎”这个概念有强烈的感觉?
研究结果:
- 他们测试了许多 AI 模型(从小型到巨型)。
- 他们发现,在 AI 犯错的情况下,有**16% 到 47%**的时间,它实际上对正确答案有着强烈的“感觉”。
- 转折:AI 模型越大,这种情况发生的频率就越高。更大的模型不仅知道得更多,而且犯下了更多这类特定的错误:它们知道答案,但仍然答错了。
为什么会发生这种情况?(“锐化”效应)
论文指出,指令微调(Instruction Tuning,即训练 AI 变得乐于助人并遵守规则)改变了 AI 的思考方式。
想象 AI 的大脑是一片丘陵和山谷的地形。
- 训练前:山丘平坦且模糊。AI 不确定。
- 训练后:AI 变得非常果断。它将思想转化为尖锐、高耸的尖峰。
- 当 AI 正确时,正确答案的尖峰如此高耸且尖锐,以至于它轻松获胜。
- 但是,有时 AI 会感到困惑。正确答案被分散成许多小而平坦的山丘(因为它同时在思考“巴黎”、"paris"、“法国”等)。与此同时,错误的答案却是一个单一、极其尖锐、高耸的尖峰。
- AI 的决策过程就像一颗球滚下山坡。它总是滚向最尖锐的点。即使“正确”一侧拥有更多的总“山体面积”,但“错误”一侧拥有最尖锐的顶峰,所以球会滚向那里。
两种错误类型
研究人员发现了这种“承诺失败”发生的两种方式:
- 第一个词就错了:AI 立即用错误的词开始句子(例如,说“莫斯科”而不是“巴黎”),尽管它对“巴黎”有强烈的感觉。
- 走错了路:AI 用正确的词开始(例如“巴黎”),但在接下来的几个词中立即偏离轨道,将“巴黎”变成关于另一个城市的故事。
“对齐税”
论文得出结论,这是使 AI 模型变得“乐于助人”的副作用。
- 为了让 AI 自信且快速,我们训练它变得非常果断(产生尖锐的尖峰)。
- 当 AI 正确时,这非常有效。
- 但是,当 AI 稍微感到困惑时,这种同样的“果断”会使其自信地犯错。它不会犹豫去选择错误的答案,因为它的大脑非常擅长选择“最尖锐”的选项,即使该选项是错误的。
总结
- 幻觉并不总是源于无知。有时 AI 知道答案,但未能对其做出“承诺”。
- 更大的模型并非完美无缺。随着模型变大,它们变得更擅长果断,这具有讽刺意味地使它们更容易自信地犯错。
- 问题在于分布。AI 将其对正确答案的“知识”分散到许多变体中,过于稀薄;而错误的答案则集中在一个尖锐的点上。AI 选择了那个尖锐的点,而不是正确的答案。
论文建议,要解决这一问题,我们可能需要教导 AI 关注“整体概念”(即所有表达“巴黎”的方式),而不仅仅是选择那个最尖锐的单个词。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。