From Architecture to Output: Structural Origins of Hallucination in Large Language Models and the Amplifying Role of Data
本文认为,大语言模型中的幻觉是三种核心架构决策——自注意力机制、极大似然估计和自回归解码——所导致的结构性后果,这些决策构成了一个复合失效系统,而数据集病理学仅是放大而非起源于该系统,因此有必要从基于输出的分类转向针对特定机制的诊断与缓解策略。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这是一篇使用简单语言和日常类比对该论文进行的解释。
核心观点:问题不在于数据,而在于机器本身
想象你有一个写故事的机器人。有时,这个机器人写的文章听起来完美无瑕、流畅自然且充满自信——但内容完全是编造的。我们称之为“幻觉”(Hallucination)。
大多数人认为机器人撒谎是因为它读了烂书或糟糕的网络数据。这篇论文认为这种看法是错误的。论文声称,即使你给机器人一个世界上最完美的图书馆,它仍然会撒谎。
为什么?因为机器人的大脑结构(其架构)在设计时就注定了撒谎是不可避免的。作者识别出了三个特定的“设计缺陷”,这些缺陷共同作用,导致了这些充满自信的谎言。
三大“设计缺陷”(复合失效系统)
论文指出,机器人有三个特定的习惯会导致幻觉。把它们想象成机器中的三个齿轮,当它们同时转动时,就会产生一个虚假的故事。
1. “模式匹配者”(自注意力机制 / Self-Attention)
缺陷: 机器人并不真正理解“意义”,它只理解“频率”。
类比: 想象一个人读过数百万本书,但从未踏出过家门。他知道“Sylhet”和“茶”在几乎所有他读过的句子中都会成对出现。
- 运作方式: 如果你问:“Sylhet 以什么闻名?”机器人看到了强烈的模式:Sylhet + 茶。于是它自信地回答:“Sylhet 以茶闻名。”
- 幻觉: 但如果你问:“孟加拉国的首都是哪里?”机器人可能仍然会抓取“Sylhet”这个模式,因为这些词在它的训练数据中经常一起出现,即便在新的语境下它们并不合理。
- 论文观点: 机器人混淆了统计上的邻近性(经常一起出现的词)与语义上的真实性(实际存在的事实)。它不检查事实,它只检查词语是否通常能凑在一起。
2. “人气竞赛”(极大似然估计 / Maximum Likelihood Estimation)
缺陷: 机器人的训练目标是预测“最可能”出现的下一个词,而不是“最真实”的下一个词。
类比: 想象一场游戏节目,主持人提出了一个问题,而奖品会颁发给那个猜中了观众脑海中最常见答案的人,而不论这个答案是否正确。
- 运作方式: 如果 90% 的互联网都说“闪电绝不会两次击中同一地点”(这是一个谬误),而只有 10% 的人说会,那么机器人会学习到这个谬误是“正确”答案,因为它更受欢迎。
- 幻觉: 机器人追求的不是真实,而是流畅度。它奖励机器人表现得像个“平均水平的人类”,即便这些人类文本充满了谎言。论文指出,规模更大的模型在讲述真相方面反而变得更差,因为它们更擅长记忆数据中的谎言。
3. “单行道”(自回归解码 / Autoregressive Decoding)
缺陷: 一旦机器人写下一个词,它就无法收回。
类比: 想象一列火车在移动的同时铺设自己的轨道。如果工程师犯了一个微小的错误,把轨道向左偏了一点,火车就必须沿着这个方向继续行驶。它无法跳回去修正最初的错误。
- 运作方式: 机器人一次写一个词。如果它在第一个词上犯了小错(由于缺陷 #1 或 #2),这个错误的词就会成为后续词语的“真理”。
- 幻觉: 机器人意识不到自己犯了错。它只是基于这个错误的起点构建剩下的句子。结果就是一个听起来逻辑通顺、流畅自然,但建立在谎言之上的故事。这被称为“级联失效”(Cascade Failure)。
坏数据的作用(放大器)
论文承认,坏数据(如罕见的“长尾事实”或带有偏见的网络内容)会让情况变得更糟。但论文认为,坏数据只是一个放大器,而非起因。
- 类比: 把这三个设计缺陷想象成一片干枯的森林。坏数据仅仅是火星。
- 如果森林是湿润的(完美的数据),火星可能不会引发火灾。
- 但如果森林是干枯的(存在架构缺陷),即使是一个微小的火星(一个小的数据错误)也会引发一场大火(幻觉)。
- 论文观点: 你不能仅仅通过移除火星来扑灭火灾。你必须修复森林的干燥问题(即架构问题)。数据本身并不创造幻觉,是机器的设计利用了数据来创造幻觉。
为什么现有的检查清单会失效
论文批评了目前研究幻觉的方法。研究人员通常根据谎言的“样子”进行分类(例如,“它与输入内容矛盾”或“它捏造了一个事实”)。
论文的批判: 这就像医生说“病人发烧了”,却不去检查发烧是由流感、感染还是温度计坏了引起的。
- 解决方案: 作者提出了一种新的分类方法。我们不应只看输出结果,而应该观察机制。
- 机器人是因为混淆了词语模式而撒谎吗?(自注意力机制)
- 机器人是因为追随了流行的谬误而撒谎吗?(极大似然估计)
- 机器人是因为无法修正早期的微小错误而撒谎吗?(自回归级联)
总结
这篇论文认为,大语言模型产生幻觉并不是因为它们“愚蠢”或拥有“坏数据”,而是因为它们的构建基于三个特定的架构决策:
- 它们学习的是模式,而非真相。
- 它们被奖励的是流行度,而非准确性。
- 它们被困在了一条无法回头的路径上,无法修正自己的错误。
在修复这三个结构性的齿轮之前,这些机器人将继续编写那些流畅、自信但事实错误的精彩故事。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。