Entropy Distribution as a Fingerprint for Hallucinations in Generative Models
本文介绍了校准熵分数(CES),这是一种轻量级、单次前向传播的黑盒方法,它利用词元级熵分布来检测大语言模型的幻觉,具备形式化误差保证,且性能与计算成本高昂的多采样方法相当。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在听一位讲故事的人叙述。有时,他们讲述的故事完全真实且流畅自然;而另一些时候,他们开始“幻觉”——编造事实、陷入混乱,或胡言乱语,让人无法理解。
长期以来,试图捕捉这些谎言的计算机不得不做以下两件事之一:要么要求讲故事的人重复讲述五到六遍,以核对细节是否一致(这既缓慢又昂贵),要么窥探讲故事者的大脑,查看他们的秘密笔记(对于封闭系统而言,这往往是不可能的)。
本文介绍了一种新颖而巧妙的方法,只需一次聆听故事即可识破谎言。这种方法被称为校准熵分(Calibrated Entropy Score, CES)。
以下是其工作原理,辅以简单的类比:
1. “置信度计”(熵)
每当大型语言模型(LLM)生成一个词时,它都对下一个词拥有一个“置信度计”。
- 高置信度:模型确切知道该说什么。这就像一位完全掌握食谱的厨师。此时的“熵”(一种不确定性度量)是低的。
- 低置信度:模型正在猜测。这就像厨师盯着空冰箱,不确定该做什么菜。此时的“熵”是高的。
2. 旧方法 vs. 新方法
旧方法(困惑度):
以往的方法考察的是整个故事的平均置信度。
- 类比:想象一名学生参加考试。旧方法只看他们的平均成绩。如果平均分是 70%,他们可能及格。但这掩盖了真相:他们是每道题都得了 70 分吗?还是 10 道题得了满分(100%),另外 10 道题完全错误(0%)?平均分相同,但后一种情况的学生要不稳定得多。
新方法(CES):
作者意识到,置信度计的形状比平均值更重要。
- 类比:当模型讲述真相时,其置信度计是平稳且可预测的。而当它开始产生幻觉时,该计表就会失控。它可能暂时平静,随后突然飙升到完全困惑的状态,接着再次飙升。
- 论文声称,这种“狂野模式”是谎言的指纹。即使平均置信度看起来正常,那些尖峰(最大不确定性)以及曲线的整体形状也会将其暴露无遗。
3. CES 如何运作(“指纹”检查)
该方法分两步进行:
- 学习“真实”模式:首先,系统聆听许多已知为真实的故事。它构建了一个“参考地图”(统计曲线),描绘真实故事的置信度计长什么样。它会记录:“好的,真实故事通常在这里有小幅波动,但在那里很少出现巨大尖峰。”
- 一次性测试:当新故事出现时,系统只需一次聆听。它不需要寻求第二次意见。它将故事的置信度计与“真实地图”进行比对。
- 如果故事出现了奇怪的尖峰,或者形状与地图不符,系统就会发出警报:"这看起来像是幻觉!"
4. 为何这意义重大
- 速度:它只需对文本进行一次遍历。这就像只需听一次说话就能识破谎言,而不必让人重复讲述五遍。
- 黑盒友好:你无需查看模型的内部代码或隐藏思维。你只需要“logits"(模型在选定单词之前输出的原始置信度数值),大多数 API 都会提供这些数据。
- 统计证明:作者并非凭空猜测其有效性。他们利用数学证明,随着故事变长,漏掉谎言的概率降至几乎为零,而错误指控真实故事的概率也降至几乎为零。
总结
可以将CES想象为一个不需要测谎仪或二次访谈的测谎器。它只需聆听文本中不确定性的节奏。如果节奏平稳,则很可能是真实的;如果节奏出现 erratic(反复无常)、狂野的跳跃(即使平均值看起来正常),则很可能是幻觉。
该论文在 10 种不同的 AI 模型和 8 种不同类型的问题(从数学到常识问答)上测试了这种方法,发现这种“单次遍历”方法在捕捉谎言方面与昂贵、多次遍历的方法效果相当,但速度更快、成本更低。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。