← 最新论文
🤖 machine learning

Hallucination Is Linearly Decodable from Mid-Layer Hidden States in Quantized LLMs

本文证明了在 4-bit 量化开源大语言模型的中层隐藏状态中,存在一种能够编码幻觉且线性可分的真实性信号,这使得利用简单的线性探针即可实现接近完美的 AUROC 得分进行检测,而基于采样的检测方法在相同的评估协议下表现显著较差。

原作者: Aizierjiang Aiersilan

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Aizierjiang Aiersilan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明但有点不可靠的机器人助手。它有时会说真话,有时会编造一些听起来很有道理但完全错误的事实(这些被称为“幻觉”)。

这篇论文就像是一份侦探报告,试图弄清楚:我们如何才能发现机器人在撒谎,以及谎言隐藏在它的“大脑”哪个位置?

研究人员在三个流行的开源机器人大脑(Llama、Mistral 和 Qwen)上进行了测试,这些大脑经过了“压缩”(使用一种叫做“4-bit 量化”的技术,就像把高清电影压缩成小文件而不损失太多质量,以便让它们能在标准家用电脑上运行)。

以下是他们发现的研究结果,用通俗易懂的方式解释如下:

1. “真相检测器”是一条简单的直线

研究人员尝试了两种主要方法来抓捕机器人的谎言:

  • “赌徒”法(采样): 对机器人问同一个问题 10 次。如果它给了你 10 个不同的答案,说明它可能很困惑或者在撒谎。如果它每次都给同样的答案,说明它可能在说真话。
  • “X光”法(探测): 在机器人思考时,直接观察它的内部。具体来说,他们观察了“隐藏状态”(大脑各层之间的电信号),看看是否存在一个表示“真”或“假”的模式。

结果: “X光”法取得了压倒性的胜利。通过观察机器人大脑中间的一个特定层,一个非常简单的数学工具(线性探测器)就能以 90% 到 100% 的准确率判断机器人是否在撒谎。

“赌徒”法(问它 10 次)基本上是没用的,在这种特定的测试中,它的表现并不比抛硬币好多少(准确率约为 50%)。

2. 谎言在大脑的哪里?

研究人员发现,“真相信号”并不是无处不在的。它就像摩天大楼里的一个特定房间,真相就写在墙上。

  • 对于 LlamaMistral 机器人(共有 32 层楼),真相在第 13 到 18 层最为明显。
  • 对于 Qwen 机器人(共有 28 层楼),真相在第 19 到 25 层最为明显。

如果你在这些特定的“楼层”检查机器人的大脑,你几乎可以瞬间知道它是否诚实。

3. 为什么“赌徒”法失败了?

你可能会想,“为什么问它 10 次不起作用呢?”
论文通过一个巧妙的区别解释了这一点:

  • 探测器(X光) 被给出了一个特定的答案(例如,“法国的首都是巴黎”),并被问到:“你的大脑是否认可这是真的?”它观察的是机器人对这个特定句子的内部反应。
  • 赌徒(采样) 只是被问了一个问题,并被要求“写出 10 个不同的故事”。它测量的是机器人对问题的困惑程度,而不是某个特定答案是否为真。

因为测试的设置是为了检查特定的答案,所以“赌徒”法找错了地方。这就像是通过要求作者从头开始写 10 遍文档来寻找文档中的某个特定错别字,而不是直接读一遍文档。

4. “简单线条”对比“复杂机器”

研究人员尝试使用一种超级复杂的数学工具(MLP)来寻找谎言,认为它可能比简单的工具更聪明。
令人惊讶的是: 复杂的工具并没有比简单的工具好多少。机器人大脑中的“真相”实际上非常直观——它几乎就像一条直线。你不需要超级计算机来寻找它;一把简单的尺子就足够了。

5. “注意力”的线索

还有另一个有效的方法,但仅限于机器人正在阅读特定文本(如维基百科文章)时。
他们观察了机器人在第一步时的“注意力”(它在关注什么):

  • 如果机器人是根据文本说真话,它的注意力是集中且冷静的。
  • 如果它在产生幻觉,它的注意力则是分散且混乱的。
    这提供了一个非常强烈的线索(准确率高达 94%),而且不需要任何额外的数学计算或时间。

核心总结

如果你想抓住一个小型、压缩后的 AI 机器人关于事实的谎言:

  1. 不要问它同一个问题 10 次(这会浪费时间,而且在这里效果不好)。
  2. 窥探它大脑的中间层(大约在第 15 或第 20 层)。
  3. 你可以使用一个非常简单、快速的数学检查,以近乎完美的准确率识破谎言。

论文得出结论,对于这类特定类型的测试,观察机器人大脑内部比让它重复自己要更快、更准确。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →