← 最新论文
💬 NLP

Do Hallucination Neurons Generalize? Evidence from Cross-Domain Transfer in LLMs

该研究通过跨领域实验证明,此前发现的“幻觉神经元”无法在不同知识领域间泛化,表明大语言模型的幻觉机制并非单一通用模式,而是依赖于特定领域的神经元群体,因此幻觉检测器需针对各领域分别校准。

原作者: Snehit Vaddi, Pujith Vaddi

发布于 2026-04-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Snehit Vaddi, Pujith Vaddi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文探讨了一个非常有趣的问题:大型语言模型(LLM)在“胡说八道”(幻觉)时,脑子里是不是有一套通用的“撒谎机制”?

为了让你轻松理解,我们可以把这篇论文的研究过程想象成寻找“撒谎者”的指纹

1. 背景:我们以为找到了通用的“撒谎指纹”

之前的研究发现,在大模型的神经网络里,有极少一部分(不到 0.1%)特定的神经元,当它们活跃时,模型就很可能在胡说八道。研究者把这些叫作**“幻觉神经元”(H-neurons)**。

这就好比侦探发现:只要看到某人**“左眼在抽搐”**,就能断定他在撒谎。于是大家以为,这是一个通用的生理特征,不管这个人在聊什么(聊天气、聊法律、还是聊代码),只要左眼一抽搐,就是在撒谎。

2. 核心实验:换个场景,这个“指纹”还管用吗?

这篇论文的作者(Snehit Vaddi 和 Pujith Vaddi)想验证一个大胆的想法:如果我们在“聊八卦”(通用知识问答)时找到了这些“撒谎神经元”,那它们在“聊法律”、“聊金融”、“聊科学”或者“写代码”时,还能用来抓撒谎吗?

他们做了个像**“换场考试”**一样的实验:

  • 训练阶段:让模型在 6 个完全不同的领域(通用知识、法律、金融、科学、道德、代码)里做题。
  • 识别阶段:在“通用知识”领域,找出哪些神经元活跃时模型在撒谎。
  • 测试阶段:拿着这套在“通用知识”里找到的“撒谎神经元名单”,去检查模型在“法律”或“代码”领域是不是在撒谎。

3. 惊人的发现:通用指纹不存在!

结果非常打脸:这套“通用撒谎检测器”完全失效了。

  • 在自己家里(同领域):准确率很高(约 78%)。就像侦探在“八卦圈”里,看到左眼抽搐,确实能抓出 78% 的撒谎者。
  • 到了别人家(跨领域):准确率直接跌到 56%(几乎就是瞎猜)。就像侦探拿着“左眼抽搐”的名单去抓“法律界”的骗子,结果发现:法律界的人撒谎时,根本不需要左眼抽搐,甚至可能右眼在抽搐,或者手指在发抖

结论是:模型在不同领域“胡说八道”时,动用的“大脑零件”是完全不同的。

4. 有趣的比喻:不同的“谎言工厂”

为了更形象地理解,我们可以这样比喻:

  • 通用知识(如“澳大利亚首都是哪里”):就像是一个**“记忆仓库”**。模型在这里撒谎,是因为它记错了或者编造了事实。这时候,特定的“记忆神经元”会乱跳。
  • 法律或科学推理:这像是一个**“逻辑推理室”**。模型在这里犯错,往往是因为逻辑推演错了,而不是记错了事实。这时候,动用的是另一套完全不同的“逻辑神经元”。
  • 代码:这像是一个**“精密仪器车间”。代码里的错误(比如缓冲区溢出)和道德问题(比如该不该偷面包)完全是两码事。代码领域的“撒谎”甚至会让那些在道德领域能预测撒谎的神经元反过来工作**(预测正确时它们反而活跃,预测错误时它们反而安静)。

最讽刺的是:有些神经元在“代码领域”是“撒谎警报器”,但到了“道德领域”却变成了“诚实警报器”。如果你试图用抑制“代码撒谎神经元”的方法去防止模型在道德问题上撒谎,结果可能会适得其反,让模型在道德问题上更爱撒谎。

5. 这对我们意味着什么?(现实影响)

这篇论文给那些想给 AI 装上“防撒谎眼镜”的人泼了一盆冷水,但也指明了方向:

  1. 没有“万能药”:你不能训练一个通用的“防撒谎系统”,然后指望它在所有场景下都管用。就像你不能给所有国家的警察发同一套制服,因为不同地方的犯罪手法不同。
  2. 需要“定制服务”:如果你要在法律 AI 里防撒谎,就必须专门针对法律数据去训练检测器;要在医疗 AI 里防撒谎,就得专门针对医疗数据训练。
  3. 干预要小心:以前有人想通过“关掉”那些撒谎神经元来修复模型。但这篇论文警告说,如果你关错了领域(比如在代码模型里关掉通用知识的撒谎神经元),不仅没用,还可能把模型搞得更坏。

总结

这就好比我们以为人类撒谎时都会**“脸红”**(通用机制),但研究发现:

  • 聊八卦时,撒谎者确实会脸红
  • 但在法庭上撒谎,他们可能会手心出汗
  • 在写代码时撒谎,他们可能会眼神游离

这篇论文告诉我们:AI 的“撒谎”不是一种单一的疾病,而是一组根据场景不同而变化的“症状”。要治好它,必须“对症下药”,不能“一药治百病”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →