← 最新论文
💬 NLP

LLMs Explain't: A Post-Mortem on Semantic Interpretability in Transformer Models

本文认为,广泛使用的语言模型解释方法——特别是基于注意力的解释和通过嵌入进行的特征映射——由于根本性的方法论缺陷和人工制品,无法可靠地检测语义理解或语言抽象,从而对当前在普适计算语境下关于大语言模型可解释性的主张提出了质疑。

原作者: Alhassan Abdelhalim, Janick Edinger, Sören Laue, Michaela Regneri

发布于 2026-02-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Alhassan Abdelhalim, Janick Edinger, Sören Laue, Michaela Regneri

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个非常聪明、带有魔力的黑匣子,它能写故事、回答问题、还能翻译语言。大家都称这个黑匣子为“大语言模型”(LLM)。因为它的工作做得太出色了,工程师和科学家们想要了解它究竟是如何“思考”的。他们想窥视黑匣子的内部,看看里面的齿轮是如何转动的。

这篇论文本质上是对科学家试图观察这个黑匣子的两种流行方法进行的一次“尸检”(医学解剖)。来自汉堡大学的研究团队通过测试这两种方法,试图观察这些模型是否真正理解了语言。

结论: 这两种方法都失败了。它们不仅没有发现“微弱”的解释,反而发现这些方法本身是基于错误的假设。科学家们用来证明“看,模型理解了这个!”的“证据”,实际上只是由测试设置方式所创造的一种幻象。

以下是他们测试的两种方法的详细拆解,并使用简单的类比来解释为什么它们失效了。

方法 1:“聚光灯”(注意力分析)

理论:
在这些 AI 模型中,有一些被称为“注意力头”(attention heads)的部分。科学家认为这些部分的作用就像一个聚光灯。如果模型正在讨论“狗”,而聚光灯照在了“拉布拉多”这个词上,那么理论便是:“啊哈!模型将‘狗’和‘拉布拉多’联系起来,是因为它知道它们之间存在关联!”

现实检验:
研究人员测试了这种聚光灯是否真的能在信息穿过模型的各个层(即它的“大脑”)时,始终聚焦在同一个词上。

  • 类比: 想象你正在教室里传纸条。你在纸上写下“狗”。你把纸传给下一个学生,他上面画了一个涂鸦。你传给下一个人,下一个人把它折叠起来,并与另一张纸条混合在一起。当这张纸传到教室后排时,它已经变成了一个由许多不同纸条混合而成的皱巴巴的纸团。
  • 发现: 研究人员发现,当信息到达模型的更深层时,这张“纸条”(词的表示)已经被熔化并与其他纸条混合在一起了。聚光灯不再是照在原始的那个词上,而是照在了一个由许多词组成的混乱混合物上。
  • 结论: 当科学家们画出漂亮的图表,展示模型“关注”哪些词时,他们看到的其实是一个看起来有意义的模式,但那实际上只是混合过程产生的一种人工痕迹(artifact)。模型并不一定是在思考词与词之间的关系;仅仅是数学计算在视觉上“看起来”像是那样。

方法 2:“翻译官”(嵌入属性推理)

理论:
第二种方法试图通过将模型的内部数字(嵌入/embeddings)视为一种秘密代码,来观察模型“知道”什么。科学家尝试构建一个“翻译官”(一个小型的计算机程序)来将这些数字解码成人类的特征。

  • 例子: 如果模型有一个代表“苹果”的向量,能否通过翻译官预测出“苹果”是“红色的”、“可食用的”以及“长在树上的”?如果翻译官得到了高分,科学家就会说:“看!模型知道苹果是什么!”

现实检验:
研究人员测试了翻译官究竟是在解码“含义”,还是仅仅在“作弊”。

  • 类比: 想象你试图通过观察一个人的身高来猜测他最喜欢的颜色。
    • 套路: 如果你的数据集里所有人只要个子高就喜欢“蓝色”,而你建立了一个根据身高来猜测“蓝色”的翻译官,你会得到一个完美的分数。
    • 现实: 但如果你交换了数据,让“高个子”现在喜欢“红色”,而你的翻译官仍然能完美地猜出“蓝色”,这意味着你的翻译官并不是真的在学习关于颜色的知识。它只是在记忆数据的“形状”,或者是利用了颜色列表很短且具有重复性的事实。
  • 发现: 研究人员尝试向翻译官喂入无意义的数据。他们打乱了单词,用随机的乱码替换了“苹果”,或者混淆了属性(让“苹果”与“刺痛”和“致命”联系在一起)。
  • 结果: 翻译官仍然得到了高分!无论含义是真实的还是虚假的,这都不重要。高分是由数据集的数学结构(例如数据的稀疏程度或拥挤程度)驱动的,而不是因为模型真正理解了这些概念。

为什么这很重要?

作者认为,我们目前正在构建依赖于这些 AI 模型的复杂系统(如自动驾驶汽车或医疗诊断工具)。为了让这些系统既安全又高效,工程师使用这些“可解释性”方法来进行:

  1. 调试系统(找出为什么会出错)。
  2. 压缩系统(使其变小以便在手机上运行)。
  3. 信任系统(决定是否可以安全使用)。

危险之处: 如果用于检查系统的工具是损坏的,我们可能会误以为系统是安全且运作正常的,而实际上并非如此。这就像是用一个坏掉的温度计来检查病人是否发烧;如果温度计总是显示“98.6度”,你可能会错过真正的病情。

核心观点

论文得出结论:虽然这两种方法能产生令人信服的故事(漂亮的图片和高分),但它们并不能提供真正的科学解释

  • 注意力图就像是在看一张模糊的照片,并说服自己看到了一个脸孔,尽管那其实只是噪声。
  • 属性推理就像是根据字符串的长度来猜测密码,而不是根据实际的字符。

作者并不是说 AI 是没用的;他们是说我们需要停止假设这些特定的工具能够告诉我们 AI 在“思考”什么。在我们将这些模型用于控制现实世界的系统之前,我们需要更严格地测试我们的假设。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →