← 最新论文
💬 NLP

For What Reason? Interpreting Models' Encoding of Causation and Antithesis

本文研究了指令微调的 Transformer 模型如何编码因果(causation)与对立(antithesis)论辩关系,揭示了预测决策在不同层级间是在不同阶段做出的,并且这些模型在基于论辩的推理中表现出不对称的表示。

原作者: Abhidip Bhattacharyya, Shira Wein

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Abhidip Bhattacharyya, Shira Wein

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你不仅是在通过听取词汇来理解一段对话,更是在感受将这些词汇紧紧联系在一起的无形丝线。在人工智能的世界里,这些丝线被称为“话语关系”(discourse relations)。你可以把它们想象成将故事粘合在一起的胶水,告诉你是其中一句话是下一句的“原因”,还是与下一句相矛盾的“惊喜”。对于计算机而言,要实现真正的有用和安全,它需要理解这些内在的联系,而不仅仅是单词的字典定义。如果一个机器人无法区分“我学习了,所以我通过了”(一种快乐的因果关系)和“我学习了,然而我失败了”(一种悲伤的矛盾关系),它可能会给你糟糕的建议或误解你的感受。这篇论文深入探讨了现代人工智能的“大脑”,观察它是如何处理这些棘手的关系的。

研究人员 Abhidip Bhattacharyya 和 Shira Wein 决定在两个流行的 AI 模型(LLaMA 和 Mistral)内部扮演侦探,以弄清楚它们是如何区分因果关系(事情发生是因为某事)和对立关系(事情发生却违背了某事)的。他们设计了一个简单的游戏:给 AI 展示一个带有空格的句子,比如“约翰努力学习,所以他___能通过”,并要求它在“能够”或“不能”中填入一个词。通过更换连接词(将“所以”改为“然而”)或翻转动词的含义,他们可以精确地观察到 AI 的内部齿轮是如何运转并做出正确选择的。

以下是他们的发现,这有点像是在探索一座工厂流水线是如何运作的。

思维的流水线
团队发现,AI 并不是一次性做出决定的。相反,它是一个接力赛。当 AI 阅读像“所以”或“然而”这样的提示词时,它的早期和中期层(可以把这些层想象成摩天大楼的前几层)会立即开始理解局部含义。它们负责发出指令:“哦,‘所以’通常意味着一个好的结果,而‘然而’则意味着一个转折!”

然而,这些早期层并不拥有最终决定权。随着信息向高层(塔顶)传输,决策会被锁定。研究人员发现,一旦中间层完成了它们的工作,顶层主要就是将那个决定向前传递到终点。如果你试图通过用另一个句子替换它们的“想法”来干扰顶层,AI 并不会改变主意——因为它已经太晚了,决定已经做出了。但如果你在 AI 看到“所以”或“然而”时,去干扰中间层,你实际上可以翻转它的答案。这表明,对于这些特定的线索,中间层才是真正的决策者。

隐藏的偏见
其中一个最有趣的发现是,AI 并非完全中立。研究人员发现,某些层具有内置的偏见。有些层似乎对“不能”这个答案有强烈的偏好,而另一些层则无论句子内容如何,都倾向于“能够”。这就像有一组裁判,其中一些天生脾气暴躁,只想说“不”,而另一些则非常乐观,只想说“是”。最终的答案是这些带有偏见的层之间的一场拔河,直到真相胜出。

动词的角色
研究还表明,AI 足以聪明到能够超越仅仅是连接词的限制。如果句子使用了一个否定动词(比如“违反规则”而不是“努力学习”),AI 就必须更加努力地去弄清楚“能够”还是“不能”才符合语境。研究人员发现,根据动词是积极的还是消极的,AI 会使用不同的内部路径。当动词是负面时,AI 大脑内部的连接变得不太稳定且更加混乱,这表明负面情绪或行为会让 AI 的推理过程变得有些摇摆不定。

底线结论
简而言之,这篇论文表明,AI 模型不仅仅是“知道”答案;它们是循序渐进地构建答案的。大脑的早期部分识别线索,中间部分做出判断,而顶层部分则负责交付判决。虽然 AI 在这项任务上表现出色(几乎每次都能答对),但它依赖于特定的、有时带有偏见的内部电路来完成工作。这有助于我们理解,为了让 AI 真正符合人类价值观,我们不仅需要知道它回答了什么,还需要知道它是如何决定的,因为通往答案的路径与答案本身同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →