← 最新论文
💬 NLP

Causal Tongue-Tie: LLMs Can Encode Causal Direction, But Their Yes/No Outputs Fail to Express

本文揭示了大型语言模型中存在一种“因果舌系带”现象,即尽管模型的口头是/否输出无法表达其因果知识(准确率约 50%),但其隐藏状态却能准确编码因果证据(准确率约 97%),这表明仅基于最终答案的标准基准测试可能会歪曲模型真实的因果推理能力。

原作者: Ziyi Ding, Xiao-Ping Zhang

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziyi Ding, Xiao-Ping Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将一个大语言模型(LLM)比作一位坐在教室里才华横溢却害羞的学生。这位学生参加了一场关于因果关系的测试(例如“吸烟是否会导致肺癌?”)。

这篇论文发现了一种奇怪的现象,作者称之为“因果性口吃”(Causal Tongue-Tie)。以下是将其拆解为简单部分的解释:

1. 两种声音:“大脑”与“嘴巴”

通常,我们假设如果电脑的“大脑”(其内部数学运算和隐藏计算)知道答案,那么它的“嘴巴”(它打出的文本)也会说出同样的话。

这篇论文发现,对于这些模型而言,大脑和嘴巴讲述的是不同的故事。

  • 大脑(隐藏状态): 当你窥探模型思考时的数学运算,你会发现它已根据问题中提供的证据,清晰地得出了正确答案。这就像学生举手并向老师低声说出正确答案。
  • 嘴巴(输出): 当模型真正开口(写下“是”或“否”)时,它无视了自己的大脑,转而回归它认为的常识,即使证据表明并非如此。这就像学生低声说出了正确答案,却因害怕出错而大声喊出错误的答案。

2. “反常识”测试

为了证明这一点,研究人员使用了一个技巧。他们给模型提供了证据相反的问题。

  • 场景: 他们告诉模型,“在这个故事中,吸烟预防了肺癌。”(在现实世界中,吸烟会导致肺癌)。
  • 结果:
    • 模型的嘴巴: 回答说“不,吸烟不能预防肺癌”。它拒绝接受新规则,坚持现实世界的习惯。
    • 模型的大脑: 一个特殊工具(“探针”)深入模型的数学运算内部,发现它已完美理解了新规则。根据提供的故事,它知道答案应该是“是”。

大脑知晓真相(97% 的准确率)与嘴巴说出错误内容(50% 的准确率)之间的差距,就是“因果性口吃”。

3. “口吃”的隐喻

把它想象成一个口吃的人。

  • 他们确切地知道自己想说什么。
  • 他们脑海中拥有正确的词汇。
  • 但当他们试图说话时,舌头却卡住了,结果不小心说出了相反的话或一些泛泛之词。

论文认为,当模型在因果关系问题上“答错”时,并不总是意味着模型愚蠢或不理解。有时,这意味着模型完全理解却无法通过标准的“是/否”格式表达出来

4. 为什么“是/否”是问题所在

研究人员尝试了不同的提问方式,看看能否“解开”这个口吃。

  • 询问“是/否”: 模型失败了。它陷入了旧习惯的泥潭。
  • 询问"A 或 B": 当他们迫使模型在两个具体选项之间做出选择(例如,“是 A 导致 B,还是 B 导致 A?”)时,模型几乎 100% 的时间突然答对了。

这表明问题不在于模型缺乏知识。问题在于接口。简单的“是/否”按钮就像一个陷阱,迫使模型默认依赖其训练数据(常识),而不是提示中的具体证据。

5. 这对“推理”意味着什么

这篇论文关于我们如何评估 AI 提出了一个关键点:

  • 如果模型答对了: 它可能只是在猜测或遵循某种模式,并不一定是在进行“推理”。
  • 如果模型答错了: 这并不意味着它无法推理。它可能在其“大脑”内部正确地进行推理,但未能大声说出来。

核心结论:
我们不能仅仅通过最终的“是”或“否”来判断 AI 是否理解因果关系。有时,AI 知道真相,但因过于“口吃”而无法以我们预期的方式表达出来。论文建议,我们需要更好的方法来倾听模型实际在想什么,而不仅仅是听它说了什么。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →