← 最新论文
💬 NLP

Linear Probes Detect Task Format, Not Reasoning Mode in Language Model Hidden States

本文表明,尽管针对大语言模型(LLM)隐藏状态的线性探测在区分演绎、归纳和溯因推理任务方面取得了极高的准确率,但这种分离完全是由任务格式混淆驱动的,而非源于这些推理模式本身具有不同的计算表示。

原作者: Subramanyam Sahoo, Vinija Jain, Aman Chadha, Divya Chaudhary

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Subramanyam Sahoo, Vinija Jain, Aman Chadha, Divya Chaudhary

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:AI 大脑是否存在不同的“模式”?

想象一下,你正在试图弄清楚一位厨师是如何烹饪的。你注意到,当他们做沙拉时,会穿上一件绿色的围裙;而当他们煎牛排时,会穿上一件红色的围裙。你可能会猜想:“啊!绿色围裙意味着他们在用‘沙拉策略’,而红色围裙意味着他们在用‘牛排策略’。”

这正是研究人员对大语言模型(LLM)所做的研究。他们观察 AI 的“隐藏状态”(其内部大脑活动),并使用一种称为**线性探测(linear probe)**的简单测试,来观察 AI 是否像厨师切换围裙一样,在不同的“推理模式”(如演绎、归纳和溯因)之间进行切换。

长期以来,数据看起来非常完美。那个“绿色围裙”(演绎任务)和“红色围裙”(归纳任务)在 AI 大脑的不同区域完全分离。研究人员曾认为:“太棒了!AI 为不同类型的思考构建了截然不同的内部电路。”

但这篇论文说:“等等。你看到的不是思考过程,你看到的只是制服。”

调查过程:实际发生了什么?

研究人员使用三种不同类型的逻辑谜题对 AI(具体是一个名为 Qwen3-14B 的模型)进行了更深入的观察:

  1. 演绎(Deductive): 逻辑谜题(类似于数学证明)。
  2. 归纳(Inductive): 科学问题(寻找规律)。
  3. 溯因(Abductive): 侦探破案(猜测最佳解释)。

他们发现,AI 的大脑活动在处理每种类型时确实看起来完全不同。但他们怀疑其中存在陷阱。

“制服”带来的混淆

可以这样理解:

  • 演绎谜题来自一个网站,那里的每个问题都有 4 个可选答案且带有长篇故事。
  • 归纳谜题来自另一个网站,那里的每个问题也有 4 个可选答案,但使用了科学术语。
  • 溯因谜题来自第三个网站,那里的每个问题只有 2 个可选答案且非常简短。

研究人员意识到,AI 并不一定是切换了它的“思考风格”。相反,它只是在对问题的格式(format)做出反应。这就像厨师穿上绿色围裙,并不是因为他们在做沙拉,而是因为制作沙拉的那个厨房被漆成了绿色。

三项测试(“侦探工作”)

为了证明他们的理论,研究人员运行了三项特定的测试:

1. “脱掉制服”测试(残差分析)
他们提取了 AI 的大脑活动,并通过数学方法“洗掉”了格式细节(例如答案的数量、文本的长度以及问题来自哪个网站)。

  • 结果: 一旦去除了“制服”(格式),“绿色围裙”和“红色围裙”就消失了。所有三种任务的大脑活动看起来完全一样。那种完美的区分感消失了,降到了随机水平。
  • 类比: 如果你拿走了绿色和红色的围裙,无论厨师是在做沙拉还是煎牛排,看起来都一模一样。

2. “行为检查”(迹线-模式一致性)
他们观察了 AI 在解决问题时实际写出的文字。AI 在解决逻辑谜题与解决悬疑案件时,表现出的行为真的不同吗?

  • 结果: 没有。AI 在解决这三类问题时都表现得非常出色(准确率 86%),但它在阐述解决方案时的说话方式对于所有问题几乎是完全相同的。它并没有切换策略,而是为所有问题都使用了一种“超级策略”。
  • 类比: 厨师无论是在切西红柿还是切胡萝卜,使用的刀工和切菜动作都是完全一样的。他们并没有使用一种“西红柿技巧”或“胡萝卜技巧”。

3. “推动”测试(因果引导)
研究人员尝试通过“推动”AI 的大脑特定方向,来强迫它表现得像是处于“演绎模式”或“归纳模式”。他们将此与随机推动进行对比。

  • 结果: 向“演绎”方向推动的效果并不比随机推动更好。大脑的几何结构实际上并不控制思考风格。
  • 类比: 试图通过推搡来强迫厨师更换围裙,并不能改变他们烹饪的内容。围裙的颜色只是一个巧合,而不是烹饪风格的原因。

结论

论文得出结论:在这些测试中获得高准确率,并不足以证明 AI 拥有不同的内部推理电路。

当研究人员为不同类型的推理使用不同的数据集时(这是标准做法),AI 学到的是识别数据集的格式(即“制服”),而不是逻辑本身。研究人员在 AI 大脑中看到的“独特几何结构”,仅仅是问题格式的反映,而非特殊思考模式的反映。

核心启示:
仅仅因为 AI 的大脑在处理不同任务时看起来不同,并不意味着它的思考方式发生了变化。它可能只是穿着了不同的制服。要真正理解 AI 如何推理,我们需要剥离格式,看看思考过程本身是否发生了变化。在这种情况下,AI 似乎使用一种强大的、统一的策略来解决各种逻辑问题,而不是在专门的模式之间进行切换。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →