← 最新论文
💬 NLP

Reasoning Models Know What's Important, and Encode It in Their Activations

该研究发现,语言模型在推理过程中会在其内部激活中编码步骤重要性的表征,且这种表征比推理链本身的文本包含更多信息,表明分析模型内部状态对于理解推理机制至关重要。

原作者: Yaniv Nikankin, Martin Tutek, Tomer Ashuach, Jonathan Rosenfeld, Yonatan Belinkov

发布于 2026-04-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Yaniv Nikankin, Martin Tutek, Tomer Ashuach, Jonathan Rosenfeld, Yonatan Belinkov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文探讨了一个非常有趣的问题:当人工智能(AI)像人一样“思考”并一步步解题时,它自己真的知道哪一步是关键的,哪一步只是废话吗?

想象一下,你让 AI 做一道数学题。它可能会写出长长的推理过程,像写日记一样,有几十步。但其中有些步骤是真正解决问题的“核心”,而有些步骤可能只是它在“自言自语”或者重复已知信息,删掉它们完全不影响最终答案。

这篇论文的核心发现可以用一个生动的比喻来解释:

1. 表面文字 vs. 内心独白(Token vs. 激活值)

  • 表面文字(Token): 就像我们读到的 AI 写出来的“日记”。如果我们只读这些文字,很难分辨哪一步是关键的。就像看一个人的演讲记录,有时候他说了很多废话,有时候又说了关键句,光看文字很难一眼看出重点。
  • 内心独白(激活值/Activations): 这是 AI 在生成每一个字之前,大脑内部发生的“电火花”或“神经活动”。论文发现,AI 的“内心独白”比它说出来的“话”更诚实、更清晰。

比喻:
想象你在玩一个复杂的密室逃脱游戏。

  • Token(表面文字) 是你写在笔记本上的解题步骤。你可能写了很多:“首先,我看了看门……然后我摸了摸墙……哎呀,这墙好凉……"(废话)。
  • Activations(内心激活) 是你大脑里真正的思考过程。当你看到墙上的暗号时,你的大脑瞬间“亮”了一下,知道“啊!这就是关键线索!”;而当你摸墙觉得凉的时候,大脑只是平淡地处理了一下。
  • 论文发现: 如果我们只读你的笔记本(Token),很难分清哪句话重要。但如果我们能直接读取你大脑的“电波”(激活值),我们就能精准地知道哪一刻你真正“顿悟”了,哪一刻你只是在发呆。

2. 核心发现:AI 早就知道什么重要

研究人员做了一件事:他们训练了一个小探测器(Probe),专门去“偷听”AI 在生成某一步时的内心活动,然后问它:“这一步重要吗?删掉它还能解题吗?”

  • 惊人的结果: AI 在还没写出下一步的时候,它的内心活动里就已经标记好了“这一步很重要”或者“这一步是废话”。
  • 这意味着什么? AI 并不是在写完所有步骤后,回头才意识到哪些有用。它在思考的过程中,潜意识里就已经知道哪些是核心逻辑,哪些是多余的。这种“重要性”的信号,深深地藏在它的神经网络里,而不是写在它输出的文字上。

3. 为什么这很重要?(三个关键点)

A. 只有“内心”才懂,光看“嘴巴”不行

如果你只分析 AI 写出来的文字(Token),你很难准确找到关键步骤。就像你听一个人说话,他可能啰里啰嗦,但如果你能直接看他的微表情或脑电波,你就能瞬间抓住重点。论文证明,要真正理解 AI 是怎么推理的,必须看它的“大脑内部”,而不能只看它输出的“文字”。

B. 这种“重要性”是通用的

研究人员测试了不同的 AI 模型(有的像 GPT,有的像 DeepSeek)。结果发现,“什么是重要步骤”这个概念,在不同的 AI 大脑里是一样的。

  • 比喻: 就像不同语言的人(英语、中文、法语)在解决同一个数学题时,虽然他们说的话不同,但他们大脑里“灵光一现”的那个瞬间(关键步骤)是高度相似的。这种“重要性”的编码方式,是 AI 界通用的“语言”。

C. 它不是靠“位置”或“长短”判断的

你可能会想:“是不是 AI 觉得第一步和最后一步最重要?或者字数多的步骤最重要?”

  • 答案:不是。 研究发现,AI 判断重要性完全不看这一步是在开头还是结尾,也不看这一步有多长。它是基于逻辑内容来判断的。哪怕是一句很短的话,如果它是解题的关键,AI 的内心就会给它打上“重要”的标签。

4. 这对我们意味着什么?

  • 更高效的 AI: 既然我们知道 AI 心里知道哪些步骤是废话,未来我们可以训练 AI,让它自动跳过那些“可删除”的废话步骤。这样,AI 解题会更快,消耗的计算资源更少,就像把一段冗长的电影剪辑成最精彩的预告片,但剧情一点没少。
  • 更透明的 AI: 以前我们觉得 AI 的推理过程像黑盒,现在我们知道,只要打开“黑盒”看它的内部激活值,就能看清它到底在想什么。这让我们能更信任 AI 的回答,知道它的结论是建立在真正的逻辑上,而不是靠蒙或者凑字数。

总结

这篇论文告诉我们:AI 其实是个“心里有数”的聪明人。 它生成的长篇大论里,混杂着很多废话,但它自己的“大脑”里清楚地知道哪些是干货,哪些是水分。而且,这种判断能力是写在它的“基因”(内部激活)里的,而不是写在它嘴里的。

一句话总结: 别光听 AI 说了什么,要看它“想”了什么;因为它的“想”比它的“说”更诚实、更精准。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →