Reading Between the Dots: Decoding Hidden Computation across Filler Tokens
本文表明,前沿大语言模型在其隐藏状态中对无内容的填充标记进行着结构化、可读的多步推理,这揭示了即使在表面标记无法提供可见思维链的情况下,通过对残差流进行无监督解码,隐藏计算仍然是可监测的。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在观看一位魔术师表演魔术。通常,为了理解他是如何做到的,你会观察他的双手并倾听他的话语。在人工智能(AI)的世界里,这就像是在观察“思维链”(Chain of Thought, CoT)——即 AI 在给出答案之前写出的逐步解释。
长期以来,安全专家一直担心,如果 AI 停止写出它的步骤而只是直接给出最终答案,我们将无法得知它是在正确思考还是仅仅在瞎猜。这篇题为**《读懂点点之间》(Reading Between the Dots)**的论文研究了一个特定的、奇怪的情景:即在问题和答案之间,AI 被给予了一堆无意义的“填充”标记(比如一串点 ...... 或计数数字 1 2 3 4 5)。
以下是研究人员的发现,通过简单的概念进行了拆解:
1. 魔术技巧:AI 利用了“空白空间”
研究人员向两个非常聪明的 AI 模型(DeepSeek V3 和 Kimi K2)提出了困难的数学和逻辑问题。
- 没有点时: AI 经常出错。
- 有点时: AI 答对的概率大大提高。
事实证明,AI 并不是在忽略这些点。它是在利用这个“空白空间”作为一个草稿本(scratchpad)。尽管这些点在我们看来毫无意义,但 AI 实际上是在这些点所占据的数字空间内进行秘密的数学运算和推理。这就像一位厨师在向顾客说话的同时,一边切菜一边在心里默念食谱;顾客听不到声音,但烹饪过程正在发生。
2. “X光视觉”:看见隐藏的思想
一个大问题是:如果 AI 没有把步骤写出来,我们还能看到它在想什么吗?
作者说可以。他们开发了一种特殊的“X光”工具(称为 Logit Lens),它观察的是 AI 内部的电信号(其“残差流/residual stream”),而不是仅仅阅读它打出的文字。
- 类比: 想象 AI 的大脑是一条繁忙的高速公路。它打出的文字只是行驶在路面上的汽车。但在道路下方,有隧道和管道在输送着实际的水流和电力,驱动着汽车行驶。
- 他们的发现: 通过观察这些点下方的“隧道”,我们可以看到 AI 在甚至还没打出最终答案之前,就已经在检索事实(例如“莫扎特去世时 35 岁”)并进行计算(例如“35 + 93 = 128”)。这些点并非空洞无物;它们充满了 AI 内部的计算过程。
3. “大脑移植”实验
为了证明这些点确实是导致 AI 正确思考的原因(而不仅仅是巧合),他们进行了一个“大脑移植”实验。
- 他们从一次成功的 AI 运行中提取了内部“思想”(隐藏数据),并将它们转换到另一次即将失败的 AI 运行中。
- 结果: 那个失败的 AI 突然开始给出正确的答案,仿佛它从另一个 AI 那里“感染”到了正确的想法。这证明了点中的信息是真实的、有用的,并且对于得出答案至关重要。
4. “解码器环”:解读秘密代码
研究人员构建了一个简单的、无监督的流水线(一套不需要被教导的指令)来解码这些隐藏的思想。
- 他们提取了点中的隐藏信号,清理掉噪声,并将排名前列的候选内容输入到第二个非常聪明的 AI(“裁判”)中。
- 成功率: 这个解码器能以 80% 到 95% 的准确率正确猜测 AI 在想什么。
- 它的发现: 即使 AI 从未写下它们,解码器也能找回具体的数字、城市名称或元素。如果 AI 答错了,解码器甚至能说明为什么错(例如:“它找到了正确的数值,但忘记了将它们相加”)。
核心启示
论文认为,仅仅因为 AI 没有大声说出它的推理过程(或者没有写出可见的思维链),并不意味着它的推理过程对我们来说永远是隐形的。
- 问题: 如果我们只看 AI 写下的文字,我们可能会错过它真正的思考过程,尤其是当它使用“填充”标记时。
- 解决方案: 我们拥有观察其内部信号的工具。即使 AI 试图在“空白”空间里隐藏它的工作,我们仍然可以通过观察“残差流”(内部电信号活动)来了解它到底在做什么。
简而言之: AI 就像一个正在参加考试的学生,他在纸上写下答案,但所有的计算过程都在脑海中完成。这篇论文表明,即使我们无法在纸上看到计算过程,我们仍然可以使用特殊的工具来读取这个学生的思想,并看清他是如何解决问题的。这表明,“隐藏”的计算并不一定意味着“不可审计”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。