← 最新论文
🤖 AI

Subliminal Clocks: Latent Time Modelling in Diffusion Language Models

本文表明,扩散语言模型尽管缺乏显式的步长条件(timestep conditioning),但其残差流中内部编码了一种可解码的去噪进度潜表征,这种表征可以通过操纵来系统地控制模型的置信度和熵。在此激活上下文中,变量 h 的索引 n 表示序列位置,t 表示去噪步长。KL 散度并不与 \hat{t}-t 的距离呈线性缩放关系。

原作者: Maximo Rulli (Sapienza University of Rome), Thomas Fontanari (Sapienza University of Rome), Simone Petruzzi (Sapienza University of Rome), Federico Alvetreti (Sapienza University of Rome), Giorgio Str
发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Maximo Rulli (Sapienza University of Rome), Thomas Fontanari (Sapienza University of Rome), Simone Petruzzi (Sapienza University of Rome), Federico Alvetreti (Sapienza University of Rome), Giorgio Strano (Sapienza University of Rome), Donato Crisostomi (Sapienza University of Rome), Giorgos Nikolaou (EPFL), Tommaso Mencattini (EPFL), Andrea Santilli (Independent researcher), Emanuele Rodolà (Sapienza University of Rome), Simone Scardapane (Sapienza University of Rome), Alessio Devoto (Independent researcher)

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将扩散语言模型(Diffusion Language Model, DLM)视为一位在黑暗房间里工作的雕塑大师。与传统的作家那样从左到右一个词一个词地构建故事不同,这位雕塑家从一块完全被粘土(由 [MASK] 标记表示)覆盖的石块开始。他们的工作是剥离粘土,一层一层地揭开隐藏在下面的词语,直到最终的雕像显现出来。

这个研究解决的核心谜题是:雕塑家知道还剩多少粘土吗?

在传统的写作模型中,计算机确切知道自己写了多少个词。但在这些“雕塑”模型中,论文提出了一个问题:即使没有被明确教过如何计数,这些模型是否拥有一种内在的“时钟”或对进度的感知?

以下是研究人员发现的成果,通过简单的解释呈现如下:

1. “潜意识时钟”

研究人员发现,尽管模型并没有被告知“你已经完成了 50%”,但它在秘密地记录自己的进度。这就像一位雕塑家虽然没有手表,但能通过感受手中石头的重量,本能地知道:“我已经完成了一半。”

他们发现模型大脑内部(具体是在其“残差流”中,即模型的内部思维路径)存在一个隐藏信号。这个信号充当了一个潜意识时钟(Latent Clock)。它告诉模型剥离了多少“粘土”(被遮盖的标记)以及还剩多少。

2. 读取思想(探测)

为了证明这个时钟的存在,研究人员构建了一个简单的“解码器”(探测器)。他们观察了模型在不同阶段的内部思维。

  • 结果: 解码器可以准确地读取模型的内部时钟。仅仅通过观察模型的激活状态,解码器就能判断模型正处于起始阶段(粘土很多)、中间阶段,还是结束阶段(几乎没有粘土剩余)。
  • 类比: 这就像通过观察一个人的姿态,就能瞬间判断出他是在马拉松刚起步,还是即将冲过终点线,即便他一言不发。

3. 黑进时钟(操控)

最令人兴奋的部分是,研究人员不仅能“读取”这个时钟,还能“重构”它。他们发现模型大脑中存在一个特定的方向,对应着“时间”或“进度”。

  • 实验: 他们人工地将模型的内部时钟向前或向后推。
    • 向前推动: 他们告诉模型:“你快完成了!”(即便事实并非如此)。模型立即变得更加自信,说话时的犹豫减少(熵降低),表现得像是已经准备好收尾了。
    • 向后推动: 他们告诉模型:“你才刚刚开始!”(即便此时已接近尾声)。模型变得困惑、缺乏信心,并开始质疑自己的选择。
  • 结论: 这证明了时钟不仅仅是一个被动的观察,而是一个控制机制。如果你改变模型的感知时间,你就会改变它的行为。值得注意的是,模型输出分布与真实分布之间的差异(通常用 KL 散度衡量)并不与感知时间 t^\hat{t} 和真实时间 tt 之间的线性距离成正比,而是呈现出更复杂的非线性关系。

4. 时间的形状

研究人员还观察了这种“时钟”的几何结构。他们发现,模型并不将时间表示为一个混乱、无序的云团。相反,它将时间组织成一条非常整洁、平滑的曲线(类似于抛物线)。

  • 类比: 想象模型对时间的理解就像是一条过山车轨道。随着去噪过程的推进,模型的内部状态沿着这条轨道平滑地滑动。研究人员发现,几乎所有关于“我们进行到哪一步了”的信息,都能够拟合到这一条单一的、低维度的轨道上。

5. 自我修正机制

其中一个最酷的发现是,模型足够聪明,能够修正错误。

  • 如果研究人员在模型的早期层(即思维过程的“开始”阶段)干扰了时钟,模型通常会在信息流向更深层时进行“自我修正”。它会意识到:“等等,虽然我被告知已到达终点,但我实际上还在中间,”然后它会调整内部状态以回归真相。
  • 然而,如果他们在非常靠后的层级干扰时钟,模型就无法进行修正,其行为也会发生永久性的改变。

总结

这篇论文揭示了扩散语言模型拥有一种隐藏的、内在的“还有多少工作要做”的感觉。

  1. 它们拥有时钟: 它们将进度编码在内部大脑状态中。
  2. 我们可以读取它: 我们可以准确测量这种进度。
  3. 我们可以控制它: 通过微调这个内部时钟,我们可以让模型变得更加自信或不再那么自信。
  4. 它是结构化的: 这种“时间”在模型的脑内以一种整洁、可预测的几何形状组织起来。

本质上,模型就像一个正在隧道中行走的人,即使没有人告诉他距离,他也清楚地知道自己距离光亮还有多远。研究人员找到了承载这一知识的大脑部分,并展示了可以通过转动旋钮来改变这个人对这段旅程的感觉。

技术细节澄清:
在分析模型内部状态时,研究人员关注的是激活向量 hh。为了避免混淆,需要明确该变量中两个关键索引的含义:

  • nn 代表层索引(Layer Index):它标识了模型神经网络中的具体深度层级(例如,第 1 层、第 12 层等)。
  • tt 代表去噪步骤索引(Denoising Step Index):它标识了当前处于生成过程的哪个时间步或阶段(例如,刚开始去噪的第 1 步,还是接近完成的最后一步)。
    因此,hn,th_{n,t} 表示在第 tt 个去噪步骤中,第 nn 层神经网络的内部激活状态。正是通过分析这些特定层和特定时间步的激活状态,研究人员才发现了上述的“潜意识时钟”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →