← 最新论文
💬 NLP

Where Should Diffusion Enter a Language Model? Geometry-Guided Hidden-State Replacement

本文介绍了 DiHAL,这是一种几何引导的混合模型,通过识别预训练 Transformer 中的最优层以扩散桥替换其进行隐状态重建,从而改进连续扩散语言模型,避免了直接的连续到离散 token 恢复,并实现了更优越的性能。

原作者: Injin Kong, Hyoungjoon Lee, Yohan Jo

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Injin Kong, Hyoungjoon Lee, Yohan Jo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和创意类比对论文《扩散模型应进入语言模型的何处?》的解释。

核心难题:试图修复一台坏掉的收音机

想象你有一台非常聪明的收音机(即大型语言模型),它擅长预测句子中的下一个词。它通过监听一系列单词并逐个猜测接下来的内容来工作。这被称为“自回归”模型。

最近,科学家们尝试使用一种名为扩散(Diffusion)的不同技术(即生成惊艳 AI 图像的同款技术)来让这些收音机表现更好。在图像扩散中,AI 从一张充满静态噪点的图片开始,慢慢将其清理,直到出现清晰的图像。

然而,当研究人员试图将这种方法应用于文本时,效果并不理想。文本是由离散的块(像乐高积木)组成的,而扩散技术最适合处理平滑、连续的水流。试图直接将“噪点”转化为“乐高积木”是混乱的。AI 常常感到困惑,最终输出的单词也是错误的。

新想法:不要修复积木,要修复蓝图

这篇论文的作者孔进金(Injin Kong)及其同事提出了一个不同的问题:“我们应该让扩散技术进入收音机的哪个部位?”

他们决定不让扩散技术去清理最终的乐高积木(即单词),而是让它去清理收音机在决定最终单词之前所使用的蓝图(即隐藏的内部思维)。

他们将这个新系统称为DiHAL(用于语言的扩散 - 变换器混合架构)。这可以看作是一种“定位并替换”策略。

第一步:“几何”侦探

论文指出,收音机大脑的各个部分并不相同。有些部分混乱且难以清理;有些部分则井然有序,易于修复。

为了找到最佳位置,作者们创建了一个“几何分数”。想象收音机的大脑是一座山脉:

  • 曲率(坡度):有些区域陡峭且平滑(容易滑向正确答案);有些区域平坦或崎岖(难以导航)。
  • 刚度(结构):有些区域刚性十足,能很好地保持形状;有些区域则摇晃不稳。
  • 维度(复杂性):有些区域很简单,就像一条笔直的走廊;有些区域则是巨大且令人困惑的迷宫,充满了死胡同。

作者们构建了一个工具,用于测量收音机每一层的这些“几何”特征。他们发现,早期层(靠近处理起始处)就像一条平滑、有序的走廊。而后期层则像是一个复杂、纠缠的迷宫。

发现:扩散技术在起始处平滑、有序的走廊中效果最好。它在末端纠缠的迷宫中则举步维艰。

第二步:“定位并替换”手术

一旦找到了完美位置(通常是收音机的第 2 层或第 3 层),他们进行了一次手术式替换:

  1. 定位:他们确定了“蓝图”最容易清理的具体层级。
  2. 替换:他们移除了收音机的原始早期层,并用一个扩散桥(Diffusion Bridge)取而代之。
  3. 保留:他们保留了收音机的其余部分(上层和最终的输出端)原封不动。

实际运作方式

  • 扩散桥接收嘈杂的输入,并慢慢将其清理,以重建原始收音机在该特定层级本应具有的“蓝图”(即隐藏状态)。
  • 一旦蓝图被清理完毕,它就被交还给原始收音机未受干扰的上层。
  • 原始收音机随后完成工作,将这个清晰的蓝图转化为最终的单词。

为什么这更好

论文在两个巨大的 80 亿参数模型(Llama-3 和 Qwen3)上测试了这种方法。

  • 旧方法:试图直接清理最终单词,就像试图通过锤击齿轮来修复一块坏掉的手表。这很困难,而且往往会弄坏时间。
  • DiHAL 方法:这就像把手表拆开,用一种温和、精密的工具清洁主发条(即隐藏蓝图),然后再把手表组装回去。因为收音机的上层已经是解读该特定蓝图的专家,它们可以完美地解码这个清晰的信号。

结果

实验表明:

  1. 几何分数有效:他们的“侦探工具”成功预测了哪些层级最适合进行这种手术,而无需尝试每一层。
  2. 质量提升:新的混合模型生成的文本比其他试图直接修复单词的扩散方法更准确(困惑度更低)且更多样化。
  3. 它是混合体:值得注意的是,DiHAL 并非纯粹的扩散模型。它是一种混合体。它利用扩散技术修复过程的早期部分,但仍依赖原始强大的变换器层来进行最终的思考和单词选择。

结论

论文总结认为,扩散模型在文本上表现不佳的原因,不仅仅是因为文本是“离散的”(像乐高积木)。而是因为我们试图在 AI 大脑中错误的“房间”应用扩散技术。通过找到具有正确几何特征(平滑、有序且简单)的房间,并让扩散技术在那里清理内部蓝图,我们可以在不从头重建整个 AI 的情况下获得更好的结果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →