← 最新论文
🤖 machine learning

Don't Retrain, Align: Adapting Autoregressive LMs to Diffusion LMs via Representation Alignment

本文介绍了 REPR-ALIGN,这是一种通过使扩散语言模型的隐藏状态与预训练自回归模型的隐藏状态对齐,从而加速扩散语言模型训练的方法,该方法在无需改变架构或增加参数的情况下,既保留了已学习的语义表示,又实现了高效的适配。

原作者: Fred Zhangzhi Peng, Alexis Fox, Anru R. Zhang, Alexander Tong

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Fred Zhangzhi Peng, Alexis Fox, Anru R. Zhang, Alexander Tong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文《不要重训——只需对齐》的解释。

核心理念:不要建新房,只需翻新旧房

想象你有一位大师级建筑师(自回归模型),他花了数年光阴,从地基到屋顶,一块砖一块砖地学习如何建造房屋。这位建筑师极其聪明,深知如何砌砖、窗户该装在哪里,以及如何确保屋顶稳固。这就是当前大多数人工智能语言模型的工作原理:它们从左到右,一个词接一个词地预测句子中的下一个词。

现在,想象你想用一种完全不同的方法建造房屋:扩散模型。你不是一块砖一块砖地建造,而是从一堆随机杂物(噪声)开始,慢慢清理,将混乱 refinement 成完美的房屋。你可以先修屋顶再打地基,或者在墙中间加一扇窗户。这种方法对于某些任务来说更快、更灵活,但通常教导一个新的人工智能从零开始做到这一点非常昂贵。

问题所在:
通常,要将这位“砌砖”建筑师转变为“清理杂物”建筑师,研究人员会扔掉旧蓝图,抛弃大部分已学到的知识,并试图再次教导人工智能如何清理混乱。这就像解雇了大师级建筑师,然后雇佣一个新团队从零开始学习如何建房。这需要大量的时间、金钱和数据。

解决方案(REPR-ALIGN):
这篇论文的作者提出了一个简单的问题:为什么要扔掉建筑师的知识呢?

他们意识到,无论是由左至右建造,还是通过清理混乱来建造,关于“如何建房”的“知识”(即语言结构、语法和含义)是相同的。唯一改变的是建造方法

因此,他们没有重新训练人工智能,而是采取了以下做法:

  1. 冻结大师建筑师:他们保留了原始、经过高度训练的“砌砖”模型并将其冻结。它无法学习任何新东西;它只是作为一个完美的参考静止不动。
  2. 建造一个双胞胎:他们创建了一个具有完全相同大脑结构的双胞胎模型,但这个双胞胎被设定为执行“清理杂物”(扩散)任务。
  3. 对齐技巧:当双胞胎试图学习如何清理混乱时,研究人员不断对它低语:“嘿,看看大师建筑师此刻在想什么。确保你的想法与他的匹配。”

他们使用数学上的“余弦相似度”(一种衡量两个方向有多接近的方法),强制双胞胎在大脑的每一层中的内部想法都与冻结的大师的思路保持一致。

结果:更快、更便宜、更智能

通过这种“对齐”而非“重训”的方法,论文发现了一些惊人的结果:

  • 速度:新模型学习新建造方法的速度比从零开始学习快 4 倍
  • 所需数据更少:通常,训练扩散模型需要海量数据。但由于该模型“锚定”在聪明的大师建筑师身上,即使使用通常数据量的极小部分,它也能有效学习(就像在一位完美知晓路线的副驾驶陪同下学习驾驶)。
  • 性能更优:生成的模型(称为oDLM)在编码任务上的表现优于其他从头训练或使用不同方法训练的大型模型,尽管它使用的计算资源更少。

“冻结”带来的额外好处

论文还发现,由于“知识”已经锁定在冻结的大师模型中,你甚至不需要更新新双胞胎大脑的每一个部分。你可以冻结重型部分(如词汇和逻辑中心),只让“注意力”部分进行学习。这使得训练过程快了两倍,且不会降低质量。

总结

可以这样理解:

  • 旧方法:解雇专家,雇佣新手,花数年从头开始教导他们一切。
  • 新方法(本文):让专家保持通话。让新手尝试新工作,但强制他们实时复制专家的思维过程。

这篇论文证明,你不需要重新学习语言“是什么”;你只需要学习如何以不同的顺序生成它。通过将新模型与旧模型对齐,你获得了两者的最佳之处:旧模型的深厚知识和新方法的灵活性,而成本仅为原来的一小部分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →