想象两位不同类型的厨师尝试撰写一个故事。
传统厨师(自回归模型) 从左到右一次写一个词。如果他们在早期犯错,就无法回头修正。这就是目前大多数 AI 模型(如 Llama)的工作方式。
扩散厨师(扩散语言模型) 从一页杂乱无章、充满胡言乱语的草稿开始。他们同时对整页内容进行多次迭代,逐步清除噪声,直到故事变得通顺。这就是新的“扩散”方法(如 LLaDA)。
这篇论文研究了这两位厨师在工作时“大脑”内部发生的情况。研究人员发现,扩散厨师的工作方式与传统厨师几乎完全相反,这也改变了我们压缩或加速这些模型的方法。
以下是三大主要发现,用简单的方式解释:
1. “超级通道”与“团队协作”
在传统厨师的“大脑”(Llama)中,不同部分为不同的词亮起。如果你意外关闭其中一个特定的灯泡,厨师会感到些许困惑,但仍能完成故事。
而在扩散厨师的“大脑”(LLaDA)中,研究人员发现了一件奇怪的事:只有一个灯泡亮得如此耀眼,以至于令人目眩。
- 这个“超级通道”几乎在故事的每一个词上都处于激活状态,从故事一开始直到中间部分皆是如此。
- 它至关重要,以至于如果你只拔掉这一根线,厨师不仅会感到困惑,还会彻底崩溃,开始反复重复同一个词(“买 买 买 买……")。
- 类比: 想象一支施工队。传统施工队有许多工人从事不同的工作。如果一名工人离开,大楼建造速度会稍慢一些。而扩散施工队则有一名“超级工人”独自支撑整栋大楼,其他人只是站在一旁观看。如果这名超级工人离开,大楼会瞬间倒塌。
2. “冗余的早期层”(与常态相反)
通常,在 AI 模型中,早期层就像“草图”阶段(非常独特且富有创意),而深层则变得重复,因为模型已经学到了所需的一切(这被称为“深度诅咒”)。
研究人员发现,扩散模型颠覆了这一模式:
- 早期层很无聊: 由于那名“超级工人”承担了所有繁重工作,扩散模型的早期层都在做完全相同的事情。它们是彼此的冗余副本。
- 深层具有独特性: 较后的层实际上拥有更多样性。
- 类比: 在普通工厂中,前几个工作站是独特的组装步骤,而最后几个工作站只是抛光(无聊/重复)。而在扩散工厂中,前几个工作站都在复制来自“超级工人”的同一指令,而真正的独特工作发生在最后的工序中。
3. 这对“缩小”模型意味着什么
由于这些差异,压缩这些模型(使其变小)的规则完全相反。
- 对于传统模型: 你通常需要对早期层格外小心,因为它们是独特的。你应该更激进地剪枝(削减)深层。
- 对于扩散模型: 你实际上可以更激进地削减早期层!既然它们只是“超级工人”的冗余副本,移除它们不会造成太大伤害。事实上,研究人员发现,如果你像对待传统模型那样处理扩散模型(先削减深层),模型的性能反而会更差。
- 结果: 扩散模型出奇地坚韧。即使将它们显著缩小(使用 3 比特量化),它们的表现也比传统模型好得多。传统模型在缩小后可能会损失 65% 的智能,而扩散模型仅损失约 2%。
背后的“原因”
研究人员进行了一项特殊实验,从头训练了两个微型模型:一个使用传统方法,另一个使用扩散方法。他们发现,奇怪的“超级工人”和“冗余早期层”现象是由训练方法本身导致的,而非模型设计所致。
似乎扩散方法对早期层进行了“过度训练”,迫使它们依赖那个主导通道,而传统方法则让早期层保持更多样化。
总结
- 扩散模型拥有一个“超级通道”,在早期阶段承担所有工作。
- 移除该通道会摧毁模型,但移除其他早期层是安全的,因为它们只是冗余副本。
- 要缩小这些模型: 大力削减早期层,并保护深层。这与你处理标准 AI 模型的做法完全相反。
- 结论: 扩散模型的构建方式不同,因此我们需要不同的规则来使其高效运行。
技术摘要:扩散语言模型中的层坍塌
问题陈述
扩散语言模型(DLMs)已成为自回归(AR)模型的有力竞争者,提供并行令牌生成并避免“反转诅咒”。然而,DLMs 的内部激活动态和逐层表示结构仍鲜为人知。目前存在一个关键缺口,即 AR 模型中关于冗余、异常值和压缩策略的发现是否能直接迁移到 DLMs,或者 DLMs 是否表现出不同的行为,从而需要针对训练、微调和压缩的新方法。具体而言,尚不清楚“深度诅咒”(即由于训练不足导致深层变得冗余)是否适用于 DLMs,或者其训练目标是否诱发了不同的结构性病理。
方法论
作者对大规模从头预训练的 DLM LLaDA-8B 进行了系统分析,并将其与架构几乎完全相同的 AR 模型 Llama-3.1-8B 进行对比。为了将训练目标的影响与架构特性隔离开来,本研究采用了以下方法:
- 层相似性分析:计算不同层隐藏激活之间的逐令牌余弦相似度,以量化冗余程度。
- 激活异常值检测:分析激活热图,以识别跨令牌位置和层持续存在的高幅值通道。
- 权重谱分析:利用权重矩阵特征值的 Hill 估计量(αHill) 来评估层的可训练性。基于重尾自正则化(HT-SR)理论,较低的 αHill 值表示更重的尾部特征和更强的特征学习(过度训练),而较高的值则表明训练不足。
- 消融研究:剪枝特定通道(例如主导的“超级异常值”),以观察灾难性故障与轻微准确率下降之间的差异。
- 受控预训练:在相同数据(FineWebEdu)上使用相同超参数训练一对 1.6 亿参数的模型(AR-160M 和 DLM-160M),仅训练目标不同(交叉熵与掩码扩散)。
- 压缩实验:在各种稀疏分配策略(均匀、早期更稀疏 [EIS]、深层更稀疏 [DIS])下,评估模型对剪枝(使用 WANDA)和量化(使用 GPTQ)的鲁棒性。
主要发现
1. 超级异常值与层坍塌
LLaDA-8B 表现出一种独特的现象,称为层坍塌,由单个超级异常值通道(通道 3848)驱动。
- 持续性:与 AR 模型中异常值具有令牌特异性不同,该通道在网络前半部分的层中,在所有令牌位置上均保持持续的高激活。
- 关键性:剪枝该单一通道会导致模型退化为重复的随机令牌循环(GSM8K 准确率为 0%),而剪枝 Llama-3.1-8B 中的顶层通道仅导致轻微准确率下降(-4%)。
- 机制:超级异常值充当信息的主导载体,抑制了其他通道的表达能力,导致多个早期层产生几乎相同且冗余的隐藏表示。
2. 反转的冗余模式
DLMs 中的逐层相似性结构与 AR 模型中观察到的结构相反:
- AR 模型:早期层是独特的;深层变得日益冗余(归因于“深度诅咒”或训练不足)。
- DLMs(LLaDA-8B):早期层高度冗余且彼此相似。这种冗余并非由训练不足引起,而是由过度训练导致,证据是早期层的 αHill 值显著低于 Llama。超级异常值在网络早期将表示集中到低维结构中。
3. 压缩鲁棒性与策略反转
尽管超级异常值具有脆弱性,但 DLMs 对压缩表现出惊人的鲁棒性:
- 量化:在 3 位 GPTQ 量化下,LLaDA-8B 在 GSM8K 上的下降仅为 -1.8%,而 Llama-3.1-8B 在相同设置下下降了 -64.7%。
- 稀疏分配:两个模型系列的最佳稀疏分配策略是反转的。
- AR(Llama):更激进地剪枝深层(DIS)或使用均匀稀疏是最优的。剪枝早期层(EIS)是次优的。
- DLM(LLaDA):更激进地剪枝早期层(EIS)在 50% 稀疏度下比反向策略(DIS)带来 +8.4% 的提升。这是因为 DLMs 的早期层(除超级异常值外)高度冗余,而深层保留了更多独特的信息。
4. 通过受控预训练验证
受控的 1.6 亿参数预训练实验证实,这些动态是扩散训练目标固有的,而非架构差异所致。
- 与 AR-160M 相比,DLM-160M 表现出更高的早期层相似性和更低的 αHill(表明过度训练)。
- DLM-160M 对压缩的鲁棒性高于 AR-160M,其最佳稀疏策略再次是 DLMs 采用 EIS,而 ARs 采用 DIS。
- 注:在 1.6 亿参数模型中未观察到超级异常值,这与文献中关于此类异常值在更大规模(>67 亿参数)下出现的观点一致。
意义与主张
该论文声称,扩散训练目标从根本上重塑了相对于 AR 模型的层动态,导致:
- 一种新的结构现象:存在一个驱动早期层坍塌的持久性超级异常值,这与 AR 模型中令牌特异性的异常值不同。
- 过度训练与训练不足:DLMs 中的早期层冗余是过度训练(强低维结构)的结果,而不是通常在深层 AR 层中看到的训练不足。
- 压缩的实际影响:源自 AR 模型的标准压缩启发式方法不仅次优,而且对 DLMs 具有主动的破坏性。具体而言,为早期层分配更多稀疏性(EIS)是 DLMs 的最佳策略,这与 AR 模型偏好的 DIS 策略相反。
- 鲁棒性:只要保留主导的超级异常值,DLMs 就具有超越可比 AR 模型的内在量化和剪枝鲁棒性。
作者得出结论,这些发现需要对 DLMs 的压缩和部署方式进行重新评估,表明观察到的冗余模式是扩散目标本身的直接后果。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。