Retrofitting Linear Attention into Diffusion Language Models
本文介绍了块混合注意力(block-hybrid attention),这是一种在对先前块进行线性化处理的同时,在当前活跃块内保留精确 Softmax 的方法,从而能够高效地对预训练扩散语言模型进行改造,以实现高达 1.7 倍的推理加速,且性能降幅极小。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下人工智能的世界就像一座巨大且繁忙的图书馆,一位超级聪明的机器人图书管理员正试图编写一个故事。多年来,这种图书管理员的标准工作方式是“自回归”式的:它写下一个词,停下来,思考刚才写下的所有内容,再写下一个词,停下来,再次思考。这就像是在盖塔楼,每加一块砖都要等胶水干透后才能继续。虽然这种方法很可靠,但对于长篇故事来说速度太慢了。
最近,一种名为“扩散”(Diffusion)的新风格来到了。扩散图书管理员不再是逐块砌砖,而是从一张写满问号的白纸开始,尝试一次性猜出整个故事,通过反复优化这些猜测,直到文字变得有意义。这就像是一群艺术家在同时绘制一幅壁画;他们可以工作得更快,因为他们不需要等待前一块砖干透。然而,即使是这种快速的方法也有一个缺陷。随着壁画变得越来越大,艺术家们必须不断回看之前已经确定的每一个词,以确保新词能够契合。这就像是在写第101页时,要试图记住一本长达10,000页的书,这最终会拖慢所有人的速度并填满图书馆的记忆。
这就是研究人员解决的难题。他们问道:“我们能否通过改变图书管理员记忆过去的方式,让这种快速的扩散方法变得更快?”他们的答案是一个被称为“块混合注意力机制”(Block-Hybrid Attention)的巧妙技巧。他们意识到,虽然图书管理员需要完美地记住当前的段落(以确保句子的流畅),但他们并不需要以高清晰度去重新阅读之前章节的每一个词。相反,他们可以将旧章节总结成一张微小的、固定大小的“摘要表”。这使得图书管理员能够以闪电般的速度编写新的部分,而不会被沉重的历史负担所困扰。
核心理念:双速记忆系统
该论文介绍了一种方法,用于改造(或升级)现有的强大扩散语言模型(具体是一个拥有160亿参数的模型,称为 LLaDA 2.1),使其能够使用这种“摘要表”策略,而无需从头开始重新训练。
把模型的脑子想象成拥有20个不同的思考层。在原始模型中,每一层都像是一个极其专注的图书管理员,阅读之前每一个单词以理解当前的词。这很准确,但很沉重。研究人员的创新——块混合注意力机制,将工作分成了两种模式:
- “当下”模式(精确注意力): 当模型正在处理它正在生成的当前词块时,它保持“超专注”模式。它使用标准的、重型的记忆来查看当前段落中的每一个词,以确保句子逻辑完美。
- “过去”模式(线性注意力): 当模型需要记住之前区块(已完成的章节)发生的事情时,它会切换到“线性注意力”。它不再重新阅读整本书,而是查阅一个固定大小的摘要状态。这就像是看一本书的索引或一页纸的摘要,而不是重新阅读全文。无论书有多长,这个摘要的大小都保持不变。
他们是如何做到的:两阶段升级
研究人员并没有只是简单地更换零件然后祈祷,而是使用了一个细致的两阶段过程,以确保模型在升级过程中不会丢失智能。
- 第一阶段:影子训练。 他们拿出了原始的、聪明的模型(“老师”),并将其冻结。然后,他们用新的“块混合”版本替换了20个注意力层中的6个(“学生”)。学生被训练去模仿老师的输出,完全一致,并使用“受损”版本的文本作为输入。这就像是一个学生在影子练习老师,试图复制厨师的每一个动作并品尝出完全相同的味道,但学生只负责处理被分配给它的特定菜肴。这一阶段耗时约24小时。
- 第二阶段:微调。 一旦学生学会了模仿老师,研究人员就让整个模型重新协同工作。他们使用了一种叫做 LoRA(低秩自适应)的技术,对模型的连接进行微小且精确的调整。这就像是给升级后的模型进行了一次快速的“抛光”,以修复由于新部件与旧部件沟通不畅而产生的任何小瑕疵。这一阶段耗时约6小时。
结果:更快、更轻、依然聪明
团队测试了他们升级后的模型,命名为 LLaDA-HYBRID,以观察它在写作和解决问题方面是否依然出色,以及它是否真的变快了。
它还懂得如何思考吗?
令人惊讶的是,是的。尽管他们用这种“摘要表”方法替换了20个层中的6个,模型的表现仍然非常接近原始模型。
- 在一项名为 HumanEval 的编程测试中,原始模型得分 75.6%,混合模型得分 72.0%。
- 在一项数学测试 CMATH 中,原始模型得分为 88.3%,混合模型为 86.7%。
- 有趣的是,在另一项编程测试 MBPP+ 中,混合模型实际上有所提升,从 57.7% 提高到了 63.0%。
论文指出,虽然模型在最难的推理任务上(如一项名为 GPQA-Diamond 的困难科学测试,得分从 38.9% 降至 30.8%)稍逊一筹,但它很大程度上保留了编写代码和解决数学问题的能力。
它真的变快了吗?
这正是奇迹发生的地方。因为模型不再需要为每个新词重新阅读整个对话历史,它可以同时处理更多的请求。
- 在测试模型每秒能生成多少词时,混合模型在峰值性能(处理128个并发请求)下比原始模型快了1.7倍。
- 原始模型的内存占用会随着故事的增长而增加,最终会遇到无法处理更多用户的瓶颈。而混合模型由于拥有固定大小的“摘要表”,可以在耗尽内存之前处理更多的并发请求。
总结
这篇论文表明,我们并不总是需要从头开始构建一个新的、更快的AI。相反,我们可以获取一个强大的现有AI,并赋予它一个“混合记忆”系统。通过在保持对当下敏锐关注的同时,将过去总结为紧凑的形式,我们可以使这些模型变得显著更快且更高效。研究人员发现,通过大约 60小时 的公开数据训练即可完成这项升级,这为在不牺牲太多智能的前提下,让AI服务变得更快、更便宜提供了一条充满希望的路径。不过,作者也指出这仅仅是个开始;他们只升级了6个层,未来的工作可能会找到升级更多层或处理更长故事的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。