Data-Efficient Autoregressive-to-Diffusion Language Models via On-Policy Distillation
本文介绍了 OPDLM,这是一个通过在策略蒸馏(on-policy distillation)将自回归语言模型转化为扩散语言模型的低数据效率框架,该框架有效地消除了训练与推理之间的不匹配,并在保留先验知识的同时,将训练标记需求降低了高达 7,000 倍。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一位才华横溢、世界级的厨师(即自回归模型,或称 ARLM)。这位厨师通过多年一步步、循序渐进地烹饪每一道菜肴来磨练技艺,每一步都会观察刚刚放入锅中的食材,以此决定下一步该放什么。这位厨师速度极快且博学多才,但他们只懂得如何直线式地进行烹饪。
现在,想象你想让这位厨师学习一种全新的、革命性的烹饪风格,叫做扩散(即扩散语言模型,或称 DLM)。在这种新风格中,厨师不再是循序渐进地烹饪,而是从一碗随机、无法辨认的食材(一个“被遮盖”的序列)开始,通过不断精炼,一次性将其转化为一道完美的佳肴。这种新风格的优势在于,它可以同时预测多个食材,从而可能让烹饪速度变得更快。
问题:“翻译”鸿沟
论文解释说,以往试图将这种“循序渐进”的厨师转变为“一次性完成”的厨师时,存在两个大问题:
- 记忆丧失: 当你强迫厨师停止循序渐进的烹饪,转而开始尝试一次性猜出整道菜时,他们往往会忘记在多年训练期间学到的成千上上万个食谱。这就像告诉一位大师级的钢琴家,突然要闭着眼睛用另一种调式来演奏;他们可能会失去手感。
- 练习与表现的不匹配: 在旧方法中,厨师通过随机向碗里扔食材来进行练习(随机遮盖)。但在现实世界的推理阶段,厨师实际上是根据自己对猜测的信心程度来精炼菜肴的。练习的内容与实际表现并不匹配,导致厨师在关键时刻总是显得有些生疏。
解决方案:OPDLM(“在策略”导师)
作者引入了一种名为 OPDLM(在策略扩散语言模型)的新方法。你可以将其视为一个智能化的训练营,利用一种叫做在策略蒸馏(On-Policy Distillation)的技术解决了上述两个问题。
以下是其运作方式,使用一个简单的类比:
- 学生与老师: “学生”是新的扩散厨师。“老师”是原始的、处于冻结状态的循序渐进式厨师(老师被保存在一个玻璃罩内,保持不变)。
- “在策略”的转折点: 与其在随机、混乱的食材碗中进行练习(旧方法),不如让学生厨师使用他们自己全新的、“一次性完成”的风格来烹饪一顿完整的饭菜。他们生成了从混乱的碗到成品菜肴的完整路径。
- 蒸馏过程: 一旦学生完成了这顿饭,冻结的老师厨师就会观察那份完全相同的菜肴,并说道:“如果是我来做这道特定的菜,对于每一个缺失的食材,我具体会给出什么样的答案。”
- 学习过程: 学生将自己的猜测与老师的答案进行对比,并从中学习。
为什么这是一个游戏规则的改变者
因为学生是在他们自己生成的菜肴基础上进行练习(匹配实际表现),并且接受来自原始专家的纠正,所以他们既不会忘记原有的知识,学习速度也会更快。
论文声称这种方法极其高效:
- 数据节省: 它比以往的方法需要少 15 到 7,000 倍的训练样本。如果其他方法需要阅读十亿本书籍才能学会,这种方法可能只需要几十本。
- 无需“预训练”成本: 你不需要从头开始训练一个新的扩散厨师(这既昂贵又缓慢)。你只需要拿出一个现有的专家,给予这段特定的训练,他们就能完成蜕变。
- 保留魔力: 即使在转换过程中并未明确教授这些技能,新模型依然保留了原有的“思考”和“多语言”能力。这就像厨师自然而然地记得如何说法语或解决复杂的谜题,因为训练保留了他们原有的思维。
结果
论文表明,这种全新的“OPDLM”厨师在数学、编程和通用知识任务上的表现,足以媲美现有的顶尖厨师,但他们达到这一水平所耗费的精力和数据仅为前者的极小部分。它将改变模型“大脑”这一困难的过程,变成了一个简单、高效的后训练升级。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。