← 最新论文
💬 NLP

SelFusion: Self-distillation for Diffusion Language Models

该论文提出了 SelFusion,一种用于扩散语言模型的创新自蒸馏框架,它通过在困难和容易掩码模式之间进行双向知识蒸馏来动态纠正标记级错误,从而显著提升生成质量,并往往能超越外部教师模型。

原作者: Hyeongsoo Lim, Jinyoung Kim, Eunseo Seo, Minho Jang, Jiwon Yoon

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Hyeongsoo Lim, Jinyoung Kim, Eunseo Seo, Minho Jang, Jiwon Yoon

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的世界中,速度与质量之间存在着一种持久的张力。多年来,最强大的语言模型一直依赖于一种被称为“自回归”(autoregression)的方法,即计算机一次生成一个词,通过阅读之前生成的输出内容来决定下一个词。这种顺序处理过程就像一个人在写句子时,每写下一个词之前都要回头看一眼刚才写的每一个词;它虽然可靠且能产生高质量的结果,但本质上很慢。新一代被称为“扩散语言模型”(diffusion language models)的模型试图通过同时生成许多词来解决这一瓶颈。这些模型不是从头到尾地书写句子,而是从一组乱序、隐藏的词块开始,逐渐将它们细化为连贯的响应,就像雕塑家从一块原石中揭示出雕像一样。虽然这种并行方法承诺了近乎瞬时的响应速度,但这些模型在历史上一直难以达到其较慢的顺序型对手那样的清晰度和准确度。

研究人员长期以来一直试图利用一种称为“知识蒸馏”(knowledge distillation)的技术来弥补这一差距,即让一个更小、更快的模型通过模仿一个更大、更准确的“教师”的行为来进行学习。然而,当科学家们将这种标准方法应用于新的扩散模型时,结果却令人失望。试图强迫快速的并行模型去复制缓慢的顺序模型的尝试往往以失败告终,导致输出结果并不比模型自主学习时更好,有时甚至更差。根本问题在于这两种类型的模型对单词的“思考”方式不匹配。慢速模型对自己的选择非常确定,而快速模型则更不确定,并将信心分散在许多可能性之中。试图强迫不确定的模型去模仿确定的模型,就像要求一名学生去模仿一位说着不同语言的老师;学生无法理解底层的逻辑,只能捕捉到表面的噪声。

为了克服这一问题,中央大学(Chung-Ang University)的一个研究小组提出了一种名为 SelFusion 的新方法,该方法完全抛弃了外部教师的概念。系统不再向外部寻求指导,而是通过同时运行两个不同版本的同一任务来进行自我教学。想象一下,一名学生正在参加考试,其中一个版本的试卷有很多问题被隐藏了,迫使学生根据有限的线索进行猜测;而第二个版本的同一份试卷则隐藏的问题较少,提供了更多的上下文。研究人员在单个模型内部创建了这两个“模式”:一个是在许多隐藏词的情况下工作的“困难模式”,以及一个是在较少隐藏词情况下工作的“简单模式”。拥有更多信息的简单模式通常能产生更好的预测,但它并不完美。它有时会变得过度自信,仅仅因为拥有更多上下文,就对错误答案表现出极高的确定性。

这项创新的核心在于系统如何处理这两种模式。研究人员并没有简单地让简单模式去教导困难模式,而是设计了一种动态的双向交换机制。系统会不断检查每种模式对于每个特定单词是否真正正确。如果简单模式是正确的,它就会引导困难模式;如果困难模式在简单模式自信地出错时反而表现正确,那么困难模式就会占据主导地位。这种双向流动确保了模型能够从任何给定时刻最可靠的信号中学习。为了防止简单模式对自己的错误过于固执,研究人员增加了一个微小的校准步骤,通过轻轻降低其在错误时的置信度,确保它不会误导学习过程。整个过程都在单个模型内完成,不需要外部教师,也仅需对模型规模进行极小的扩充。

在各种指令遵循任务的测试中,这种自我教学方法被证明非常有效。经过 SelFusion 训练的模型表现始终优于那些依赖外部教师的方法,无论这些教师是缓慢的高质量模型还是其他扩散模型。在许多情况下,这个自我教学的模型甚至超越了它原本旨在模仿的那些规模更大、速度更慢的模型。例如,在特定的基准测试中,这种新方法取得了比现有的最佳外部教师更高的分数,证明了模型可以通过精炼其内部逻辑,实现超越其初始能力的进化。研究人员发现,这种方法不仅提高了生成文本的质量,还保持了扩散方法的速度优势,为创造快速、高质量的语言工具提供了一条切实可行的路径。

该研究还强调了为什么以往结合这些技术的尝试会失败。通过分析模型的内部运作,团队证实,快速模型与慢速模型在置信度分布上的差异是主要的障碍。慢速模型过于僵化,而快速模型则过于分散,导致直接复制无法奏效。自我蒸馏法之所以成功,是因为它没有试图进行直接复制,而是允许模型在自身的犹豫不决与更具信息量的预测之间找到平衡。这种方法表明,快速语言生成的未来可能并不取决于寻找一个更大、更好的教师,而在于教会模型信任自己最好的直觉,同时保持足够的谦逊以纠正错误。研究结果表明,通过正确的内部框架,并行生成的速度与顺序推理的质量终于可以共存。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →