← 最新论文
💬 NLP

Masked Distillation: Internalizing the Chain-of-Thought in Language Models

本文介绍了“掩码蒸馏”(masked distillation),这是一个通过训练学生模型仅预测解题 Token,同时接收基于教师模型思维链(Chain-of-Thought)的条件反馈,从而将大语言推理模型(Large Reasoning Models)的推理能力内化至学生模型参数中的框架,进而实现直接答案生成并降低推理延迟,且不牺牲准确性。

原作者: Durgesh Kalwar, Vardhan Palod, Subbarao Kambhampati

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Durgesh Kalwar, Vardhan Palod, Subbarao Kambhampati

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:你最喜欢的 AI 助手就像一个才华横溢但爱唠叨的学生。当你问它一个难题时,它不会直接脱口而出答案,而是会涂涂画画写满几页笔记,画出图表,并在最终写下解决方案之前,把思考的每一个步骤都说出来。这种“大声思考”的过程,在技术领域被称为“思维链”(Chain of Thought),它让 AI 模型在处理数学和逻辑谜题时变得异常聪明。然而,这里有一个代价:那些笔记页面的生成需要耗费大量的时间和能量。这就像是请一位出租车司机送你去超市,但不仅要付他开车到超市的钱,还要付他先在城市街区里绕圈子的钱,仅仅是为了让他“思考”你应该去哪个货架。科学家们长期以来一直在思考:我们能否教会 AI 在它的“脑海中”完成所有这些思考?如果我们能做到这一点,AI 就能跳过那些冗长的、唠叨的笔记,直接给出答案,从而节省大量的计算时间和算力。

这篇名为《掩码蒸馏》(Masked Distillation)的论文深入探讨了这个问题。研究人员在处理大型推理模型(LRMs)时,提出了一个问题:他们能否通过训练,让一个较小的“学生”模型内化那个喜欢大声思考的聪明“教师”模型的思考过程。他们想看看学生模型是否能学会跳过笔记直接输出最终答案,同时依然保持同样的高水平智能。他们使用了一种被称为“掩码蒸馏”的巧妙技术来测试这一点。想象一下,老师正在解开一个谜题,而学生正在旁观。老师看到了完整的题目及其详细的思考过程,但学生只看到了题目。目标是看学生是否能学习老师的秘密逻辑,并在不需要写下步骤的情况下独立解决谜题,即便在学习过程中老师拥有所有的笔记作为引导。

团队设计了两个主要的实验。在第一个实验中,他们使用同一个 AI 模型既作为教师又作为学生,只是要求它以不同的方式进行思考。在第二个实验中,他们使用一个更大、更聪明的模型作为教师,以及一个更小、更简单的模型作为学生。他们还引入了一个“脚手架”(scaffold)的概念。你可以把它想象成自行车的辅助轮。有时,学生可能需要看到老师笔记中的一小部分(即“脚手架”)才能得出正确答案,而不是尝试从零开始。他们测试了学生需要看到多少老师的思考内容才能获得最佳效果。

结果呈现出一种“惊喜”与“并非如此简单”并存的状态。在一个名为 GSM8K 的小学数学问题数据集上,学生模型表现得非常出色。它们成功实现了思考过程的内化。完全“掩码”的学生(即一个从不写下任何笔记的学生)答对率达到了 76.0%,这比其初始能力有了巨大的飞跃,而且平均仅使用了 369.6 个 token(文本单位),而教师模型则使用了 2,398.1 个 token。这实现了 6.5 倍的效率提升!

然而,在处理一个更难的数字游戏 Countdown 时,情况发生了变化。在这里,试图在脑海中完成一切的学生(完全掩码模式)表现反而变差了,准确率降至 41.7%。事实证明,对于这类特定类型的谜题,学生需要看到老师的一部分笔记才能取得成功。但有趣的是,研究人员发现了一个“甜点位”(sweet spot)。通过让学生看到老师思考过程的一小部分(约 30%,即 alpha 为 0.3),学生的准确率飙升至 86.2%。这几乎接近了教师的水平(87.3%),但使用的 token 数量仍比教师少约 1.3 倍。这就像是给了学生恰到好处的辅助轮,让他们能够完美平衡,而不必背负整辆自行车。

论文还研究了这些学生在处理新颖、未见过的谜题(分布外任务)时的表现。在数学方面,学生表现良好;但在 Countdown 谜题方面,结果则有些复杂。有趣的是,在某些情况下,接受了少量脚手架训练的学生,在面对难度增加或发生变化的谜题时,其泛化能力甚至比教师本身还要好。

一个关键发现是,教学方法至关重要。当他们尝试仅仅通过向学生展示老师的笔记并要求其模仿(这种方法称为监督微调,Supervised Fine-Tuning)来进行教学时,效果并不理想。而“掩码蒸馏”方法——它使用一种更复杂的、将学生的猜测与教师实际想法进行对比的方式——在转移“思考”技能方面要有效得多。

最后,这篇论文表明,我们不能简单地为所有问题都“抹除”掉所有的思考步骤。AI 是否能“静默思考”很大程度上取决于问题的类型以及学生模型本身对该主题已有的了解程度。对于像基础数学这样熟悉型的任务,AI 可以学会静默思考并节省大量时间。对于更难、更陌生的谜题,它可能仍然需要一点帮助——即一小部分笔记的“脚手架”——才能完成任务。研究人员总结道,这种“脚手架”是一个可以调节的强大工具,它让我们能够在 AI 的智能程度与给出答案的速度之间找到完美的平衡。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →