想象一下,你有一位才华横溢、世界级的教授(老师),他能解决极其困难的数学问题,编写复杂的代码,并回答棘手的科学问题。现在,想象你有一个聪明但瘦小的学生(学生),他想向这位教授学习,但没有同样的脑力和记忆力。
这篇论文的目标是教会这个小学生像那位伟大的教授一样思考,尽管学生的规模要小得多。阿里巴巴云的团队创造了一种实现这一目标的新方法,称为 DASD-4B-Thinking。
以下是通过简单的类比对其实施过程进行的解释:
旧方法:仅仅是抄袭作业
以前,研究人员试图通过给学生提供教授完成的作业答案来教导他们。学生只是在死记硬背这些答案。
- 问题: 有时教授的答案太完美且过于罕见,有时又很混乱。如果学生只是随机挑选作业来抄袭,他们可能会错过最重要的教训,或者被混乱的内容搞糊涂。此外,只有当教授站在旁边(看着答案)时,学生才会学习如何抄袭,但在现实世界中,学生必须独自解决问题。这就像一个学生只有在老师在耳边低声提示下一个词时才能写出一篇论文;当他们尝试独立写作时,就会卡壳。
新方法:更聪明的训练营
作者意识到他们需要一个更好的训练计划。他们引入了三种主要的“超能力”来解决旧有的问题:
1. “热身”与“冲刺”策略(温度调度学习)
想象教授正在授课。
- 旧的错误: 老师有时会给出非常简单、显而易见的答案,有时又会给出狂野、混乱或罕见的答案。学生在还没理解基础知识之前,就被那些狂野的答案搞糊涂了。
- 新的修正: 团队创建了一个两步走的计划。
- 第一步(热身): 首先,他们给学生提供教授最清晰、最自信的答案(低温度)。这有助于学生建立坚实的基础,并快速学习基本模式。
- 第二步(冲刺): 一旦学生有了信心,他们就引入了更多样化且棘手的答案(高温度)。这让学生接触到更广泛的问题解决风格,使他们变得更加灵活和稳健。
- 结果: 学生先学习基础知识,然后扩展视野,而不是一开始就被 overwhelming(压倒)了。
2. “找不同”过滤器(差异感知采样)
当教授和学生看同一个问题时,他们的想法有时会不同。
- 旧的错误: 学生被迫复制教授给出的每一个答案,即使学生已经对另一种(错误的)方式很有信心。这会让学生的大脑感到困惑。
- 新的修正: 团队构建了一个过滤器,观察答案并询问:“教授认为这是一个绝佳的主意,但学生却认为这是一个坏主意的地方在哪里?”
- 他们将训练重点放在这些特定的时刻。这些是“高价值”的教训,即学生最有可能学习新知识并纠正错误的地方。
- 他们忽略了那些学生和教授已经达成共识的答案(因为学生已经知道了),或者忽略了那些学生虽然自信但无法轻易纠正的错误。
- 结果: 学生只把学习时间花在真正需要学习的课程上,这使得他们的学习时间效率极高。
3. “模拟演练”训练(混合策略蒸馏)
这解决了学生需要老师在旁低声提示下一个词的问题。
- 旧的错误: 学生通过模仿老师的完整答案来进行练习。但在真正的测试中,老师不在场。学生开始写作,然后陷入停滞,并因为他们从未练习过如何独立完成句子而感到恐慌。
- 新的修正: 他们创建了一个“模拟演练”。
- 他们让学生尝试独立解决一个问题。
- 如果学生开始偏离轨道或卡住了,他们会在句子中间停止学生。
- 然后,教授介入并正确地完成这个句子。
- 学生随后从这个“半写完、半纠正”的答案中学习。
- 结果: 学生学会了如何从自己的错误中恢复并独立完成任务,这使他们在现实世界中更加可靠。
了不起的结果
通过使用这种智能训练营,团队创造了一个微型模型(仅有 40 亿参数,这在 AI 世界中是非常小的),它能够像甚至比之规模大得多的模型(有些达到了 320 亿参数)一样思考。
- 效率: 他们仅使用 448,000 个训练样本就实现了这些结果。其他团队通常需要数百万甚至数千万个样本才能获得类似的结果。这就像是用极少的研究时间就拿到了博士学位。
- 性能: 在困难的数学竞赛(如 AIME)、编程挑战和科学问题上,这个小模型击败了该领域的许多“巨头”。
总结
这篇论文表明,你不需要海量的数据或巨大的计算机来创造一个聪明的 AI。相反,你需要一种更聪明的教学方式。通过分阶段教学、专注于正确的课程,并练习如何独立完成任务,一个小型的 AI 可以成为推理冠军。
该团队已向世界分享了他们的“教科书”(数据集)和“毕业的学生”(模型),以便他人能从他们的研究方法中学习。
技术摘要:通过分布对齐序列蒸馏实现卓越的长链条推理(Long-CoT)
1. 问题陈述
本文探讨了当前增强小语言模型推理能力的主流范式——即通过对教师生成的响应进行监督微调(SFT)来进行序列级蒸馏——所存在的局限性。尽管最近的研究(如 DeepSeek-R1 蒸馏)已经证明,在高质量教师输出上进行 SFT 可以获得强大的推理性能,但作者认为,这种方法从根本上是基于 SF T视角,而非知识蒸馏的核心原则。
作者识别了现有实践中的三个关键局限性:
- 教师分布表示不足: 当前的方法通常依赖于带有启发式过滤的随机采样,这无法充分覆盖教师序列级输出分布的全支撑集(full support)。这导致模式覆盖度差,或者包含了难以被较小学生模型学习的噪声、低概率序列。
- 学习能力失配: 标准的 SFT 虽然增加了真实标记(ground-truth tokens)的概率,但可能会产生误导性的梯度。具体而言,如果学生模型对一个教师分配低概率的标记赋予了高概率,SFT 会将学生模型进一步推离教师的分布。现有方法缺乏一种机制来识别更符合学生学习能力的靶向分布。
- 曝光偏差(Exposure Bias): 使用教师强制(teacher forcing,即暴露在教师前缀下)训练的模型在自回归推理过程中会遭受分布偏移的影响,此时它们必须依赖自身的预测。这种不匹配会导致误差累积和复合偏差,尤其是在长链条思维(CoT)推理任务中。
2. 方法论
作者提出了 DASD(分布对齐序列蒸馏),这是一个旨在显式强化教师-学生交互并解决上述三个局限性的训练流水线。该流水线由三个核心创新组成:
A. 温度调度学习(Temperature-Scheduled Learning)
为了解决学习稳定性与分布覆盖度之间的权衡,作者提出了两个阶段的训练计划:
- 第一阶段(低温度): 学生模型首先在具有高置信度的低温度样本(例如 T=0.6)上进行训练。这些样本表现出一致的模式,允许快速、稳定的收敛。
- 第二阶段(高温度): 训练继续使用高温度样本(例如 T=1.0)。虽然这些样本由于更高的多样性和噪声而更难学习,但它们覆盖了教师输出中更广泛的模式。
- 原理: 这种“由易到难”的课程学习(或反向温度退火)允许学生模型在尝试学习教师完整分布中更丰富、更多样化的潜在信息之前,先掌握一致的模式。
B. 差异感知采样(Divergence-Aware Sampling, DAS)
为了识别支持有效学习的目标序列级分布,作者引入了一个分布分解框架。他们分析了在响应的句子级片段上,教师(pT)、预蒸馏学生(pS)以及后蒸馏学生(pD)之间的概率差异。
- 分类: 响应被分为四类:教师句子(pT≫pS)、学生句子(pS≫pT)、共享句子(概率相似)以及增强句子(pT,pS 相似但 pD 更高)。
- 选择策略: 实证分析表明,教师句子(即教师分配高置信度而学生分配低概率的句子)与测试集性能的提升相关性最强。这些实例提供了清晰且无误导性的梯度。
- 实现: 该采样策略优先考虑富含“教师句子”的样本。与 Logit 蒸馏不同,该方法仅需要教师和学生的标记级概率,因此能够兼容具有不同分词器(tokenizer)和架构的模型。
C. 混合策略蒸馏(Mixed-Policy Distillation)
为了减轻曝光偏差,作者在初始的离策(off-policy)SFT 之后引入了一个轻量级的混合策略阶段:
- 流程: 训练后的学生模型对一部分训练问题生成响应。对于与教师生成内容显著偏离的响应(例如截断或错误的响应),学生生成的序列会在随机点处截断,然后提示教师模型完成后续序列。
- 训练: 只有通过质量过滤的教师后续序列会被保留用于微调。这创建了一个包含教师强制前缀和学生生成前缀的混合数据集,使模型能够学习纠正自身的错误,从而减少训练与推理之间的分布偏移。
3. 核心贡献
- DASD-4B-Thinking 模型: 一个完全开源的 4B 参数推理模型,在同等规模的开源模型中达到了最先进(SOTA)的性能。
- 方法论创新: 提出了由三个组件组成的流水线(温度调度学习、差异感知采样和混合策略蒸馏),通过关注分布对齐而非简单的 SFT,重新定义了序列级蒸馏。
- 数据效率: 该模型仅使用 448K 个训练样本就实现了其性能,这比大多数现有的开源工作(通常使用数百万个样本)少了一个数量级。
- 跨架构验证: 该流水线被证明在多种模型族(例如,从
gpt-oss-120b 蒸馏到 Qwen3-4B)和规模(在 30B MoE 变体 DASD-30B-A3B-Thinking-Preview 上进行了验证)中都是有效的。
4. 实验结果
模型在五个具有挑战性的基准测试上进行了评估:AIME24、AIME25、LiveCodeBench (v5/v6) 和 GPQA-Diamond。
- 数学推理: DASD-4B-Thinking 在 AIME24 上达到了 88.5,在 AIME25 上达到了 83.3。这些分数超越了规模显著更大的模型,包括 32B 规模的
Qwen3-32B (81.4/72.9) 和 GLM-Z1-32B (80.8/63.6),以及 8B 的 DeepSeek-R1-0528-Qwen3-8B (86.0/76.3)。
- 代码生成: 在 LiveCodeBench v5 上,该模型得分为 69.3,优于
Qwen3-32B (65.7) 和 NVIDIA-OpenReasoning-Nemotron-7B (63.9)。
- 科学推理: 在 GPQA-Diamond 上,它达到了 68.4,与 32B 的
Qwen3-32B 性能持平,并接近 253B 的 NVIDIA-Nemotron-Ultra-253B (76.0)。
- 消融实验: 结果证实了每个组件都做出了增量贡献。低温度训练建立了强大的基线,高温度训练扩展了能力,而混合策略蒸馏则提供了最终的鲁棒性以对抗曝光偏差。
5. 意义与主张
论文声称 DASD-4B-Thinking 展示了通过精细的蒸馏流水线,复杂的推理能力可以高效地从大型教师模型转移到轻量级学生模型。作者强调,其方法:
- 重新定义了蒸馏: 它超越了“SFT 视角”,明确解决了蒸馏的核心原则——学习教师的完整输出分布。
- 挑战了缩放法则(Scaling Laws): 它实现了与规模大 8 到 60 倍的模型相当甚至更好的性能,这表明对于推理任务而言,数据质量和蒸馏策略比单纯的参数量更为关键。
- 促进了可复现性: 通过开源模型、训练数据集和方法论,作者旨在促进社区对高效、透明推理模型的研究。
作者总结道,其工作为开发紧凑、高性能的推理模型提供了新的视角,尽管他们也承认未来仍需进一步完善分布感知重加权并集成智能体(agentic)能力。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。