← 最新论文
💻 computer science

Distribution-Aligned Sequence Distillation for Superior Long-CoT Reasoning

本文介绍了 DASD-4B-Thinking,这是一种轻量级的开源推理模型,它通过一种能够更好地对齐教师-学生分布并缓解曝光偏差的新型训练流水线,在利用显著更少的训练样本的同时,解决了当前序列级蒸馏中的关键局限性,从而实现了最先进的性能。

原作者: Shaotian Yan, Kaiyuan Liu, Chen Shen, Bing Wang, Sinan Fan, Jun Zhang, Yue Wu, Zheng Wang, Jieping Ye

发布于 2026-01-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Shaotian Yan, Kaiyuan Liu, Chen Shen, Bing Wang, Sinan Fan, Jun Zhang, Yue Wu, Zheng Wang, Jieping Ye

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位才华横溢、世界级的教授(老师),他能解决极其困难的数学问题,编写复杂的代码,并回答棘手的科学问题。现在,想象你有一个聪明但瘦小的学生(学生),他想向这位教授学习,但没有同样的脑力和记忆力。

这篇论文的目标是教会这个小学生像那位伟大的教授一样思考,尽管学生的规模要小得多。阿里巴巴云的团队创造了一种实现这一目标的新方法,称为 DASD-4B-Thinking

以下是通过简单的类比对其实施过程进行的解释:

旧方法:仅仅是抄袭作业

以前,研究人员试图通过给学生提供教授完成的作业答案来教导他们。学生只是在死记硬背这些答案。

  • 问题: 有时教授的答案太完美且过于罕见,有时又很混乱。如果学生只是随机挑选作业来抄袭,他们可能会错过最重要的教训,或者被混乱的内容搞糊涂。此外,只有当教授站在旁边(看着答案)时,学生才会学习如何抄袭,但在现实世界中,学生必须独自解决问题。这就像一个学生只有在老师在耳边低声提示下一个词时才能写出一篇论文;当他们尝试独立写作时,就会卡壳。

新方法:更聪明的训练营

作者意识到他们需要一个更好的训练计划。他们引入了三种主要的“超能力”来解决旧有的问题:

1. “热身”与“冲刺”策略(温度调度学习)

想象教授正在授课。

  • 旧的错误: 老师有时会给出非常简单、显而易见的答案,有时又会给出狂野、混乱或罕见的答案。学生在还没理解基础知识之前,就被那些狂野的答案搞糊涂了。
  • 新的修正: 团队创建了一个两步走的计划。
    • 第一步(热身): 首先,他们给学生提供教授最清晰、最自信的答案(低温度)。这有助于学生建立坚实的基础,并快速学习基本模式。
    • 第二步(冲刺): 一旦学生有了信心,他们就引入了更多样化且棘手的答案(高温度)。这让学生接触到更广泛的问题解决风格,使他们变得更加灵活和稳健。
    • 结果: 学生先学习基础知识,然后扩展视野,而不是一开始就被 overwhelming(压倒)了。

2. “找不同”过滤器(差异感知采样)

当教授和学生看同一个问题时,他们的想法有时会不同。

  • 旧的错误: 学生被迫复制教授给出的每一个答案,即使学生已经对另一种(错误的)方式很有信心。这会让学生的大脑感到困惑。
  • 新的修正: 团队构建了一个过滤器,观察答案并询问:“教授认为这是一个绝佳的主意,但学生却认为这是一个坏主意的地方在哪里?”
    • 他们将训练重点放在这些特定的时刻。这些是“高价值”的教训,即学生最有可能学习新知识并纠正错误的地方。
    • 他们忽略了那些学生和教授已经达成共识的答案(因为学生已经知道了),或者忽略了那些学生虽然自信但无法轻易纠正的错误。
    • 结果: 学生只把学习时间花在真正需要学习的课程上,这使得他们的学习时间效率极高。

3. “模拟演练”训练(混合策略蒸馏)

这解决了学生需要老师在旁低声提示下一个词的问题。

  • 旧的错误: 学生通过模仿老师的完整答案来进行练习。但在真正的测试中,老师不在场。学生开始写作,然后陷入停滞,并因为他们从未练习过如何独立完成句子而感到恐慌。
  • 新的修正: 他们创建了一个“模拟演练”。
    • 他们让学生尝试独立解决一个问题。
    • 如果学生开始偏离轨道或卡住了,他们会在句子中间停止学生。
    • 然后,教授介入并正确地完成这个句子。
    • 学生随后从这个“半写完、半纠正”的答案中学习。
    • 结果: 学生学会了如何从自己的错误中恢复并独立完成任务,这使他们在现实世界中更加可靠。

了不起的结果

通过使用这种智能训练营,团队创造了一个微型模型(仅有 40 亿参数,这在 AI 世界中是非常小的),它能够像甚至比之规模大得多的模型(有些达到了 320 亿参数)一样思考。

  • 效率: 他们仅使用 448,000 个训练样本就实现了这些结果。其他团队通常需要数百万甚至数千万个样本才能获得类似的结果。这就像是用极少的研究时间就拿到了博士学位。
  • 性能: 在困难的数学竞赛(如 AIME)、编程挑战和科学问题上,这个小模型击败了该领域的许多“巨头”。

总结

这篇论文表明,你不需要海量的数据或巨大的计算机来创造一个聪明的 AI。相反,你需要一种更聪明的教学方式。通过分阶段教学、专注于正确的课程,并练习如何独立完成任务,一个小型的 AI 可以成为推理冠军。

该团队已向世界分享了他们的“教科书”(数据集)和“毕业的学生”(模型),以便他人能从他们的研究方法中学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →