← 最新论文
🤖 machine learning

Knowledge Distillation from Large Reasoning Models to Compact Student Models: A Case Study on the John O Bryan Mathematics Competition

本文表明,通过使用双智能体框架和早停机制,利用从 DeepSeek-R1 教师模型中蒸馏出的思维链数据对紧凑型 Qwen2.5-7B 学生模型进行微调,可以显著提高其在 John O'Bryan 数学竞赛和 MATH-500 基准测试中的准确率,同时也揭示了较短的回答长度与推理质量下降之间存在相关性。

原作者: Gaurab Baral, Aaditya Khanal, Yangyang Tao, Junxiu Zhou

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Gaurab Baral, Aaditya Khanal, Yangyang Tao, Junxiu Zhou

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位才华横溢、世界级的数学导师(我们称他为 Professor DeepSeek)。他非常厉害,能解决极其困难的竞赛题目。他很出色,但体型庞大、反应迟缓,且需要一台超级计算机才能运行。你想教一位更小、更快、更便宜的学生(我们称她为 Student Qwen)像教授一样思考,这样她就能在普通的笔记本电脑上胜任同样的工作。

这篇论文讲述了研究人员如何利用一套特定的数学题(来自北肯塔基大学 2011 年至 2025 年举办的真实竞赛——John O'Bryan 数学竞赛)来教导这位学生的故事。

以下是他们实验过程的简化版故事:

1. 训练方法:“展示你的解题步骤”

研究人员并没有直接把最终答案交给学生。他们使用了一种特殊的技巧,叫做思维链(CoT)蒸馏

  • 老师: 首先,“Professor DeepSeek” 解决了 671 道往届竞赛题。但他不仅仅是写下答案,还写出了他思考的每一个步骤,就像学生在考试中展示解题过程一样。
  • 验证者: 第二个 AI 检查了教授的工作,以确保这些步骤确实是正确的。只有完美的解题过程才会被保留下来。
  • 学生: 随后,“Student Qwen”(一个较小的模型)接受训练,旨在模仿这些循序渐进的解题步骤。

2. “过度练习”的陷阱

研究人员面临了一个经典问题:过拟合(Overfitting)
想象一个学生背下了练习题的精确答案,而不是学习数学概念。如果你给他们一个稍微不同的题目,他们就会失败。

  • 研究人员最初让学生进行了 1,000 轮(迭代)训练。
  • 结果: 学生开始背诵训练题目中的具体词汇,而不是学习逻辑。她的表现实际上变得更差了。
  • 解决方法: 他们意识到学生在 200 轮时达到了巅峰。在那之后,她只是在机械模仿。因此,他们通过提前停止训练(在 200 轮时停止)来保持她的“新鲜感”和泛化能力。

3. 结果:稳步提升

通过提前停止训练,学生的表现有了显著提升:

  • 训练前: 学生的正确率约为 65%
  • 训练后: 她跃升到了约 69.4%
  • 额外收获: 她不仅在这些特定的题目上表现更好,在另一个著名的数学基准测试 MATH-500 上也取得了进步,这证明她真正学会了推理的“技能”,而不仅仅是记住了答案。

4. “字数”实验

研究人员想知道:学生需要多少“思考空间”?
他们强制要求学生在严格的字数限制内解题(就像考试中有严格的字数限制一样)。

  • 无限制 (R1): 她写了大约 220 个词,正确率为 69%
  • 适度限制 (R2): 她写了大约 120 个词,正确率下降到 62%
  • 严格限制 (R6): 她被迫只能写大约 31 个词。她的准确率骤降至 42%

类比: 这就像要求某人解一个复杂的谜题。如果你给他们一个小笔记本(字数很少),他们不得不跳过步骤并进行猜测。如果他们有一个完整的笔记本(字数很多),他们就可以写出逻辑并得到正确答案。研究发现,对于这类难题,你需要大约 50 到 100 个词的“思考空间”才能得到一个好的答案。

5. 她的薄弱环节

  • 速度 vs. 逻辑: 学生在竞赛中的“两人速解(Two-Person Speed)”部分表现最弱。这些题目需要快速的多步计算。当字数限制很紧时,她无法容纳必要的计算步骤,导致准确率比其他部分下降得更厉害。
  • 格式错误: 有趣的是,研究人员发现,学生大约 40% 的错误并不是因为她数学不好。她实际上得到了正确的数字,但书写方式很乱(比如没有简化分数,或者忘记把答案放在方框里)。如果由人类或简单的脚本来清理她的书写格式,她的得分会更高。

核心结论

这篇论文证明,你可以通过训练,将一个庞大、强大的 AI 教会一个更小、更便宜的 AI,使其能够有效地通过数学题进行推理,但前提是必须在它开始死记硬背之前停止训练。

然而,这里有一个限制条件:思考需要空间。 如果你强迫 AI 过于简洁(字数太少),她就会失去解决难题的能力。对于这类数学竞赛,理想的“甜点区(Sweet Spot)”是允许 AI 有足够的空间写出大约 50 到 100 个词的推理过程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →