← 最新论文
🤖 machine learning

LARK: Learnability-Grounded Trajectory Selection for Efficient Reasoning Distillation

本文介绍了 LARK,这是一个以可学习性为基础的框架,它通过优先选择那些在最大化学生模型学习率的同时保持分布覆盖率的教师推理轨迹,从而高效地进行蒸馏,进而超越了现有的基于启发式的方法。

原作者: Tianrun Yu, Kaixiang Zhao, Chih-Chun Chen, Amanda Hughes, Taylor W. Killian, Fenglong Ma, Weitong Zhang, Porter Jenkins

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianrun Yu, Kaixiang Zhao, Chih-Chun Chen, Amanda Hughes, Taylor W. Killian, Fenglong Ma, Weitong Zhang, Porter Jenkins

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:用最合适的例子教导学生

想象一下,你是一位老师,正试图教一名学生(一个小型的 AI 模型)如何解决复杂的数学问题。你有一位才华横溢的导师(一个大型 AI 模型),他可以针对同一个问题生成几十种不同的解题方式。

导师的解释中,有些是完美的,有些很混乱,有些太简单,而有些则过于复杂。

问题所在:
目前大多数选择向学生展示哪些解释的方法,都依赖于“直觉”或简单的规则:

  • “答案是否正确?”(是/否)
  • “这个解释听起来是否流畅?”
  • “学生是否喜欢这个解释?”

作者认为,这些方法忽略了最重要的一个问题:“这个特定的学生是否真的能从这个特定的解释中学习?”

仅仅因为一个解释质量很高,并不意味着它对这个学生在这个时刻来说就是合适的。一个完美的解释可能太简单了(学生已经掌握了),或者太难了(学生无法跨越其中的鸿沟)。

解决方案:LARK(基于可学习性的锚点时间排序)

这篇论文引入了 LARK,一种挑选最佳训练样本的新方法。LARK 不再问“这是一个好的解释吗?”,而是问:“这个解释能否帮助学生进步得最快?”

这就像一位私人教练为运动员选择练习项目:

  • 旧方法: 选择那些看起来最令人印象深刻或最受欢迎的练习。
  • LکARK 方法: 选择那些难度恰到好处的练习,既能让运动员变得更强壮,又不至于让他们受伤或放弃。

LARK 是如何工作的(背后的“魔法”)

LARK 使用了一个聪明的技巧,可以在不实际进行完整的、昂贵的训练过程的情况下,弄清楚学生需要什么。

1. “锚点”(起点)

想象学生正站在地图上的某个特定位置(他们当前的知识水平)。LARK 查看所有可能的解释(轨迹),并询问:“如果我们使用这个解释,学生向目标移动的速度会有多快?”

它计算出一个被称为 ρ\rho (rho) 的分数。

  • ρ\rho 值: 学生目前正卡在这一类特定问题上,而这个解释提供了一个清晰的“推动力”来解决问题。它处于“金发姑娘区”(Goldilocks zone)——既不太难,也不太易。
  • ρ\rho 值: 学生已经掌握了这一点,或者解释过于混乱,导致学生无法理清哪里需要修正错误。

2. “仅前向”快捷方式

通常,为了知道一个学生能学到多少,你必须实际教导他们并观察表现(这需要耗费大量的时间和计算资源)。

LARK 非常聪明。它使用了一个数学快捷方式(“前向传递代理”)。它观察学生当前的预测以及他们的预测与正确答案之间的差距

  • 类比: LARK 不需要让学生跑完一场完整的马拉松来测试体能,它只需观察学生现在的姿态和呼吸,就能预测他们需要多少训练才能达到理想状态。它避免了为每一个候选样本都进行昂贵的“反向传递”(完整的训练过程)。

3. “均衡饮食”(卡方正则化)

如果 LARK 只挑选那一个“完美”的解释,学生可能会感到厌倦,或者只能学会一种狭隘的技巧。

  • 解决方法: LARK 使用一条规则(称为 χ2\chi^2-正则化)来确保学生获得均衡的饮食。它会挑选前几个最佳解释,但会对它们进行加权,使学生能够学习多种技能,而不仅仅是某一种单一的技巧。这防止了系统通过反复挑选同一个简单的答案来“作弊”。

结果:为什么它很重要

论文在多个不同的 AI 模型和数学基准测试(如 AIME、AMC 和 MATH)上测试了 LARK。

  • 结果: LARK 始终优于所有其他方法。无论研究人员为每个问题挑选 1 个还是 3 个示例,经过 LARK 训练的学生学习速度更快,得分也更高。
  • 证据: 作者展示了 LARK 分数实际上可以预测学生在训练期间“损失值”(即错误率)下降的速度。
    • 视觉证明: 在实验中,使用 LARK 训练的学生在降低错误率方面的速度,远快于使用随机示例或仅凭“质量”进行选择的学生。
    • “为什么”: LARK 特别选择了那些学生处于“有把握地犯错”状态的示例。学生知道自己错了,而解释向他们展示了错在哪里,从而提供了一条清晰的修正路径。

一句话总结

*LARK 是一个聪明的选择器,它能挑选出学生 AI 当下最需要的推理示例,从而实现最快学习;它利用数学快捷方式,在不浪费时间处理太简单或太混乱的例子时,精准找到那个“难度适中”的平衡点。*

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →