← 最新论文
🤖 machine learning

Capacity-Dependent Effects of Data Selection for Reasoning

本文证明了基于似然度的数据选择对推理微调的有效性取决于容量,即高似然度数据有利于较小的模型并能带来更快的初期收益,而低似然度数据则能为较大的模型带来更优的长期性能。

原作者: Cuong Dang, Hoang Anh Just, Ruoxi Jia

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Cuong Dang, Hoang Anh Just, Ruoxi Jia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何解决一道棘手的数学题。你有一个超级聪明的老师,能够完美地解决它,但你还有一个刚刚起步的学生。在人工智能的世界里,这被称为“蒸馏”(distillation)。目标是将一个庞大、强大的模型(老师)的知识浓缩到一个更小、更快的模型(学生)中,以便它能在日常设备上运行。但问题在于,老师可以针对同一个问题生成许多不同的解法。有些答案很简单,看起来很像学生自己可能会猜到的答案;而另一些答案则非常复杂、狂野,且与学生目前的思维方式截然不同。

长期以来,研究人员一直认为,教导学生最好的方式是向他们展示那些最容易理解的答案——即那些让他们感到熟悉的内容。这似乎合乎逻辑:如果你试图用高级物理学来教授基础微积分,他们可能会感到困惑并选择放弃。但一项新的研究表明,这种“易于理解即是最好”的规则可能是一个陷阱。真正的秘诀不在于把事情变得简单,而在于将课程的难度与学生大脑的大小相匹配。如果学生很小,简单的课程效果很好;但如果学生庞大且强大,他们实际上需要那些困难、令人困惑的课程才能发挥出全部潜力。本文探讨了如何为不同的机器人选择合适的课程,以确保我们不会浪费时间或计算能力。

这项研究背后的研究人员 Cuong Dang、Hoang Anh Just 和 Ruoxi Jia 旨在测试一个流行的想法,即“基于似然性的选择”(likelihood-based selection)。简单来说,“似然性”(likelihood)就是一个分数,告诉我们一个模型说出特定句子的可能性有多大。如果一个模型认为“我肯定会说这句话”,那么这就是高似然性的答案;如果它认为“我绝不会说这句话”,那么这就是低似然性的答案。论文研究了一个具体的问题:我们应该始终使用高似然性的答案(那些感觉熟悉的内容)来训练我们的 AI 学生,还是应该有时强迫他们从低似然性的答案(那些感觉陌生且困难的内容)中学习?

为了找到答案,团队利用数学题作为他们的实验场。他们提取了大量的数学题,并让强大的“老师”模型为每个问题生成多种不同的解法。然后,他们使用不同规模的“学生”模型(从非常小的 15 亿参数到相当大的 80 亿参数)采用了两种不同的策略进行训练。一组学生只看“容易”的答案(高似然性),而另一组学生只看“困难”的答案(低似然性)。他们观察了这些学生随时间变化的表现,并在各种数学基准测试(如 AIME、AMC 和 MATH)上检查了他们的得分。

他们发现了一个完全取决于学生“大脑规模”的迷人模式。对于最小的模型, “容易”策略是明显的赢家。这些小学生在面对接近他们已知知识的答案时,学习得既快又稳。当他们被迫面对“困难”的答案时,他们就迷失了。他们会开始不断重复问题,或者只是机械地复制答案而不理解步骤,导致无法进步。这就像是他们试图攀登一座高山,却连迈出第一步的力量都没有,只能不断滑落。

然而,对于更大、更强大的模型,情况完全改变了。这些大个头学生在开始阶段的表现也和那些小模型一样,在“容易”的答案下做得更好。但随着训练的进行,神奇的事情发生了。那些接受“困难”答案训练的学生开始追赶,并最终实现了超越。那些“容易”组的学生遇到了瓶颈并停止了进步,而“困难”组则持续攀升。他们能够吸收复杂的、陌生的推理过程,并利用这些知识去解决以前根本无法触及的问题。研究人员称之为“快速拟合/缓慢增益”(Fast-Fit / Slow-Gain)模式。小模型“快速拟合”了容易的数据并止步于此,而大模型则经历了“缓慢增益”,即困难的数据最终带来了更强大的推理能力。

论文指出,并不存在一种单一的“最佳”选择训练数据的方法。这完全取决于你的计算预算和模型的规模。如果你有一个小模型或有限的时间,那就坚持使用高似然性、易于学习的数据。这样效率很高,且能获得快速的结果。但如果你有一个大模型并且有足够的耐心进行长时间训练,你应该拥抱低似然性、具有挑战性的数据。这就像一名马拉松运动员:初学者需要平坦、轻松的路径来建立信心,但精英运动员需要陡峭、崎岖的山路来打破个人最好成绩。

作者通过现实世界的实验和理论框架支持了这一观点。他们证明了小模型仅仅是因为缺乏“容量”来理解其现有知识与老师复杂的答案之间的差距。困难的数据离它们太远了,小模型无法跨越这个鸿沟。但大模型拥有足够的“空间”来扩展并从这种距离中学习。论文结论认为,推理过程中的数据选择不应是一套“一刀切”的规则。相反,它应该是一种精细的平衡:将课程的难度与学习者的容量相匹配,你就能获得最好的结果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →