Data Repetition Beats Data Scaling in Long-CoT Supervised Fine-Tuning
本文证明了,与标准直觉相反,在思维链数据上进行监督微调时,通过在较小数据集上进行重复训练直至达到完全记忆,而非通过扩大单轮训练的数据集规模,可以获得更优越的推理性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教导一位聪明但容易分心的学生去解决极其困难的谜题,比如复杂的数学问题或深奥的科学问题。在人工智能的世界里,这个学生就是一个“语言模型”,即一个通过阅读文本来学习的计算机程序。为了让这些模型具备推理能力,科学家们使用了一种叫做“监督微调”(SFT)的过程。你可以把它想象成给这个学生一叠由大师级教师编写的范例解答。学生阅读这些范例,并尝试模仿其中的思考过程,一步步地进行,直到他们能够独立解决类似的题目。
长期以来,机器学习领域一直遵循着一条金科玉律:“越多越好”。这种直觉很简单:如果你想让学生学得好,你应该给他们一个庞大的、包含各种独特书籍的图书馆。他们看到的例子越多样,他们在面对新情况时的泛化能力就越强。这就像是认为读完10,000个不同的故事,总是比反复阅读相同的100个故事要好。但如果这条规则是错误的呢?如果对于这种特定类型的“推理”训练,秘诀不在于一个更大的图书馆,而在于对一个较小图书馆的深度理解呢?这正是来自 COLM 2026 会议的一篇新论文所探讨的问题,它挑战了我们关于 AI 如何思考的基本假设。
这项研究背后的研究人员决定通过一系列受控实验来测试“越多越好”这一规则。他们采用了一个标准的 AI 模型,并使用“思维链”(Chain-of-Thought)数据对其进行训练——这些是长篇、详细的推理轨迹,模型通过这些轨迹学习在回答问题之前先进行思考。他们设定了一个严格的预算:一个固定的“计算量”(就像是一个学生被允许学习的固定时长)。然后,他们比较了两种策略。策略 A 是给学生一大堆独特的例子(51,200 个样本),但让他们对整堆例子仅进行一次阅读。策略 B 是给学生极少量的例子(仅 200 或 400 个样本),但让他们反复阅读这同一小堆例子,次数多达 128 次。
结果令人惊讶且违反直觉。论文发现,那个反复阅读小规模数据集的学生(策略 B)在解决新的难题时,表现得比那个仅仅匆忙浏览过庞大图书馆的学生(策略 A)要出色得多。在 AIME 数学竞赛和 GPQA 科学测验等高难度基准测试中,使用 400 个样本训练 128 个 epoch(重复次数)的模型,其表现大幅超越了使用 51,200 个样本训练仅 1 个 epoch 的模型——准确率提升了 12 到 26 个百分点。这就像是那个完美背诵了几篇关键故事的学生,竟然能比那个走马观花看了一千本书的学生更好地解决新的谜团。
论文还探讨了为什么会发生这种情况以及其局限性。他们发现,这种进步并非来自于学习新知识,而是来自于模型对推理结构的“记忆”。随着模型重复学习这个小数据集,它最终达到了能够以近乎完美的准确率(100%)预测训练样本中下一个词的程度。一旦模型达到了这种对训练数据的“完全记忆”,它在处理新测试时的表现就不再提升,而是进入了平台期。这表明,对于这种特定类型的训练,目标不是尽可能多地看到不同的例子,而是将推理的模式内化,直到它成为一种本能。
有趣的是,研究人员检查了这种“重复”是否会导致模型忘记原有的知识(这是一个被称为“灾难性遗忘”的问题)。他们发现,重复小数据集实际上比阅读庞大数据集一次所导致的遗忘更少。这似乎表明,通过深入练习推理结构,模型对自己逻辑的信心变得更加坚定,从而有助于它专注于任务而不丢失通用知识。
然而,作者也谨慎地指出,这并不是解决一切问题的“万灵药”。他们明确排除了这种方法适用于所有数据的可能性;例如,如果提供范例的老师水平很差,或者范例本身是错误的,那么这种优势就会发生变化。他们还指出,虽然“重复优势”是稳健的,但为什么记忆训练数据有助于泛化,其确切原因仍然是一个谜。他们认为,模型可能是在解锁它已经拥有的隐藏能力,而不是在学习某种全新的东西。
简而言之,这篇论文表明,对于教导 AI 进行推理,我们可能在浪费时间去寻找越来越大的数据集。相反,我们可能会通过选取一小组高质量的推理范例,并让模型反复研读直到彻底掌握,从而获得更好的结果。作者提出了一个新的实用规则:持续在小数据集上训练,直到模型能够完美预测训练文本,然后停止。尽管他们尚未完全解释这种现象背后的“为什么”,但他们已经证明了,有时在 AI 的世界里,把同一页纸读 100 遍,远比走马观花地看 100 页不同的内容要强大得多。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。