← 最新论文
🤖 machine learning

Reasoning Quality Emerges Early: Data Curation for Reasoning Models

本文提出了一种针对推理模型的具有成本效益的数据策展方法,该方法仅利用扰动检查点的初始推理标记和损失模式来识别多样且具挑战性的样本,从而实现了比现有基准模型更优越的性能和标记效率。

原作者: Hongyi Henry Jin, Wenhan Yang, Meysam Ghaffari, Carlos Morato, Baharan Mirzasoleiman

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Hongyi Henry Jin, Wenhan Yang, Meysam Ghaffari, Carlos Morato, Baharan Mirzasoleiman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:寻找正确的“大脑食粮”

想象一下,你想教一个学生(AI 模型)如何解决复杂的谜题,比如高级数学或医学诊断。你拥有一个巨大的图书馆(数据)。有些书很简单,有些很枯燥,而有些则极其困难,需要深度思考。

为了让这个学生成为天才,你并不想把所有的书都给他。你想要的是一叠经过精心挑选的、最且最具多样性的谜题。这被称为“监督微调”(SFT)。

难点在于: 目前,寻找这些难题就像雇佣一个昂贵的专家团队去阅读每一本书的每一页,以决定它是否“难”。这既耗时又费钱,而且专家们也会感到疲劳并犯错。

重大发现:“第一口”就能说明问题

本文的作者发现了一个捷径。他们发现,你不需要读完整本书才能知道它是否难。你只需要观察学生在开始思考时写下的前几句话

他们称之为**“问题理解阶段”**(Problem Understanding Phase)。

  • 类比: 想象一个学生拿到了一道数学题。
    • 简单问题: 学生立即说:“好的,我需要求出 X,”然后开始书写。他们听起来充满信心且笃定。
    • 难题: 学生停顿了一下,重新阅读问题,说:“等等,这个问题因为这个细节有点棘手,”在开始解题前显得有些困惑。

作者意识到,这种初始的“困惑”或“犹豫”(在数学上通过 loss/损失值 来衡量)是一个完美的信号,表明这个问题实际上很难。如果学生在刚开始时就踉跄绊倒,那么这个问题就值得用来教学。

方法论:“TEMP”(Token 高效模型扰动)

论文引入了一种名为 TEMP 的新方法。可以把它看作是对数据的“压力测试”。其工作原理分为三个简单的步骤:

1. “摇晃的桌子”测试(过滤难度)

想象 AI 模型正坐在一张桌子旁。通常,这张桌子非常稳固。但为了进行这项测试,作者稍微摇晃了桌子(他们在模型中加入了随机的“噪声”)。

  • 如果学生正在解决一个简单问题,即使桌子摇晃,他们仍能写出答案。他们的“loss”(误差)保持在较低水平。
  • 如果学生面对的是一个难题,轻微的摇晃就会让他们立刻陷入恐慌并踉跄绊倒。他们的“loss”会激增。
  • 结果: 通过只观察学生思考过程中的前 100 个单词(token),系统可以立即标记出难题并丢弃简单的题目。这节省了 99% 的阅读时间。

2. “集体拥抱”(确保多样性)

一旦收集到了一堆难题,他们需要确保这堆题里不是 1,000 个同类型的难题。他们需要多样性。

  • 他们观察学生思考过程中的接下来的 1,000 个单词
  • 他们将“思考方式”相似的问题进行分组。
  • 从每个组中,他们挑选出那些最“脆弱”(即模型最容易出错)的题目。
  • 结果: 他们获得了一系列不同类型的难题,确保学生学会处理各种不同的场景,而不仅仅是某一种特定的技巧。

3. “水晶球”(为什么有效)

论文从数学上证明,如果两个问题在最初的 1,000 个单词中看起来很相似,那么它们在后续解决过程中很可能需要相同的“大脑肌肉”。因此,基于开头进行筛选,效果与根据整个故事进行筛选一样好。

结果:更快、更便宜、更好

作者在医学和数学数据集上测试了该方法。

  • 性能: 他们的这种方法使 AI 比现有方法更聪明(提升了高达 1.7%)。
  • 效率: 这是最大的胜利。因为他们只阅读了前 100 或 1,000 个单词,而不是整个 90,000 词的推理过程,他们节省了 91% 的计算能力(token)。

总结

与其雇佣昂贵的专家阅读整本书来寻找难题,本文给出的建议是:“只需听取学生思考的前几句话。如果他们立刻踉跄绊倒,那就是难题;如果他们听起来很自信,那就跳过。”

这使得我们能够使用通常所需的一小部分时间和金钱,来构建更聪明的 AI 模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →