← 最新论文
🤖 AI

GRACE: Gradient-aligned Reasoning Data Curation for Efficient Post-training

GRACE 是一种可扩展的、无需奖励模型的数据筛选方法,它利用与梯度对齐的信号在步骤级别对推理数据进行评分和选择,从而提升后训练效率,仅使用 5% 的数据集即可实现全数据集的性能。

原作者: Junjie Li, Ziao Wang, NingXuan Ma, Jianghong Ma, Xiaofeng Zhang

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Junjie Li, Ziao Wang, NingXuan Ma, Jianghong Ma, Xiaofeng Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于GRACE论文的解读,将其拆解为简单概念并辅以日常类比。

核心问题:“整体不等于部分之和”

想象你正在教一名学生如何解答一道复杂的数学题。你给他们看一页教科书,上面展示了完整的解题过程:第一步、第二步、第三步,一直到最后的答案。

旧方法(当前方法):
大多数 AI 训练系统将整页内容视为一个单一的“好”或“坏”的教训。如果最终答案正确,整页内容都会获得一颗金星;如果答案错误,整页内容都会被打上一个红叉。

  • 缺陷: 实际上,那页纸上的某些步骤可能是精彩的洞见,而另一些步骤仅仅是学生重复了三行前说过的话,或者是偏离主题、陷入混乱且毫无结果的旁支。将整页内容视为一个整体,会导致 AI 浪费时间去研究那些枯燥或令人困惑的部分,从而可能错过隐藏在中间的精彩洞见。

解决方案:GRACE(“步步为营”的教练)

作者们创建了一种名为GRACE(Gradient-aligned Reasoning dAta Curation,梯度对齐推理数据策展)的方法。GRACE 不像旧方法那样给整页打分,而是像一位观察力极强的教练,看着学生一步步解决问题。

以下是 GRACE 的工作原理,使用徒步类比来说明:

想象 AI 是一名试图攀登山顶(即正确答案)的徒步者。推理轨迹就是徒步者所走的路径。

  1. “答案对齐”信号(眺望山顶):

    • GRACE 会问:“这一步是否指向了山顶?”
    • 如果某一步让徒步者更接近顶峰,它就得高分。
    • 如果某一步让徒步者原地打转或走向悬崖,它就得低分。
  2. “轨迹一致性”信号(回顾来路):

    • GRACE 还会问:“考虑到徒步者刚才走过的路,这一步合理吗?”
    • 如果徒步者正在攀登陡峭的斜坡,却突然试图在河里游泳,这就显得突兀。即使河流很美,它也打断了攀登的连贯性。GRACE 会惩罚那些与上一步脱节的步骤。

秘密武器:“魔镜”(无需回溯)

通常,为了判断某一步是否有效,你必须模拟整个训练过程,停下来,倒带,并精确计算那一步如何改变了 AI 的“大脑”。这就像试图通过让赛车停下、拆解引擎并检查齿轮来测量风速。这耗时极长,对于海量数据集来说太慢了。

GRACE 的创新:
GRACE 使用了一个巧妙的技巧,称为**“表示级梯度代理”**。

  • 类比: 与其拆解汽车,GRACE 是在汽车向前行驶时,观察从引擎排出的“废气”(内部信号)。
  • 通过在单次前向传播(即只阅读一次文本)中观察这些信号,GRACE 可以在无需“倒带”或进行复杂反向计算的情况下,精确估算某一步的有用性。这就像通过烹饪时的食物香气来判断厨师的技艺,而不是等 meal 结束后再品尝每一口。

结果:更少数据,更好性能

该论文在大规模数学问题数据集(MMathCoT-1M)上,使用视觉语言模型(Qwen3-VL)测试了这种方法。

  • 旧方法: 为了获得优异结果,通常需要向 AI 提供所有数据(100%)。
  • GRACE 方法:
    • 仅使用20%的数据(即最好的 1/5 步骤),AI 的表现比使用 100% 数据训练还要高出 8.8%
    • 仅使用**5%**的数据,AI 的表现就与使用完整数据集相当。

为什么数据更少反而表现更好?
训练时使用“所有”数据,就像强迫学生阅读图书馆的每一页,包括那些有错别字、枯燥重复和错误方向的页面。这会让学生感到困惑。GRACE 过滤掉了“噪声”,只向 AI 提供“纯金”般的步骤。这防止了 AI 被糟糕的示例搞糊涂,帮助它学得更快、更聪明。

总结

  • 问题: 当前的 AI 训练将推理链中的每一步视为同等重要,浪费时间在糟糕的步骤上。
  • 修正: GRACE 根据每一步是否有助于得出答案以及是否符合当前故事脉络,对每一步进行单独评分。
  • 技巧: 它使用一种“仅前向传播”的捷径来即时评分,无需缓慢复杂的计算。
  • 成果: 你可以用极少量的数据训练出更智能的 AI,既节省时间和算力,又实际提升了性能。

该论文得出结论:推理数据的价值不仅仅在于最终答案是否正确,更在于通往该答案的旅程是否是一条建设性的、合乎逻辑的路径。GRACE 能够找到这些建设性的路径,并摒弃其余部分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →