← 最新论文
💬 NLP

Beyond Rejection Sampling: Trajectory Fusion for Scaling Mathematical Reasoning

本文介绍了 TrajFusion,这是一种通过将错误的轨迹与反思提示及正确解法进行自适应融合,从而通过模拟试错学习来超越标准拒绝采样的微调策略,旨在增强大语言模型的数学推理能力。

原作者: Jie Deng, Hanshuang Tong, Jun Li, Shining Liang, Ning Wu, Hongzhi Li, Yutao Xie

发布于 2026-02-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Jie Deng, Hanshuang Tong, Jun Li, Shining Liang, Ning Wu, Hongzhi Li, Yutao Xie

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一名学生如何解决一道非常困难的数学题。

旧方法(拒绝采样)
传统上,在训练用于数学的 AI 模型时,研究人员使用一种被称为“拒绝采样”(Rejection Sampling)的方法。这就像一位严厉的老师,只向学生展示完美、正确解法

如果老师尝试解决这个问题十次,其中九次都错了,他们会把那九次尝试全部丢弃。他们只保留那一次做对的结果。学生只能看到最终完美的答案。

  • 问题所在: 学生学会了答案是什么,但他们从未学会当自己犯错时该如何恢复。他们看不到常见的陷阱、错误的路径或如何修复逻辑错误。这就像只给驾驶员看一条完美路线的地图,却从未向他们展示当走错路或遇到死胡同时该怎么办。

新方法(TrajFusion)
这篇论文介绍了一种新方法:TrajFusion。它不再丢弃错误的尝试,而是将它们编织进教学过程中。

想象一下,现在的老师会对学生说:

“好,让我们来试着解决一下。

  1. 第一次尝试: 我尝试了这条路径,但我意识到我在这里犯了个错误。(展示错误的路径)。
  2. 反思: ‘等等,这看起来不对劲。让我们再试一次。’(这是一个‘反思提示’)。
  3. 第二次尝试: 我尝试了另一条路径,但我漏掉了一个步骤。(展示另一条错误的路径)。
  4. 反思: ‘嗯,我漏掉了什么。让我仔细思考一下。’
  5. 最终尝试: 好了,现在我终于搞定了!这就是正确的解法。”

它是如何运作的(“融合”部分)
其核心创新在于,AI 不仅仅是展示任何错误的答案。它使用了一个智能过滤器:

  • 如果老师连续 10 次犯同样的错误: 系统会意识到这是一个“死胡同”或简单的误解。它可能不会将此展示给学生,因为这并无太大帮助。
  • 如果老师犯了 10 种不同类型的错误: 系统会说:“哇,这个问题真棘手!有很多种出错的方式。”然后,它会将这些多样化的错误路径融合进训练课程中。

这创造了一个**“试错”模拟**。AI 学到的不仅是目的地,还有在混乱中寻找方向并自我纠正的过程。

结果
研究人员在两个 AI 模型(LLaMA3 和 DeepSeekMath)上进行了测试,涵盖了从基础学校数学到高难度竞赛级问题的多个数学基准测试。

  • 擅长处理难题: 新方法在最难的问题上(如奥数题)表现最好。这些问题的特点是极易迷失方向,因此学习如何找回路径至关重要。
  • 高效: 它不需要更大的大脑或新型的计算机芯片。它只是改变了 AI 在训练期间“阅读”的内容。
  • 可扩展性: 无论使用少量数据还是海量数据,它都能表现良好。甚至当他们尝试教 AI 解决需要同时记忆大量信息的超长、复杂问题时,它依然有效。

总结
这篇论文认为,错误是宝贵的数据。通过停止丢弃错误尝试的做法,转而将其转化为结构化的“尝试、失败、反思、再试”式的教学,AI 变成了一个更出色的问题解决者。它学会了识别自己的错误并进行纠正,就像人类在学习一项困难技能时所做的那样。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →