← 最新论文
💻 computer science

REVES: REvision and VErification--Augmented Training for Test-Time Scaling

该论文提出了 REVES,这是一个两阶段迭代框架,通过将成功恢复轨迹中的中间“近失”步骤转换为解耦的修正与验证提示来增强训练,从而实现高效的离策学习,其在编程、数学和约束满足任务上的表现显著优于标准的多轮强化学习和进化搜索方法。

原作者: Yuanxin Liu, Ruida Zhou, Xinyan Zhao, Amr Sharaf, Hongzhou Lin, Arijit Biswas, Mohammad Ghavamzadeh, Zhaoran Wang, Mingyi Hong

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuanxin Liu, Ruida Zhou, Xinyan Zhao, Amr Sharaf, Hongzhou Lin, Arijit Biswas, Mohammad Ghavamzadeh, Zhaoran Wang, Mingyi Hong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是对论文 REVES: REvision and VErification–Augmented Training for Test-Time Scaling 的解释,使用了简单的语言和富有创意的类比。

大局观:为什么“初试”是不够的

想象你正在参加一场很难的考试。大多数人并不能在第一次尝试时就答对。相反,他们会想:“等等,这看起来不对劲,”然后检查自己的工作,发现错误,然后重试。

目前的 AI 模型(大语言模型)擅长回答问题,但它们通常被训练成“一击即中”的思考者。它们被教导要立即给出最好的答案并停止。问题在于,当这些模型在现实世界中部署时,它们往往需要根据反馈(例如编程中的编译器错误或数学中的逻辑检查)来修正自己的答案。

本文作者认为,将模型训练成“一击即中的天才”并不能让它成为一个优秀的“修正者”。你不能只通过给一个人进行一次性必须完美完成作文的测试,就教会他成为一名优秀的编辑。

问题所在:“盲目”的教练

论文指出,我们目前训练 AI 修正其工作的做法存在缺陷。

类比:马拉松跑者
想象正在为马拉松训练一名跑者。

  • 标准训练: 你让跑者跑完整个 26 英里。如果他们完成了,你就给他们一个奖杯。如果他们在第 10 英里时绊倒了,但继续跑完了全程,你仍然会给他们一个奖杯。
  • 缺陷: 跑者会认为:“太棒了!在第 10 英里绊倒是获胜策略的一部分!”他们没有意识到绊倒是一个错误。他们只知道最终结果是好的。

在 AI 术语中,这被称为轨迹级信用分配(trajectory-level credit)。如果一个模型做了三次错误的猜测,然后在第四次尝试时得到了正确答案,标准训练会将“信用”赋予所有三次错误的猜测,因为它们是通往成功的路径的一部分。这会让模型感到困惑。

解决方案:REVES(“教官式”方法)

作者提出了一种名为 REVES 的新方法。REVES 不再关注整场比赛,而是将其分解为每一个具体的步骤。

类比:体育训练课
REVES 将训练从“跑完整个马拉松”转变为“练习特定的专项训练”。

  1. 捕捉错误: AI 尝试解决一个问题。它陷入困境或犯了一个“差一点就对”的错误(几乎对了,但还是错了)。
  2. 停止并隔离: REVES 不会让 AI 继续运行以观察它是否最终能靠运气成功,而是直接在那个时刻停止过程。
  3. 两部分训练课:
    • 修正训练(Revision Drill): AI 被展示这个错误,并被问到:“你如何修复这个特定的错误?”
    • 验证训练(Verification Drill): AI 被展示这个错误,并被问到:“这个答案是正确还是错误?为什么?”

通过这样做,AI 学会了两种截然不同的技能:

  1. 如何修复一个特定的错误(修正)。
  2. 如何发现一个错误(验证)。

它是如何运作的(两阶段循环)

论文描述了一个不断重复的循环:

  • 第一阶段:模拟(数据增强)
    AI 尝试解决许多问题。当它经过几次尝试后成功时,系统会保存那些“差一点就对”的时刻。它将这些时刻转化为新的练习题:“这是一个错误的答案;请修复它,”以及“这是一个错误的答案;请告诉我它是错的。”
  • 第二阶段:训练(单轮强化学习)
    AI 使用这些新的练习题通过标准的、简单的训练方法进行训练。它学会了修复错误和识别错误。
  • 重复: AI 变得越来越好,因此“差一点就对”的错误也会变得越来越难。系统会生成新的、更难的训练课,循环往复。

结果:他们发现了什么?

作者在三个主要挑战类型上进行了测试:

  1. 编程: AI 需要编写计算机程序。REVES 帮助它修复 Bug 的能力远优于以往的方法,在标准编程基准测试中得分显著提高。
  2. 数学: AI 解决了复杂的数学问题。它学会了有效地纠正自己的逻辑错误。
  3. 谜题与“圆填充”(Circle Packing): 他们测试了一个非常难的几何问题,叫做“圆填充”(将圆放入正方形中)。
    • 惊喜之处: 一个相对较小的 AI 模型(40 亿参数)通过 REVES 训练后,表现得与使用庞大进化搜索方法(尝试数千个随机变体)的超大规模复杂系统一样出色。
    • 泛化能力: 尽管该 AI 仅在数学和编程上接受了训练,但它在解决从未见过的逻辑谜题(如数独和 N 皇后问题)方面也变得更强了。这表明,“修复错误”的能力是一种通用的超能力,而不仅仅局限于数学。

核心结论

论文声称,提高模型修复单个步骤的能力,会自动提高其使用任何涉及检查和修正工作的复杂策略(如树搜索或进化算法)的能力。

简而言之: 不要只教 AI 如何得到正确答案。要教它如何发现自己错了,以及如何修复它。通过将“差一点就对”的失败转化为特定的练习课,AI 变成了一个更聪明、更具自我纠错能力的思考者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →