← 最新论文
💻 computer science

Rethinking Reward Models for Multi-Domain Test-Time Scaling

本文通过展示一个跨越 14 个领域的统一评估,挑战了细粒度过程奖励模型更优越这一传统观点,该评估揭示了生成式结果奖励模型(gORM)是表现最稳健且最一致的模型,而逐步生成式过程模型则因标签噪声而遭受误差累积的影响。

原作者: Dong Bok Lee, Seanie Lee, Sangwoo Park, Minki Kang, Jinheon Baek, Dongki Kim, Dominik Wagner, Jiongdao Jin, Heejun Lee, Tobias Bocklet, Jinyu Wang, Jingjing Fu, Sung Ju Hwang, Jiang Bian, Lei Song

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Dong Bok Lee, Seanie Lee, Sangwoo Park, Minki Kang, Jinheon Baek, Dongki Kim, Dominik Wagner, Jiongdao Jin, Heejun Lee, Tobias Bocklet, Jinyu Wang, Jingjing Fu, Sung Ju Hwang, Jiang Bian, Lei Song

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个超级聪明的机器人如何解决棘手的谜题。你不仅希望机器人得到正确答案,还想知道它是如何得出答案的。它是走了捷径?它犯了错误,意识到错误并自我修正了吗?还是它只是瞎猜碰巧对了?

为了帮助机器人学习,我们使用了一个“奖励模型(Reward Model)”——把它想象成一个严格批改机器人作业的老师。长期以来,数学界最聪明的老师是过程奖励模型(PRM)。这些老师会检查机器人思考过程中的每一个步骤。如果机器人在第3步犯了一个微小的错误,老师就会停下来并说:“游戏结束,这不对!”这种想法是:通过检查每一步来使用放大镜,似乎是最细致、最有帮助的学习方式。

但转折点来了:这篇论文指出,对于大多数现实世界的谜题(如法律、医学或通用知识),这种放大镜实际上可能会让老师“致盲”。

大实验:14个不同的世界

研究人员不仅仅研究了数学问题。他们在14个不同的领域(包括法律、生物学、历史和心理学)测试了四种不同的“老师”。他们想看看哪位老师最擅长帮助机器人从一堆猜测中选出最佳解决方案。

这四位老师分别是:

  1. 最终答案评分员 (dORM): 只看最终结果。“你得到正确答案了吗?是/否。”
  2. 分步评分员 (dPRM): 检查每一步。“第1步很好,第2步不好,停止。”
  3. 聊天机器人最终答案评分员 (gORM): 一个聪明的AI,它会写一段简短的解释并给出最终判决。
  4. 聊天机器人分步评分员 (gPRM): 一个聪明的AI,它会为每一个步骤编写解释并逐一评分。

令人惊讶的结果

在数学世界里,分步老师(PRM)通常胜出。但当研究人员转向其他13个领域时,结果完全反转了:

  • “分步式”聊天机器人 (gPRM) 是表现最差的。 它难以跟上节奏。
  • “分步式”人类风格老师 (dPRM) 表现平平。 它的表现与简单的最终答案评分员差不多。
  • “聊天机器人最终答案”老师 (gORM) 成为了冠军。 它最为稳健,在测试的每一个领域中都带来了持续的提升。

为什么分步老师会失败?

该论文提出了两个主要原因,而且非常高明。

1. “啊哈!”时刻问题 (The "Aha!" Moment Problem)
想象一个机器人正在解决谜题。它在第2步犯了个错,但随后它意识到:“噢不,我搞砸了!”并在第3步将其修复,最终得到了正确答案。这被称为“啊哈!”时刻。

  • PRM 的问题: 分步老师被训练成认为如果有一个步骤错了,那么整个过程就是错的。它们就像是一个裁判,只要球员一绊倒就吹哨,即便球员随后站起来并踢进了制胜球。论文表明,在这些多领域测试中,这些老师经常因为过早停止评分而错过了这些“啊哈!”式的自我修复过程。
  • 长度问题: 机器人的思考链条变得越长,分步老师在自身评分时出错的可能性就越大。论文指出,随着推理链条的增长,分步老师评分中的误差也会随之增加,导致其可靠性降低。

2. “噪声标签”陷阱 (The "Noisy Label" Trap)
在数学中,我们有完美的真人老师来完美地批改每一步。但在法律或医学领域,雇佣人类来为机器人的每一个思考步骤进行评分成本太高了。因此,我们使用其他AI来自动为步骤评分。

  • 问题所在: 这些自动评分器会犯错(产生噪声)。论文发现,分步老师对这些错误非常敏感。如果自动评分器在某一步其实是对的时候却判定为错,分步老师就会感到困惑并失败。
  • 赢家: 最终答案老师(尤其是聊天机器人版本 gORM)要强韧得多。它们可以忽略中间的小噪声,专注于最终结果是否合理。

“共识过滤”故障 (The "Consensus Filter" Glitch)

还有一个原因导致了分步式聊天机器人 (gPRM) 的失败。为了训练它,研究人员使用了一种叫做“共识过滤”的方法。他们让AI对自己步骤进行评分,但如果AI的评分与“标准答案”(ground truth)不符,他们就会丢弃那部分数据。

  • 结果: 这个过程无意中丢弃了所有长且复杂的、“啊哈!”式的思考链条。这使得老师只剩下短小、简单的例子可以学习。当这个老师试图在现实世界中处理长而复杂的谜题时,它完全准备不足。论文显示,这个老师的训练数据与测试数据截然不同,就像是用五年级的数学教学生,然后去测试他们的十二年级微积分一样。

总结

如果你正在构建一个帮助机器人思考复杂现实问题(如法律案件或医疗建议)的系统,不要过度纠结于评分每一个单步。

论文建议,生成式结果奖励模型 (gORM) —— 即一个能够解释其推理过程并对整个解决方案给出最终“是/否”判决的聪明AI —— 是最可靠的工具。它更稳健,能更好地处理长链条思维,并且不会被噪声数据所干扰。

虽然分步老师(PRM)在拥有完美标签和短问题的数学领域表现出色,但论文认为,对于混乱、漫长且复杂的现实世界,你需要的是那位关注“大局”的老师 (gORM)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →