← 最新论文
💬 NLP

Process Rewards with Learned Reliability

本文介绍了 BetaPRM,一种分布式过程奖励模型,它同时预测步骤级成功概率及其可靠性以支持自适应计算分配,从而通过基于预测置信度动态调整计算量,显著提升了 Best-of-N 推理中的准确率与 token 消耗之间的权衡。

原作者: Jinyuan Li, Langlin Huang, Chengsong Huang, Shaoyang Xu, Donghong Cai, Yuyi Yang, Wenxuan Zhang, Jiaxin Huang

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Jinyuan Li, Langlin Huang, Chengsong Huang, Shaoyang Xu, Donghong Cai, Yuyi Yang, Wenxuan Zhang, Jiaxin Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位老师,正在批改学生的一篇长篇、多步骤的数学论文。你希望对每一个步骤都给予反馈,而不仅仅是最终答案。这就是**过程奖励模型(PRMs)**为人工智能所做的工作:它们充当逐步指导的教练,告诉人工智能“第一步做得很好”,或者“第二步看起来有问题”。

然而,论文指出了这些教练目前工作方式的一个缺陷。它们只给出一个数字(例如 8/10 的分数),并表现得好像这个数字是 100% 确定的。但事实上,教练可能只是在猜测。如果人工智能走了一条看似可行但可能通向死胡同的奇怪路径,旧的教练仍然会给它高分,而人工智能则会盲目地信任它。

作者提出了一种名为BETAPRM的新教练,它不仅给出分数,还会给出置信度

以下是使用简单类比进行的分解说明:

1. 问题:会“猜测”的教练

想象你试图预测抛硬币的结果是否为正面。

  • 旧方法(标准 PRM): 你抛了 8 次硬币,其中 5 次是正面。旧教练说:“概率正好是 62.5%。”它将这个微小的样本视为一个完美且不可改变的事实。
  • 问题所在: 如果你再抛 8 次硬币,你可能会得到 4 次正面或 6 次正面。旧教练并不知道这一点。它将"62.5%"视为铁一般的事实,尽管这是基于一个微小且充满噪声的样本得出的。这使得人工智能在不确定情况下表现得过于自信。

2. 解决方案:“诚实”的教练(BETAPRM)

BETAPRM改变了游戏规则。它不再给出一个单一的数字,而是给出一个可能性范围,并告诉你它对这一范围的把握有多大。

  • 类比: 想象教练手里拿着一根橡皮筋。
    • 橡皮筋的中心: 这是预测的分数(例如,“这一步看起来有 70% 的可能性是正确的”)。
    • 橡皮筋的紧绷程度: 这代表了可靠性
      • 紧绷的橡皮筋(高置信度): 教练非常确定。橡皮筋紧紧地绷在 70% 的刻度周围。如果你再抛一次硬币,结果很可能仍会保持在 70% 附近。
      • 松弛的橡皮筋(低置信度): 教练不确定。橡皮筋被拉得很宽,覆盖了从 40% 到 90% 的所有范围。教练的意思是:“我认为它是 70%,但我可能完全搞错了。”

通过学习这种“紧绷度”(论文中称为集中度),模型学会了说:“我对这一步很有信心”,或者“我仅仅是在猜测,所以不要太信任我”。

3. 它是如何学习的:“蒙特卡洛”训练

教练如何学会变得诚实?

  • 论文使用了一种称为**蒙特卡洛延续(Monte Carlo continuations)**的方法。想象人工智能尝试解决一个问题,在第 3 步停下来,然后从那个确切的点出发,尝试 16 次不同的方式来完成这个问题。
  • 这 16 次尝试中,有些成功了,有些失败了。
  • 旧教练: 查看这 16 次尝试,计算成功的次数(比如 10 次),并将"10/16 = 0.625"作为绝对真理记忆下来。
  • BETAPRM: 查看这 16 次尝试并思考:“好吧,我看到了 10 次成功。这是一个好迹象,但因为我只有 16 次尝试,所以存在很多随机性。我应该保持橡皮筋松弛,以容纳这种噪声。”

它使用一种称为**Beta-Binomial(贝塔 - 二项式)**分布的数学工具,来学习分数与不确定性之间的这种平衡。

4. 超能力:自适应计算(ACA)

论文介绍了一种利用这种“诚实教练”的新方法,称为自适应计算分配(Adaptive Computation Allocation, ACA)

把这想象成一次公路旅行的预算。你有一定量的汽油(或金钱)来寻找最佳路线。

  • 旧方法(固定预算): 无论情况如何,你都会派出 16 辆不同的车去寻找最佳路线。即使第 1 辆车在第一英里后明显是获胜者,你仍然会派出其余的 15 辆车以求保险。这浪费了汽油。
  • 新方法(ACA):
    1. 你先派出一小组车(比如 4 辆)。
    2. 你检查“诚实教练”(BETAPRM)。
    3. 情景 A(高置信度): 教练说:“第 1 辆车是获胜者,而且我非常有信心(橡皮筋紧绷)没有其他车能超越它。”
      • 行动: 立即停止!节省汽油。你不需要派出其余的 12 辆车。
    4. 情景 B(低置信度): 教练说:“第 1 辆车看起来不错,但我的橡皮筋很松弛。我不确定第 2 辆或第 3 辆车是否实际上更好。”
      • 行动: 不要停止。派出更多的车去探索那些不确定的路径。

结果

论文在四种不同的人工智能模型和四个数学基准测试上对此进行了测试。

  • 更好的选择: 通过更信任那些“紧绷橡皮筋”的分数,人工智能选择正确答案的频率比旧方法更高。
  • 节省汽油: 新方法(ACA)节省了高达**33.57%**的解决问题所需的计算能力(token)。它停止在答案已经显而易见的问题上浪费时间,而只在真正不确定时才投入额外的时间。

总结

BETAPRM是一位更聪明的教练,它不仅给出等级,还会告诉你该在多大程度上信任这个等级。通过知道何时是在猜测,人工智能可以停止在简单问题上浪费精力,而将脑力集中在那些困难且不确定的问题上。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →