← 最新论文
💬 NLP

Off-the-Shelf LLMs as Process Scorers: Training-Free Alternative to PRMs for Mathematical Reasoning

本文提出了块级引导生成(Chunk-Level Guided Generation),这是一个无需训练的框架,它利用现成的大型语言模型作为过程评分器,从较小的模型中选择固定长度的推理块,从而有效地防止错误传播,并在数学基准测试上优于多数投票法和经过训练的过程奖励模型。

原作者: Atoosa Chegini, Soheil Feizi

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Atoosa Chegini, Soheil Feizi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图解决一个非常困难的数学问题。你有两个助手:一位初级助手(一个体积小、速度快,但有时会犯糊涂的 AI)和一位资深专家(一个体积庞大、速度慢,但才华横溢的 AI)。

你的目标是在不为了每一次步骤都动用资深专家的情况下,尽可能节省成本或时间,从而获得正确答案。

旧的方法(以及它们为什么失败了)

1. “掷骰子”法(事后选择):
过去,人们会让初级助手从头到尾写出五到十个完整的解题过程。然后,他们会让资深专家查看所有完成后的答案,并从中选出最好的一个。

  • 问题在于: 当资深专家查看答案时,初级助手已经在解题过程中犯了错误。如果初级助手在中间阶段走错了路,资深专家无法修复它;他们只能从中挑选出一个“错得最少”的完整故事。这就像是要求厨师在蛋糕已经烤焦之后再去修复它。

2. “步进式教练”法(过程奖励模型 - PRM):
一种更新的方法是让资深专家在初级助手写作的过程中进行检查。初级助手写一句话,资深专家进行检查,如果写得好,就让他们继续;如果不好,就让他们重试。

  • 问题在于: 这种方法效果很好,但它需要资深专家经过专门训练(就像一位研究过多年数学错误的教练)。训练这样的教练既昂贵又困难。

新的想法:“块级引导生成”

论文作者提出了一种聪明的、免费的替代方案,不需要训练新的教练。他们称之为**“块级引导生成”(Chunk-Level Guided Generation)**。

它是这样运作的,这里使用一个简单的类比:

“固定长度拼图”类比
想象初级助手正在搭建一个积木塔。

  1. 规则: 他们不允许初级助手一次性搭建整个句子或整个段落,而是每次只能搭建恰好 20 块积木(即一个“块”)。
  2. 选项: 在每一步,初级助手会快速搭建出 32 个不同版本的这 20 块积木。
  3. 评分: 资深专家查看这些短小的积木堆。他们不会写任何新内容,只是根据这些积木属于正确数学解题过程的可能性给出一个“分数”。
  4. 选择: 初级助手挑选得分最高的积木堆,将其锁定,然后开始搭建下一个 20 块积木。

为什么“固定长度”很重要(“长度偏差”陷阱)
研究人员发现大型 AI 模型思维中存在一个有趣的怪癖。如果你要求一个大模型去评判一个短的数学步骤与一个长的数学步骤,大模型通常会认为较长的那一个更好,即使它其实是一堆废话。这就像一位老师认为写了 10 页论文的学生一定比写了 1 页摘要的学生更有学问,即便那 1 页摘要才是正确的。

通过强制初级助手编写长度完全相同的“块”,资深专家就可以进行公平的比较。这消除了“长度偏差”,让 AI 能够评判数学的质量,而不是仅仅评判文本的长度。

两种评分策略

论文测试了资深专家对这些“块”进行评分的两种方式:

  1. 似然引导选择 (LGS): 资深专家只需挑选出看起来最符合“数学逻辑”的那个块。
  2. 对比引导选择 (CGS): 这是更聪明的一种。资深专家会问:“这个块对我来说是否比对初级助手来说看起来更好?”
    • 如果初级助手觉得一个块还可以,但资深专家觉得它极其出色,那么这就是一次巨大的胜利。
    • 这种方法能找到那些资深专家的“专家直觉”能发挥最大价值的步骤,从而纠正初级助手的盲点。

结果:他们发现了什么?

研究人员在困难的数学测试(如高中和大学竞赛)上测试了这些方法。

  • 击败了“掷骰子”法: 新方法明显优于等待初级助手完成任务后再进行挑选的方法。它在错误发生之前就将其修复了。
  • 击败了“训练好的教练”: 在许多情况下,这种“免费”的方法(使用现成的资深专家)表现得与昂贵的、经过专门训练的“过程奖励模型”教练一样好,甚至更好。
  • 更短、更聪明的答案: 令人惊讶的是,新方法生成的答案比训练好的教练方法更。训练好的教练往往会让初级助手写出冗长、啰嗦的解释以求稳妥。而新方法则能引导初级助手走向直接、简洁且正确的路径。
  • 规模化能力: 即使使用了更聪明的初级助手(一个 70 亿参数的模型),该方法依然表现出色,非常接近于大规模 720 亿参数模型的性能。

核心结论

这篇论文表明,你不需要训练一个专门的“数学教练”AI 就能获得极佳的效果。你只需要在一个较小的 AI 正在工作时,利用一个大而聪明的 AI 对其产生的每一个固定大小的片段进行快速评分即可。这是一种无需训练、具有成本效益的方法,能让小型 AI 模型解决难题的能力几乎媲美那些最庞大、最昂贵的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →