← 最新论文
💬 NLP

Scaling Evaluation-time Compute with Reasoning Models as Evaluators

本文表明,通过逐步过程评估,在推理模型作为评估器时增加测试时计算量,可显著提高评估准确性,并能通过重排序提升语言模型的问题解决能力,这与在生成过程中扩展计算量所带来的益处相一致。

原作者: Seungone Kim, Ian Wu, Jinu Lee, Xiang Yue, Seongyun Lee, Mingyeong Moon, Carolin Lawrence, Kiril Gashteovski, Julia Hockenmaier, Graham Neubig, Sean Welleck

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Seungone Kim, Ian Wu, Jinu Lee, Xiang Yue, Seongyun Lee, Mingyeong Moon, Carolin Lawrence, Kiril Gashteovski, Julia Hockenmaier, Graham Neubig, Sean Welleck

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正在参加一场难度极高的数学考试。通常,为了获得更高的分数,你可能会尝试更努力地思考,或者写出更多的解题步骤来解决问题。这篇论文提出了一个引人入胜的问题:如果与其仅仅更努力地思考答案,不如更努力地思考如何评判答案,结果会怎样?

以下是该论文核心思想的拆解,辅以简单的类比:

1. 旧方法:“快速评判者”

传统上,当我们使用人工智能来检查另一个人工智能的答案是否正确时,我们会使用“直接评估器”。这就像一位快餐店收银员。你递给他们一张收据(即答案),他们立刻会说:“看起来不错”或“看起来不行”。他们不会停下来思考为什么好或不好;他们只是基于以前见过的模式,迅速给出一个分数。

2. 新想法:“推理型评判者”

研究人员尝试了一种不同的方法。他们使用一种名为推理模型的特殊人工智能来进行评判。这就像一位终身教授,拒绝只是匆匆瞥一眼答案。

这位“教授”不会给出一个快速的分数,而是强迫自己写出一篇长篇详细的文章(即“思维链”)来解释其推理过程。它可能会说:

  • “等等,让我再检查一遍第 3 步……"
  • “嗯,这个逻辑似乎不太稳固。”
  • “让我回溯一下,看看是否有更好的方法。”
  • “好的,我已经验证了整个过程,我有信心了。”

论文将这种方法称为**“扩展评估时计算”**。用通俗的话说就是:花更多的时间和脑力去评判考试,而不是花更多的时间去解答考试。

3. 他们评判的两种方式

研究人员测试了这位“教授”评判答案的两种方法:

  • 结果评估:查看最终答案,并问:“结果正确吗?”(就像检查试卷上的最终得分)。
  • 过程评估:查看解题过程中的每一个步骤,并问:“这个特定步骤合乎逻辑吗?”(就像检查试卷上展示的计算过程)。

重大发现:这位“教授”(推理型评估器)被强迫“思考”并写出其推理步骤的次数越多,它在评判方面就越出色。就像学生通过更长时间的思考在解决数学问题上变得更擅长一样,评判者通过更长时间的思考在发现错误方面也变得更出色。

4. “最佳 N 选”游戏:质量与数量

为了测试这种更优质的评判是否真的有帮助,他们玩了一个名为**“最佳 N 选”**的游戏。

  • 设定:想象一个生成式人工智能针对一个难题生成了 64 个不同的答案。
  • 旧策略:使用“快速评判者”快速检查所有 64 个答案,并选出最好的一个。
  • 新策略:使用“推理型评判者”(即教授)仅深入分析8个答案,但非常仔细地进行分析。

结果:这位“推理型评判者”从仅 8 个答案中选出最佳答案的表现,优于“快速评判者”从 64 个答案中选出最佳答案的表现。

类比:这就像聘请一位专家侦探对 8 条线索进行非常彻底的调查,而不是聘请 100 名实习生匆匆瞥一眼 64 条线索。深入的调查比广泛而浅显的搜索更频繁地发现了真相。

5. 为什么这行得通?

论文发现,“推理型评判者”特别擅长发现隐藏的错误

  • 有时,人工智能得出了正确的最终答案,但使用了错误的方法(就像在数学考试中猜对了数字)。
  • “快速评判者”可能会说:“干得好!”因为答案是正确的。
  • “推理型评判者”会检查步骤,发现错误,然后说:“等等,答案是对的,但逻辑有缺陷”,并予以拒绝。

总结

论文证明,花更多的计算能力去评估一个答案,与花更多的计算能力去生成一个答案同样有效。

通过强迫人工智能评判者“大声思考”并仔细检查每一步,我们可以用更少的尝试获得更好的结果。这是一种从“更努力地尝试以获得正确答案”向“更努力地思考以找到正确答案”的转变。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →