← 最新论文
💻 computer science

Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces

本文介绍了“Reasoning Jury”(推理陪审团),这是一个通过在多个开源权重的大语言模型之间采用协调一致机制,从而在准确识别和评估长推理链中的推理缺陷方面,显著超越前沿模型的具有成本效益的系统。

原作者: Congchao Wang, Diwakar Singh, Qiaozi Gao, Spyros Matsoukas, Yang Liu, Mahdi Namazifar

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Congchao Wang, Diwakar Singh, Qiaozi Gao, Spyros Matsoukas, Yang Liu, Mahdi Namazifar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

侦探的困境:为什么一个大脑还不够

想象一下,你正试图教一个超级聪明的机器人如何破解谜案。你不仅希望机器人能喊出最终答案,还希望看到它完整的思维过程,一步步地,就像侦探在笔记本上记录下每一个线索、理论和死胡同一样。这就是研究人员所称的“推理痕迹”(reasoning trace)。在人工智能的世界里,这些痕迹是学习的命脉。如果机器人犯了错,我们需要确切知道它在漫长的思维链条中的哪个环节脱离了轨道,这样我们才能进行修复。

但问题在于:这些推理痕迹可能极其冗长,有时会延伸数百个步骤。这就像要求一个人阅读一部 500 页的推理小说,并指出其中每一个细微的逻辑漏洞。即使是最聪明的人类(或最先进的 AI)也可能会因为疲劳、分心或仅仅是陷入某种特定的理解而错过一个微妙的错误。这就是这篇论文要解决的问题:我们如何可靠地发现这些庞大且复杂的思维过程中的错误?作者提出了一个解决方案,即不再依赖于单一的“超级法官”,而是使用一整个评审团来达成共识,就像法庭上的陪审团一样。


推理陪审团:众脑协作 vs. 孤胆英雄

在这篇论文中,作者介绍了一个名为 Reasoning Jury(推理陪审团) 的系统。把它想象成一场高风险的真人秀游戏,而一段冗长且复杂的推理痕迹就是参赛选手。通常情况下,我们会请一位超级聪明的 AI(“前沿模型”)来观看这场表演,并说“通过”或“失败”。但作者发现,即使是最强大的单个 AI,也经常会漏掉隐藏在数百个步骤中的微妙错误。这就像是让一个人去大海捞针;他们可能会找到,但也可能因为眨眼的时机不对而错过。

因此,作者决定尝试一种不同的方法:陪审团

他们没有使用单一的法官,而是组建了一个由多个 AI 模型组成的评审团。这些模型充当“陪审员”。游戏流程如下:

第一阶段:独立裁决
首先,每位陪审员独立阅读题目和冗长的推理痕迹。他们此时还不进行交流。每位陪审员都会写下一份他们发现的缺陷清单,并指出错误发生的具体步骤(例如,“在第 14 步,数学计算出错了,因为……”)。他们还会标记错误的严重程度:是微小的笔误(minor/轻微)、重大的逻辑错误(major/重大),还是会导致整个答案崩溃的致命缺陷(fatal/致命)?

第二阶段:审议
这是见证奇迹的时刻。陪审员们在一个虚拟房间里与一位**主持人(Moderator)**汇合。主持人就像一位严格的裁判,他本身并不了解问题的答案,他只负责倾听陪审员们对案件的辩论。

  • 辩论: 陪审员们展开唇枪舌战。有人可能会说:“我认为第 14 步错了,”而另一人可能会反驳:“不,第 14 步没问题,真正的罪魁祸首是第 15 步!”他们通过辩论直到达成共识。
  • 整合: 或者,主持人可以直接将第一阶段的所有清单进行合并,生成一份最终的、干净的报告,去除重复项并保留最佳的解释。

他们的发现:群体的力量

结果令人惊讶且令人兴奋。当作者在名为 Hard2Verify 的基准测试(该测试包含具有长推理痕迹的极难数学题)上测试该系统时,他们发现,由开源权重模型(即免费使用且不受付费墙限制的模型)组成的陪审团,其表现实际上可以超越现有的最昂贵的“前沿”AI 模型。

以下是他们的发现明细:

  • 更高的准确度: 单个顶尖 AI 模型(如 Opus-4.6)在发现这些推理错误方面的得分约为 73.7(分值为 0 到 100)。但由三个较便宜的开源模型(具体为 gpt-oss-120b)组成的辩论陪审团,其得分达到了 82.3。这是一个巨大的飞跃!即使是仅由三个开源模型组成的陪审团,也显著超过了单个最强模型。
  • “提升”效应: 论文表明,陪审团不仅仅是取了平均分,它实际上提升了整体水平。当陪审员进行辩论时,他们捕捉到了任何单个陪审员都会错过的错误。这就像一群朋友在解谜:一个人看到了一个碎片,另一个人看到了它如何契合,最终他们比任何一个人单独行动时都更快、更准确地完成了整幅拼图。
  • 更便宜、更快速: 或许是最具实际意义的发现是成本问题。运行单个“超级模型”来判断这些痕迹是非常昂贵的。作者计算得出,使用这个陪审团系统比使用单个前沿模型进行相同任务要便宜 6.4 倍。事实上,陪审团的成本仅为运行那些昂贵模型的 8% 到 16%。这就像是以一名实习生的价格聘请了一支专家侦探团队。

为什么这很重要:修复机器人的大脑

论文还测试了该系统是否真的能帮助 AI 学习。他们选取了一个犯错的模型,向它展示了陪审团提供的详细反馈(不仅是指出哪里错了,还包括为什么错),并要求它重试。

  • 结果: 当模型接收到来自陪审团的丰富反馈时,它在重试问题时的准确率从 71.2% 跳升至 76.2%
  • 启示: 这表明,拥有详细的、分步骤的错误诊断,比仅仅被告知“你错了”对 AI 更有帮助。这就像是老师说“你做错了”,与老师说“你在第 14 步把这两个数字加错了;正确的做法应该是这样的”,这两者之间有着本质的区别。

论文排除了哪些可能性

作者非常谨慎地测试了他们的结果是否只是偶然。他们明确排除了以下几种情况:

  • 并非仅仅因为模型数量更多: 他们尝试了“多数投票法”(即取大多数陪审员意见的结论)。这种方法效果并不好,因为陪审员很少会对完全相同的步骤达成一致。审议(Deliberation)(即辩论和讨论的过程)才是产生差异的关键因素。
  • 并非仅仅因为多样性: 他们测试了一个由三个完全相同的模型组成的陪审团。即使没有不同类型的模型,陪审团仍然显著提高了得分。这表明,即便“大脑”是相同的,独立的思考和随后的辩论过程依然起到了作用。
  • 并非万能灵药: 论文承认,虽然陪审团非常擅长发现错误发生的位置,但他们尚未完全证明陪审团给出的每一个解释在事实层面都是 100% 完美的。然而,该系统足够稳健,足以用于训练和调试。

总结

Reasoning Jury(推理陪审团) 证明了在检查 AI 复杂且冗长的思维时,众脑协作优于单兵作战。通过让多个模型进行辩论并完善他们的发现,我们可以发现即使是最聪明的单个 AI 也会错过的错误,同时还能节省大量的资金。它将 AI 推理的评估从一项孤独、昂贵的任务转变为一个协作式、具有成本效益的过程,为未来更智能、更可靠的 AI 系统铺平了道路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →