LLMs as a Jury: Cross-Model Consensus Can Outperform Process Reward Models for LLM Reasoning
本文介绍了“LLM-jury”,这是一种无需参数的测试时扩展方法,它利用独立训练模型之间的跨模型共识,通过利用误差去相关性,在选择正确推理链方面超越了自一致性和经过训练的奖励模型,同时提供了一个闭式定律来预测其准确率并识别其失效上限。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试解决一个非常棘手的数学问题或科学谜题。你向一个超级聪明的 AI 寻求答案。但有时,即使是最聪明的 AI 也会陷入自己的思维定式,因为过于自信于错误的逻辑而一遍又一遍地犯同样的错误。
这篇论文介绍了一种检查答案的新方法:LLM-Jury(大语言模型陪审团)。
问题所在:“回声壁”陷阱
通常,当我们想要确定 AI 是否正确时,我们会多次询问同一个问题并取出现次数最多的答案。这被称为自一致性(Self-Consistency)。
把这想象成向你最好的朋友寻求建议,但你连续问了 12 遍。如果你的朋友今天心情不好,导致回答错误,他们很可能会连续 12 次都答错。他们会充满信心地为错误的答案投票,而因为你只问了他们一个人,所以这个“多数派”也是错误的。论文表明,这种方法继承了那个朋友的盲点。
另一种人们试图修复此问题的方法是训练一个专门的“裁判 AI”来给答案评分。但这个裁判需要大量的“家庭作业”(标注数据)来学习如何评分,而且如果你问它一个它未曾学习过的学科问题,它往往会失败。
解决方案:“LLM-Jury”
作者提出了一个不同的想法:跨模型共识(Cross-Model Consensus)。与其问一个朋友 12 遍,不如问四个在不同环境下成长、接受了不同教育、思维方式完全不同的不同朋友。
- 设置: 你有一个“生成器” AI 来创建可能的答案列表。然后,你有一个由三个其他 AI(如 Qwen、DeepSeek 和 Claude)组成的“陪审团”,它们各自独立地解决一次该问题。它们永远不会看到彼此的工作。
- 裁决: 如果四名陪审员中有三名对某个答案达成一致,那么就选择那个答案。
为什么有效:“散射”效应
论文用一个巧妙的隐喻来解释这一点,即关于错误的解释。
- 来自同一个模型的错误答案就像一群朋友都在同一个地方被同一块石头绊倒。他们都会跌倒在同一个位置。
- 来自不同模型的错误答案则像是各奔东西的朋友被不同的东西绊倒。一个被香蕉皮绊倒,另一个被松动的石头绊倒,还有一个被水洼绊倒。他们的错误会“散射”到各处。
因为来自不同模型的错误答案是分散的,它们会相互抵消。然而,正确的答案却是唯一能让所有人理解的东西,因此它能聚集所有的选票。论文测量了这一点,并发现,在困难的数学竞赛中,这种陪审团方法捕捉到了比旧有的“问一个朋友多次”方法多出的 100% 的潜在提升,而单个模型尝试对自己进行评分的提升几乎为 0%。
“神奇定律”与“天花板”
研究人员不仅仅是猜测这行得通;他们写出了一个数学定律(一个没有隐藏参数的公式),可以精确预测陪审团的表现。他们在从小学数学到研究生水平科学的七个不同基准测试上测试了这个定律,结果显示它预测的结果平均误差仅为 0.03(这非常接近!)。
然而,论文也发现了一个衡量其表现上限的天花板(限制)。
- 共同错误底线(Shared-Error Floor): 有时,四名陪审员可能会共享同一个误解。例如,如果他们在训练过程中都学错了某个特定的科学事实,他们可能会全部一致地同意一个错误的答案。
- 论文测量了这个“底线”。在数学问题上,它几乎为 0(他们很少共享相同的数学错误)。但在科学问题(如 GPQA 基准测试)上,底线约为 0.03,这意味着存在一小部分概率,他们会因为拥有共同的盲点而自信地达成一致的错误结论。
结果:击败专家
论文将这个免费、无需训练的 Jury 与四种不同类型的“经过训练的裁判”(专门用于评分的 AI 模型)进行了比较。
- 在其训练范围内: 在数学问题上,Jury 与最好的训练后裁判并驾齐驱或甚至更优。
- 在其训练范围外: 在那些训练后裁判从未见过数据的科学问题上,Jury 是表现最好的,而训练后的裁判则表现挣扎。
Jury 实现这一切无需任何额外的训练或标注数据。它直接利用我们现有的模型。
“协议级联”:节省成本
论文还提出了一种聪明的省力方法。你不一定总是需要询问所有四名陪审员。
- 先询问两名陪审员。如果他们达成一致,任务完成(便宜!)。
- 如果他们意见不一,那么再请另外两名加入聚会(更昂贵,但仅针对难题)。
这种“级联”方法在获得与每次询问四名陪审员同样高准确度的同时,节省了大量的计算能力。
它不是什么
论文非常明确地说明了这种方法不是什么:
- 它不是解决一切问题的万灵药。如果所有模型都共享一个错误的观念(比如某个特定的化学单位换算),Jury 会自信地出错,任何投票都无法修复它。
- 它不是仅仅“模型越多越好”。论文证明,问一个模型 32 次的效果比问四个不同的模型各一次要差。其魔力在于模型之间的差异,而不仅仅是投票的数量。
- 它不是最强单体模型的替代品(如果该模型已经完美的话)。但既然没有模型是完美的,Jury 就是我们在从一堆猜测中挑选正确答案时所能使用的最佳工具。
简而言之,论文表明,如果你想知道一个 AI 是否正确,不要让它自我评分。让一个由不同 AI 组成的专家组进行投票。如果他们达成一致,你可以信任他们。如果他们产生分歧,你就知道你需要进一步挖掘。而且最棒的是,你在开始之前就能精确预测你可以信任他们到什么程度。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。