← 最新论文
🤖 AI

Joint Consistency: A Unified Test-Time Aggregation Framework via Energy Minimization

本文提出了联合一致性(JC),这是一种统一的测试时聚合框架,将答案选择构建为一个约束能量最小化问题,该问题同时利用独立评估信号和成对大语言模型裁判比较,在各类推理基准测试中展现出优于现有基线的性能。

原作者: Yunzhen Yao, Hongye Wang, Yahong Wang, Michael C. Gastpar, Bo Jiang, Lie He

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Yunzhen Yao, Hongye Wang, Yahong Wang, Michael C. Gastpar, Bo Jiang, Lie He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试解决一个非常棘手的谜题,比如一道复杂的数学题或一个巧妙的编程挑战。你请了一群聪明的 AI 助手(大语言模型)来解答。你不是只问一个,而是让许多 AI 写出它们的思考过程并给出答案。现在,你面前堆满了各种各样的解决方案。有些是正确的,有些是错误的,还有些只是令人困惑。

核心问题在于:你如何从这堆混乱的答案中选出唯一最佳的答案?

本文介绍了一种名为**联合一致性(Joint Consistency, JC)**的新方法来解决这个问题。以下通过简单的类比来解释其工作原理。

旧方法:计票或打分

大多数现有方法试图通过以下两种方式之一选出优胜者:

  1. “人气竞赛”(自洽性):他们只是统计有多少人给出了相同的答案。如果有 10 个人说"42",只有 2 个人说"17",他们就选"42"。
    • 缺陷:如果大多数人都自信地错了怎么办?或者如果“正确”的答案虽然罕见却极其精妙怎么办?
  2. “单人裁判”(加权评分):他们请一个裁判 AI 根据每个方案单独看起来有多好,给每个方案打分(例如 0 到 100 分)。他们选择得分最高的那个。
    • 缺陷:裁判在孤立状态下很难给出准确的评分。这就像要求一位影评人在没看过任何其他电影可供比较的情况下给一部电影打分。评分可能是武断的。

新方法:“群体辩论”(联合一致性)

作者提出了联合一致性,它将选择过程视为一场群体辩论团队会议,而不是个人的绩效评估。

JC 不是单独审视每个答案,而是让裁判 AI 审视成对的答案,并回答:“如果我必须在答案 A 和答案 B 之间做出选择,哪一个更好?”

能量最小化类比:磁性粒子

为了理解所有这些成对比较,作者使用了物理学中的一个概念,即伊辛模型(Ising Model)。想象你在桌子上有一堆微小的磁铁(候选答案)。

  • “外场”(独立得分):每块磁铁都有其固有的强度(就像来自裁判的独立得分)。
  • “相互作用”(成对比较):磁铁之间也会根据它们的比较情况产生吸引或排斥。如果磁铁 A 明显优于磁铁 B,它们会以某种方式“排斥”,暗示它们不应同时成为赢家。如果磁铁 A 和磁铁 C 都击败了同一组其他磁铁,它们就会“相互吸引”并保持一致。

联合一致性就是排列这些磁铁,使整个系统尽可能“平静”(能量最低)的过程。系统会自然地稳定在这样一种状态:被选中的答案是那个:

  1. 拥有良好的独立得分。
  2. 在直接对决中始终优于其他选项。

为什么这很重要

本文提出了三个主要观点:

  1. 它统一了所有方法:这个单一的数学公式可以根据你的调整方式,充当人气竞赛、单人裁判或面对面辩论。它是挑选答案的“万能遥控器”。
  2. 它在比较方面更聪明:通过使用“面对面”的比较(人类和 AI 通常比给出绝对评分更擅长比较),JC 即使在大多数人都错了或独立得分令人困惑的情况下,也能找到正确答案。
    • 论文中的例子:在一次测试中,“人气竞赛”因为许多人猜了同一个答案而选错了答案。“单人裁判”因为某个答案看起来花哨而选错了答案。但是,联合一致性审视了成对辩论,意识到正确答案在直接比较中始终优于其他选项,从而选出了正确答案。
  3. 它高效:将每个答案与其他所有答案逐一比较将耗时无穷(就像每个人都要和所有人比赛)。作者发明了一个捷径。他们意识到,他们只需要比较答案的(例如,“A 组 vs B 组”),而不需要比较每一份单独的论文。这使得它在处理巨大问题时既快速又经济。

结果

作者在困难的数学竞赛(如 AIME 和 HMMT)和编程挑战中测试了这种方法。他们发现,联合一致性始终胜过旧方法。

  • 即使 AI 生成器表现较弱,它也能有效工作。
  • 即使“裁判”AI 不同,它也能有效工作。
  • 与仅生成答案相比,运行它的额外成本非常低。

总结

联合一致性想象成市政厅会议上一位明智的主持人。主持人不只是统计有多少人高喊“投 X 一票!”(人气),也不是请一位专家给所有人打分(单人评分),而是问道:“如果把候选人 X 和候选人 Y 放在一个房间里,谁会赢?”通过倾听所有这些成对辩论,主持人找到了那个真正最一致、最稳健的候选人,即使他们不是最响亮或最著名的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →