← 最新论文
🤖 AI

Agreement Before Diversity: Verification-First Complementarity for Heterogeneous Language-Model Coordination

本文提出了“先一致后多样性”(Agreement-Before-Diversity, ABD),一种针对异构语言模型的验证优先协调方法,该方法利用一个冻结且无标签的决策规则,仅在锚点答案得到可信样本证实时才予以保留,从而在 LiveCodeBench 和 GPQA-Diamond 上实现了最先进的性能,同时提供了精确的理论恒等式,用以审计准确率提升与推理成本之间的权衡。

原作者: Ruitong Li, Binjie Guo, Aisheng Mo, Guowei Su, Jie Li, Ru Zhang

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruitong Li, Binjie Guo, Aisheng Mo, Guowei Su, Jie Li, Ru Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图解决一个棘手的谜题,你没有只向一个人询问答案,而是向一整个专家团队求助。其中有些是数学奇才,有些是创意作家,还有一些是逻辑大师。这就是**大型语言模型(LMs)**协同工作的世界。在科学领域,这被称为“集成”(ensemble)。其核心思想非常简单:如果你有更多的人参与尝试,你获得正确答案的机会就越大。这就像是有十个人去猜罐子里有多少颗豆子;他们猜测的平均值通常比任何一个人的猜测都更接近真相。

然而,这里有一个陷阱。仅仅拥有十个猜测并不意味着你知道该选哪一个。有时候,听起来最自信的专家实际上是错的,而那个沉默寡言的专家才是对的。更糟糕的是,如果你请一位“超级专家”来整合所有答案,他们可能会不小心用一个华丽但错误的答案盖过了正确的答案。科学家们一直在问的一个大问题是:**我们如何知道什么时候该信任那个新的、华丽的答案,什么时候该坚持原有的答案?**我们需要一条规则,它能说:“停!这个新答案足够好,可以取代旧的了,”而不是仅仅靠猜测。

这就是一种名为**“先共识后多样性”(Agreement-Before-Diversity, ABD)**的新方法。把它想象成一个负责任且公正的裁判,负责监督一支 AI 专家团队。ABD 不会盲目地让一个华丽的新答案覆盖旧答案,而是设置了一个简单的“安全检查”。它是这样运作的:

  1. 锚点(The Anchor): 首先,团队选定一个“锚点”答案(当前的最佳猜测)。
  2. 安全检查(The Safety Check): 在他们看到那些华丽的新答案之前,来自同一团队的另外两位受信任的专家会对这个“锚点”进行检查。如果这两位专家与“锚点”完全一致,裁判就会说:“太好了!我们达成了共识。保留锚点,不要浪费时间或金钱在其他事情上。”
  3. 切换(The Switch): 但如果这两位专家与“锚点”不一致,裁判就会说:“好吧,‘锚点’不太稳固。现在,请引入整个多样化的专家团队,来合成一个全新的、华丽的答案。”

论文证明了这种简单的规则之所以极其强大,是因为它将多样性(拥有多种选择)与权威性(改变答案的权利)区分开来。作者发现,这种方法不仅仅是在猜测;它利用数学证明了其有效性的确切原因。他们发现了两个“神奇公式”(精确恒等式)来解释结果:

  • 该方法优于这样一种系统:即仅当“锚点”在两者达成一致的具体案例中确实优于“华丽答案”时,才制作一个新的华丽答案。
  • 该方法也优于这样一种系统:即仅当新的“华丽答案”修正了“锚点”所犯的错误,且没有意外破坏正确答案时,才永不改变答案。

在现实世界的测试中,这个裁判系统表现惊人。在一项名为 LiveCodeBench 的编程挑战赛中,ABD 方法达到了 59.43% 的正确率,击败了仅有约 52% 正确率的标准方法。在一次高难度的科学测试 GPQA-Diamond 中,它达到了 75.00%,再次领先于其他方法。

真正酷的地方在于,论文展示了在每种情况下它为何奏效。在编程测试中,“安全检查”很少通过(仅为 1.71%),因为计算机代码非常精确,两个随机尝试很难完美匹配。因此,系统大多时候只是让华丽的团队接管,事实证明这是正确的举动。但在科学测试中,安全检查经常通过(73.33%),由于“锚点”通常是正确的,系统通过坚持简单的答案节省了大量的精力,而不是过度思考。

论文还明确排除了一些常见的观点。它表明,仅仅拥有一个“多样化”的不同 AI 模型团队本身是不够的;如果没有关于何时切换的严格规则,你可能只会得到更多的错误答案。它还证明了你不需要预先知道“正确”答案来做决定;该规则仅通过观察专家之间是否达成一致即可奏效。

简而言之,**“先共识后多样性”(Agreement-Before-Diversity)**教会我们,拥有更多选择固然好,但你需要一个聪明的把关人来决定何时使用它们。它将向许多 AI 求助的混乱过程,转变为一种精确、可审计且高效的策略。这不仅仅关乎拥有最聪明的 AI,更关乎拥有使用它们的最高明规则。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →