When Does Combining Language Models Help? A Co-Failure Ceiling on Routing, Voting, and Mixture-of-Agents Across 67 Frontier Models
本文认为,诸如路由(routing)和投票(voting)等多模型大语言模型系统的性能增益,从根本上受限于“共同失效率”(即所有模型同时失效的频率),这一指标是标准相关性度量所无法捕捉的,并且除非存在强大的查询级路由信号,否则往往会将集成准确率限制在单个最佳模型的水平。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大局观:为什么“更多声音”并不总是意味着“更好的答案”
想象你是一位正在试图解决难题的经理。你面前有 67 个不同的专家(AI 模型)可供选择。科技界的普遍建议是:“不要只选最聪明的那个人;要询问一群人并对答案进行投票。如果他们意见不一,那么这个群体通常会比任何单个专家都更聪明。”
这篇论文指出,这种建议往往是错误的。有时,询问一群专家得到的答案,实际上与只询问一个最顶尖的专家所得到的结果完全相同,但成本却高得多。事实上,在处理难题时,整个群体可能会集体失败,无论如何投票都无法挽救。
两个主要问题
作者发现,组合模型会遇到“玻璃天花板”(一个无法突破的极限),主要有两个原因。
1. “集体出错”天花板(共同盲点)
想象你向 67 位专家提了一个非常棘手的数学问题。
- 旧有的信念: 如果专家们具有多样性,他们会犯不同的错误。如果专家 A 错了,专家 B 可能就对了。
- 现实情况: 在处理困难的开放式问题(如复杂的数学或编程)时,这 67 位专家往往会在同一时间犯下完全相同的错误。他们拥有一个共同的“盲点”。
论文将此称为 (Beta):即每一个模型都在同一个问题上失败的速率。
- 规则: 无论你如何组合它们(投票、路由或级联),你的准确率永远无法高于 100% 减去 。
- 类比: 想象 67 个人试图在一间屋子里寻找一把隐藏的钥匙。如果他们全都看向了同一个错误的角落(因为他们都被教导了同样的错误知识),那么询问所有人也无济于事。无论你问多少人,你也永远找不到那把钥匙。
2. “相关性陷阱”(错误的指标)
目前,公司通过观察 (Rho) 来决定是否使用一组模型, 衡量的是两个模型犯相同错误的频率。
- 陷阱: 论文证明, 是预测“集体出错”问题的糟糕指标。你可能会拥有两个看起来差异很大(低相关性)的模型,但它们在处理最难的问题时仍会一起失败。
- 类比: 这就像检查两位天气预报员是否对“明天是否会下雨”达成一致。他们可能在 90% 的时间里意见不一。但如果一场巨大的飓风来袭(难题),他们可能都会判断错误。检查他们日常的意见一致性,并不能告诉你当大风暴来临时他们是否会同时失灵。
两个阶段:何时组合,何时停止
论文将任务分为两个截然不同的“世界”或阶段:
世界 A:“受限于天花板”的任务(开放式数学与编程)
- 发生的情况: 这些是没有任何多项选择选项的难题。
- 结果: “集体出错”率()很高。专家们集体失败。
- 教训: 在这类任务中,组合模型是徒劳的。你无法超越单个最强的模型,因为整个群体都困在同一个盲点中。论文发现,在这些任务上,“集体出错”率比标准数学预测的高出约 2.5 倍。
世界 B:“受限于可实现性”的任务(科学与多项选择题)
- 发生的情况: 这些任务的答案很明确,或者有选项可供选择(例如多项选择测试)。
- 结果: “集体出错”率接近于零。专家们很少会同时出错。
- 教训: 在这里,确实存在提升的空间。专家们对答案存在分歧,因此一个智能系统理论上可以选出正确的答案。然而,论文发现,目前的“路由”系统(决定使用哪个模型的 AI)太笨了,无法真正识别出这些差异。它们错失了机会。
“格式”带来的惊喜
作者对科学问题(GPQA)进行了一次有趣的实验。
- 当以多项选择题的形式提问时,模型很少会集体出错。
- 当以自由回答(去掉选项)的形式提问时,模型突然开始以极高的频率集体失败。
- 核心结论: 导致失败的原因不是“主题”(科学),而是“格式”。开放式问题会触发“集体出错”的盲点。
经济学教训:多样性 vs. 质量
论文还测试了一个常见的观点:“如果你将一个聪明的模型与一个虽然笨但具有多样性的模型混合在一起,你会得到更好的结果。”
- 发现: 这通常是错误的。如果“笨”的模型差异太大,它往往会为错误答案投票,从而拖累聪明的模型。
- 例外情况: 只有当模型的质量相等时,多样性才会发挥作用。如果一组模型同样聪明,但犯错的“类型”不同,那么组合它们就会奏效。但如果你把天才和新手混在一起,新手通常会损害团队的表现。
总结:你应该怎么做?
- 不要再信任“成对相关性”这个数字。 它无法告诉你整个群体是否会集体失败。
- 检查“集体出错”率 ()。 在构建复杂的多个模型系统之前,先检查它们是否会在同样的难题上出错。如果它们确实会,你就遇到了天花板。任何投票都无法突破它。
- 不要只是盲目增加模型数量。 向一个已经拥有共同盲点的群体中添加更多模型,就像是在一个找错了房间的搜救队中增加更多人一样。这毫无帮助。
- 关注“格式”。 如果你问的是开放式问题,请预期模型会集体失败。如果你能将它们转化为多项选择题,你或许能解锁有效组合它们的能力。
底线结论: 在当今最难的开放式任务上,最优秀的模型彼此过于相似,以至于它们会一起失败。除非你有一个非常明确的信号来识别“哪个模型适合哪个问题”,否则组合它们很少能超越单个最强模型。真正的魔力不在于模型的数量,而在于找到那些以不同方式失败的模型。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。