← 最新论文
🤖 AI

The Capability Frontier: Benchmarks Miss 82% of Model Performance

本文引入了“能力前沿”(Capability Frontier),这是一个帕累托最优的评估框架,它揭示了现有的基准测试由于未能考虑到不同模型的互补优势以及从多次生成中选择最佳输出所带来的益处,从而系统性地低估了大型语言模型在现实世界中的表现,低估幅度高达82%。

原作者: Bradley Fowler, Ryan Smith, Daniel Thi Graviet, William Myers, Joshua Greaves, Narmeen Fatimah Oozeer, Antía García, Philip Quirke, Amirali Abdullah, Fazl Barez, Shriyash Kaustubh Upadhyay

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Bradley Fowler, Ryan Smith, Daniel Thi Graviet, William Myers, Joshua Greaves, Narmeen Fatimah Oozeer, Antía García, Philip Quirke, Amirali Abdullah, Fazl Barez, Shriyash Kaustubh Upadhyay

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在主持一场规模宏大、高风险的知识竞赛。你拥有一支由 20 名不同专家(即 AI 模型)组成的团队,每位专家都有其独特的优势。其中一位是编程天才,另一位是医学奇才,还有一位是历史大师。

问题:“单人玩家”错误
目前,当我们测试这些 AI 专家有多出色时,通常会挑选一个专家来回答所有问题。如果这位专家不知道答案,我们就将其标记为错误。

这篇论文指出,这是一个巨大的错误。这就像雇佣一名医生来治疗所有可能的疾病,或者要求一名厨师烹饪菜单上的每一道菜。即使那名医生在平均水平上是“最强”的,他们仍然会错过某些特定的病例,而他们的同事本可以完美解决这些病例。通过只使用一个模型,我们严重低估了我们的 AI 团队实际上所能达到的成就。

解决方案:“能力前沿”
作者引入了一种衡量性能的新方法,称为**“能力前沿”(Capability Frontier)**。你可以把它看作是一种“超级团队”策略。

与其强迫一个模型去做所有事情,不如想象你有一个神奇的、无所不知的经理(称为**“先知/Oracle”**),他能审视每一个问题,并瞬间知道哪位专家最适合回答它。

  • 如果问题是关于 Python 代码,他就把问题交给编程专家。
  • 如果是关于心脏手术,就交给医学专家。
  • 如果是一个谜题,就交给逻辑专家。

“能力前沿”就是这个完美的团队所能获得的得分。它代表了如果我们能将正确的工具完美匹配到正确的工作中时,所能达到的绝对最佳表现。

重大发现:我们正在错失机会
该论文在 16 种不同类型的任务(如编程、医学和逻辑)上对 21 种不同的 AI 模型进行了实验。结果令人震惊:

  1. 我们大大低估了 AI: 当我们将“单人玩家”得分与“超级团队”得分进行比较时,他们发现标准基准测试遗漏了 82% 的潜在性能。
  2. 更低成本成为可能: 如果你想获得与“最佳”单个模型同等高质量的答案,超级团队可以通过使用更便宜的专业化模型来处理简单问题,从而节省 85% 的成本。
  3. 更高的准确度成为可能: 如果保持成本不变,超级团队产生的错误比最好的单个模型少 54%

“噪声”陷阱:为什么我们不能仅仅靠猜测
你可能会想:“好吧,那我就尝试问 10 个不同的模型,然后选出最好的那个答案。” 论文警告说,这非常棘手。

如果你只是询问 10 个模型并挑选胜者,你可能会不小心选出一个仅仅是因为运气好(“侥幸”答案)的模型,而不是一个真正优秀的模型。这被称为**“优化者的诅咒”(Optimizer's Curse)**。这就像是因为一枚硬币连续 10 次正面朝上,你就认为它是“幸运”硬币一样,而实际上它可能只是一枚普通的硬币,只是刚好运气好而已。

作者开发了特殊的数学工具(如“去偏差/de-biasing”方法)来过滤掉这些幸运的侥幸值,从而找到团队真正的潜力。他们发现,如果不使用这些工具,之前的研究会高估团队能实现的提升程度。

“熵”因素:为什么多样性至关重要
论文还通过模拟研究了为什么这行得通。他们发现,问题的多样性越高(混合了数学、艺术、代码和历史),使用团队带来的优势就越大。

把这想象成一支运动队:

  • 如果你们只参加一项所有人只需直线奔跑的游戏(低多样性),那么一名快跑者就足够了。
  • 如果游戏需要奔跑、游泳、攀爬和解谜(高多样性),那么你就需要一整支由专家组成的团队。任务越多样化,“超级团队”的价值就越高。

底线
论文得出结论,我们目前正通过一个非常狭窄的视角来看待 AI。通过固守一个模型和一次尝试,我们看到的只是一个模糊、不完整的画面。如果我们开始动态地切换模型并明智地进行多次尝试,我们可以以更低的成本获得好得多的结果。“能力前沿”正是那张展示我们究竟能达到多高高度的地图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →