← 最新论文
📊 statistics

Deployment-complete benchmarking

本文提出了“部署完备基准测试”框架,该框架通过量化证据模糊性来评估基准分数是否能可靠地指导部署决策,揭示出现有基准尽管分数很高却往往无法支持现实世界决策的问题,并提出了一种“先认证后获取”策略以显著减少错误的部署决策。

原作者: El Mustapha Mansouri, Keigo Arai

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: El Mustapha Mansouri, Keigo Arai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位招聘经理,正试图决定录用谁来完成一项非常具体的工作:在暴风雪中驾驶一辆送货卡车。

你有一份候选人名单,并让他们参加了一项标准的驾驶测试。该测试衡量他们在空旷停车场停车以及在晴天驾驶的能力。结果很明确:候选人 A 得了完美的 100/100 分,候选人 B 得了 95/100 分。

基于这个“基准分数”,你自然会录用候选人 A。但问题在于:你给他们做的测试,实际上并没有测试他们在暴风雪中驾驶的能力。

这篇题为《部署完备的基准测试》(Deployment-complete benchmarking)的论文指出,我们在人工智能模型、新材料和医疗化合物方面正在犯同样的错误。我们将测试分数视为系统已准备好应对现实世界的保证,而实际上,该分数往往只能证明系统擅长应对测试本身。

以下是他们研究发现的简要说明,使用了简单的类比:

1. “纤维”问题:相同分数,不同现实

作者引入了一个称为“纤维”(fiber)的概念。想象一下,纤维是指一组在驾驶测试中得分完全相同的人。

  • 理想情况: 该组中的每个人在暴风雪中驾驶的能力都同样出色。如果你从该组中录用任何人,都是安全的。
  • 现实问题(混合纤维): 实际上,该组是混合的。有些人能在暴风雪中驾驶,而另一些人会立即撞车。他们在晴天测试中都得了相同的分数,但该测试未能捕捉到这种差异。

论文将这种情况称为“混合纤维”。这是一个数学证明,表明你的测试分数不足以做出决策。如果你面对的是“混合纤维”,你就是在盲目飞行。

2. “完美分数”陷阱

作者进行了实验,创建了一个完美的测试。他们发现,即使一个模型在基准测试(晴天测试)中获得了100% 的完美分数,它对于实际工作(暴风雪)可能仍然毫无用处。

  • 类比: 想象一位厨师在安静的厨房里做蛋糕完美无缺。你录用他们是为了在一个混乱嘈杂的厨房里烹饪盛大的宴会。他们的“完美蛋糕分数”并不能告诉你他们是否能应对混乱。
  • 发现: 在他们的实验中,一个在测试中表现“完美”的模型,仍有约**55%**的情况未能预测现实世界的结果,因为测试遗漏了一个关键信息(即“残差”或“暴风雪”)。

3. “混合纤维”审计

作者走出去检查了现实世界的基准测试(如毒理学领域的 Tox21 和材料科学领域的 JARVIS),以查看存在多少“混合纤维”。结果令人震惊:

  • 毒理学(Tox21): 97.9% 的具有相同测试分数的组别中,混合了安全化学品和有毒化学品。该测试分数对于决定安全性几乎毫无用处。
  • 材料科学(Matbench/JARVIS): 在主要审计中,你可以自信录用的候选人中位数为0%。分数如此模棱两可,以至于在没有更多信息的情况下,你无法信任任何一个分数。

4. 解决方案:“先认证,后获取”

那么,我们该怎么办?论文提出了一种名为“先认证,后获取”(Certify-Then-Acquire)的新工作流程。

不要仅仅查看分数并做出决定,而是遵循以下步骤:

  1. 检查分数: 查看基准测试结果。
  2. 检查纤维: 问自己:“这个分数组是否包含好结果和坏结果的混合?”
  3. 如果是混合的(模棱两可): 不要猜测!停止。 你需要运行一个额外的特定测试(“探针”)来消除困惑。
    • 类比: 如果驾驶测试模棱两可,就不要立即录用该司机。给他们一个在雪地里的 5 分钟快速测试。
  4. 如果是纯粹的: 如果该组全部安全(或全部不安全),那么你才可以做出决定。

这种新方法的结果:

  • 在毒理学测试中,该方法将错误决策(误报)从1.19% 降低到了 0.027%
  • 在材料测试中,它将错误决策从20.3% 降低到了 0.128%
  • 额外好处: 它经常改变了你选择的模型或材料。按旧分数排名的“最佳”模型,往往是对实际工作最糟糕的选择。新方法则选对了。

5. “完备曲线”

作者提出了一种新的结果报告方式。不要只说“我们的模型达到了 95% 的准确率”,报告应包含一条“完备曲线”(Completion Curve)。

这条曲线回答了这个问题:“我们需要投入多少额外信息(或资金)才能确保我们的决定是正确的?”

  • 如果曲线平坦,你需要大量的额外测试才能确定。
  • 如果曲线陡峭,你已经接近确定无疑了。

核心结论

该论文认为,分数不是决策。分数只是一条证据。

  • 旧方式: “模型得了 95 分,所以我们部署它。”(这很危险,因为分数可能未涵盖现实世界的风险。)
  • 新方式: “模型得了 95 分,但该分数让我们对 20% 的案例感到不确定。在部署之前,让我们对那 20% 进行一项额外测试以确保无误。”

作者总结道,对于任何高风险决策(部署 AI、购买材料、批准药物),我们必须停止仅报告分数。我们必须报告分数实际支持了什么哪里存在歧义,以及消除这种歧义需要多少成本

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →