← 最新论文
🤖 AI

Position: Evaluation Scores Are Perishable Knowledge Claims

本文认为评估分数是易逝的知识主张,在通过取平均值进行聚合时容易产生“信任通胀”,因此提议采用一种保守的“最弱环节”方法,通过明确追踪分数的正式性、范围和有效窗口,以防止误导性的排名。

原作者: Sankalp Gilda, Shlok Gilda

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Sankalp Gilda, Shlok Gilda

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

计分卡陷阱:为什么“平均值”可能是一个谎言

想象你是一名侦探,正试图通过三位不同证人的线索来破解一个谜团。一位证人是超级精准的机器人,从不撒谎,但它只能从远处观察犯罪现场;另一位是健谈的人类,近距离观察了一切,但有时为了显得自己很酷而编造事实;第三位是一面镜子,只是重复嫌疑人的话。如果你取他们陈述的“平均值”,你可能会得到一个听起来非常合理、四平八稳的版本。但问题在于:如果人类证人说嫌疑人戴着红帽子(而实际上戴的是蓝帽子),那么这一个错误的细节就会毁掉整个故事,无论机器人的天气描述有多完美。在人工智能领域,特别是当我们试图衡量这些“计算机大脑”有多聪明时,我们经常犯下这个同样的错误。我们将测试分数视为简单的数学题,认为只需将它们相加并除以测试数量即可得到一个“最终成绩”。但本文的作者认为,这些分数不仅仅是数字;它们是对真理的某种主张,具有失效期、特定的适用范围以及不同的可靠程度。如果我们忽略了这些隐藏的规则而仅仅将它们平均化,我们最终会陷入“信任通胀”(Trust Inflation)——这是一个高级说法,意指我们对一个实际上可能在最危险之处出现故障的系统过度自信了。

论文的核心思想:停止平均,开始检查最弱的一环

由 Sankalp 和 Shlok Gilda 撰写的这篇论文指出,目前对 AI 模型进行排名的做法存在根本性缺陷,因为它将所有的测试结果都视为同样强大且永久的。作者将这个问题称为信任通胀。当我们将不同类型的证据——例如自动化计算机检查、人类意见和 AI 评判——混合成一个单一的“平均”分数时,就会发生这种情况。问题在于,一个单一的弱点就能摧毁整个局面,但平均值却掩盖了这种弱点。

为了解释这一点,作者使用了一个简单的类比:想象一条链条。整条链条的力量并不取决于所有环节的平均强度,而是取决于最弱的一环。如果你有一条链条,其中 99 个环节由钢制成,而一个环节由纸制成,那么整条链条会在羽毛的重量下断裂。同样,如果一个 AI 模型擅长写诗,但在讲述事实(真实性)方面表现糟糕,那么一个“平均”分数可能会让它看起来像是一个不错的全能选手。但在现实世界中,如果该 AI 被用于提供医疗建议,它无法讲述真相的能力将是一场灾难,无论它的诗写得多么优美。

论文建议我们停止将“平均值”作为默认方法。相反,我们应该采用“最弱一环”的方法,特别是对于安全至上的任务。这意味着如果一个 AI 在哪怕一个重要的测试中失败了,它的整体评分也应该下降以反映这一失败,而不是由其其他优秀的得分来支撑。

AI 真理的三条规则

作者提出,每一个 AI 测试分数都应该附带一个“标签”,告诉我们三件具体的事情,就像食品包装会告诉你里面有什么、产自哪里以及何时过期一样:

  1. 形式度(证据有多强?): 并非所有测试都是平等的。论文创建了一个“等级”系统。

    • F0 级(最弱): 包括由其他 AI 模型对作品进行评判或众包意见的分数。作者认为,这些分数只能被信任到 0.70 的可靠性上限,因为 AI 评判者往往只喜欢冗长、华丽的答案,即使这些答案是错误的。
    • F1 & F2 级(更强): 这些是结构化的计算机检查或受控的人类测试。它们更可靠,但即使是人类测试也有极限(可靠性最高为 0.95)。
    • F3 级(最强): 这是正式的数学证明。这是唯一可以达到 1.00 完美可靠性的东西。
    • 规则: 如果你将一个 F0 级的分数与一个 F2 级的分数混合,整个结果将被限制在 F0 级别(0.70)。你不能通过添加一个强大的测试来让一个弱测试变得强大。
  2. 范围(这适用于哪里?): 一个测试分数仅对其测试过的特定情境真实。如果一个 AI 在英语问题上接受了测试,并不意味着它擅长西班牙语。如果它在常识方面接受了测试,并不意味着它擅长法律咨询。论文认为,分数应明确说明其限制,以免我们误将其用于错误的地方。

  3. 有效性窗口(何时过期?): 测试分数是有保质期的。就像牛奶一样,它们会变质。作者指出,一旦 AI 模型在训练过程中见过这些测试题目(这个问题被称为“污染”),分数就会变得毫无意义。他们建议每个分数都应该有一个失效日期。一个 AI 生成的观点可能只在几周内有效,而一个正式的数学证明则可能永远有效。

现实世界的证据:“信任通胀”在行动

作者不仅是在讨论理论;他们还为 AI 智能体构建了一个真实的测试系统,并发现了一些可怕的漏洞。

  • 沉默的 Bug: 他们发现,由于他们的计算机代码语言之间存在不匹配,导致每一次失败都被记录成了成功。系统在向他们撒谎,在没有人察觉的情况下夸大了分数。这是基础设施层面的“信任通胀”。
  • “平均值”的谎言: 他们在著名的公开排行榜 HELM 上测试了这个理论。他们观察了 54 个顶尖 AI 模型在 10 个不同场景下的表现。
    • 当他们根据平均分数对模型进行排名时,前 5 名模型属于一组。
    • 当他们根据最弱一环(任何类别中的最低分)进行排名时,前 5 名模型是完全不同的另一组
    • 事实上,这两个前 5 名名单之间的重合度为零。那些通过平均法看起来是最好的“全能选手”的模型,实际上是那些拥有最大隐藏弱点的模型。而那些按旧方法看起来“平庸”的模型,实际上是最可靠的,因为它们没有任何灾难性的失败。

这对未来意味着什么

论文最后向 AI 社区发出了行动呼吁。他们希望我们停止在分数背后隐藏数学逻辑。

  • 展示你的过程: 每个分数都应该携带一个标签,说明证据有多强、适用于什么范围以及何时过期。
  • 选择你的立场: 如果我们必须合并分数,我们应该承认我们使用的是哪种方法。我们是在表现乐观(使用平均值)还是保守(使用最弱一环)?论文认为,出于安全考虑,我们应该默认使用保守的“最弱一环”方法,但至少我们要承认我们做出了这种选择。
  • 版本控制: 就像软件代码一样,记录测试结果的方式应该是版本化的,这样我们才不会误将苹果和橘子进行比较。

作者承认这是一篇“立场论文”(position paper),这意味着他们是在基于强大的逻辑和工程经验提出一种新的思考方式,而不是通过一项证明一切 100% 正确的大规模新实验。他们承认,过于保守可能会让优秀的模型看起来表现不佳,但他们认为,与其部署一个在平均水平上看起来很棒但在关键时刻出错并造成伤害的系统,不如保持谨慎。通过让分数的“认识论状态”(即真理性及其局限性)透明化,我们可以对哪些 AI 系统值得信赖做出更好的决策。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →