← 最新论文
🤖 AI

When benchmark inferences do not compose: Projectibility in AI evaluation

本文认为,由于端点、假设和依赖项的不一致,有效的 AI 基准测试推论并不会自动转化为有根据的后果性主张,据此提出了一个“可投影性审计”框架,用以诊断这些缺乏支持的逻辑衔接。

原作者: Brett Reynolds

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Brett Reynolds

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图弄清楚一个新研发的机器人厨师是否已经准备好经营一家繁忙的餐厅。你不能仅仅在测试厨房里观察它切洋葱,然后就假设它能应对一场完整的晚餐服务。你必须追问:当食材发生变化时,它的烹饪方式还是一样吗?如果有人类经理检查食物,它的表现还会一样好吗?它能撑过一周的服务,还是只能撑过一小时?这就是**AI评估(AI evaluation)**的核心——在这个领域,科学家们试图衡量人工智能究竟有多聪明或多有能力。

为了做到这一点,研究人员经常使用基准测试(benchmarks)。把基准测试想象成一次标准化考试,就像驾照考试一样。如果一辆车通过了测试,它就能拿到驾照。但棘手之处在于:通过测试并不自动意味着这辆车可以在暴风雪中、在颠簸的土路上或者在带着紧张乘客的情况下安全驾驶。在AI的世界里,我们经常看到这样一种推理链条:“AI通过了测试,所以它具备‘通用推理’能力,所以它可以胜任这项特定工作,所以它是可以安全使用的。” 核心问题在于:第一步的证据是否真的能连接到第二步,以及第二步是否能连接到第三步?本文探讨了为什么即使每一个步骤本身看起来都非常完美,这种连接也经常会断裂。


破碎的逻辑链

想象你正在用积木搭一座塔。你有一个完全正方形且稳固的积木块(一个基准测试结果)。你还有另一个同样正方形且稳固的积木块(一项显示AI在特定办公室表现良好的局部研究)。你可能会想:“如果我把它们叠在一起,我就拥有了一座高大且稳定的塔!”但如果第一个积木的顶部稍微有点圆,而第二个积木的底部稍微有点平呢?它们看起来像是契合的,但实际上并没有接触。这座塔会摇晃并倒塌。

这就是布雷特·雷诺兹(Brett Reynolds)在这篇论文中指出的主要问题。他称之为非组合原则(non-composition principle)。简单来说,仅仅因为你拥有两个都被“证实”(由可靠数据支持)的证据,并不意味着你可以把它们粘在一起来构成一个更大的、更强力的主张。论文指出,当我们试图将这些证据链条起来时——比如从“AI通过了测试”转向“AI在现实世界中是安全的”——我们往往会忽略那些逻辑崩塌的微小缝隙。

“法律助理”谜题

为了展示这种情况是如何发生的,作者讲述了一个律师事务所尝试使用一种新AI工具的故事。

  1. 测试: 开发人员展示了他们的AI模型在某项特定的法律问题上正确率达到了90%。
  2. 人工检查: 律师事务所展示了当人类律师审查草稿时,他们能发现99%的错误。
  3. 巨大的飞跃: 该律所假设,如果他们将这两者结合起来,最终的法律备忘录将达到99.9%的完美度。

论文说:请停下来。 这种逻辑是破碎的。

为什么?因为“测试”和“人工检查”讨论的是不同的事物。测试可能只检查AI是否能找到书中的一段引文。但人类律师可能会检查AI是否遗漏了一个至关重要的法律,而这个法律并不在书中。如果AI遗漏了那个法律,人类律师可能也无法发现,因为他们寻找的是错误类型的方向不对。这两个研究就像是两个从不同角度观察拼图的人;他们都看到了完美的图像,但他们看的并不是同一幅图。

论文通过数字模拟了这一过程。在一种情景下,AI在处理“终止条款”(一种特定类型的法律问题)请求时表现出色,但在处理“合理通知”请求时却表现得一塌糊涂。如果你只是计算平均分,你可能会认为AI的整体表现很棒。但如果该律所需要用它来处理两种类型的请求,那么“平均分”就是在欺骗他们。实际上,对于一半的工作内容来说,这个AI简直是一场灾难。

“魔力平均值”陷阱

论文还警告了一种被称为**聚合(aggregation)*的统计技巧。想象你有一个班级的学生。一半的学生在数学测试中得了100分,另一半得了0分。平均分是50%。听起来还可以,对吧?但如果你需要每个*学生都通过考试才能运行校车,那么这个平均分就毫无意义了。

在AI领域,一个“稳定均值”(稳定的平均得分)可能会掩盖很多麻烦。作者展示了,尽管AI的平均得分保持不变,但它犯错的类型可能正在变得越来越糟糕。也许它以前只是犯一些小的拼写错误,但现在它在犯危险的法律错误。如果你只看平均值,你就会错过“最坏情况”正在恶化的事实。论文通过模拟证明,你可以拥有一个完全稳定的平均分,同时AI却在最关键的地方走向失败。

这对未来意味着什么

那么,这篇论文建议我们怎么做呢?它提出了一个**“可投影性审计”(Projectibility Audit)**。

把它想象成任何想要使用AI的人都必须遵循的清单。在你说“这个AI已经准备好投入现实世界”之前,你必须回答以下特定问题:

  • 积木契合吗? “测试”涵盖的题目类型是否与“现实世界”的工作类型一致?
  • 条件相同吗? 测试是在安静的房间里进行的,而实际工作是在嘈于、混乱的办公室里进行的吗?
  • 信息丢失了吗? 你是否丢弃了关于哪些问题很难的细节,从而只看到了平均水平?

论文并不是说AI不好,或者我们不能使用它。它说的是,我们需要在如何连接这些点时更加谨慎。我们不能仅仅因为一个AI通过了测试,就假设它能胜任一份工作。我们必须检查测试与工作之间的连接,以及工作与最终结果之间的连接。

总结

这篇论文是对AI界的一次现实检验。它表明,我们往往过于急于堆叠我们的证据块,假设它们完美契合,而实际上它们存在缝隙。作者通过模拟和逻辑论证表明,对一个步骤的支持并不自动转化为对下一步的支持。

如果开发者说:“我们的AI准确率是90%”,而一家公司说:“我们的律师能发现99%的错误”,论文告诉我们:先不要把这些数字相乘。 你必须检查AI犯下的错误类型是否正是律师们所寻找的错误类型。如果你不这样做,你可能会建造一座看起来很高,但在承受真实负载时就会坍塌的塔。论文并不声称已经解决了AI安全问题,但它为我们提供了一张更好的地图,帮助我们找到逻辑裂痕隐藏的地方。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →