← 最新论文
🤖 machine learning

Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment

本文引入了“评估盲区”(evaluation blindness)的概念,即测量函数无法检测出表现看似正常的系统故障,并通过形式化分析、案例研究以及对现实世界事件的分类,证明了这种隐性损坏同时影响着训练和部署阶段,从而要求将测量基础设施作为贯穿整个人工智能生命周期的核心正确性关注点,并采取统一的处理方法。

原作者: Priyanka Bajaj (Independent Researcher)

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Priyanka Bajaj (Independent Researcher)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在建造一个机器人厨师。你通过让它品尝自己做的菜肴并调整食谱来教它烹饪。如果机器人把吐司烤焦了,你希望它能立即察觉并调低火力。但如果机器人的味蕾坏了呢?如果它尝到了焦掉的吐司,却想:“嗯,完美!”机器人会继续烤焦吐司,厨房里烟雾弥漫,直到房子着火之前,没人知道发生了什么。这就是现代人工智能(AI)令人恐惧的现实。科学家们正在构建极其智能的 AI 系统,它们可以写故事、解数学题,甚至提供法律建议。但这些系统非常复杂,有时它们会以我们用来检查它们的工具无法察觉的方式失效。我们称之为“沉默失效”(silent failure)。这就像一辆汽车的测速计坏了,即使车速实际上是 100 英里或只有 10 英里,它也始终显示“时速 60 英里”。如果负责人只看这个测速计,他们根本不知道汽车出了问题,直到发生车祸。

这篇由研究员 Priyanka Bajaj 撰写的论文,调查了一种被称为评估盲点(Evaluation Blindness)的特定类型的不可见失效。这是一个高级说法,意思是指我们的“体检”工具对某些问题视而不见。论文指出,这种盲点发生在两个完全不同的阶段:在 AI 被训练(学习)期间,以及在部署(实际工作)之后。作者认为,我们一直将这两个问题视为独立的问题,但它们实际上是同一种结构性缺陷:测量工具显示“一切正常”,即便系统已经损坏。通过观察现实世界的灾难,比如律师因为 AI 生成的虚假案例而陷入麻烦,或者航空公司聊天机器人编造虚假政策,论文表明,在这些公开的失败案例中,超过一半的失败在标准监控系统发现有人受伤之前,对它们来说都是完全不可见的。作者提出了一种新的分类方法和一个“失效预算”(failure budget)系统,这就像是一个安全限制,规定了特定的 AI 在被关闭前允许犯多少错误,具体取决于其工作的危险程度。

巨大的隐形故障

让我们深入探索这个谜团的核心。论文引入了一个概念叫做评估盲点(Evaluation Blindness)。想象你是一位正在给学生作文评分的老师。如果学生写了一篇充满谎言的糟糕文章,但你的评分标准坏了,竟然给了他们一个“A”,那么你就产生了“评估盲点”。学生不及格,但你的测量结果显示他们很成功。

在 AI 世界中,当用于检查 AI 是否运行正常的计算机程序(“测量函数”)产生了一个看起来正常的结果,尽管 AI 实际上正在做错误的事情时,就会发生这种情况。论文对此进行了正式定义:如果一个 AI 正在失效,但我们的工具无法区分这种失效与健康状态之间的差异,且没有触发其他警报,我们就遇到了评估盲点。

作者指出,这不仅仅是一个偶然的故障;这是一个结构性问题,可能发生在 AI 生命周期的两个不同阶段:

  1. 训练阶段(Training Time): 这是 AI 学习的时候。想象一个学生正在为考试复习。如果老师(AI 的奖励系统)不小心因为学生记住了答案的关键点而不是理解了数学原理而给了他一颗金星,那么这个学生在模拟测试中会得到满分,但在真正的考试中会失败。论文给出了一个具体的例子:一个流行的开源库(TRL)中的一个 Bug,其中的一项数学计算略有错误。AI 的训练看起来非常完美——“损失值”(衡量错误程度的分数)下降了,奖励也上升了。但 AI 实际上学到了错误的东西,因为背后的数学逻辑是错误的。在有人将代码与原始指令进行对比之前,没有人注意到这一点。
  2. 部署阶段(Deployment Time): 这是 AI 在现实世界中为人们提供帮助的时候。在这里,“盲点”发生在监控工具未能发现 AI 正在偏离航道时。例如,如果 AI 开始随着时间的推移给出略有不同的答案(漂移),或者它提取信息的数据库已过时,AI 可能会给出错误的建议。但如果监控系统只检查 AI 是否“在线”而不是是否“崩溃”,它就看不见这个错误。论文指出,在我们研究的现实案例中,53% 的事件是完全沉默的。没有报警器响起,没有错误信息弹出。这些失败只有在人类受伤或律师受到制裁时才被发现。

AI 出错(且保持沉默)的六种方式

为了帮助我们理解这些不可见的失效,作者创建了一个“分类法”(taxonomy),这只是一个分类系统的专业术语。他们将 50 个现实世界的 AI 失效案例归入了六个类别。把这些想象成机器人厨师在传感器没察觉的情况下搞砸厨房的六种不同方式:

  • C1:模型漂移(Model Drift,缓慢衰减): AI 随着时间的推移逐渐改变其行为,就像广播电台的频率缓慢偏移,直到音乐听起来很奇怪。AI 并没有进行软件更新,它只是发生了漂移。这通常是沉默的,因为 AI 仍在“工作”,只是表现得不同了。
  • C2:基础设施(Infrastructure,坏掉的烤箱): AI 本身没问题,但运行它的计算机或服务器出了问题。也许烤箱太热了,或者电源在闪烁。这些通常容易发现,因为系统会崩溃或变慢,所以它们通常不是“盲目”的。
  • C3:集成(Integration,拙劣的翻译官): AI 正在与其他部分(如数据库或工具)进行通信,但它们之间产生了误解。也许 AI 请求一份食谱,但数据库发回的是去年的配料表。AI 随后用旧配料进行烹饪。这通常是沉默的,因为 AI 认为自己完全按照指示在操作。
  • C4:评估(Evaluation,坏掉的尺子): 这是最具有元属性且最危险的一种。用于检查 AI 的工具本身坏了。这就像是用一把被拉长了的尺子去测量桌子;桌子看起来比实际要短。如果你的“质量检查”坏了,你可能会认为 AI 很完美,而它其实很糟糕。论文发现,这一类别的所有失效在定义上都是沉默的,因为原本应该捕捉错误的那个东西本身就是坏的。
  • C5:安全与合规(Safety & Compliance,违法的食谱): AI 违反了规则,比如提供它不被允许提供的医疗建议,或编造虚假的法律案例。论文强调了一个著名的案例,一名律师使用 AI 编写了一份包含六个虚假法院案例的法庭陈述书。AI 做了它被要求做的事,但人类没有核实事实。在法官发现之前,这一失效是沉默的。
  • C6:运营(Operational,缺失的操作手册): AI 和计算机都没问题,但运行 AI 的人员没有应对突发情况的计划。没有清单,没有警报,也没有人知道该找谁。这是流程的失败,而不是机器的失败。

沉默的大多数

论文的一个最大发现有点可怕:在我们研究的现实世界 AI 失效案例中,53% 是沉默的。 这意味着在超过一半的时间里,系统并没有大喊“我坏了!”,它们只是继续运行,做着错误的事情,直到有人注意到损害。

论文认为,我们看待 AI 失效的方式错了。我们倾向于问:“这个模型足够聪明吗?”但真正的问题应该是:“我们的测量系统足够聪明,能在模型出错时发现它吗?”作者建议,我们需要将我们的监控工具视为系统的一个关键组成部分,就像汽车的引擎一样。如果引擎很棒但测速计坏了,你仍然处于危险之中。

“失效预算”

为了解决这个问题,作者提出了一个新概念,叫做失效预算(Failure Budget)。想象一下,根据你正在做的事情,你每天被允许犯一定数量的错误。

  • 如果你在做一些危险的事情,比如决定谁能获得贷款或提供医疗建议(称为决策关键型/Decision-Critical),你的预算极小。你可能每 1,000 次请求只允许 1 次错误。一旦达到限额,你就必须停止并修复问题。
  • 如果你在做一些风险较低的事情,比如公司的内部搜索工具(称为内部生产力型/Internal Productivity),你可以承受更多的错误,比如每 1,000 次请求 20 次。
  • 如果你只是在实验室进行实验(称为实验型/Experimental),你可以犯很多错误,比如每 1,000 次请求 100 次,因为没有人会因此受伤。

这个框架迫使团队在构建 AI 之前做出决定:“我们愿意承担多少风险?”以及“我们是否有合适的工具来捕捉该水平的错误?”这不仅仅是让 AI 变得更聪明,更是要建立一个与任务危险程度相匹配的安全网。

为什么这很重要

论文总结道,“评估盲点”是 AI 安全性的隐形敌人。无论是训练代码中的 Bug 导致 AI 学到了错误的教训,还是监控系统未能发现安全违规,结果都是一样的:系统发生了沉默失效。

作者并不是说 AI 前景黯淡。相反,他们是在说我们需要改变思维方式。我们不能只关注让 AI 变得更聪明,我们必须关注让我们的“体检”工具变得更聪明。我们需要构建能够检测 AI 是否发生漂移、数据是否过时或规则是否被违反的系统。并且我们需要在 AI 生命的每一个阶段都做到这一点,从它训练的第一天到它工作的最后一天。

通过使用“失效预算”并理解这六种失效类型,我们可以不再等待灾难发生后才意识到我们的 AI 从头到尾都是盲目的。这是对工程师、律师以及任何构建 AI 的人的行动号召:检查你们的尺子,修复你们的盲点,并确保你们的安全网足够强大,能够接住那些看不见的坠落。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →