← 最新论文
💻 computer science

How Should AI Safety Benchmarks Benchmark Safety?

本文通过回顾 210 个 AI 安全基准测试,旨在识别其技术与认识论方面的缺陷,并提出了一套以成熟的风险管理和测量理论为基础的路线图,以开发更具效度、鲁棒性且负责任的安全评估框架。

原作者: Cheng Yu, Severin Engelmann, Ruoxuan Cao, Dalia Ali, Orestis Papakyriakopoulos

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Cheng Yu, Severin Engelmann, Ruoxuan Cao, Dalia Ali, Orestis Papakyriakopoulos

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位试图为新一代超级智能机器人评分的老师。你想知道它们是否安全,可以被释放到现实世界中,或者它们是否可能会(无意中或故意地)制造麻烦。为了做到这一点,你给它们进行了一系列测试,就像是人工智能的驾驶执照考试。在计算机科学领域,这些测试被称为“基准测试”(benchmarks)。把基准测试想象成一个标准化的障碍赛跑:如果一个机器人能够跳过障碍、解决谜题并避开陷阱,我们就假设它已经为现实世界做好了准备。但问题在于,仅仅因为一个机器人擅长跳过你设置的特定障碍,并不意味着它不会被你没放在赛道上的香蕉皮绊倒,也不意味着它不会因为觉得无聊而决定放一把火。这篇论文深入探讨了 AI 安全测试中混乱且复杂的世界,认为我们目前的“障碍赛跑”往往过于简单、过于僵化,有时甚至完全偏离了真实危险的本质。

这篇论文的作者们——来自慕尼中理工大学和康奈尔大学等研究机构的一个研究团队——决定对 AI 安全测试现状进行一次大规模的审视。他们不仅仅是窥视了几个测试,而是审查了研究人员创建的 210 个不同的安全基准测试。他们想看看这些测试是否真的在有效地保护我们,还是仅仅给了我们一种虚假的安全感。

这里有一个大问题:大多数测试关注的对象都错了。 他们发现,81% 的基准测试只检查我们已经知道并见过的风险,比如“有毒”语言或简单的诱导 AI 违反规则的技巧(称为“越狱”)。这就像是只在平坦笔直的赛道上测试一辆汽车,就假设它在泥泞的山路上也能应对自如一样。这些测试完全忽略了那些怪异、不可预测且全新的 AI 出错方式,作者称之为“未知的未知”(unknown unknowns)。

此外,这些测试衡量安全性的方式在数学逻辑上也往往站不住脚。论文指出,79% 的基准测试将安全性视为一个简单的“通过或失败”的开关。它们统计 AI 拒绝了多少次不当请求,并将其称为“安全得分”。但作者认为这是误导性的。仅仅因为 AI 在测试中 90% 的情况下拒绝了请求,并不意味着它在现实世界中就有 90% 的安全性。这就像是说一座桥是安全的,因为它在微风中屹立不倒,却不去检查它是否能承受飓风。这些测试往往忽略了如果 AI 失败了,其造成的伤害会有多严重,也未考虑到现实生活中人们询问这些危险问题的频率。

研究人员还发现,测试与现实之间的联系往往是断裂的。他们称之为“代理链”(proxy chain)。想象一下,你想知道一名学生是否是一名优秀的驾驶员,于是你在模拟器上测试他停车的技术。这就是一个“代理”。但如果模拟器没有考虑到雨天、其他车辆或学生因玩手机而分心,那么测试结果并不能告诉你他在高速公路上是否真的安全。论文认为,许多 AI 安全测试就像那个模拟器:它们测量的是“拒绝率”或“关键词匹配”等指标,但这些数字并不总能转化为现实世界的伤害。

那么,作者建议我们该怎么做呢?他们提出了一个包含 10 项建议 的新路线图,以修复这些破碎的测试。

首先,他们说我们需要停止仅仅测试我们已知的东西。我们需要构建能够主动搜寻 AI 可能出现的新奇、怪异且不可预见失效方式的测试。他们建议使用能够不断尝试以新方式破坏 AI 的工具,而不是仅仅固守一份固定的问题清单。

其次,我们需要更精准的数学。与其仅仅说“通过”或“失败”,我们应该计算实际的风险。这意味着要问:“这种坏事发生的可能性有多大?”以及“如果发生了,后果会有多严重?”作者建议使用一种被称为“概率风险评估”(Probabilistic Risk Assessment)的方法,这种方法被广泛应用于核能和航空领域。他们甚至展示了一个计算过程:一个模型在测试中看起来很安全,但当你考虑到用户的使用量以及人们询问危险问题的频率时,其实际风险要高得多。

第三,我们需要确保我们的测试确实在测量它们声称要测量的东西。这意味着要非常明确地定义在特定情境下的“安全性”含义,并确保测试反映了现实世界,而非仅仅是一个干净的人造实验室。他们还认为,我们需要让可能受到 AI 影响的人群参与进来——比如青少年、患者或特定社区——来帮助设计测试,因为他们最清楚什么样的伤害对他们而言是真实的。

为了证明他们的想法有效,团队构建了一个针对 AI 如何与青少年谈论心理健康的小型示例测试。他们不仅询问 AI 是否了解规则,还模拟了真实的对话,并根据青少年实际使用这些工具的频率计算了潜在的伤害。结果显示,即使是那些在标准测试中显得“安全”的模型,一旦考虑到现实世界的数字,仍然可能造成显著的问题。

最后,这篇论文并不是在说 AI 注定失败,也不是说我们无法对其进行测试。它是在说,我们目前的测试方法就像是用尺子去测量汤的温度——它们是错误的工具。为了真正确保 AI 的安全,我们需要停止将安全性视为一个简单的清单,而要开始将其视为一个复杂的、活生生的系统,这个系统会变化、会带来惊喜,并且需要我们去思考现实世界,而不仅仅是试管里的实验。作者建议,通过采用这些更严谨、更以人为本的测试方式,我们可以构建出不仅聪明而且真正安全的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →