What AI Red-Team Evaluations Can and Cannot Prove
本文为人工智能红队评估建立了一个可计算的“证据天花板”,证明了虽然目前的基准测试可以有效地证明高频危害的安全性,但由于固有的统计局限性,它们在证明罕见灾难性风险的安全性方面存在根本性的不足。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图破解谜题的侦探,谜题是:“这个新机器人是否安全到可以释放到现实世界中?”为了找出答案,你不仅仅是要求机器人说“我很乖”;而是会让它经历一系列棘手的测试,就像一场红队演习(red-team exercise),试图诱导它说出一些恶意或危险的话。这就是 AI 安全评估的世界。但问题在于,你需要尝试多少次诡计,才能确定这个机器人是安全的?如果你尝试了 10 次诡计而它都通过了,这足够了吗?如果机器人在一百万次尝试中仅有一次表现危险呢?
这就是统计学发挥作用的地方。把它想象成黑暗房间里的一把手电筒。一个小手电筒(一个小规模测试)可以轻易照出地板上一个巨大的、明显的石头(频繁出现的错误)。但如果危险是一个极其微小、几乎看不见的尘埃,偶尔才会出现,那么同样的小手电筒可能会完全错过它,即使那粒尘埃确实存在。科学家们长期以来一直在争论这些 AI “安全测试”究竟是有用的,还是仅仅在浪费时间。有人说它们证明不了任何事;也有人说它们证明了一切。本文通过做一件非常具体的事情介入了这场争论:它计算了手电筒需要多亮,才能看到不同大小的尘埃。
这篇由 APIsec Research Labs 的 Bandana Kaur 撰写的论文认为,安全测试并非毫无用处,但它们也不是魔杖。它们有一个证明能力的硬性极限,而这个极限是一个数学问题,而非观点问题。作者使用了一个叫做“证据天花板”(evidential ceiling)的概念。想象一下你有一个只能装一定量水的桶。如果你试图证明漏水是“很小”的,那么一桶满水(零失败的干净测试)是非常有说服力的。但如果你试图证明漏水是“极微小”的(比如某种罕见的、灾难性的故障),那么同样的这桶水可能太小了,无法捕捉到足够的证据来确保万无一失。
该论文的主要发现是,存在一个可计算的“交叉点”。如果一种伤害发生的频率足够高(例如发生率为 1%),那么大约 520 个提示词(prompts)的标准测试就足以得出结论:“好的,这个模型可能足够安全,可以部署。”事实上,如果你运行了 520 次测试且未发现任何问题,这实际上比发现一个问题更有力。这就像是在寻找一个干净的房间:如果你预期到处都是细菌,那么一个干净的房间会是一个巨大的惊喜,并证明某些东西正在起作用。
然而,论文为罕见事件划定了一条明确的界限。如果一种有害行为极其罕见(例如发生率低于 0.001%),那么无论你在合理的预算内尝试多少个提示词,一份“白纸”(零失败记录)几乎无法告诉你任何信息。数学表明,对于这些罕见的、灾难性的风险,一份干净的测试结果是微弱的证据,因为干净的测试可能只是运气好。在这一领域,一次观察到的失败实际上比一份干净的测试更具信息量,因为干净的测试可能只是运气使然。论文计算出,对于这些罕见事件,目前的公开基准测试“在数量级上都远远不够”——这意味着它们比证明安全性所需的规模小了数千倍。
作者还指出,这些测试的构建方式至关重要。如果测试问题都非常相似(比如用稍微不同的措辞问同一个问题),那就好比是在找草堆里的针,却只检查了房间的一个角落。论文指出,目前的测试往往聚集在一起,使得它们看起来比实际效果要好。此外,论文反对仅仅通过“增加”测试数量来解决问题的想法。相反,我们需要更聪明的测试,能够更好地区分安全模型与不安全模型。如果一个测试能 90% 地诱骗一个坏模型,但只能 10% 地诱骗一个好模型,那么它就是一个强大的工具。但如果它对两者都同样有效,那么无论运行多少次,它都是没用的。
最后,论文提出了一套关于 AI 实验室应如何报告其结果的新规则。他们不应该只是说“我们运行了 500 次测试且没有发现坏情况”,而应该准确报告他们的测试究竟能证明什么。如果伤害率较高,他们可以声称安全性。如果伤害率极低且罕见,他们应该承认他们的测试无法证明安全性,并且需要其他类型的证据。论文并不是说我们应该停止测试;而是说我们应该停止假装我们的测试可以证明那些在数学上无法证明的事情。这是一个关于诚实的呼吁:了解你手电筒的极限,不要在只照亮了一个角落的情况下,就声称你看到了整个房间。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。