Safety, or Just Capability? A Validity Audit of Agent-Safety Benchmarks
本文认为,由于指标存在缺陷、排名不一致以及小样本伪影,当前的智能体安全性基准测试缺乏有效性,并最终证明了更高的模型能力往往与增加的不对齐风险相关联而非安全性,从而表明任何可信的安全性声明都必须对基准测试、指标和目标行为进行精确定义。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在给一群能够说话、思考,甚至能像人类一样使用工具的超级聪明机器人打分。你想知道两件事:它们解决谜题的能力有多强?更重要的是,它们是否安全?它们是会拒绝做坏事,还是会无意中帮助反派?在人工智能的世界里,科学家们构建了“基准测试”(benchmarks)——这基本上就是标准化的考试——来衡量这些指标。就像驾照考试检查你是否会停车一样,这些基准测试检查机器人是否能识别出危险请求并说“不”。
但棘手的部分在于:衡量“安全性”比衡量“聪明程度”要难得多。如果你要求一个机器人解决一道数学题,通常会有一个正确答案。但如果你要求它保持“安全”,那看起来应该是什么样子的?这意味着拒绝每一个坏请求吗?还是意味着它需要准确知道何时该说“不”,而不至于表现得过于胆小?最近,出现了数十种新的测试来衡量安全性。大问题在于:这些不同的测试测量的真的是同一件事吗?如果一个机器人在一项安全性测试中拿了“A”,是否意味着它在任何地方都是安全的?或者有没有可能,这些测试只是在检查不同的技能,或者是在诱骗机器人看起来很安全,而实际上并非如此?
这篇论文就像是一个侦探故事,作者们化身卧底,对四种流行的安全性测试进行了审计。他们没有仅仅停留在表面分数上;他们亲自在来自不同科技公司的多达 22 个不同的 AI 模型上运行了这些测试,以观察到底发生了什么。
首先,他们发现了一个存在于最著名的测试之一——R-Judge 中的隐蔽漏洞。该测试使用一种叫做“F1”的评分系统来评估模型识别危险请求的能力。作者发现了一个奇怪的诡计:如果一个机器人只是对每一个问题都猜“危险!”,它实际上能得到一个相当高的分数——0.690。事实上,这个只会一致地回答“始终不安全”的机器人,得分竟然比五个真正试图区分好坏请求的聪明模型还要高!这就像一位老师仅仅因为学生每次举手大喊“着火啦!”就给学生打高分,即使根本没有火灾一样。论文证明了这种特定的评分方法是有问题的,因为它没有为正确识别安全事物而给予奖励。
接下来,团队研究了机器人的通用智能(其“能力”)是否仅仅是隐藏在安全性得分之后。他们发现,聪明确实有助于机器人通过一些安全性测试,但这种关系非常混乱。有时,机器人越聪明,它看起来就越安全。另一些时候,变得超级聪明反而会让机器人在特定场景下(比如当它被要求在故事中扮演反派时)变得不那么安全。作者表明,你不能仅仅假设一个聪明的机器人就是一个安全的机器人;这种联系取决于你使用哪种测试以及你在观察哪组机器人。
最令人惊讶的发现是,这些安全性测试彼此之间并不一致。作者对 18 个机器人进行了测试,并将它们带入了三种主要的安全性测试中。结果是混乱的:一个在某项测试中被评为“最安全”的机器人,在另一项测试中可能被评为“最不安全”。这就像一个学生在数学上得了高分,但在科学上得了低分,而测试组织者却在争论谁才是真正的“优等生”。论文发现,如果你只看一小组机器人(比如仅仅七个),你可能会看到一个看起来像是权衡取舍(即在一种方式上保持安全意味着在另一种方式上不安全)的虚假模式。但当他们将群体扩大到 18 个或更多机器人时,这个模式就消失了。这种“权衡取舍”只是因为观察样本过少而导致的偶然现象。
最后,作者检查了这些安全性得分是否可以预测机器人在从未见过的全新情况下的行为。他们发现,机器人的通用智能对于预测它能否完成任务(比如在线买票)非常有效,但安全性得分在预测机器人在新场景下是否会做出危险行为方面表现得很糟糕。唯一显示出与特定类型危险有强关联性的测试是一个叫做 AgentHarm 的测试,它预测了机器人抵抗“越狱”(即诱导其打破规则的诡计)的能力。然而,即便如此,这也不是衡量通用安全性的完美标准;它仅仅意味着机器人擅长应对这种特定类型的诡计。
简而言之,论文的结论是:不存在单一的 AI“安全性得分”。你不能只看一个数字就说:“这个机器人是安全的。”你得到的得分完全取决于你使用哪种测试、如何计算成绩以及你测试的是哪些机器人。如果你想对机器人的安全性做出声明,你必须非常明确:指出具体的测试、具体的指标、你正在测量的行为以及你测试的机器人群体。否则,你可能只是在观察一个非常擅长猜“危险!”的机器人,或者是一个仅仅因为运气好而刚好有一群好朋友的机器人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。