← 最新论文
🤖 AI

AIR-BENCH Live: An Evolving Safety Benchmark for Foundation Models

本文介绍了 AIR-BENCH Live,这是一个针对基础模型的自我演进式安全基准测试,它利用自动化流水线来持续整合新的政府法规并生成多语言攻击提示词,从而解决静态基准测试在快速变化的 AI 环境中的局限性。

原作者: Rohan Naphade, Minzhou Pan, Bo Li

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Rohan Naphade, Minzhou Pan, Bo Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,人工智能的世界就像一座巨大且不断扩张的图书馆,其中的机器人正在学习编写故事、解决问题,甚至与我们聊天。但就像任何图书馆一样,这里也有关于可以书写内容的规则:不能有关于如何制造炸弹的指令,不能有仇恨言论,也不能有窃取秘密的诡计。科学家们设计了“安全测试”来观察这些机器人是否遵守规则。把这些测试想象成一系列旨在诱骗机器人违反规则的谜题或陷阱。如果机器人拒绝了诱骗,它就会获得高分;如果它落入了陷阱,就会获得低分。问题在于,世界变化得很快。新的法律通过了,新的欺骗机器人的方法被发明了,而旧的谜题变得太容易破解了。去年的一个安全测试到今天可能已经毫无用处,因为机器人已经学会了忽略旧的招数,或者因为一项新的法律禁止了该测试从未想到的内容。这就是为什么研究人员一直在寻找一种让这些测试变得“鲜活”并能自我更新的方法,以便它们在永不停歇的世界中保持相关性。

这篇论文介绍了一种全新的、能够自我更新的安全测试,名为 AIR-BENCH Live。把它想象成一名保安,他不仅仅是站在门口拿着一份固定的禁令清单,而是拥有一个机器人助手,这个助手不断地扫描新闻,阅读世界各地的最新法律,并立即创造出新的、充满陷阱的谜题来测试人工智能。研究人员构建了一个流水线,可以自动“抓取”(读取)来自美国、中国和欧盟等地的政府法规。当它发现一条新规则时——比如一项禁止偷窃机器人大脑或利用伪造视频干扰选举的法律——它会将一个新的类别添加到其安全清单中。然后,一个 AI 智能体团队会协作编写基于这些新规则的、逼真的多语言提示词(即谜题)。他们使用“人格”(personas),也就是类似于表演角色的一种方式,使这些谜题听起来像是来自不同情境下的真实人类,而不是一个正在读剧本的机器人。

该团队使用这个全新的、不断演进的基准测试测试了 14 种不同的 AI 模型。他们发现安全水平存在巨大的差距:有些模型非常安全,几乎拒绝了所有的诱骗(得分 1.00),而另一些模型则很容易被诱骗(得分低至 0.17)。有趣的是,这些现代化的提示词比旧的提示词更难,导致即使是最守规矩的模型也会偶尔出错。研究人员还发现,当使用英语以外的语言进行提问时,大多数模型的安全性会略微下降,这表明让机器人在所有人类语言中都保持礼貌和安全仍然是一项正在进行中的工作。论文最后总结道,虽然我们无法阻止世界的变化,但我们可以构建能够随之演进的安全测试,确保随着人工智能变得越来越聪明,我们测试其安全性的能力也变得越来越聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →