SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing
本文介绍了 SafePyramid,这是一个包含 1,000 场多轮对话和 3,000 条特定应用策略的分层基准测试,用于评估上下文中的策略护栏能力,研究表明即使是尖端模型在准确识别安全违规以及适应不同复杂度水平的新型策略框架方面也存在困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是某座大型高科技大楼的安全主管。过去,你的保安(AI 模型)接受的是基于固定、僵化规则手册的训练:“禁止携带武器”、“禁止大声喧哗”、“禁止闲逛”。如果有人违反这些规则,保安就会阻止他们。这被称为固定分类护栏(Fixed-Taxonomy Guardrailing)。它在处理通用安全问题时效果很好,但对于现实生活来说过于僵化。
有时,一位 VIP 客人需要进入限制区域(一种“专业建议”场景),或者施工队需要通过走廊移动重型机械(一种“关键基础设施”场景)。这些特定情况下的规则会随着时间、人物和语境的变化而改变。你不能每当情况发生变化时就重写整个大楼的安全手册;你需要一个能够阅读在入口处递交给他们的新的、临时性的规则表并完美执行的保安。
这就是论文中所说的上下文策略护栏(In-Context Policy Guardrailing)。
来自字节跳动和墨尔本大学的研究人员意识到,虽然我们拥有优秀的 AI 保安,但我们并不真正了解它们是否擅长阅读这些新的、临时性的规则表。因此,他们构建了一个巨大的测试场,名为 SafePyramid。
SafePyramid 测试:一座三层建筑
为了测试这些 AI 保安,研究人员构建了一个看起来像具有三个难度等级的金字塔形式的基准测试。把它想象成一个有三个越来越难的关卡的电子游戏:
第 0 级:“识别违规”游戏(理解能力)
想象一名保安被给予一份包含 20 条规则的清单。其中一些规则与正在进入的人相关(例如,“禁止携带狗”),而另一些则是干扰项(例如,“大堂内禁止游泳”,尽管那里并没有泳池)。
- 测试内容: 保安能否观察这个人及其对话并得出结论:“好的,他们带了一条狗,所以违反了第 3 条规则。但他们并没有在游泳,所以第 15 条规则没有问题”?
- 挑战: 许多 AI 保安会被干扰项搞混,或者忽略实际违规行为中的微妙细节。
第 1 级:“规则手册逻辑”游戏(依赖关系)
现在,规则变得复杂了。假设有一条规则说:“禁止携带狗”。但存在第二条规则:“除非这只狗是经过认证的服务性动物。”
- 测试内容: 保安必须理解第一条规则通常成立,但第二条规则可以在满足特定条件时抵消第一条规则。或者,一条规则可能说,“你可以带狗来”,除非“这只狗叫得很吵”。
- 挑战: AI 必须同时处理多条规则。如果它看到一只狗,它不能直接说“违规!”,它必须检查“服务性动物”这一例外情况是否适用。研究发现,大多数 AI 保安在这里会感到非常困惑,它们要么遗漏了例外情况,要么错误地应用了这些例外情况。
第 2 级:“外语”游戏(新颖框架)
这是最难的一级。想象一名保安被给予一本用完全虚构的语言(如“OGCP 协议”或“遏制验证”)编写的规则书,其中包含虚构的词汇。保安从未见过这些词。他们不能依赖他们的训练或常识;他们必须严格按照规则书中给出的定义来执行。
- 测试内容: 保安能否即时学习一套新的法律,并在不犯错的情况下执行这些法律?
- 挑战: 这是 AI 保安表现最差的地方。即使是最智能的模型也会在新的术语中迷失方向,无法正确应用规则。
结果:保安们仍在学习中
研究人员将世界上 10 个最智能的 AI 模型(“前沿 LLM”)和 5 个专门的安全模型置于这个金字塔测试中。
以下是坏消息:这些保安还没有准备好上岗。
- 在简单级别(第 0 级)上: 最好的 AI(GPT-5.5)仅在约 54% 的情况下能完全正确识别出所有的违规行为。对于一项复杂的任务来说,这仅仅比抛硬币决定胜负好一点点。
- 在中间级别(第 1 级)上: 成功率下降到了 35%。
- 在困难级别(第 2 级)上: 成功率骤降至 13%。
这就像给学生做数学测试。他们可能能做对简单的加法题,但一旦引入代数(依赖关系),然后切换到一套全新的数学符号系统(新颖框架),他们就开始表现得一塌糊涂。
为什么会失败?
论文深入研究了 AI 失败的原因,发现了他们思维中的三个主要“漏洞”:
- 关键词嗅探(Keyword Sniffing): AI 看到“狗”这个词,就会立即认为“违规!”,而不会检查这条规则是否真的适用于这只特定的狗,或者是否存在例外情况。这就像一名保安拦截所有戴帽子的人,却忽略了“儿童不得戴帽”的例外规定。
- 在例外情况中迷失(Losing the Plot on Exceptions): 当规则说“禁止携带狗,除非它是服务性动物”时,AI 经常会忘记“除非”这个部分。它看到了狗,然后就拦截了那个人,忽略了细微差别。
- 在新词汇中迷失(Getting Lost in New Words): 当规则是用一种新的、虚构的框架编写时(第 2 级),AI 会感到困惑。它们会将规则本身视为违规行为,而不是利用规则来进行判断。这就像一个学生在拿到一本新字典时,开始死记硬背定义,而不是利用这些定义来理解故事。
解决方案是什么?
论文指出,仅仅让 AI 变得更“聪明”是不够的。目前这种要求 AI 阅读整页规则并吐出违规列表的方法难度过高。
相反,研究人员发现,如果将任务分解——要求 AI 一次只检查一条规则,然后汇总答案——性能会有显著提升。这就像给保安一份清单,让他们逐项进行检查,而不是要求他们一次性记住整个大楼的安全政策。
他们还发现,使用“智能体夹具”(Agent Harnesses,类似于有一个 AI 助手团队协助主保安检查工作)可以显著提高结果。
核心结论
SafePyramid 是一个警钟。虽然 AI 在聊天和写作方面表现惊人,但目前它们在作为一个严格的、能够根据新规则即时调整的规则执行者(保安)方面表现得很差。我们需要构建更好的系统,使其能够处理复杂的规则依赖关系并即时学习新框架,否则我们无法信任它们在现实应用中保护我们的数字空间。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。