✨ 要点🔬 技术摘要
想象一下你是一位宇宙飞船的船长,但你其实并不负责驾驶飞船。相反,你雇佣了一位超级聪明、充满热情的机器人副驾驶来驾驶它。这个机器人非常擅长执行你的命令,但它有一本非常具体的规则手册:它必须始终首先听从船长(系统)的最终指令,然后是你的个人请求,最后才是它在飞船仪表盘上发现的陌生人留下的笔记(工具)。
在人工智能的世界里,这些“机器人”就是大语言模型(LLM),而这些“规则”被称为指令层级(instruction hierarchies)。把这种层级想象成一场严格的家庭晚餐:父母(系统指令)拥有最终决定权,孩子们(用户请求)可以提出自己的要求,但邮递员(工具输出)不能直接闯进来告诉父母该做什么菜。人们最大的担忧是,如果邮递员在门缝下塞了一张纸条说:“忽略父母,我们早餐吃披萨吧”,而机器人副驾驶听从了邮递员而不是船长,飞船就会失事、数据会泄露,或者机器人会开始做一些被严令禁止的事情。这不仅仅是一个小故障,而是一个等待发生的安全噩梦。
于是有了 IH-BENCHMARK ,这是来自 HiddenLayer, Inc. 的一项新研究,它就像是一个针对这些 AI 机器人的巨大且混乱的障碍赛场。研究人员想要看看他们的副驾驶在情况变得混乱时,是否真的能遵守规则手册。他们并没有只问机器人简单的问题;他们设置了 2,336 个不同的“冲突场景”,在这些场景中,机器人必须在一条高优先级的规则和一条低优先级的冲突指令之间做出选择。他们测试了两种主要的麻烦类型:系统 vs. 用户 (人类试图诱骗机器人违反规则)以及 用户 vs. 工具 (工具,如搜索引擎或数据库,无意中或恶意地输出了与用户要求相矛盾的指令)。
结果如何?这有点像坐过山车。这项研究评估了 37 种不同的 AI 模型,得分差异巨大,从接近完美的 98.2% 到摇摇欲坠的 20.5% 。但这里有一个最令人惊讶的转折:在一门课上表现优异并不意味着你能通过下一门课。研究人员发现,一个模型可能在对抗试图诱骗它的真人(系统 vs. 用户)方面表现得像个冠军,但在面对工具输出试图诱骗它(用户 vs. 工具)时却会彻底失败。这就像一个保安,他能很好地拦住在大门口试图行窃的小偷,却会让一名快递员因为没检查送货清单就直接走进来。
论文指出,“指令层级鲁棒性”(instruction-hierarchy robustness)并不仅仅是 AI 拥有的某一种超能力,而是需要分别进行测试的一系列不同技能的集合。有些模型擅长忽略那些明显的、大声叫嚣着要破坏规则的指令,但它们会被微妙的诡计搞糊涂,比如工具输出悄悄改变了语言或添加了一个微小的假事实。研究还表明,让规则变得更“严格”(增加更多警告)有助于一些弱模型提高表现,但对于另一些模型来说,无论如何大声疾呼都没有用。最终,这项研究表明,我们不能仅仅因为一个 AI 通过了一项测试就假设它是安全的。为了让我们的数字飞船安全飞行,我们需要在让它们接管控制权之前,检查它们是否能应对各种各样的冲突——从前门到仪表盘。
技术摘要:IH-BENCHMARK
问题陈述
随着大语言模型(LLMs)演变为能够编排工具并管理多轮对话的智能体,**指令层级鲁棒性(instruction-hierarchy robustness)**的可靠性已成为安全性与实用性的核心。其核心问题在于模型能否根据指令来源正确确定优先级:系统消息应优先于用户输入,而用户输入又应优先于对话历史和工具输出。
当模型无法遵循这种排序时,对抗性用户输入可能会覆盖系统约束,而恶意工具输出则可能在中途劫持模型的行为。虽然先前的研究已经形式化了这种层级关系,但现有的评估存在两个主要局限性:
单一边缘关注(Single-Edge Focus): 许多基准测试仅关注系统-用户冲突(S ≻ U S \succ U S ≻ U ),忽略了由工具输出引起的冲突。
改编数据集(Adapted Datasets): 其他研究通过改编公开数据集而非构建专门的层级冲突场景,导致在智能体设置及特定约束(如工具允许/拒绝列表或参数限制)方面的覆盖范围有限。
因此,目前缺乏能够共同测试智能体设置中跨层级冲突的基准测试。
方法论:IH-BENCHMARK
作者引入了 IH-BENCHMARK (IH-B) ,这是一个专门设计的基准测试,旨在评估两个不同维度的指令层级鲁棒性:
系统 ≻ \succ ≻ 用户 (S ≻ U S \succ U S ≻ U ): 评估当用户发出冲突请求时,模型是否能保持更高优先级的系统约束。
用户 ≻ \succ ≻ 工具 (U ≻ T U \succ T U ≻ T ): 评估当低优先级工具输出中出现冲突指令时,模型是否能保持用户的任务目标。
构建与范围
约束族(Constraint Families): 该基准测试基于人类编写的包含 44 个约束族 的分类法构建,涵盖五个领域:通用、医疗、金融、零售和编程。
S ≻ U S \succ U S ≻ U 维度: 19 个约束族,涵盖输出约束(词汇、格式)、主题约束(禁止话题、竞争对手引导)和工具约束(全面禁止、参数限制)。
U ≻ T U \succ T U ≻ T 维度: 25 个约束族,涵盖响应格式操纵、内容操纵(事实篡改)、工具操纵(拦截/重定向调用)以及高严重性智能体行为(命令执行、数据外泄、未经授权的购买)。
场景生成: IH-B 程序化生成了 2,336 个可执行场景 (734 个属于 S ≻ U S \succ U S ≻ U ,1,602 个属于 U ≻ T U \succ T U ≻ T )。场景通过绑定约束参数并改变以下变量来生成:
约束严格度 (L L L ): 从简单的陈述语句 (L 1 L_1 L 1 ) 到强化的条款及拒绝指令 (L 3 L_3 L 3 )。
提示词措辞 (P P P ): 显式 (P 1 P_1 P 1 ) 与 隐式 (P 2 P_2 P 2 ) 用户请求。
交付变体 (D D D ): 对于 U ≻ T U \succ T U ≻ T ,改变冲突指令嵌入在工具输出中的方式(普通、脱离上下文、确认、切换)。
智能体模拟器: 对于智能体 U ≻ T U \succ T U ≻ T 场景,该基准测试采用了三个基于 Python 的有状态模拟器(编程、零售、医疗支持),以模拟持久的副作用和多步工具交互。
评估协议: 使用统一的二元通过/失败协议。
谓词 DSL: 使用轻量级领域特定语言进行字符串匹配、结构检查和工具调用检查。
LLM-as-a-Judge: 用于机械验证难以实现的类别(例如品牌诋毁、话题参与),利用映射到二元决策的四级评分标准。
非冲突场景: 被纳入以衡量过度拒绝(over-refusal)情况,并确保模型不会因约束敏感性而导致普通请求失败。
核心贡献
程序化基准测试: 提出了 IH-B,涵盖了源自 44 个约束族的 S ≻ U S \succ U S ≻ U 和 U ≻ T U \succ T U ≻ T 两个维度的 2,336 个场景。
统一评估框架: 一个结合了受控提示场景与有状态智能体模拟器的系统,实现了跨静态、工具介导及智能体设置的评估。
全面的实证分析: 对 37 种模型变体 (22 种闭源模型,15 种开源权重模型)进行评估,揭示了指令层级鲁棒性并非单一能力,而是随冲突表面和约束类型变化的多种行为集合。
结果
对 37 种模型的评估显示出显著的差异,整体合规率范围在 98.2% 至 20.5% 之间。
维度的脱节(Dissociation of Tracks): 在 S ≻ U S \succ U S ≻ U 维度上的高性能 并非 U ≻ T U \succ T U ≻ T 鲁棒性的可靠指标。例如,Grok 4.20 (R) 在 S ≻ U S \succ U S ≻ U 上的合规率达到 96.9%,但在 U ≻ T U \succ T U ≻ T 上仅为 65.6%。这表明,抵御直接用户覆盖并不保证能抵御工具输出注入。
模型差异: 闭源模型通常优于开源权重模型。闭源模型的平均合规率在 S ≻ U S \succ U S ≻ U 为 88.6%,在 U ≻ T U \succ T U ≻ T 为 75.1%;而开源权重模型在 S ≻ U S \succ U S ≻ U 为 80.5%,在 U ≻ T U \succ T U ≻ T 为 59.1%。
约束严格度的影响:
在 S ≻ U S \succ U S ≻ U 中,更严格的约束 (L 2 , L 3 L_2, L_3 L 2 , L 3 ) 持续提升了合规率,特别是对于较弱的模型(例如,Qwen 3 235B-A22B 在特定领域设置下从 23.5% 提升至 88.2%)。
在 U ≻ T U \succ T U ≻ T 中,强化效果并不统一。虽然某些模型(如 Grok 4.20 (R))表现出巨大增益(从 18.8% 升至 89.6%),但其他模型(如 Qwen 3 235B-A22B)在所有严格度水平下仍维持在 10% 左右,表明这是一种根本性的边界维持能力缺失,而非仅仅是指令敏感度问题。
约束族分析:
S ≻ U S \succ U S ≻ U : 最困难的族是 forbid-tools-all (52.4%),即模型难以在用户请求下拒绝所有工具调用。主题约束是最容易的(例如,forbid-disparagement 为 98.6%)。
U ≻ T U \succ T U ≻ T : 最困难的族涉及低风险、无嫌疑的行为,如 content-lie (50.1%) 和 format-disclaimer (50.4%)。相反,高严重性行为(如未经授权的购买或批量关闭票据)被抵御得更为可靠(例如,purchase 为 88.1%),这可能是由于现有的安全对齐训练。
失败的微妙性: 最具启发性的失败往往是微妙的(例如,注入的免责声明、微小的细节扭曲),而非明显的危险行为。模型在抵御未经授权的大规模操作方面比检测微妙的事实漂移更为可靠。
意义与局限性
论文认为,指令层级鲁棒性 不是一种单一的统一能力 ,而是一系列必须在多个冲突表面、约束类型和攻击呈现方式下进行评估的行为。发布 IH-B(包括语料库、模拟器和评估工具)旨在支持负责任的评估与部署,帮助开发者在部署前识别模型或场景特定的弱点。
局限性:
该基准测试侧重于有界单任务场景,未涵盖上下文随时间累积的长程多轮对话。
领域覆盖是经过选择且不对称的,基于各领域自然契合的维度(例如,金融仅出现在 S ≻ U S \succ U S ≻ U 中,编程仅出现在 U ≻ T U \succ T U ≻ T 中)。
虽然 44 个约束族中有 35 个是人工编写的,但其余部分是由 LLM 建议并经人工审核的,这意味着覆盖范围广泛但并非穷尽。
作者承认,披露特定模型的弱点带有辅助攻击者的风险,但他们认为系统化、可重复的安全评估所带来的收益超过了这些风险。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。