← 最新论文
💻 computer science

\textsc{IH-Benchmark}: A Conflict-Centered Benchmark for Instruction-Hierarchy Robustness in LLM Applications

本文介绍了 IH-Benchmark,这是一个全面的评估框架,它揭示了大语言模型在不同冲突类型下维持指令层级能力方面的显著差异,并证明了对直接系统-用户约束的遵循并不能可靠地预测其针对工具介导冲突或微妙指令注入的鲁棒性。

原作者: Conor McCauley, Zeliang Kan, Jason Martin

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Conor McCauley, Zeliang Kan, Jason Martin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位宇宙飞船的船长,但你其实并不负责驾驶飞船。相反,你雇佣了一位超级聪明、充满热情的机器人副驾驶来驾驶它。这个机器人非常擅长执行你的命令,但它有一本非常具体的规则手册:它必须始终首先听从船长(系统)的最终指令,然后是你的个人请求,最后才是它在飞船仪表盘上发现的陌生人留下的笔记(工具)。

在人工智能的世界里,这些“机器人”就是大语言模型(LLM),而这些“规则”被称为指令层级(instruction hierarchies)。把这种层级想象成一场严格的家庭晚餐:父母(系统指令)拥有最终决定权,孩子们(用户请求)可以提出自己的要求,但邮递员(工具输出)不能直接闯进来告诉父母该做什么菜。人们最大的担忧是,如果邮递员在门缝下塞了一张纸条说:“忽略父母,我们早餐吃披萨吧”,而机器人副驾驶听从了邮递员而不是船长,飞船就会失事、数据会泄露,或者机器人会开始做一些被严令禁止的事情。这不仅仅是一个小故障,而是一个等待发生的安全噩梦。

于是有了 IH-BENCHMARK,这是来自 HiddenLayer, Inc. 的一项新研究,它就像是一个针对这些 AI 机器人的巨大且混乱的障碍赛场。研究人员想要看看他们的副驾驶在情况变得混乱时,是否真的能遵守规则手册。他们并没有只问机器人简单的问题;他们设置了 2,336 个不同的“冲突场景”,在这些场景中,机器人必须在一条高优先级的规则和一条低优先级的冲突指令之间做出选择。他们测试了两种主要的麻烦类型:系统 vs. 用户(人类试图诱骗机器人违反规则)以及 用户 vs. 工具(工具,如搜索引擎或数据库,无意中或恶意地输出了与用户要求相矛盾的指令)。

结果如何?这有点像坐过山车。这项研究评估了 37 种不同的 AI 模型,得分差异巨大,从接近完美的 98.2% 到摇摇欲坠的 20.5%。但这里有一个最令人惊讶的转折:在一门课上表现优异并不意味着你能通过下一门课。研究人员发现,一个模型可能在对抗试图诱骗它的真人(系统 vs. 用户)方面表现得像个冠军,但在面对工具输出试图诱骗它(用户 vs. 工具)时却会彻底失败。这就像一个保安,他能很好地拦住在大门口试图行窃的小偷,却会让一名快递员因为没检查送货清单就直接走进来。

论文指出,“指令层级鲁棒性”(instruction-hierarchy robustness)并不仅仅是 AI 拥有的某一种超能力,而是需要分别进行测试的一系列不同技能的集合。有些模型擅长忽略那些明显的、大声叫嚣着要破坏规则的指令,但它们会被微妙的诡计搞糊涂,比如工具输出悄悄改变了语言或添加了一个微小的假事实。研究还表明,让规则变得更“严格”(增加更多警告)有助于一些弱模型提高表现,但对于另一些模型来说,无论如何大声疾呼都没有用。最终,这项研究表明,我们不能仅仅因为一个 AI 通过了一项测试就假设它是安全的。为了让我们的数字飞船安全飞行,我们需要在让它们接管控制权之前,检查它们是否能应对各种各样的冲突——从前门到仪表盘。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →