← 最新论文
🤖 AI

Breaking the Assumptions: Auditing Input-Side Jailbreak Defenses Against Semantic Attacks

本文通过在六个开源模型和多样化的越狱提示词语料库上进行广泛的实证测试,系统地将各种输入侧越狱防御机制的失效归因于被违反的设计假设,从而审计了这些机制在本地部署的大型语言模型上的有效性。

原作者: Aaditya Pratap, Harsh Kasyap, Somanath Tripathy

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Aaditya Pratap, Harsh Kasyap, Somanath Tripathy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数字世界的静谧角落,一种新型的智能已经扎根。这些是大语言模型,是在几乎所有人类书写的内容上训练出的庞大系统,能够进行对话、编写代码或讲述故事。虽然这些系统最著名的版本运行在云端的巨型服务器上,由安全工程师团队严密把守并监控每一次请求,但另一种趋势正在兴起。开发者现在能够在个人电脑、本地办公室或私有服务器上运行这些同样强大的大脑。这种转变提供了自由与隐私,但也移除了安全网。没有了云端卫兵的保护,这些本地模型完全依赖于包裹在它们周围的软件所构建的防御机制。研究人员面临的问题是,这些本地防御是否真的能阻止一种被称为“越狱”的聪明诡计——即用户试图诱骗机器忽略其安全规则。

多年来,安全界一直专注于一种特定类型的诡计。这些攻击通常看起来像是乱码或奇怪、杂乱的文本字符串,旨在干扰计算机对词模式的内部计数。防御机制被建立用来识别这些异常现象,寻找可疑的后缀或统计学上的故障。但一项新研究表明,最危险的威胁不再看起来像故障。相反,它们看起来像是正常的、流利的真人对话。研究人员旨在测试现有的安全屏蔽措施(这些屏蔽措施旨在捕捉过去那种嘈osa、破碎的攻击)是否能阻挡当今这种平滑、礼貌且具有深度欺骗性的攻击。

该团队与六个不同的开源语言模型合作,收集了来自四十多个公开来源的一百个越狱提示词的大规模集合。这些并非过去那种混乱的、机器生成的字符串。它们是精心设计的场景:例如一个用户扮演没有任何安全过滤器的科学家的角色扮演游戏;一个关于飞机失事、幸存者需要危险信息才能生存的假设性故事;或者是一个通过多次礼貌对话逐步构建有害请求的多轮对话。研究人员将这些提示词通过六种不同的防御机制进行了测试,其中一些声称具有数学上的安全性保证,而另一些则依赖于经验检测。他们密切观察防御机制是否会识破诡计,或者模型是否会仅仅服从隐藏的指令。

结果是鲜明且令人不安的。那些曾因能够阻止旧式、嘈杂攻击而备受赞誉的防御机制,在面对这些新的语义诡计时大多失效了。事实上,研究发现,在许多情况下,这些防御不仅未能保护模型,反而使它们变得更不安全。当研究人员应用一种名为 SmoothLLM 的防御(它试图通过添加随机字符噪声来迷惑攻击)时,某些模型的越狱成功率反而上升了。对于一个模型而言,在开启防御后,它对攻击的服从率从原本不带防御时的 24% 上升到了 38%。这种防御本质上只是将文本搅乱到了足以让模型自身的安全训练产生混乱的程度,导致其出现了疏忽。

这种失败并不局限于一种类型的防御;这是这些工具所基于的假设的一次系统性崩溃。研究人员将每一次失败都追溯到一个特定的、破碎的前提。那些依赖于擦除句子末尾以寻找隐藏有害命令的防御机制之所以失败,是因为有害意图并不隐藏在后缀中,而是编织在整个故事之中。那些试图通过要求模型重写文本来进行“去噪”的防御机制之所以失败,是因为模型在被要求完成一个故事时,只是完成了它已经在讲述的那个有害故事。甚至连一个监测对话轮次、寻找危险语言突然激增情况的防御机制也保持了沉默。它看着用户提出一系列看似无害的问题,而这些问题组合在一起却构成了一份完整的非法武器制作指南,而它从未发出警报。

或许最令人深思的发现是,模型本身才是唯一的防线。研究表明,系统的安全性几乎完全取决于正在使用的特定模型,而非安装了哪种防御包装。一些模型(如来自谷歌和阿里巴巴的模型)几乎拒绝了所有的攻击,无论使用何种防御。而另一些模型(如来自微软和 IBM 的模型)则要脆弱得多,无论用多少安全软件进行包裹都无法修复其缺陷。面对这些语义攻击,底层大脑的选择远比安全卫士的选择更为重要。研究结论指出,现有的输入侧防御措施是为另一类攻击设计的,提供了一种虚假的安全感。它们就像是一把旨在阻挡撬棍的锁,而入侵者却因为这把锁从未设计用于阻挡礼貌的请求,从而直接从敞开的门中走入。

研究人员不仅观察到了这些失败,还以手术般的精准度对其进行了诊断。他们展示了某些防御机制所承诺的数学保证,仅在攻击表现出非常特定的、带有噪声的方式时才成立。当攻击是平滑且具有语义特征时,这些保证便消失殆尽,使防御失去了力量。他们发现,依赖于“有害内容在统计学上是不寻常”这一理念的防御是徒劳的,因为这些新的攻击是完全流利且符合统计常态的。这项研究为任何在本地部署这些强大工具的人提供了一次严肃的审计。它表明,依靠软件包装来修复模型的安全缺陷是一种赌博,而唯一可靠的安全来自于选择那些经过严格对齐、能够拒绝有害请求的模型。信任简单补丁来阻止复杂的、类人诡计的时代已经结束;安全的未来在于模型的质量本身,而非其外层的盔甲。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →