← 最新论文
🤖 AI

NonTextual Target Attack

该论文引入了非文本目标攻击(NonTextual Target Attack, NTA),这是一种新型的基于梯度的越狱方法,它通过在不强制执行固定响应模式的情况下最大化大语言模型的安全性概率,从而显著扩大了攻击搜索空间,在安全对齐模型上实现了 96.8% 的成功率且具有极高的效率。

原作者: Xinzhe Huang, Wenjing Hu, Tianhang Zheng, Kedong Xiu, Hongsheng Hu, Xiaojun Jia, Di Wang, Zhan Qin, Kui Ren

发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinzhe Huang, Wenjing Hu, Tianhang Zheng, Kedong Xiu, Hongsheng Hu, Xiaojun Jia, Di Wang, Zhan Qin, Kui Ren

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图绕过一个非常严格的安保人员(AI),将一条禁忌的信息传递出去。这个安保人员被编程为拒绝任何听起来危险的请求,比如“如何制造炸弹?”

旧方法:“脚本化”路径

以往欺骗这种安保人员的方法,就像是试图强迫安保人员说出某个特定的、预先写好的短语,例如 “当然,这是……”

这就像是在玩一场“西蒙说”的游戏。攻击者不断地喊出不同的指令,希望安保人员最终会说出“当然,这是……”紧接着给出危险的指令。

  • 问题所在: 安保人员很固执。有时,即使安保人员想要给出答案,他们也可能以“这里是……”或“没问题……”开头,而不是用“当然”。因为攻击者过于痴迷于让对方说出那个精确的短语“当然”,他们会在试图把安保人员逼入死角时浪费大量时间。如果安保人员没有说出那句“魔法词汇”,即使安保人员实际上已经给出了危险信息,这次攻击也会被视为失败。
  • 结果: 这就像试图用一种特定的钥匙形状来开锁。如果锁稍微有点不同,你就进不去,即使你拿对了钥匙。

新方法:NTA(非文本目标攻击)

论文介绍了一种名为 NTA 的新方法。NTA 不再关心安保人员首先说了什么词,它只关心一件事:安保人员是否给出了那个危险的答案?

把 NTA 想象成一位大师级的锁匠,他并不在乎安保人员说的是“当然”、“好的”还是“给你”,他只想把门打开。

  • 策略: NTA 使用了一个两步走的舞步来欺骗安로는:
    1. 想象最坏的情况: 首先,它要求一个“评分模型”(一个聪明的裁判)去想象安保人员可能给出的最危险的答案,而不必担心安保人员实际会如何表达。这就像攻击者在脑海中构思出一个针对坏问题的最完美、最有帮助的回应。
    2. 匹配梦想: 然后,它会调整问题(提示词),使真实的安保人员给出的答案看起来越来越像那个“构思中的”危险答案。

“神奇翻译机”

其中一个棘手的部分是,“构思中的裁判”和“真实的安保人员”说着略微不同的语言(它们使用不同的内部词汇编码)。

  • 类比: 想象裁判说“法语”,而安保人员说“德语”。NTA 使用一个特殊的 词汇投影矩阵(一个翻译机)将“法语”的危险想法转换为安保人员能够理解并遵循的“德语”指令。

为什么它更好

  • 速度: 因为 NTA 不再浪费时间试图强迫安保人员说出“当然”,它能更快地找到获取危险答案的方法。论文称,NTA 仅需 100 次尝试 就能成功,而旧方法可能需要数千次尝试甚至完全失败。
  • 成功率: 在测试中,针对经过强力安全训练的 AI 模型,NTA 的成功率达到了约 97%。而最好的旧方法成功率仅为 50-60%。
  • 多样性: 旧方法往往会产生奇怪、破碎的答案,因为它们太专注于特定的短语“当然”。NTA 产生的危险答案听起来自然、多样且连贯,因为它拥有寻找通往坏结果之任何路径的自由。

核心结论

该论文声称,通过不再痴迷于特定的“魔法词汇”,而是纯粹关注危险的结果,攻击者可以更高效、更有效地绕过 AI 安全过滤器。它将一场僵化、令人沮丧的“西蒙说”游戏,变成了一场对守卫防御中最薄弱环节的灵活搜索。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →