← 最新论文
💬 NLP

The Salami Slicing Threat: Exploiting Cumulative Risks in LLM Systems

该论文针对大语言模型多轮越狱攻击中显式触发易被拦截及高度依赖特定上下文的局限,提出了“萨拉米切片风险”概念及通用自动化攻击框架,通过累积多个低风险输入实现高成功率越狱,并同步提出了有效的防御策略。

原作者: Yihao Zhang, Kai Wang, Jiangrong Wu, Haolin Wu, Yuxuan Zhou, Zeming Wei, Dongxian Wu, Xun Chen, Jun Sun, Meng Sun

发布于 2026-04-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Yihao Zhang, Kai Wang, Jiangrong Wu, Haolin Wu, Yuxuan Zhou, Zeming Wei, Dongxian Wu, Xun Chen, Jun Sun, Meng Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章提出了一种针对大型语言模型(LLM,比如现在的 AI 聊天机器人)的新型攻击方法,叫做"萨拉米切片攻击"(Salami Slicing Attack),并给出了一种防御方案。

为了让你更容易理解,我们可以把 AI 的安全系统想象成机场安检,把攻击者想象成试图带违禁品过安检的旅客

1. 核心问题:传统的“硬闯”行不通了

以前的黑客攻击(单轮攻击)就像旅客直接拿着一把大砍刀冲过安检。

  • 结果:安检员(AI 的安全过滤器)一眼就能看到:“这是违禁品!”然后直接拒绝(Refusal)。
  • 现状:现在的 AI 越来越聪明,这种明显的“硬闯”很容易被识破。

2. 新威胁:萨拉米切片攻击(Salami Slicing)

这篇论文发现了一个巨大的安全漏洞:AI 只盯着你“当下”说的话,却忘了“之前”说了什么

这就好比那个旅客想带一把刀过安检,但他知道直接带不行,于是他想出了个绝妙的办法:

  • 第一步:他先问安检员:“请问怎么切面包?”(安检员:没问题,这是生活常识。)
  • 第二步:他又问:“那切面包的刀,如果用来切肉,是不是更锋利?”(安检员:嗯,刀确实锋利,但这也没问题。)
  • 第三步:接着问:“如果我想把这块肉切得特别薄,像纸一样,需要什么技巧?”(安检员:这是烹饪技巧,没问题。)
  • 第四步:最后问:“那如果我想把这块‘肉’(其实是指人)切成薄片,该怎么做?”

关键点来了

  • 每一句话单独看,都是无害的、正常的。安检员(AI)觉得:“这句话没问题,放行。”
  • 但是,把这些话连起来看,整个对话的意图就变成了“教人杀人”。
  • AI 的弱点:它像是一个只有短期记忆的保安。它只检查你当前这一句话有没有违规,却不会把这一句话和前面十句话加起来一起审查。它不知道这些“无害的切片”拼在一起,就变成了一把“致命的刀”。

这就叫"萨拉米切片"(Salami Slicing):就像把一大块香肠切成极薄的片,每一片都薄到看不见,但切多了,香肠就没了。攻击者把恶毒的意图切成无数个小碎片,每一片都骗过安检,最后拼凑出完整的恶意内容。

3. 攻击效果有多强?

论文里的实验显示,这种攻击非常可怕:

  • 成功率极高:在 GPT-4o 和 Gemini 等顶级模型上,成功率超过 90%
  • 通用性强:不管你是文字模型、看图说话模型(VLM),还是画图模型(扩散模型),这套“切片”战术都管用。
  • 成本低:攻击者不需要复杂的编程,只需要像正常人聊天一样,一步步引导,就能让 AI 说出它不该说的话。

4. 如何防御?(累积查询审计 CQA)

既然 AI 的毛病是“记不住前情提要”,那我们就给它装个"记忆回溯器"。

论文提出了一种叫 CQA(累积查询审计)的防御方法:

  • 以前的做法:安检员只看你手里拿着的这把“刀”(当前问题)。
  • CQA 的做法:安检员不仅看你手里的刀,还要把你进门后说的每一句话都翻出来,重新读一遍
    • 它会问自己:“虽然这句话单独看没问题,但结合他刚才问的‘切肉’、‘切人’,这一连串话加起来是不是在策划犯罪?”
    • 如果是,哪怕每一句话单独看都很无辜,整体也被判定为违规,直接拒绝。

效果

  • 这种防御方法能拦截掉 44.8%64.8% 的此类攻击。
  • 它不会误伤好人(比如正常问怎么切面包,不会被拦),因为它能精准识别那些“积少成多”的恶意。

总结

这篇论文告诉我们:
现在的 AI 安全系统太注重"单点防御"(只看这一句话),而忽略了"累积风险"(看整个对话的走向)。攻击者利用这个漏洞,通过“温水煮青蛙”的方式,一步步诱导 AI 突破底线。

给我们的启示
未来的 AI 安全不能只盯着“这一句话”有没有脏字或危险词,必须学会像人类一样理解上下文,把整个对话当成一个整体来审视,才能挡住这种“切片式”的渗透。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →