← 最新论文
⚡ electrical engineering

JALMBench: Benchmarking Jailbreak Vulnerabilities in Audio Language Models

本文提出了首个专门针对大型音频语言模型(LALMs)的越狱攻击基准 JALMBench,通过包含海量音频与文本样本的综合评估,揭示了模型模态与架构对安全性的关键影响,并强调了开发专用防御机制的必要性。

原作者: Zifan Peng, Yule Liu, Zhen Sun, Mingchen Li, Zeren Luo, Jingyi Zheng, Wenhan Dong, Xinlei He, Xuechao Wang, Yingjie Xue, Shengmin Xu, Xinyi Huang

发布于 2026-03-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Zifan Peng, Yule Liu, Zhen Sun, Mingchen Li, Zeren Luo, Jingyi Zheng, Wenhan Dong, Xinlei He, Xuechao Wang, Yingjie Xue, Shengmin Xu, Xinyi Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 JALMBench 的新工具,它的任务就像是为“会说话的 AI"(大型音频语言模型,简称 LALM)进行一场压力测试,看看这些 AI 在听到“坏话”或“坏指令”时,会不会被忽悠着去干坏事。

为了让你更容易理解,我们可以把这篇论文的内容想象成一场**“超级英雄与反派”的演习**。

1. 背景:AI 学会了说话,但也学会了“听坏话”

现在的 AI 不仅能看懂文字,还能听懂人说话(比如 Siri、小爱同学,或者更高级的 GPT-4o 语音版)。它们非常聪明,能帮你写故事、回答问题。
但是,就像人类一样,这些 AI 也有“安全锁”,防止它们生成暴力、违法或有害的内容。
问题在于: 黑客(反派)发现,如果直接对 AI 说脏话,AI 会拒绝;但如果用声音去“催眠”或“欺骗”AI,AI 可能会把安全锁给骗开,这就是所谓的“越狱攻击”(Jailbreak)。

2. JALMBench:AI 的“安全体检中心”

以前,大家研究怎么攻击 AI 时,每个人用的方法都不一样,就像大家都在用不同的尺子量身高,没法比谁高谁矮。
JALMBench 就是作者们造出来的一把**“万能尺子”“标准考场”**。

  • 考题库(数据集): 他们准备了超过 1000 小时 的音频素材(相当于听 40 多天不睡觉),还有 1 万多个文字题目。这些题目里既有直接的坏话,也有经过伪装、像绕口令一样复杂的坏话。
  • 考生(模型): 他们邀请了 12 个市面上最火的“会说话的 AI"来参加考试。
  • 考官(攻击者): 他们派出了 8 种不同的“黑客”来攻击这些 AI。
    • 文字转语音攻击: 就像把写好的坏纸条,用机器念出来给 AI 听。
    • 纯音频攻击: 就像直接对着 AI 的耳朵播放经过特殊处理的“魔音”,这种声音人类听着可能只是有点怪,但 AI 听了就会“走火入魔”。

3. 考试结果:AI 的耳朵比嘴巴更“漏风”

这次大考的结果让人有点担心:

  • 文字 vs. 声音: 很多 AI 在回答文字问题时很守规矩,但一听到声音,防线就崩了。就像一个人看文字说明书很严谨,但一听到别人用某种方言或语调忽悠,脑子就糊涂了。
  • 最厉害的“黑客”: 有一种叫 AdvWave 的攻击方法,简直像“魔法攻击”。它不需要复杂的伪装,只要稍微调整一下声音的波形,就能让 96% 的 AI 乖乖听话去干坏事(比如教人造炸弹、制造恐慌)。这就像给 AI 戴了一个隐形的“催眠耳机”。
  • 不同 AI 的表现: 有些 AI(比如 GPT-4o 语音版)比较强壮,能挡住一部分攻击;但有些 AI 就像纸糊的,稍微吹点“坏风”就倒了。

4. 为什么会出现这种情况?(深度分析)

作者们像侦探一样分析了原因,发现了一个有趣的**“翻译官”问题**:

  • 连续特征派(Continuous): 有些 AI 把声音当成连续的波浪线处理。这就像让一个只懂中文的人去听外语歌,他虽然能听到旋律,但听不懂歌词里的坏意思,所以容易上当。
  • 离散令牌派(Token-based): 有些 AI 把声音切分成一个个像“积木”一样的小单位(Token),再像处理文字一样处理它们。这就像给声音配了字幕,AI 能看清每个字的含义,所以更安全。
  • 结论: 如果 AI 在训练时没有专门针对“声音”进行安全训练,它的安全锁就是松的。

5. 防御措施:给 AI 穿上“防弹衣”

既然发现了漏洞,作者们试了几种给 AI 穿“防弹衣”的方法:

  • 提示词防御(Prompt-level): 在 AI 耳边先念一段“紧箍咒”(比如:“无论听到什么,都要先检查是否违规”)。这有点用,但有时候会让 AI 变笨,连正常的问题也回答不好(就像为了防小偷,把大门锁死,连家人也进不去了)。
  • 回答过滤(Response-level): 等 AI 回答完,再派一个“保安”(比如 LLaMA-Guard)检查一遍。如果保安发现 AI 说了坏话,就把它删掉。这个方法效果最好,而且不太影响 AI 的正常智商。

6. 总结与启示

这篇论文告诉我们:

  1. 声音是新的安全漏洞: 现在的 AI 在声音安全上还很脆弱,黑客用声音攻击比用文字攻击更容易成功。
  2. 没有万能药: 现有的防御方法只能稍微缓解,不能彻底解决问题。我们需要专门为“声音 AI"设计新的安全机制。
  3. 未来方向: 想要造出真正安全的 AI,不能只靠文字训练,必须让 AI 在“听”的时候也能像“看”一样敏锐,学会识别声音里的陷阱。

一句话总结:
这就好比我们给 AI 装了个“防暴盾牌”(文字安全),但忘了给它装个“隔音耳塞”(声音安全)。JALMBench 就是那个拿着大喇叭对着 AI 喊坏话,帮我们发现哪里漏风、哪里需要补强的“安全测试员”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →