← 最新论文
⚡ electrical engineering

SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal Models

本文表明,三模态音视频语言模型极易受到非针对性的纯音频对抗攻击,通过利用多模态处理各个阶段的弱点,此类攻击可以在感知失真极小的情况下实现高达 96% 的成功率。

原作者: Aafiya Hussain, Gaurav Srivastava, Alvi Ishmam, Zaber Hakim, Chris Thomas

发布于 2026-01-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Aafiya Hussain, Gaurav Srivastava, Alvi Ishmam, Zaber Hakim, Chris Thomas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你有一个非常聪明、长着三只眼睛的机器人,名叫“Trimodal”。这个机器人可以同时观看视频、聆听声音并阅读文本。它将这三种感官结合在一起来回答问题,比如“视频中的人在做什么?”或者“背景里在播放什么歌曲?”

名为 SOUNDBREAK 的论文提出了一个可怕的问题:如果我们仅仅通过在它耳边低语,而不改变视频或文本的内容,就能欺骗这个机器人,会发生什么?

以下是他们研究结果的拆解,使用了简单的类比:

1. 攻击手段: “幽灵低语” (The Whispering Ghost)

大多数人认为,要欺骗机器人,必须破坏它的眼睛(视频)或大脑(文本)。但研究人员发现了一种新方法:他们只对音频动手脚。

  • 类比: 想象机器人正戴着降噪耳机试图解开一个谜题。研究人员并没有弄坏耳机,而是在音频轨道中加入了一种非常特定、几乎难以察觉的“幽灵低语”。
  • 结果: 尽管视频看起来完美无缺,文本也正常,但机器人却被搞糊涂了。它开始充满自信地给出错误的答案。在某些测试中,他们96% 的时间都成功让机器人崩溃了。

2. 欺骗机器人的六种方式

研究人员尝试了六种不同的“低语”(攻击方法),以观察机器人的哪个部分最敏感:

  1. “信心杀手” (负面语言丢失 - Negative Language Loss): 他们低语了一些指令,让机器人怀疑自己正确的答案。
  2. “耳罩” (编码器相似性 - Encoder Similarity): 他们干扰了机器人的原始音频处理部分(即将声波转化为数据的部分),使得即使声音听起来一样,但在机器人的内部传感器看来,声音已经完全不同了。这是最有效的方法。
  3. “眼罩” (视觉注意力抑制 - Vision Attention Suppression): 他们通过低语的方式,让机器人完全忽略视频,转而只关注(现在已被破坏的)音频。
  4. “过度倾听者” (音频注意力放大 - Audio Attention Amplification): 他们强迫机器人过度关注音频,使其忽略视觉线索。
  5. “混乱代理人” (注意力随机化 - Attention Randomization): 他们扰乱了机器人的内部焦点,使其以一种随机且毫无意义的顺序去观察事物。
  6. “脑雾” (隐藏状态相似性 - Hidden-State Similarity): 他们干扰了机器人的内部记忆层,使其思维偏离真相。

胜出者: “耳罩”法(干扰音频编码器)是最强的。这就像是在机器人开始思考之前,就改变了它所使用的语言,而不仅仅是干扰它最终的答案。

3. 攻击的“魔力”

研究人员发现了一些关于这些攻击如何运作的惊人发现:

  • 与音量无关: 你不需要对着机器人大喊大叫。这些“低语”非常微弱,以至于人类听众几乎察觉不到区别。这种失真度极低,几乎在听觉上是不可见的,但它却彻底击垮了机器人。
  • 熟能生巧: 使用庞大的视频库来训练攻击并不重要。重要的是他们在一个小集合上练习了多久。这就像一个扒手在一个人身上练习了数小时后成为了大师,而不是在成千上上个不同的人身上各试一次。
  • 机器人依然充满信心: 即使机器人给出了错误答案,它也百分之百确定自己是对的。它不会说“我不确定”,而是自信满满地撒谎。这使得人们很难发现机器人正在犯错。

4. 局限性:它不是“万能钥匙”

论文还发现,这种技巧并不是能对所有机器人生效的“万能钥匙”。

  • 针对特定模型: 如果你训练一种低语来欺骗机器人 A,它通常会对机器人 B 失效。这就像学习破解一种特定品牌的锁,它无法打开另一种品牌的锁。
  • 语音识别不同: 当他们把这种方法用于简单的语音转文本系统(如 Siri 或 Whisper)时,系统并不在意低语的类型。它只在意噪声的音量有多大。如果噪声大到足以扭曲声音,语音系统就会失效。但对于复杂的“视频+音频+文本”机器人,低语的结构比音量更重要。

5. 核心启示

论文总结道,我们看待这些智能机器人安全性的视角一直存在偏差。我们原以为必须保护视频和文本,但这项研究表明,音频是一个隐藏的后门

通过在音频中加入微小的、有结构的“幽灵低语”,攻击者可以让高度智能的多感官机器人彻底失效,而无需触碰视频或文本。研究人员建议,为了修复这个问题,我们需要构建能够检查其耳朵、眼睛和大脑是否在讲述同一个故事的机器人,而不是仅仅信任其中之一。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →