想象一下你有一个非常聪明、长着三只眼睛的机器人,名叫“Trimodal”。这个机器人可以同时观看视频、聆听声音并阅读文本。它将这三种感官结合在一起来回答问题,比如“视频中的人在做什么?”或者“背景里在播放什么歌曲?”
名为 SOUNDBREAK 的论文提出了一个可怕的问题:如果我们仅仅通过在它耳边低语,而不改变视频或文本的内容,就能欺骗这个机器人,会发生什么?
以下是他们研究结果的拆解,使用了简单的类比:
1. 攻击手段: “幽灵低语” (The Whispering Ghost)
大多数人认为,要欺骗机器人,必须破坏它的眼睛(视频)或大脑(文本)。但研究人员发现了一种新方法:他们只对音频动手脚。
- 类比: 想象机器人正戴着降噪耳机试图解开一个谜题。研究人员并没有弄坏耳机,而是在音频轨道中加入了一种非常特定、几乎难以察觉的“幽灵低语”。
- 结果: 尽管视频看起来完美无缺,文本也正常,但机器人却被搞糊涂了。它开始充满自信地给出错误的答案。在某些测试中,他们96% 的时间都成功让机器人崩溃了。
2. 欺骗机器人的六种方式
研究人员尝试了六种不同的“低语”(攻击方法),以观察机器人的哪个部分最敏感:
- “信心杀手” (负面语言丢失 - Negative Language Loss): 他们低语了一些指令,让机器人怀疑自己正确的答案。
- “耳罩” (编码器相似性 - Encoder Similarity): 他们干扰了机器人的原始音频处理部分(即将声波转化为数据的部分),使得即使声音听起来一样,但在机器人的内部传感器看来,声音已经完全不同了。这是最有效的方法。
- “眼罩” (视觉注意力抑制 - Vision Attention Suppression): 他们通过低语的方式,让机器人完全忽略视频,转而只关注(现在已被破坏的)音频。
- “过度倾听者” (音频注意力放大 - Audio Attention Amplification): 他们强迫机器人过度关注音频,使其忽略视觉线索。
- “混乱代理人” (注意力随机化 - Attention Randomization): 他们扰乱了机器人的内部焦点,使其以一种随机且毫无意义的顺序去观察事物。
- “脑雾” (隐藏状态相似性 - Hidden-State Similarity): 他们干扰了机器人的内部记忆层,使其思维偏离真相。
胜出者: “耳罩”法(干扰音频编码器)是最强的。这就像是在机器人开始思考之前,就改变了它所使用的语言,而不仅仅是干扰它最终的答案。
3. 攻击的“魔力”
研究人员发现了一些关于这些攻击如何运作的惊人发现:
- 与音量无关: 你不需要对着机器人大喊大叫。这些“低语”非常微弱,以至于人类听众几乎察觉不到区别。这种失真度极低,几乎在听觉上是不可见的,但它却彻底击垮了机器人。
- 熟能生巧: 使用庞大的视频库来训练攻击并不重要。重要的是他们在一个小集合上练习了多久。这就像一个扒手在一个人身上练习了数小时后成为了大师,而不是在成千上上个不同的人身上各试一次。
- 机器人依然充满信心: 即使机器人给出了错误答案,它也百分之百确定自己是对的。它不会说“我不确定”,而是自信满满地撒谎。这使得人们很难发现机器人正在犯错。
4. 局限性:它不是“万能钥匙”
论文还发现,这种技巧并不是能对所有机器人生效的“万能钥匙”。
- 针对特定模型: 如果你训练一种低语来欺骗机器人 A,它通常会对机器人 B 失效。这就像学习破解一种特定品牌的锁,它无法打开另一种品牌的锁。
- 语音识别不同: 当他们把这种方法用于简单的语音转文本系统(如 Siri 或 Whisper)时,系统并不在意低语的类型。它只在意噪声的音量有多大。如果噪声大到足以扭曲声音,语音系统就会失效。但对于复杂的“视频+音频+文本”机器人,低语的结构比音量更重要。
5. 核心启示
论文总结道,我们看待这些智能机器人安全性的视角一直存在偏差。我们原以为必须保护视频和文本,但这项研究表明,音频是一个隐藏的后门。
通过在音频中加入微小的、有结构的“幽灵低语”,攻击者可以让高度智能的多感官机器人彻底失效,而无需触碰视频或文本。研究人员建议,为了修复这个问题,我们需要构建能够检查其耳朵、眼睛和大脑是否在讲述同一个故事的机器人,而不是仅仅信任其中之一。
技术摘要:SOUNDBREAK
问题定义
集成音频、视觉和语言的多模态基础模型已展现出强大的推理能力,但其针对对抗性操纵的鲁棒性仍未得到充分理解。虽然先前的研究广泛探索了视觉-语言攻击、单模态音频攻击以及多模态协同攻击,但在理解针对三模态(音频-视频-语言)模型的非定向、仅音频对抗攻击方面仍存在显著空白。
本研究调查的具体威胁模型假设攻击者仅控制多模态输入流水线中的音频通道。攻击者旨在不修改视觉或文本输入的情况下,降低模型的推理性能。这种场景被认为是现实的,因为音频操纵可以通过受损的麦克风、环境扬声器或传输通道进行部署,且通常比视觉扰动更难检测。
方法论
作者提出了 SOUNDBREAK,一个用于生成共享音频扰动(在训练数据上学习而非针对单个样本)以诱发多模态失效的系统化框架。该攻击被表述为一个白盒优化问题,其中一个加性扰动 δ 被注入到干净的音频波形 xa 中,从而产生 x~a=xa+δ,并受到 ℓ∞ 范数约束(∥δ∥∞≤ϵ)。
其核心贡献是设计了六个互补的对抗目标,针对多模态处理流水线的不同阶段:
- 负向语言模型损失 (LnegLM):通过最小化正确输出序列的对数概率,直接降低模型对基准答案的置信度。
- 基于编码器的余弦相似度损失 (L(cos)):针对音频编码器的表示空间,最小化干净音频与扰动音频嵌入之间的余弦相似度,以破坏基础音频特征。
- 视觉注意力抑制损失 (L(visionatt)):聚合分配给视觉 Token 的注意力质量并将其最小化,从而有效地使模型对视觉证据“失明”。
- 音频注意力放大损失 (L(audioatt)):聚合分配给音频 Token 的注意力质量并将其最大化(通过最小化其负值),迫使模型过度依赖受扰动的音频流。
- 注意力随机化损失 (L(randatt)):通过最小化实际注意力分布与随机化目标之间的 KL 散度,破坏注意力机制的结构完整性。
- 隐藏状态相似度损失 (L(hidden−cos)):针对跨层的 Transformer 内部隐藏状态,将对抗性表示推离其对应的干净表示。
研究还评估了一个组合损失(Lcombined)公式,该公式共同优化上述六个目标。优化过程利用带有 Adam 的投影梯度下降法(PGD),通过在训练数据集上迭代来学习共享的扰动。
核心贡献
- 新颖的威胁模型:本研究首次系统地分析了针对三模态音频-视频-语言模型的非定向、仅音频攻击,超越了单模态或双模态的设定。
- 多阶段攻击目标:提出了六个不同的损失函数,从编码器、注意力、隐藏状态和输出层面探测漏洞,从而实现对哪些计算组件最易受攻击的解耦分析。
- 系统化评估:在三个最先进的模型(VideoLLAMA2, Qwen 2.5 Omni, Qwen 3 Omni)和三个基准测试(AVQA, AVSD, Music-AVQA)上进行了广泛实验,并同时对语音识别系统(Whisper)进行了评估。
实验结果
研究揭示了关于三模态模型鲁棒性的几项关键发现:
- 高攻击成功率 (ASR):仅音频的扰动可以诱发严重的多模态失效。在 VideoLLAMA2 上使用 AVQA 基准测试时,组合攻击实现的 ASR 高达 96.03%。仅使用基于编码器的余弦相似度损失(L(cos))就达到了 89.12% 的 ASR,在许多情况下优于输出层和基于注意力的目标。
- 低感知失真:可以实现极高效率且感知失真极低的攻击。成功的攻击保持了较低的 LPIPS 分数(例如,L(cos) 为 $0.08$)和接近零或正值的 SI-SNR 值,表明这些扰动是细微且具有结构的,而非噪声性的。
- 优化与数据规模的关系:攻击的有效性更多由扩展的优化迭代次数驱动,而非数据集规模。在较小数据集(如 1,000 个样本)上训练但经过多次迭代(如 372k 次)的模型,其 ASR 显著高于在较大数据集上进行较少迭代的模型。
- 有限的迁移性:
- 跨模型:在一种架构(如 VideoLLAMA2)上训练的攻击对其他架构(如 Qwen 2.5/3 Omni)的迁移性较差,ASR 从 ~10% 下降到 ~3-4%。这表明攻击利用了特定模型的表示特性。
- 跨领域:在通用视听数据(AVQA)上训练的攻击在音乐领域(Music-AVQA)的迁移性很差,相比于源域的 89.07%,其 ASR 仅为 13.80%。
- 跨架构:编码器空间的扰动无法在不同的音频编码器架构(如 BEATs 与 Whisper 式编码器)之间迁移。
- 语音识别系统的脆弱性:与三模态模型不同,语音识别系统(Whisper)主要对声学失真的幅度做出反应,而非特定的攻击目标。诱发高失真的攻击(如 LnegLM)在 Whisper 上实现了 >97% 的 ASR,而低失真攻击则失败了。
- 层级特异性漏洞:低层 Transformer 层(1–10 层)被确定为音频驱动攻击最关键的部分,而高层表现出的脆弱性始终较低。
- 置信度稳定性:尽管 ASR 很高,但模型对其(错误的)对抗性输出仍保持着高置信度,置信度水平与干净输入相似。这表明对抗性失效源于内部失配而非模型不确定性,使得通过置信度监控难以检测到此类攻击。
重要性与主张
本文声称揭示了多模态系统中一个此前被忽视的单模态攻击面。结果表明,控制仅音频流的攻击者可以系统地降低多模态推理能力,而无需改变视觉或文本输入。
作者强调,这些发现说明有必要建立强制执行跨模态一致性的防御机制,因为当前的模型容易受到细微、结构化音频扰动的攻击,这些扰动会通过系统传播并导致灾难性的推理失败。研究指出,仅仅因为模型集成了多种模态就假设其具备鲁棒性是不够的;必须解决音频编码和跨模态注意力机制中存在的特定漏洞。
该工作被视为理解此类脆弱性的基础性步骤,作者也指出了其局限性,如侧重于白盒设置、仅针对数字扰动以及缺乏对防御手段的评估,并建议将这些作为未来的研究方向。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。