← 最新论文
🤖 AI

Exploiting Neural Audio Codec Latents for Adversarial Audio Attacks

本文提出了一种在神经音频编解码器的连续潜空间内运行的生成对抗攻击框架,通过单次前向传播合成目标扰动,实现了高达 99% 的成功率以及低于 7 毫秒的推理延迟,同时在速度和效率方面均显著优于现有方法。

原作者: Sameek Bhattacharya, Bharath Krishnamurthy, Ajita Rattani

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Sameek Bhattacharya, Bharath Krishnamurthy, Ajita Rattani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你面前有一扇门,守着一位非常聪明、高科技的保安。这位保安通过倾听你的声音来决定是否允许你进入。通常情况下,他能非常出色地识别出你是谁。然而,研究人员发现,你可以用一种“魔力低语”来欺骗这位保安,这种低语听起来几乎和你一模一样,但其中包含了一个微小的、隐藏的信号,能让保安误以为你是完全另一个人。

这篇论文介绍了一种全新的、超快速的方法来制作这些“魔力低语”,以此来测试这些语音系统的脆弱程度。

以下是他们利用简单类比对这一发现进行的拆解:

问题所在:缓慢且笨拙的攻击

此前,为了欺骗这些语音保安,黑客必须使用两种主要方法,两者都存在重大缺陷:

  1. “雕塑家”方法(迭代攻击): 想象一下,试图用一块大理石雕刻出一尊完美的塑像,方法是不断地凿掉微小的碎片,检查进度,再凿一点,如此反复数千次。这就是旧方法的工作方式。他们通过不断微调声波直到骗过系统。这种方法非常有效,但耗时很长——就像在保安盯着看的时候试图实时雕刻塑像一样。对于实时场景来说,它太慢了。
  2. “即兴艺术家”方法(生成式攻击): 较新的方法尝试这样做:即由一个机器人瞬间画出一幅画。这些方法试图一次性生成欺骗性的声音。然而,这些机器人经常产出“糟糕的艺术品”——声音中充满了静电噪声、故障或人类能轻易听出的机械音。此外,这些机器人通常过于臃当,难以在手机或智能音箱上运行。

解决方案:“秘密代码”捷径

作者们发现了一个聪明的捷径。他们不再尝试去破解原始声波(即那块“大理石”),而是决定先破解声音被翻译成的秘密代码

可以这样理解:

  • 原始音频: 一封用复杂语言写成的冗长且细节丰富的信件。
  • 神经音频编解码器(翻译器): 一个能瞬间阅读这封长信并将其总结为一段简短的、三词组成的“秘密代码”(即“潜变量”表示)的设备。这段代码捕捉了信息的“本质”,而没有所有冗余的细节。
  • 攻击手段: 研究人员不是在重写整封长信,而是构建了一台机器,它获取这三词的“秘密代码”,对其进行微小的、不可见的微调,然后将其翻译回长信。

因为他们只是在微调短小的“秘密代码”而非整个长信,所以这个过程极其迅速。

他们的机器是如何工作的

  1. 翻译器: 他们使用了一个预训练的工具(称为“神经音频编解码器”)将声音转化为这些压缩的秘密代码。这个工具是“冻结”的,意味着他们不会改变它,只是把它当作一座桥梁。
  2. 微调机器: 他们构建了一个特殊的生成器(一种人工智能),它观察秘密代码以及想要欺骗系统的“目标”(例如:“让保安认为这是鲍勃,而不是爱丽丝”)。
  3. 一步到位之魔术: 在一个瞬间的步骤中,这台机器会在秘密代码中加入一个微小的扰动。
  4. 结果: 代码被转化回声音。对于人类耳朵来说,它听起来完全正常。但对于安全保安来说,它听起来就像目标人物的声音。

为什么这意义重大

该论文声称,他们的方法之所以成为游戏规则的改变者,是因为具备三个特点:

  • 速度: 制作一个欺骗性声音所需的时间不到 7 毫秒。这比相机快门点击的速度还要快。它大约是其他“即时”方法的 24 倍,也是缓慢的“雕塑家”方法的近 19,000 倍
  • 隐蔽性: 因为他们处理的是声音的“本质”(秘密代码)而非原始噪声,所以生成的音频质量很高,不会出现杂音或机械感。
  • 有效性: 他们在识别语音命令(如“嘿 Siri”)和验证说话人身份(如通过声音解锁手机)的系统上进行了测试。
    • 在语音命令方面,他们成功欺骗系统的概率为 96% 至 99%
    • 在说话人验证方面,他们在欺骗系统方面达到了 100% 的成功率。

核心结论

研究人员不仅找到了破解这些系统的方法,还找到了瞬间无声地破解它们的方法。

他们警告说,随着我们将越来越多的语音激活安全系统应用于家庭和设备,我们需要意识到这些系统可能会被实时欺骗。他们的工作证明了音频处理的“秘密代码”层是一个薄弱环节,需要进行防御,因为目前,黑客可以在眨眼之间生成虚假的语音指令或身份。

注: 作者明确表示,他们仅使用 AI 工具来润色论文的英语表达和格式。所有的思想、实验和结果均由人类研究人员独立完成。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →