← 最新论文
🤖 AI

LambdaMark: Semantic Audio Watermarking for Robustness and Radioactivity

LambdaMark 引入了首个通用的放射性音频水印方案,该方案将多比特消息嵌入到语义潜表征中,在实现对常见失真和对抗性移除攻击的卓越鲁棒性的同时,确保水印即使在模型针对带水印数据进行微调后依然能够持续存在。

原作者: Kexin Li, Xiao Hu, Ilya Grishchenko, David Lie

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Kexin Li, Xiao Hu, Ilya Grishchenko, David Lie

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一段极其珍贵的语音录音。在过去,如果有人偷走了它,你或许可以通过查看原始文件来证明它是你的。但如今,有了先进的人工智能,窃贼可以夺取你的声音,教机器人如何模仿你的说话方式,并让这个机器人生成从未由你说过的“新句子”。这个新声音听起来和你一模一样,但原始文件已经不复存在了。你该如何证明这个机器人使用的是偷来的你的声音呢?

这正是 LambdaMark 所要解决的问题。它是一种全新的音频“数字纹身”,这种纹身极难被抹除,即使音频被复制、编辑或用于训练新的 AI,它依然能够存在。

以下是其工作原理的解释,通过简单的类比进行说明:

1. 旧方法:在表面上作画

以往的音频水印方法就像是在一幅画的特定位置画下一个微小的、肉眼看不见的点

  • 它们将信号隐藏在声波的“噪声”中(比如某种特定的咔哒声或嗡嗡声),人类无法察觉。
  • 缺陷: 如果小偷拿走那幅画,擦掉表面,或者复印它(这相当于对音频进行压缩或通过滤波器处理),那个微小的点就会被抹去。
  • “放射性”问题: 更糟糕的是,如果小偷利用这幅画去教机器人如何作画,机器人会学习画作的“风格”,但它会忘记那个微小的、看不见的点。这个点并不会“感染”机器人创作的新艺术品。

2. LambdaMark 的方式:改变 DNA

LambdaMark 采取了一种完全不同的方法。它不是在表面上画一个点,而是改变了画作的 DNA

  • 语义偏移(The Semantic Shift): 想象一下,音频不仅仅是一个声波,而是一套描述“声音是什么”(例如,“一个开心的声音在说你好”)的指令。LambdaMark 微妙地调整了这些指令。它不是添加了噪声,而是轻微地改变了音频的“含义”或“神韵”,这种改变对人类耳朵来说依然自然,但却携带了一个秘密代码。
  • 类比: 把它想象成在汤里加入一种特定的、微妙的香料。
    • 旧方法: 在碗边缘撒上一粒微小的、肉眼看不见的盐粒。如果你把汤倒入新锅中(压缩),或者让别人品尝(下游 AI),那粒盐就会丢失。
    • LambdaMark: 稍微改变配方,使汤本身的口味变得略有不同。如果你把这锅汤倒入新锅中,那种味道依然存在。如果一位厨师(AI)品尝了这锅汤并试图重现它,他们会无意中重现那种特定的风味,因为这种风味已经成为了他们所学习的配方的一部分。

3. 为什么它是“放射性”的

论文称这种特性为**“放射性”(Radioactivity)**。

  • 在物理学中,放射性物质如果与其他物体接触,会让其他物体也具有放射性。
  • 在 LambdaMark 中,如果攻击者窃取了你带有水印的音频并用它来训练一个新的 AI 模型,那么这个新模型会继承这个水印
  • 即使这个新 AI 生成了你从未说过的新句子,这些新句子仍然会携带你的“数字 DNA”。你可以从新 AI 的输出中检测到你的水印,从而证明它是基于你被盗的数据进行训练的。

4. 为什么它如此难以去除

论文测试了 LambdaMark 抵御“对抗性攻击”(即黑客试图抹除水印的尝试)的表现。

  • 旧方法: 因为旧的水印只是声波中的“点”,黑客可以使用数学方法找到并擦除它们,或者使用 AI 精确识别这些点的位置并将其移除。
  • LambdaMark: 由于水印被编织进了音频的“含义”(语义结构)之中,因此不存在可以被擦除的单一“点”。要移除它,黑客必须从根本上改变单词的含义或声音的情感,而这将毁掉整个音频。这就像试图在不改变汤的味道的前提下,把汤里的“辣味”去掉一样;这几乎是不可能的。

结果

研究人员在真实的音频数据集上测试了 LambdaMark,发现:

  • 近乎完美的检测率: 即使在音频经过失真、压缩或添加噪声处理后,它仍能 99.9% 地检测出自身的水印。
  • 跨模型成功: 即使音频被用于训练完全不同类型的 AI 模型(如文本转语音或音乐生成器),它依然有效。
  • 无“幽灵”伪影: 带有水印的音频对人类耳朵来说听起来依然自然。

总而言之: LambdaMark 是一个不仅给门加锁(音频文件),而且改变了房屋蓝图的安全系统。如果有人偷走了蓝图并建造了一座新房子,无论小偷如何试图粉刷覆盖,这座新房子依然会带有原主人的独特签名。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →