← 最新论文
💻 computer science

Combining Self-Embedding Audio Watermarking with Ultra-Low-Bitrate Neural Codecs

本文提出了一种自嵌入音频水印框架,该框架利用紧凑的神经编解码器表示而非加密哈希,以实现在各种超低比特率神经编解码器上无需训练的检测、精确的帧级定位以及被篡改语音片段的全量恢复。

原作者: Yigitcan Özer, Xin Wang, Zhe Zhang, Junichi Yamagishi

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Yigitcan Özer, Xin Wang, Zhe Zhang, Junichi Yamagishi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代世界中,语音录音常被视为真实的永久记录。然而,技术的发展已达到如此程度,以至于演讲中的单个句子可以被替换、删除或改写,而不会留下人类耳朵可以察觉的痕迹。这种外科手术式修改音频的能力造成了一个深刻的问题:我们如何验证一段录音是否真实?如果它被篡改了,我们能否精准定位谎言始于何处?传统的音频完整性检查方法依赖于数字“封印”,例如加密哈希值。这些哈希值就像是从音频中计算出的唯一指纹;如果录音中哪怕只改变了一个比特,指纹就会失效,从而发出篡改过的信号。然而,这些传统封印有一个致命缺陷:一旦封印被破坏,原始内容就会永远丢失。该系统可以告诉你某个片段被修改了,但它无法告诉你原始的词句是什么,从而给听者留下了一个无法填补的故事空白。

东京国立情报研究所的研究人员提出了一种不同的方法,一种超越简单检测而转向主动恢复的方法。他们的工作探索了一种被称为“自嵌入”(self-embedding)的方法,即音频文件在其自身的数字结构内部携带了一个隐藏的、压缩后的自身副本。想象一下,一份文档在其页边距内隐藏着一份微小的、加密的自身文本蓝图;如果某一页被撕掉或改写,读者可以使用该蓝图来重建缺失或被改写的文本。研究人员使用新一代超低比特率神经编解码器(neural codecs)测试了这一概念。这些先进的计算机程序能够将语音压缩成极其微小的数字足迹——小到可以在不改变人类听感的情况下,在录音中放入许多份原始语音的“蓝图”副本。通过嵌入这些压缩表示而非仅仅是一个简单的哈希值,该系统不仅能检测出某个片段是否被操纵,还能重建被攻击前真实的嗓音。

团队在理想条件下测试了这一框架,这意味着他们模拟了没有背景噪声或信号退化的完美录制环境,以观察系统处理四种特定类型数字篡改的效果。他们测试了以下场景:单词被同一说话者的其他音频替换、单词被人工智能生成的合成语音替换、单词被直接删除,以及新单词被插入到语音流中的情况。在每种情况下,系统都成功恢复了隐藏的蓝图。由于蓝图被多次嵌入在整个录音中,系统可以忽略受损部分,并利用完整的副本拼凑出原始信息,就像在玩一个大部分碎片仍然存在的拼图游戏。结果是隐藏数据的完美恢复,使系统能够为任何被操纵的部分生成原始、未经篡改的语音重建。

一旦系统重建了音频“本应”呈现的样子,它就会将此重建版本与实际接收到的音频进行对比,以寻找差异。研究人员使用一种数学技术将这两个版本的音频进行对齐,从而能够发现即使是细微的时间差或结构变化。他们发现,该系统在识别录音是否被篡改方面非常有效,并且能够定位被篡改片段的具体边界。性能表现因操纵类型的不同而异:用新音频替换单词是最容易检测到的,而删除单词则是最难检测到的,因为删除内容会压缩时间轴,使得失真更难被隔离。然而,最重要的发现是,选择哪种压缩工具(或编解码器)比使用何种隐藏数据的方法更为重要。研究人员测试了三种不同的神经编解码器,结果显示,产生最忠实于原始语音重建效果的编解码器,也提供了最准确的篡改检测和定位。

研究还揭示了这些系统运作方式中一个令人惊讶的细微差别。重建语音的质量并不总是与系统检测篡改的能力相关联。其中一个编解码器产生的重建效果听起来非常自然且平滑,但在匹配原始波形方面不够精确,这实际上增加了系统识别差异的难度。相反,另一个编解码器产生的重建效果听起来不太自然,但能更精确地匹配原始数据,从而带来了更好的检测结果。这表明,对于验证完整性的目的而言,目标并不一定是创建一个完美的副本,而是要创建一个在数学上与原始源保持一致的副本。研究人员确认,隐藏的数据可以无误差地恢复,这意味着原始的口述内容总能被还原,这是传统基于哈希的系统无法实现的成就。

最终,这项工作证明了主动防御音频操纵是可能的,且无需通过训练系统来识别伪造音频样本。该系统通过将接收到的信号与其自身的自我重建进行对比来运作,不需要预先了解什么是“假”的。虽然目前的测试是在没有现实世界噪声或压缩的受控环境中进行的,但结果表明,将压缩版的音频嵌入自身是一种可行的路径。它提供了一种方法,不仅能标记录音是否遭到破坏,还能修复损伤,恢复原始表达的真相。研究表明,随着神经音频编解码器不断改进(变得更小、更高效),这种自恢复方法可能会成为在数字伪造日益普遍的时代,保护口头传播完整性的强大工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →