← 最新论文
🤖 machine learning

A Locally Tokenized Generative Model for Robust Time-Series Watermarking

本文介绍了 L-VQVAE 和 LVQMark,这是一种局部标记化的生成式框架,通过确保每个标记仅依赖于一个有界的时域邻域,克服了现有时间序列水印在后编辑攻击下的不稳定性,从而在金融、能源和神经影像学基准测试中稳定了检测可靠性。

原作者: Dongbin Kim, Geonwoo Shin, Yujin Choi, Soyeon Park, Jaewook Lee

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Dongbin Kim, Geonwoo Shin, Yujin Choi, Soyeon Park, Jaewook Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代数字领域,人工智能已成为现实的高级伪造者,能够生成看起来并表现得几乎与真实事物完全一致的合成数据。从金融市场趋势到大脑活动扫描,这些计算机生成的序列在训练其他系统和测试理论方面正变得日益有用。然而,这种力量带来了一个关键问题:我们如何知道什么是真实的,什么是机器制造的?如果缺乏验证数据集来源的方法,我们就有可能将对世界的理解建立在隐形伪造的基础之上。为了解决这个问题,科学家们开发了一种称为“水印”的方法,它就像一个直接嵌入到数据创建过程中的隐藏签名。这个签名旨在对人眼不可见,但可以通过特定的密钥被检测到,从而允许任何人随后证明某段数据确实是由特定的模型生成的。

然而,挑战在于这些数字签名异常脆弱。在时间序列数据的世界中——其中信息像一条数字之河随时间流动——任何微小的编辑,例如裁剪掉一段区域或稍微移动数值,都可能扰乱隐藏的签名。以往的修复尝试依赖于一种试图同时观察整个序列来解码信息的方法。研究人员发现这种全局方法存在缺陷;当攻击者篡改数据的某一部分时,解码过程会在整个序列中产生混乱,导致检测器要么完全漏掉水印,要么更糟的是,错误地指控无辜的、未加水印的数据为伪造。这种不稳定性意味着,这个旨在保护我们信任的工具很容易被简单的编辑所欺骗。

来自首尔大学和南洋理工大学的研究团队现在提出了一种构建这些签名的新方法,该方法将数据视为小的、可管理的块,而不是作为一个单一且纠缠在一起的整体。他们引入了一个名为 L-VQVAE 的新系统,该系统将长的时间序列数据流分解为短的、重叠的窗口。该系统不再试图通过理解数据的整个历史来寻找模式,而是将每个小窗口编码为一个离散符号,就像将一个句子变成一串单独的单词一样。这种设计确保了如果攻击者切割或更改了部分数据,混乱将被限制在该特定区域内,而不会扩散到序列的其他部分。通过保持解码过程的局部性,该系统防止了小规模编辑引发导致破坏检测能力的连锁错误。

基于这种局部结构,研究人员开发了一种名为 LVQMark 的方法来实际写入和读取水印。在创建数据期间,系统会微妙地偏向其选择,以偏好某些符号而非其他符号,从而创建一个作为签名的统计模式。当需要验证数据时,即使数据受到了攻击,一个鲁棒的解码器也会介入,从受损信号中恢复原始符号。由于系统只需要观察一个小的、有界的邻域来理解每个部分,因此即使在数据被裁剪、偏移或插入随机值的情况下,它也能准确地重建隐藏的信息。研究人员在四种非常不同的数据类型上测试了这种方法:股票市场价格、能源消耗记录、电力使用情况以及大脑的功能磁共象成像(fMRI)扫描。在每种情况下,这种新方法都能成功识别出带水印的数据,同时保持极低的误报率,即使数据经历了显著的编辑。

结果表明,这种局部方法解决了困扰以往方法的稳定性问题。在旧系统要么无法检测到水印,要么错误地将干净数据标记为伪造的测试中,新系统保持了稳定。例如,当数据被裁剪掉 30% 时,旧的检测器经常产生巨大的误差,有时甚至会近乎确定地指控干净数据为伪造。相比之下,新方法使干净数据的检测得分保持在接近于零的水平,这意味着它正确地拒绝了这些数据,同时仍能清晰地识别出带水印的样本。研究人员还确认,这种鲁棒性并没有以牺牲质量为代价;由其系统生成的合成数据仍然高度逼真且对分析非常有用。通过将检测过程锚定在小的、独立的窗口上,该团队创造了一种更可靠的方法来证明合成时间序列数据的来源,确保我们赖以建立信任的数字签名能够在现实世界中不可避免的编辑和操纵中幸存下来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →