← 最新论文
🤖 machine learning

Dataset Watermarking for Closed LLMs with Provable Detection

本文提出了首个针对闭源大语言模型的可证明数据集水印方法,该方法通过提高随机选定的词对共现频率来嵌入可检测信号,并成功在模型输出中识别这些信号,即使水印数据仅占微调令牌的 1%,同时仍保持数据集的实用性。

原作者: Pengrun Huang, Kamalika Chaudhuri, Yu-Xiang Wang

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Pengrun Huang, Kamalika Chaudhuri, Yu-Xiang Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位烘焙师,花费多年时间完善了一款特色蛋糕的秘传家族食谱。你决定将食谱公之于众,让他人得以学习。然而,你担心一家大型连锁烘焙坊可能会窃取你的秘传食谱,将其混入他们庞大的面团批次中,然后宣称他们的新蛋糕完全是自己的发明。更糟糕的是,他们甚至可能利用你的食谱,以特定方式让蛋糕口感“更胜一筹”,从而误导评委,使其认为他们的连锁品牌是全球最佳。

本文介绍了一种巧妙、无形的“成分标签”,即使烘焙连锁拒绝展示他们的搅拌碗或食谱簿,你也能证明其使用了你的食谱。

以下是该论文方法的运作原理,分解为简单概念:

问题:“黑箱”烘焙坊

在人工智能领域,公司通过向“语言模型”(如智能聊天机器人)输入海量文本来构建它们。有时,它们会意外或故意使用特定数据集(如考试题或专有文章)来训练这些模型。这被称为“污染”。

问题在于,大多数此类模型都是封闭黑箱。你可以与它们对话(提问),但无法窥探其“大脑”内部以了解它们如何处理信息。以往捕捉作弊者的方法需要窥探模型的“逻辑输出”(logits,即其内部数学运算),而这对于封闭模型是不可能的。

解决方案:“秘密词对”标签

作者提出了一种在数据集发布之前对其进行水印的新方法。可以这样理解:

  1. 秘密代码:在发布数据集之前,所有者挑选一份随机词对列表,这些词对在正常对话中通常不会频繁共现(例如,“镁”和“雨伞”)。
  2. 改写:他们利用人工智能改写数据集。目标不是改变句子的含义,而是让这些特定词对出现的频率比自然情况略高。这就像微妙地调整食谱中的配料,让“镁”和“雨伞”在同一个段落中多出现几次。
  3. 无形信号:对人类读者而言,文本看起来完全正常。但在统计学上,那些特定的词对在该数据集中变得“粘滞”。

检测:“品尝测试”

随后,如果一家公司声称他们仅使用自己的数据训练了模型,你可以对其进行测试:

  1. 查询:你要求模型生成大量文本(例如让它写故事或回答问题)。
  2. 计数:你检查生成的文本,看看那些“粘滞”词对(镁 + 雨伞)是否以高于纯随机概率的频率共同出现。
  3. 裁决:如果模型使用了带水印的数据,这些词对将会频繁共现。如果模型使用你的数据,这些词对将随机分散。

论文从数学上证明,如果你观察到这种模式,那几乎肯定是因为模型是在你的特定数据集上训练的,而非出于随机运气。

为何这至关重要

论文强调了三大优势:

  • 适用于封闭模型:你无需查看模型的内部代码。你只需像普通用户一样与它对话即可。这就像只需品尝蛋糕就能检测出秘密成分,而无需进入厨房查看。
  • 具有韧性(“稀释”测试):想象烘焙坊将你的食谱与另外 99 种食谱混合。论文表明,即使你的水印数据集仅占总训练数据的 1%,那些“粘滞”词对仍然可被检测。信号足够强大,足以在淹没于海量其他数据的汪洋中幸存。
  • 抵御编辑:如果烘焙坊试图通过删除随机单词、替换同义词或添加表情符号来“清洗”食谱,该信号通常仍能幸存。其他依赖对单个单词进行微小、特定修改的方法在文本被编辑时极易失效,而这种“词对”方法则更为 robust(稳健)。

这会毁掉蛋糕吗?

水印技术的一个主要担忧是:“这是否会改变数据,使其不再适用于测试人工智能?”

作者对此进行了广泛测试。他们发现:

  • 含义保持不变:改写后的文本含义与原文一致。
  • 测试依然有效:如果你使用这种带水印的数据集来测试人工智能的智能程度,人工智能获得的分数与使用原文时相同。关于“哪个 AI 最聪明”的排名不会改变。
  • 优于替代方案:与其他重写整个句子(可能导致文本听起来像机器人)的水印方法相比,该方法进行的是更小、更局部的编辑,使文本在外观和感觉上保持自然。

局限性

论文诚实地说明了它无法做到什么:

  • 无法时光倒流:你必须在发布数据之前应用此水印。你无法回溯并给几年前已发布的数据集添加水印。
  • 非防护盾:这是一种用于事后检测盗窃或污染的工具,而非防止其发生的防护盾。
  • 训练规模:测试是在“微调”(教授模型特定技能)阶段进行的,其规模远小于模型学习一切知识的庞大“预训练”阶段。在那种大规模的预训练阶段检测污染仍然是一个未解决的挑战。

简而言之,这篇论文提供了一种统计“指纹”,使数据所有者能够证明其作品被用于训练封闭的人工智能模型,即使该模型试图掩盖证据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →