← 最新论文
🤖 AI

FIT-Print: Towards False-claim-resistant Model Ownership Verification via Targeted Fingerprint

该论文介绍了 FIT-Print,这是一个针对性的模型指纹识别框架,它在保持对多种重用技术 100% 的所有权验证准确率的同时,有效地中和了虚假声明攻击,并消除了在独立模型上的误报。

原作者: Shuo Shao, Haozhe Zhu, Yiming Li, Hongwei Yao, Tianwei Zhang, Zhan Qin

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Shuo Shao, Haozhe Zhu, Yiming Li, Hongwei Yao, Tianwei Zhang, Zhan Qin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:数字“指纹”存在的问题

想象一下,你是一位厨师,花费多年时间研发出了一份秘密且美味的食谱(深度学习模型)。你决定向世界分享这份食谱,以便让其他人学习。然而,你担心有人会偷走你的食谱,稍作修改,然后将其作为自己的作品进行销售。

为了阻止这种情况,你需要一种方法来证明:“嘿,这道菜的味道和我的秘密食谱完全一样!”

在 AI 世界中,这种证明被称为模型指纹识别(Model Fingerprinting)。它就像是在你的食谱上留下一个独特的标记,以便你日后进行识别。

旧方法的缺陷:
该论文指出,目前的指纹识别方法就像是一场蒙面品尝测试

  • 现状是如何运作的: 你给品鉴者(验证者)一勺来自你食谱的随机汤汁,以及一勺来自嫌疑人食谱的随机汤汁。如果它们尝起来很像,你就假设嫌al偷了你的食谱。
  • 漏洞在于: 一个聪明的窃贼可以烹饪出一勺“伪造”的汤,这勺汤恰好尝起来和你的随机汤汁一模一样,尽管他们的整锅汤其实完全不同。他们可以以此欺骗品鉴者,让品鉴者误以为他们偷了你的食谱,而实际上并没有。这被称为**“虚假索赔攻击”(False Claim Attack)**。

解决方案:FIT-Print(“定向”指纹)

作者引入了一个名为 FIT-Print 的新系统。它不再是蒙面品尝测试,而是使用一种定向签名(Targeted Signature)

类比:秘密握手
想象一下,你不仅仅是问:“这汤的味道和我的一样吗?”相反,你会说:“这汤的味道是否完全符合我发明的一种特定的、复杂的风味模式?”

  1. 目标(The Target): 你创建一个特定的“目标指纹”(就像一个秘密握手或一个特定的 Logo)。
  2. 优化(The Optimization): 你不仅仅是随机挑选汤的样本。你会通过数学手段调整你的食材(测试样本),直到它们在你的锅中烹饪时,能产生那个完全一致的特定风味模式。
  3. 测试(The Test): 当你检查嫌疑人的锅时,你会问:“你的汤是否能产生那套完全相同的特定风味模式?”

为什么这能阻止窃贼:

  • 旧方法: 很容易找到一勺偶然尝起来像我食谱的汤。
  • 新方法 (FIT-Print): 一个窃贼想要烹饪出一份完全不同的食谱,却又恰好能产生你那套特定的、复杂的、预定义的风味模式,这是极其困难的。窃贼可以进行欺骗的“空间”被压缩到了几乎为零。

他们是如何实现的(两种方法)

论文提出了两种创建这种“定向签名”的具体方法:

  1. FIT-ModelDiff(“逐位检测”侦探):

    • 该方法一次观察模型输出的一个微小部分(就像检查单词中的单个字母)。
    • 它测量模型对正常图像与经过轻微修改后的图像反应之间的距离。
    • 它强制这些反应去匹配一个特定的二进制代码(由 1 和 -1 组成的字符串),这个代码充当了你的签名。
  2. FIT-LIME(“特征图”侦探):

    • 该方法同时观察整幅图像。
    • 它使用了一种叫做 LIME 的技术(该技术可以高亮显示图像中哪些部分对决策最为重要)。
    • 它创建一个“重要性热力图”,并强制这个热力图看起来与你的目标签名完全一致。

结果:效果如何?

作者针对许多不同的场景测试了他们的系统,包括:

  • 复制(Copying): 仅仅是复制代码。
  • 微调(Fine-tuning): 某人拿走了你的模型并对其进行了进一步训练。
  • 剪枝(Pruning): 某人删减了你模型的部分组件以使其体积变小。
  • 提取(Extraction): 某人试图通过向你的模型提问来重建你的模型。

评分卡:

  • 防御虚假索赔: 当一名窃贼试图冒充并不拥有的模型的拥有者时,FIT-Print 100% 抓住了他们。误报率为 0%
  • 保护真实所有者: 当真实所有者检查自己的被盗或被重复使用的模型时,FIT-Print 100% 确认了其所有权
  • 抵御攻击: 即使当窃贼试图变得“聪明”并专门训练他们的模型来破坏指纹时,FIT-Print 依然表现稳健。

“仅标签”场景

论文还测试了一个更困难的情况,即验证者只能看到最终答案(例如,“这是一只狗”),而看不到内部的置信度分数。即使在这种受限的视角下,FIT-Print 仍然表现完美,能够精准区分真实所有者与虚假索赔者。

总结

该论文声称,旧的 AI 指纹识别方法过于宽松,容易被聪明的窃贼欺骗。FIT-Print 通过强制 AI 产生一个非常具体的、预定义的“签名”,而不是仅仅产生一个通用的相似性,从而解决了这个问题。这使得窃贼在数学上几乎不可能伪造一个并非其创造的模型的所有权,同时仍能让真实的所有者轻松证明自己的权利。

作者还展示了这在不同类型的模型(如文本生成器)和不同规模的模型上同样有效,证明了它是未来 AI 版权保护的一个灵活解决方案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →