← 最新论文
💻 computer science

Echoes of ownership: Adversarial-guided dual injection for copyright protection in MLLMs

本文提出了一种名为“对抗引导双注入”的框架,通过将图像作为可学习张量并结合语义级与文本级双重注入机制,为多模态大语言模型生成版权触发器,从而在衍生模型中精准提取所有权信息并抵抗微调干扰。

原作者: Chengwei Xia, Fan Ma, Ruijie Quan, Yunqiu Xu, Kun Zhan, Yi Yang

发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Chengwei Xia, Fan Ma, Ruijie Quan, Yunqiu Xu, Kun Zhan, Yi Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种给多模态大语言模型(MLLM,就是那种既能看图又能聊天的超级 AI)“打隐形水印”的新方法,用来防止别人偷了你的模型去赚钱还赖账。

我们可以把这项技术想象成给 AI 模型植入了一种“只有主人知道的特殊暗号”

1. 背景:为什么需要这个?

想象一下,你辛苦研发了一款很厉害的 AI 画家(比如 LLaVA 或 Qwen),把它开源了。结果,有个坏心眼的公司偷偷下载了你的模型,稍微改改(微调),然后声称这是他们自己的产品,开始收费。

这时候,你作为原作者,怎么证明“这模型是我做的”呢?

  • 传统方法不行:以前的方法要么需要拆开模型看内部代码(黑盒场景下做不到),要么就是给模型“洗脑”让它记住特定的指令。但坏蛋只要把模型重新训练一下,这些“洗脑”效果就没了。

2. 核心创意:双重注射(Dual Injection)

作者想出了一个绝妙的办法:造一张“特制图片”

这张图片看起来和普通的图片一模一样(人眼看不出区别),但如果你把它和特定的问题(比如“请停止”)一起喂给你的模型(或者基于你的模型微调过的模型),模型就会像条件反射一样,回答出你预设的“暗号”(比如“我在玩游戏”)。

而如果你把这张图喂给别人的模型(完全没沾过你边界的模型),它就会像正常人一样回答“我不知道”或者“这图没啥特别的”。

怎么做到这一点呢?作者用了“双重注射”策略:

  • 第一重注射:反应层对齐(Response-level)

    • 比喻:就像训练一只狗。你拿着图片,不断调整图片的像素(在计算机里是微小的扰动),直到模型看到这张图时,嘴巴必须说出你指定的那句话。
    • 作用:确保模型能“听懂”这个暗号并做出反应。
  • 第二重注射:语义层对齐(Semantic-level)

    • 比喻:这是这篇论文最聪明的地方。作者发现,虽然模型被微调过,但它们大脑深处有一个通用的“翻译官”(类似 CLIP 模块),负责把图片和文字的意思对应起来。这个“翻译官”在微调后依然很稳定。
    • 做法:作者强迫这张特制图片的“深层含义”(向量特征)必须和那句暗号文字的“深层含义”紧紧贴在一起。
    • 作用:就像给图片打上了一个通用的基因标记。不管模型怎么微调,只要它保留了那个通用的“翻译官”,看到这张图就会联想到那个暗号。这大大增强了水印的抗干扰能力

3. 对抗训练:让水印更“皮实”

坏蛋可能会说:“我不仅微调,我还把模型剪枝(删掉一些参数)或者合并一下,看你还认不认!”

为了应对这个,作者玩了一个**“左右互搏”**的游戏:

  • 在生成这张特制图片的过程中,作者同时训练一个“辅助模型”。
  • 这个辅助模型的任务是:拼命抵抗,试图不输出那个暗号。
  • 结果:特制图片为了战胜这个“抵抗者”,必须进化得更强大、更通用。
  • 比喻:就像练武,你不仅要打靶子,还要和一个不断变强的对手对练。这样练出来的武功,面对真正的坏蛋(各种微调后的模型)时,才更不容易失效。

4. 实验效果:真的管用吗?

作者在各种场景下测试了这套方法:

  • 不同微调方式:无论是简单的微调(LoRA)还是彻底重练(Full Fine-tuning),只要模型是基于原作者的模型改的,这张“特制图片”都能成功触发暗号。
  • 不同领域:无论是做数学题的、看医学图的、还是分析金融图表的模型,都能被追踪到。
  • 抗干扰:即使模型被压缩了(量化)、剪枝了(删参数)、或者合并了,这张图片依然能起作用。
  • 不伤无辜:对于完全没沾边的其他模型,这张图片就像普通图片一样,不会乱说话(不会误报)。

总结

这篇论文就像给 AI 模型发明了一种**“隐形墨水”**。

  1. 不用拆开模型:只需要一张图和一句话就能验证。
  2. 双重保险:既管“说什么话”(反应),又管“想什么意”(语义),让水印很难被洗掉。
  3. 越练越强:通过模拟坏蛋的对抗,让水印变得无坚不摧。

这就好比你在自家做的蛋糕里,不仅加了一种只有你尝得出的味道(反应层),还加了一种无论怎么加热、怎么切块都不会消失的“基因标记”(语义层)。别人就算偷了配方去改,只要用了你的面粉(基座模型),一尝就能知道:“嘿,这蛋糕还是老张家的!”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →