← 最新论文
💻 computer science

Why Neural Structural Obfuscation Can't Kill White-Box Watermarks for Good!

该论文提出了名为 \textsc{Canon} 的恢复框架,通过重新定义神经结构混淆(NSO)为生产者 - 消费者范式下的图一致性威胁模型,并全局重写下游消费者以消除冗余通道,从而在保持任务效用的同时实现了针对 NSO 攻击的 100% 白盒水印恢复。

原作者: Yanna Jiang, Guangsheng Yu, Qingyuan Yu, Yi Chen, Qin Wang

发布于 2026-03-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Yanna Jiang, Guangsheng Yu, Qingyuan Yu, Yi Chen, Qin Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于**“给 AI 模型打水印”“如何识破伪装”**的有趣故事。我们可以把它想象成一场高智商的“猫鼠游戏”。

🎭 核心故事:一场关于“身份”的伪装战

想象一下,你是一家顶级餐厅(AI 模型)的老板。为了防止别人偷走你的招牌菜配方(模型参数),你在配方里藏了一个**“隐形水印”**(White-Box Watermark)。这个水印就像是你写在配方特定页码、特定行数的秘密记号。只要有人想偷配方,你拿出放大镜(白盒验证器)一照,就能发现那个记号,证明“这是我的菜”。

🦹‍♂️ 反派登场:NSO(神经结构混淆)

之前,有一群黑客(来自 USENIX Security'23 的研究)发明了一种叫NSO的绝招。

  • 他们的做法:他们不直接擦掉你的记号,而是往配方里塞入一堆“假人”(Dummy Neurons)。
    • 比如,他们把原本的一行字,复制成三行,或者插入一些完全没用的空白行,然后调整一下排版。
    • 关键点:这些操作非常狡猾,菜的味道完全没变(模型功能完全一致,准确率 100%),但是页码和行数全乱了
  • 结果:当你拿着放大镜去找原来的记号时,发现位置全变了,或者被假人挡住了。于是,黑客宣称:“看,水印没了!我们免费(Zero Cost)就破解了你的版权保护。”

🕵️‍♂️ 主角登场:CANON(我们的新武器)

这篇论文的作者(Yanna Jiang 等人)说:“别急,这招虽然高明,但并非无懈可击。”他们开发了一个叫 CANON 的系统,专门用来**“拨开迷雾,还原真相”**。

🧩 核心原理:用“逻辑一致性”识破伪装

CANON 为什么能赢?因为它抓住了一个黑客无法回避的物理铁律“牵一发而动全身”

1. 一个生动的比喻:乐高积木与流水线

想象你的 AI 模型是一个巨大的乐高流水线

  • 正常情况:传送带 A 把积木传给传送带 B,B 再传给 C。
  • 黑客的 NSO 攻击:黑客在传送带 A 中间强行插入了几个**“假积木”**(Dummy Channels)。
    • 如果这些假积木只是在那儿摆着不动,那没问题。
    • 但如果它们要参与工作(比如把积木传给 B),黑客就必须同时修改 B 和 C 的接收规则,确保传过去的东西加起来还是原来的样子。
    • 这就留下了破绽:为了保持“味道不变”(功能等价),黑客必须在整个流水线上保持一种极其严格的数学平衡

2. CANON 的绝招:全局侦探

CANON 不像以前的防御者那样只盯着某一层看(那是“管中窥豹”)。它像一个全知全能的侦探,拿着探照灯(Probe Inputs)照遍整个流水线:

  • 寻找“幽灵”:它发现那些被插入的“假积木”,虽然看起来像真的,但它们在流水线上留下的**“活动签名”**(Activation Signatures)非常奇怪。比如,它们要么完全不动,要么总是和某个真积木成比例地动。
  • 全局同步:一旦 CANON 发现某处插入了假积木,它就知道,为了保持平衡,下游的所有接收者(Fan-out, Residual Add, Cat)都必须做出一致的调整
  • 一键还原:CANON 利用这种**“全局一致性”,像整理乱序的乐高一样,把所有多余的假积木剔除,把被搞乱的排版重新对齐。它不需要知道黑客具体怎么改的,只要模型还能正常工作,CANON 就能逆向工程**出原本的结构。

🏆 实验结果:完胜!

作者做了大量的实验,把各种复杂的现代 AI 模型(如 ResNet, EfficientNet, Inception 等)都拿去被黑客攻击,然后再用 CANON 修复。

  • 准确率:修复后的模型,做菜的味道(准确率)100% 没变
  • 水印找回:原本被黑客搞丢的水印,100% 找回来了!无论黑客怎么组合那些“假人”(零注入、成对抵消、分裂复制),CANON 都能把它们清理干净。
  • 零误伤:如果模型本来就没被攻击,CANON 也不会瞎改,完全安全

💡 总结:这篇论文告诉我们什么?

  1. 水印没死:以前有人说“结构混淆”能彻底杀死白盒水印,这篇论文证明那是错的。只要模型还能正常工作,它的内部结构就必然遵循某种逻辑,这种逻辑就是水印的救命稻草。
  2. 防御要“看大局”:以前的防御只盯着局部(比如只看某一层),容易被骗。新的防御(CANON)必须看整个图(Graph-Consistent),利用上下游的牵制关系来识破伪装。
  3. 未来可期:这意味着,即使黑客能免费修改模型结构,我们依然有办法把模型“洗白”,找回版权证明。这就像不管小偷怎么把家具重新摆放,只要房子结构没变,警察(CANON)就能把家具归位,找到藏起来的证据。

一句话总结
黑客以为把模型“打乱重组”就能抹去水印,但 CANON 就像一位精通建筑结构的侦探,利用“牵一发而动全身”的物理规律,把模型还原回了原本整洁的样子,让水印无所遁形。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →