← 最新论文
🤖 AI

Asking Back: Interaction-Layer Antidistillation Watermarks

本文提出“交互层抗蒸馏水印”,这是一种新颖的防御机制,通过将可检测的行为标记嵌入大语言模型的系统提示中,即使攻击者对传统令牌级信号进行改写或剥离,也能可靠地追踪未经授权的蒸馏行为,该方法在多种学生模型上展现出高迁移性,且对用户影响极小。

原作者: Guang Yang, Amir Ghasemian, Fengchen Liu, Zhong Wang, Ninareh Mehrabi, Homa Hosseinmardi

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Guang Yang, Amir Ghasemian, Fengchen Liu, Zhong Wang, Ninareh Mehrabi, Homa Hosseinmardi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和生动的类比对论文《Asking Back: Interaction-Layer Antidistillation Watermarks》(“反问:交互层抗蒸馏水印”)的解释。

核心难题:“幽灵学生”

想象一位在高档餐厅工作的名厨(教师),他拥有一本无人能见的秘密食谱。一个狡猾的竞争对手(攻击者)无法偷走这本食谱,但他可以点遍菜单上的每一道菜,详细记录下厨师的每句话和上菜方式,然后雇佣一名初级厨师(学生)来背诵这些笔记。

这名初级厨师变得如此擅长复制菜肴,以至于他可以开一家自己的餐厅,出售完全相同的食物,却从未见过原始食谱,也从未向厨师支付过任何费用。这被称为未经授权的知識蒸馏

名厨想知道:“那家新餐厅是不是在用我的食谱?”

旧方案:在食物上做标记

过去,厨师们试图通过在食物本身中放入隐形墨水来抓住小偷。

  • Token 水印:厨师会秘密地改变切菜的方式或装饰的摆盘(即改变 AI 回复中的特定词语或"Token")。
  • 问题:如果小偷足够聪明,他们只需重新摆盘。他们可以拿到厨师的描述,用自己的话重写(改写/转述),然后再次端上桌。隐形墨水被洗掉了,但味道(知识)却保留了下来。小偷因此逍遥法外。

新点子:“反问”水印

这篇论文提出了一种新策略。厨师不再标记食物(文本),而是标记对话(交互)。

想象厨师有一条规则:“每上一道菜后,我必须向顾客问一个后续问题,比如‘这是为了生日派对还是商务午餐?’"

  • 策略:厨师(AI API)被赋予了一个隐藏指令,偶尔提出这些后续问题。
  • 盗窃:小偷记录了厨师的回答以及问题。他们训练初级厨师模仿这种行为。
  • 关键点:即使小偷用自己的话重写了厨师的回答,初级厨师也学会了“优质服务”包括提出后续问题。因此,初级厨师开始也提出这些问题,尽管他们从未见过原始厨师。

防御者(原始厨师)随后可以光顾新餐厅,问一个问题,看看初级厨师是否会反过来提出后续问题。如果他们这样做了,这就是他们偷窃训练数据的有力证据。

他们如何测试

研究人员进行了一项大规模实验,以验证这种“反问”技巧是否有效。

  1. 设置:他们使用了一个巨大且智能的 AI(Llama-3.3-70B)作为“厨师”。他们训练了三种不同类型的小型 AI(Gemma、OLMo 和 Qwen)来模仿这位厨师。
  2. 条件
    • 强模式:厨师每次都提出后续问题。
    • 弱模式:厨师仅在约20% 的时间提出后续问题(以此增加识别难度)。
    • 风格模式:厨师不提问,而是添加一条有用的提示,例如“当你赶时间时,这招最有效”。
  3. 攻击:他们模拟了一个小偷,该小偷在训练学生之前会重写厨师的提示(即“转述攻击”)。

他们的发现(结果)

  • 它有效(H1 & H2):小型 AI 完美地学会了这种行为。即使厨师只在 20% 的情况下提问,学生们也开始以远高于正常水平的频率提出这些问题。这种现象在所有三种不同类型的学生 AI 中都发生了。
  • 它能抵御重写(H3):即使小偷试图重写提示以隐藏模式,学生们仍然保留了这一习惯。有趣的是,其中一个学生模型(OLMo)在经过转述数据的训练后,实际上在提问方面变得比原始厨师更出色
  • 它难以察觉(H4 & H5)
    • 低密度:即使厨师仅在 20% 的时间使用该水印,它依然有效。
    • 隐蔽性:他们让 20 个人与 AI 聊天。人们没有察觉到差异。他们对与“带水印”AI 的对话评分与正常对话一样满意。额外的问题并没有让人感到恼火或奇怪。

“秘密酱料”类比

可以把旧的水印想象成在砖块上绘制独特的图案。如果你把砖块拿下来,打磨掉表面,再涂上油漆,图案就消失了。

而这种方法就像是教砌砖工养成一种特定的习惯。如果你教砌砖工在砌砖前总是用抹刀敲击三次,然后他们为别人砌了一堵墙,他们仍然会敲击抹刀三次。你无法仅仅通过重新粉刷墙壁就抹去这种习惯。“敲击”是行为,而不是油漆。

结论

该论文得出结论,观察 AI如何交互(其行为)是一种捕捉窃贼的强大新途径。它是位于文本、模型代码和推理步骤之上的“第四层”防御。

  • 好消息:它难以去除,适用于不同类型的 AI,且不会打扰用户。
  • 注意事项:研究承认,如果小偷非常聪明并专门试图去除这种特定行为,他们仍可能成功。此外,在一个 AI 模型(OLMo)中观察到的“超级学习”效应可能是该模型特有的偶然现象,需要更多测试。

简而言之:如果你想知道一个 AI 是否是模仿者,不要只看它说了什么;要听它如何回应。如果它开始提出与原始模型相同的奇怪后续问题,那它很可能就是一个学生。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →