← 最新论文
💻 computer science

Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective

本文从信息论视角出发,提出了一种通过最小化教师模型输出与输入查询间的条件互信息来抑制基于 logits 的模型蒸馏攻击的新方法,在有效保护大语言模型知识产权的同时保持了其任务性能。

原作者: Hao Fang, Tianyi Zhang, Tianqu Zhuang, Jiawei Kong, Kuofeng Gao, Bin Chen, Leqi Liang, Shu-Tao Xia, Ke Xu

发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Hao Fang, Tianyi Zhang, Tianqu Zhuang, Jiawei Kong, Kuofeng Gao, Bin Chen, Leqi Liang, Shu-Tao Xia, Ke Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种保护大型人工智能模型(LLM)的新方法,防止别人“偷师学艺”。为了让你轻松理解,我们可以把整个过程想象成一位绝世大厨(教师模型)和想偷师的小学徒(学生模型)之间的故事

1. 背景:大厨的“独门秘籍”被偷了

想象一下,你是一位拥有顶级厨艺的大厨(比如 Llama 或 Qwen 模型)。你的菜谱和烹饪技巧价值连城,所以你不把菜谱公开,只通过“外卖窗口”(API)把做好的菜(回答)卖给顾客。

但是,总有一些狡猾的“小偷”(攻击者)想不花钱就学会你的手艺。他们不偷菜谱(因为拿不到),而是通过观察你端出来的每一道菜,甚至观察你端菜时的“表情”和“犹豫”(也就是论文中提到的 Logits/Logits,即模型输出每个字的概率分布),来反向推导你的烹饪逻辑。

  • 以前的防御(文字级): 就像大厨故意在菜里加奇怪的调料,或者把菜做得很难吃,让小偷学不会。但这有个问题:如果小偷只偷“味道”(文字),大厨加调料可能没用;而且如果大厨把菜做得太难吃,顾客(正常用户)也会不满意。
  • 现在的难题(逻辑级): 小偷现在很聪明,他们不仅看菜,还看你端菜时手抖不抖、眼神往哪看(Logits,即模型对下一个字的所有可能性的概率分布)。这些细微的“表情”里藏着大厨最核心的逻辑和上下文信息。现有的防御方法大多忽略了这一点。

2. 核心思路:给“表情”加一层“滤镜”

这篇论文的大厨(研究者)想出了一个绝妙的办法:我不改变我的厨艺,也不改变菜的味道,但我给端出来的菜加一层“智能滤镜”(变换矩阵)。

这层滤镜的作用是:

  1. 保留核心味道: 菜还是那个菜,顾客吃起来味道没变(模型的任务准确率保持不变)。
  2. 模糊“微表情”: 把大厨端菜时那些泄露秘密的“微表情”(多余的上下文信息)给抹掉或扭曲,让小偷看不明白。

3. 理论依据:用“信息论”算账

论文用了一个很高级的数学概念叫条件互信息(CMI),我们可以把它通俗地理解为**“泄露给小偷的额外信息量”**。

  • 理想状态: 如果大厨端菜时,只告诉小偷“这道菜是红烧肉”,而不透露“我刚才犹豫了一下是不是该放糖”或者“我刚才在想隔壁老王怎么做的”,那么小偷就学不到真本事。
  • 论文的目标: 通过数学计算,让这层“滤镜”把“多余的信息”压缩到最小,只保留“这道菜是什么”的核心信息。

4. 具体做法:两个“训练目标”

为了让这层“滤镜”起作用,研究者设计了两个训练目标,就像在训练一个**“防偷师助手”**:

  1. 目标一:菜还得好吃(交叉熵损失 LCE)
    • 我们要确保加了滤镜后,顾客(正常用户)看到的还是正确答案。比如问"1+1 等于几”,滤镜不能把"2"改成"3"。这保证了大厨的商业价值不受损。
  2. 目标二:让小偷学废(梯度方向最大化 Lgrad)
    • 这是最精彩的部分。研究者找了一个**“假学徒”**(代理学生模型)来模拟小偷。
    • 他们观察:如果直接看大厨的原版输出,假学徒能学到什么(梯度方向)?如果看了加了滤镜的输出,假学徒学到的方向是不是完全变了?
    • 策略: 调整滤镜,让假学徒学到的方向和大厨原本想教的完全相反(或者角度偏差最大)。就像大厨故意给假学徒指了一条完全错误的路,假学徒越努力学,离真功夫越远。

5. 效果:小偷“学傻了”,顾客“吃得好”

论文做了大量实验(在数学题、常识问答等数据集上):

  • 对顾客(正常用户): 大厨端出来的菜依然美味,回答依然准确,甚至逻辑依然通顺。
  • 对小偷(蒸馏攻击): 小偷试图模仿大厨,结果发现怎么学都学不会。
    • 现象: 小偷学出来的模型,要么回答变得断断续续,要么开始胡言乱语,甚至陷入死循环(比如一直在重复"794")。
    • 数据: 在数学题测试中,原本小偷能学到 70% 的水平,用了这个防御后,小偷只能学到 40% 甚至更低,而大厨自己的水平几乎没掉。

总结

这就好比一位绝世大厨,为了保护自己的核心配方,发明了一种**“智能上菜盘”**。

  • 顾客用这个盘子吃饭,味道和以前一模一样(保留效用)。
  • 但如果有小偷想透过盘子观察大厨的手部动作和眼神来偷师,这个盘子会把这些动作扭曲、模糊,让小偷看到的动作全是错的,从而彻底学废(防御蒸馏)。

这篇论文的创新点在于,它不再只是简单地“加噪音”或“改文字”,而是从信息传递的本质出发,精准地切断了“核心知识”和“多余上下文”之间的联系,是目前保护大模型知识产权的一项非常有力的技术。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →