Model Stealing Through the Lens of Model Multiplicity
本文通过证明尽管近优提取模型在准确率上与目标模型相当,但其拉肖蒙集(Rashomon Set)在公平性和鲁棒性等关键部署属性上表现出显著的多样性,从而挑战了高保真模型窃取攻击会产生经济等效代理模型的假设。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你雇佣了一位大师级厨师来创造一道秘密的、屡获殊荣的食谱。一位竞争对手想要偷走那份食谱,但他们不被允许看到食材或烹饪步骤。相反,他们只能向大师级厨师订购菜肴,品尝它们,并记录下结果。
基于这些品尝测试,竞争对手试图重现这道菜。
旧的思维方式:
长期以来,专家们认为,如果竞争对手制作出的菜肴尝起来有 99% 与大师级厨师的菜肴相似,那么他们就成功偷走了食谱。他们假设竞争对手得到了原始模型的完美克隆。如果味道一致,那么“知识产权”就丢失了。
本文的新视角:
本文认为,“尝起来一样”并不意味着“烹饪方式一样”。
作者指出,并不存在仅仅一种方法可以重现出与原版味道几乎完全相同的菜肴。存在着一整个食谱家族(他们称之为“罗生门集”,即 Rashomon Set),这些食谱都能做出与原版几乎一模一样的味道,但它们使用的食材、烹饪时间或技术却完全不同。
以下是他们如何使用简单的类比来解释这一点:
1. “条条大路通罗马”问题
想象你正在尝试猜一个 1 到 100 之间的秘密数字。
- 大师级厨师(目标模型): 知道数字是 42。
- 窃贼(对手): 问道:“比 40 大吗?” 大师说“是的”。“比 50 小吗?” 大师说“是的”。
- 窃贼的猜测: 基于此,窃贼猜是 42。他们猜对了!他们偷走了答案。
但如果窃贼猜的是 45 呢?或者是 48?
如果大师的规则实际上是“选择任何 41 到 49 之间的数字”,那么 42、45 和 48 都是同样正确的答案。它们都满足了“品尝测试”(查询)。
论文显示,在机器学习中,当窃贼窃取一个模型时,他们往往会得到这样一个“45”或“48”的猜测。它尝起来和原版一样(高保真度/fidelity),但如果你稍后问一个稍微不同的问题,或者观察特定的人群,窃贼的模型给出的答案可能与原版完全不同。
2. “影子戏”类比
把原始模型想象成一个复杂的手势,在墙上投射出一个鸟的影子。
窃贼只看到了影子(输出)。他们试图构建一只能做出同样鸟影子的手。
- 窃贼的手: 他们可能会使用不同的手指排列、不同的手腕角度或不同的手掌大小。
- 结果: 墙上的影子看起来完全是一只鸟。
- 陷阱: 如果光线稍微移动,或者你要求这只手做出一个不同的影子(窃贼从未见过的影子),窃贼的手可能会做出兔子或狗的影子,而原始的手仍会做出鸟的影子。
研究发现,即使“影子”(预测)看起来很完美,其“手”(内部逻辑)通常也是非常不同的。
3. “群体公平性”的转折
论文还研究了这些“不同的手”如何对待不同的群体。
想象大师级厨师的食谱是公平的:它给每个人都提供慷慨的分量。
窃贼的食谱平均而言尝起来是一样的。但由于他们使用了不同的方法,他们可能会在无意中给某一类人提供巨大的分量,而给另一类人提供极小的分量,尽管总食物量是相同的。
研究发现,虽然被窃取的模型在纸面上看起来是完美的副本,但它们对待不同群体(如不同种族或性别)的方式往往与原始模型截然不同。它们以原始模型没有做过的方式,重新分配了“误差”,且这种分配方式可能带有偏见。
他们到底做了什么?
研究人员不仅仅是偷了一个模型。他们偷了一个模型,然后使用了一种技巧(称为“dropout”,类似于随机摇晃模型的脑部),生成了数千个略有不同的版本的被窃模型。
他们发现:
- 所有这些模型尝起来都几乎与原版完全相同(高保真度)。
- 但是,当他们仔细观察时,许多模型在特定细节上彼此并不一致。
- 其中一些模型在处理方式上表现出了原始模型所没有的“不公平”。
核心结论
论文得出结论:窃取一个模型并不简单地等同于制作一个完美的副本。
仅仅因为被窃的模型在 95% 的情况下都能得到正确答案,并不意味着它就是原始模型。它可能是一个“看起来很像”的模型,在实验室环境下表现良好,但在现实世界中却会失效或表现出不公平的行为。
因此,如果一家公司说,“我们偷了他们的模型,因为我们的准确率是一样的”,论文给出的回应是:“别急。你可能偷到了一个完全不同的食谱,而这可能是危险的。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。