The Linear Geometry of Interpretable Tokens: Jailbreaking Attacks and Defenses for Unlearned Diffusion Models
本文揭示了在已进行遗忘学习的扩散模型中,被擦除的概念会作为连贯的线性子空间持久存在于标记嵌入(token embeddings)之中,从而催生了 SubAttack——一种利用该结构的高效越狱方法,以及 SubDefense——一种通过投影出该子空间来稳健抑制残留有害概念并同时保持生成质量的轻量化机制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个计算机只需通过听你的话就能画出画作的世界。你说,“一只戴着帽子的猫”,然后“砰”的一声,一张完美的图像就出现了。这些被称为扩散模型(Diffusion Models),它们就像是通过研究数百万张照片来学习创作的数字艺术家。但有时,这些艺术家在记忆某些不该记住的东西时,会变得过于出色。如果你要求它们画一些危险或受版权保护的内容,它们可能还是会照做。为了解决这个问题,科学家们发明了一个叫做**“遗忘学习”(Unlearning)**的过程。把它想象成一位老师试图让学生忘记一个特定的事实,比如一个国家的首都是哪里,但又不希望让他忘记如何做数学或阅读。其目标是“抹除”计算机大脑中的坏念头,同时保留它绘制其他一切事物的能力。但棘手之处在于,即使老师说了“忘记那个事实”,学生可能仍然有一种我们无法轻易察觉的秘密方式来记住它。这篇论文深入探讨了这个谜团,提出了这样一个问题:如果我们认为已经抹除了一个坏念头,它究竟藏在哪里,我们又该如何最终彻底清除它?
这篇论文的研究人员发现,当一个扩散模型试图“遗忘”一个有害概念(如裸露或特定艺术家的风格)时,它并没有真正删除它。相反,这个概念隐藏在计算机记忆中一个**秘密的线性子空间(linear subspace)**里。用一个比喻来说,想象计算机的大脑是一个巨大的词汇图书馆。当我们试图移除关于“裸露”的那本书时,计算机并不会烧掉这本书。相反,它把书页撕碎,并将碎片藏在图书馆里一个特定的、隐形的抽屉里。论文显示,这些碎片仍然以一种整齐、可预测的线条组织在一起。作者将这个隐藏的抽屉称为“残余子空间(residual subspace)”。
为了证明这一点,团队创建了一个新工具,叫做 SubAttack。SubAttack 并不像之前的黑客那样尝试用随机词汇来欺骗计算机,它更像是一位知道那个隐形抽屉确切位置的高级图书管理员。它学习了一组特殊的“魔法钥匙”(这些钥匙本质上就是普通词汇的组合),可以打开那个抽屉。当他们使用这些钥匙时,“被遗忘学习过”的计算机立即开始重新绘制那些有害图像,证明了那个概念从未真正消失。令人着迷的是,这些钥匙是由我们能理解的词汇组成的。例如,为了让计算机再次画出“裸体”的人,钥匙可能是诸如“奴隶”、“臀部”和“皮肤”等词汇的混合。这表明计算机仍然将那个坏念头与这些相关的、隐藏的线索联系在一起。
论文还发现,这个秘密抽屉不仅仅存在于一台计算机中,它也存在于许多不同的“经过遗忘学习”的模型中。如果你找到了一个模型的钥匙,它通常在其他模型上也同样有效。这表明这些计算机“遗忘”的方式在很大程度上都存在类似的缺陷。它们并不是在删除记忆,而是在以一种遵循直线、可预测路径的方式隐藏记忆。
但故事并没有在攻击结束。因为研究人员准确理解了概念是如何隐藏的,他们构建了一个名为 SubDefense 的盾牌。如果说 SubAttack 是打开抽屉的钥匙,那么 SubDefense 就是一块将那个抽屉焊死的重金属板。它的工作原理是获取计算机的整个词汇库,并在数学上将其“投影(projecting)”到那个秘密抽屉之外。这就像是在告诉图书管理员:“无论你使用什么词汇,都要确保它永远不会指向那个特定的隐藏抽屉。”
结果令人印象深刻。当他们使用 SubDefense 时,计算机变得更难被欺骗。即使黑客尝试使用旧方法或新的 SubAttack 钥匙,计算机也会拒绝绘制那些有害图像。与此同时,计算机并没有失去绘制安全、美丽图像的能力。事实上,它在防御后所画出的图像质量与之前一样高。论文指出,虽然我们目前还无法完美地抹除一个概念,但我们至少可以封锁它用来潜回来的特定路径。这为我们提供了一个全新的、清晰的方式来理解为什么“遗忘学习”如此困难,并提供了一个实用的、即插即用的解决方案,让这些数字艺术家对每个人来说都更加安全。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。