TEA: Text Encoder Alignment for Robust Concept Erasure in Text-to-Image Models
本文提出了 TEA,这是一个轻量级且与模型无关的框架,通过微调文本编码器以将包含特定概念的提示词与安全锚点对齐,从而在实现文本生成图像模型鲁棒概念擦除的同时,既消除了对抗性漏洞,又不会带来推理时的额外开销或降低良性生成的质量。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象这样一个世界:计算机可以仅凭一句话就画出图像。你输入“一只坐在月光屋顶上的猫”,一台经过数百万张图像和说明文字训练的机器,便能在几秒钟内创造出一个令人惊叹、逼真的场景。这项被称为“文本生成图像模型”的技术,为艺术家和设计师打开了大门,将想象力转化为视觉现实。然而,这种力量本身也带有风险。正如一名熟练的伪造者可以模仿某种风格一样,一个聪明的用户可以通过使用巧妙的、重新表述过的指令来欺骗这些计算机,从而绕过系统中内置的安全过滤器,生成有害或不当的图像。计算机看到了文字,却忽略了意图,从而生成了那些从未被允许出现的图像内容。
多年来,科学家们一直试图通过教计算机忘记特定的不良概念来解决这个问题,这个过程被称为“概念擦除”。一些方法试图在计算机学习之前清除不良数据,而另一些方法则试图在生成不良图像的瞬间阻止其出现。但这些解决方案往往都有一个代价:它们要么规模太大、难以在大范围内应用;要么会让计算机画不出好的图像;或者要求每次用户请求图像时都需要持续且沉重的计算能力。目标始终是找到一种方法,既能永久移除生成有害内容的能力,又不会减慢机器的速度或破坏其艺术天赋。
一支研究团队现在提出了一种新方法来应对这一问题,该方法通过改变计算机理解语言的方式,而非改变其绘画方式。他们将这种方法称为 TEA,即“文本编码器对齐”(Text Encoder Alignment)。在这些图像生成系统中,有两个主要部分在协同工作。第一部分是文本编码器,它充当翻译官的角色,将你写的句子转化为计算机可以理解的一组数字。第二部分是生成骨干网络(generative backbone),它接收这些数字并实际绘制出图像。以往试图阻止不良图像的方法通常涉及调整绘画部分,这就像是通过粉刷墙壁来试图修复房子里的漏水点;这种做法既混乱又往往无效,因为问题在于指令最初是如何被翻译的。
研究人员意识到,阻止有害图像的关键在于翻译官。他们发现,计算机识别特定不良概念(例如裸露)的能力集中在文本编码器中。为了解决这个问题,他们创建了一个仅调整这个翻译官、而不触动绘画部分的训练过程。他们从一对句子开始:一个包含有害概念的句子,如“森林中的裸体女性”,以及另一个几乎相同但安全的句子,如“森林中的女性”。然后,他们教导翻译官让这两个句子的数字看起来完全一致。
为了实现这一点,他们使用了一场巧妙的“猫鼠游戏”。他们设置了一个小型计算机程序——判别器(discriminator),其任务是分辨来自坏句子的数字与来自好句子的数字之间的差异。主翻译官试图通过改变自己的设置来欺骗这个判别器,使两个句子产生完全相同的数字。与此同时,研究人员确保翻译官不会忘记如何处理正常的、安全的句子。他们通过检查安全句子是否仍然保持着修改前的样子来确保这一点。这保证了计算机仍然能够绘制出美丽的、无害的森林和女性图像,只是失去了绘制特定有害版本的能力。
该方法的测试结果令人瞩目。在针对各种旨在绕过安全系统的复杂尝试(包括由专家设计的尝试)进行测试时,这种新方法几乎完全阻止了有害图像的生成。在其他方法无法阻止不良内容或导致计算机绘图质量下降的测试中,该方法在两方面都取得了成功。它不仅适用于旧版本的技术,也适用于最新、最先进的系统,证明了这一理念在不同类型的图像生成器上都是通用的。或许最重要的一点是,由于计算机的绘画部分从未被改变,因此系统并没有变慢。它创建图像所需的时间与之前完全相同,在用户请求图像时不需要额外的计算能力。
研究人员还测试了该方法是否可以移除其他类型的非预期概念,例如特定的艺术风格。他们发现,当被要求模仿特定艺术家(包括梵高和凯利·麦克南)的风格时,该方法可以成功阻止计算机进行复制,同时仍允许它以其他风格进行绘画。这表明该方法不仅仅是一个专门用于移除裸露内容的单一工具,而是一个灵活的工具,可以用来移除任何用户不希望计算机生成的特定想法。通过专注于翻译步骤并使用简单高效的训练过程,团队展示了在不牺牲速度或艺术创作能力的前提下,使这些强大的工具变得更安全的可能性。
这项工作代表了使人工智能更安全、更可靠的重要一步。它不再仅仅依赖于不断监控和拦截输出,而是直接将安全性构建在计算机理解语言的方式之中。该方法非常轻量化,仅需短时间的训练,并且让系统的其余部分保持原样。对于任何依赖这些工具进行内容创作的人来说,这意味着未来计算机可以被信任去遵循指令,而不会意外跨越有害领域的界限,同时保留其创作灵感。研究人员已经公开了他们的代码,允许他人测试并基于此进行开发,确保了通往更安全图像生成之路的探索得以持续进行。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。