← 最新论文
💻 computer science

Closing the Safety Gap: Surgical Concept Erasure in Visual Autoregressive Models

本文介绍了 VARE 和 S-VARE,这是通过利用辅助视觉标记和专门的损失函数来消除不安全概念,同时保持生成质量和语义保真度的视觉自回归模型中实现手术式概念擦除的新型框架。

原作者: Xinhao Zhong, Yimin Zhou, Zhiqi Zhang, Junhao Li, Yi Sun, Bin Chen, Shu-Tao Xia, Xuan Wang, Ke Xu

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinhao Zhong, Yimin Zhou, Zhiqi Zhang, Junhao Li, Yi Sun, Bin Chen, Shu-Tao Xia, Xuan Wang, Ke Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个非常有天赋、极其写实的机器人艺术家。这位艺术家不是在画布上混合颜色,而是像堆叠乐高积木一样,逐个像素地构建图像。但问题在于:它通过分层来构建图像,从模糊的低分辨率草图开始,逐渐增加细节,直到图像变得清晰。这就是 视觉自回归(Visual Autoregressive, VAR) 模型的工作方式。它们在根据文本生成图像方面表现出色,但它们有一个危险的缺陷:如果你要求它们画一些不当的内容(比如暴力场景或裸体人物),它们会乐此不疲地照做。

问题在于,我们目前为其他 AI 艺术家(称为扩散模型 Diffusion models)准备的“安全工具”并不适用于这个“堆叠乐高”的机器人。试图将这些旧工具强加给新的机器人,就像试图用修理机械表的锤子去修理数字手表——这会把整个东西搞坏。

这篇论文介绍了一种全新的、“外科手术式”的方法,可以在不破坏机器人绘画能力的前提下修复它。以下是他们是如何实现的,通过简单的类比进行解释:

1. 问题所在:“错误的多米诺效应”

在旧方法中,当试图阻止机器人绘制某些不当内容(比如“教堂”)时,工程师会告诉机器人:“不要画教堂;画一个普通的建筑即可。”

然而,由于机器人是分层构建图像的(从模糊到清晰),第一层的一个小错误会在第二层被放大,然后在第三层爆炸。到图像完成时,机器人可能已经忘记了如何正确地绘制任何东西。图像可能会看起来像一个融化的团块。这被称为误差累积(error accumulation)。

2. 解决方案:“稳定引导器”(VARE)

为了防止机器人崩溃,作者为它提供了一个稳定引导器。

想象一下,你正在教一名学生画树。与其只是说“不要画树”,不如你拿出一张普通树木的照片,并说:“看这张照片。现在,尝试画一个看起来几乎像这样的东西,但去掉那些让它看起来像树的具体树枝。”

作者在机器人的训练中加入了“辅助视觉标记”(这些就是引导图片)。这能让机器人的各个层保持对齐。它防止了错误的“多米诺效应”,确保机器人即使在试图移除某个不良概念时,仍然知道如何构建一个连贯的图像。

3. 手术刀:“过滤交叉熵”(S-VARE)

一旦机器人稳定下来,他们需要一种精确移除不良概念而不破坏其余部分的方法。

  • 旧方法: 这就像是用大锤去取除一根刺。你试图通过强制机器人的数学逻辑完美匹配一个“安全”版本来消除该概念。但由于机器人处理的是数字“比特”(开/关开关)而非平滑的梯度,这种大锤式的方法往往会砸碎整个图像。
  • 新方法 (S-VARE): 作者发明了一把手术刀。他们意识到,机器人有时会犯些小错,但它对主要概念的判断通常是正确的。因此,他们创建了一个“过滤器”。
    • 如果机器人已经把图片画得基本正确了(例如,它正确识别了天空和地面),手术刀就会忽略这些部分。
    • 它只会对机器人试图绘制“不良”概念(如裸体或特定物体)的具体部分进行切割(调整)。
    • 这就像一位外科医生只对肿瘤进行手术,而留下健康的组织。

4. 安全网:“保持损失”(Preservation Loss)

有时,当你试图修复一个特定问题时,你会不小心破坏其他东西。例如,如果你告诉机器人“不要画教堂”,它可能会忘记如何画任何建筑,或者它可能不再理解“天空”这个词。这被称为“语言漂移(language drift)”。

为了防止这种情况,作者添加了一个安全网。他们不断提醒机器人:“在移除教堂的同时,确保你仍然按照之前的方式绘制天空、草地和光影。” 这确保了机器人在失去绘制特定违禁物品的能力时,仍能保持其通用的艺术技能。

结果

论文在名为“Infinity”的模型上测试了这些方法。结果令人印象深刻:

  • 97% 的成功率: 他们成功阻止了机器人绘制敏感内容(如裸体或特定的物体,如教堂)。
  • 极小的损伤: 机器人的绘画能力(针对其他事物)下降不到 2%。它依然能绘制出精美、高质量的图像。
  • 鲁棒性: 即使人们尝试使用混淆或“对抗性”提示词(试图偷偷引入不良概念)来欺骗机器人,机器人仍然拒绝绘制它。

总结: 作者构建了一个全新的框架,它集稳定引导器、外科手术刀和安全网于一体。这使得他们能够从这一代图像生成 AI 中精准地移除危险概念,而不会破坏 AI 创作艺术的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →