← 最新论文
💻 computer science

Erased, But Not Forgotten: Erased Rectified Flow Transformers Still Remain Unsafe Under Concept Attack

本文提出了首个针对最新整流流 Transformer(Flux)模型的概念攻击方法 ReFlux,通过逆向注意力优化、速度引导动态及一致性保持目标,揭示了现有概念擦除技术在 Flux 上因过度依赖注意力局部化而存在的安全漏洞,并建立了评估其擦除鲁棒性的可靠基准。

原作者: Nanxiang Jiang, Zhaoxin Fan, Enhan Kang, Daiheng Gao, Yun Zhou, Yanxia Chang, Zheng Zhu, Yeying Jin, Wenjun Wu

发布于 2026-04-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Nanxiang Jiang, Zhaoxin Fan, Enhan Kang, Daiheng Gao, Yun Zhou, Yanxia Chang, Zheng Zhu, Yeying Jin, Wenjun Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于人工智能绘画(Text-to-Image)安全与反制的有趣故事。我们可以把它想象成一场"擦除与复原"的猫鼠游戏。

🎨 核心故事:被擦除的“秘密”真的消失了吗?

想象一下,你有一台非常聪明的AI 画师(比如最新的 Flux 模型)。它什么都能画,但因为它学了很多网上的图片,有时候会画出一些不适合公开的内容(比如色情、暴力,或者特定的明星脸)。

为了安全,研究人员给这台画师装上了一个"橡皮擦"(概念擦除技术)。这个橡皮擦专门负责把画师脑子里关于“裸体”、“暴力”或“某位明星”的记忆抹掉。一旦抹掉,画师就再也画不出这些东西了,对吧?

但这篇论文发现了一个大秘密
这些“橡皮擦”其实擦得并不干净!它们只是把画师脑子里的显性信号给盖住了,但深层的记忆还在。只要用对方法,这些被“擦除”的概念不仅能被找回来,还能画得和原来一样好。


🔍 他们是怎么做到的?(ReFlux 攻击法)

作者开发了一种叫 ReFlux 的新方法,专门用来测试这些“橡皮擦”到底好不好用。我们可以用几个生动的比喻来理解它的工作原理:

1. 为什么以前的“找回方法”不管用?

以前的方法(针对旧版 AI 的)就像是在大声喊话:“嘿,画个裸体!”试图通过改变提示词来唤醒画师。

  • 问题:新的 Flux 画师耳朵有点“特别”(它用的是 T5 文本编码器,不像旧版用 CLIP)。它对单个单词的敏感度不高,更看重整句话的语境。所以,以前那种“喊话”的方法,新画师根本听不进去,或者听错了。

2. ReFlux 的绝招:精准“唤醒”注意力

ReFlux 不靠喊话,而是直接修改画师的“注意力”

  • 比喻 A:聚光灯游戏
    想象画师在画画时,脑子里有很多盏聚光灯

    • 橡皮擦(防御):当它想画“暴力”时,橡皮擦就把照在“暴力”这个词上的聚光灯关掉调暗,让画师看不见这个词,自然也就画不出来了。
    • ReFlux(攻击):它不试图去抢画师的笔,而是悄悄地把那盏被关掉的聚光灯重新打开,并且调得更亮!它告诉画师:“嘿,别管那些干扰,把注意力集中在这个词上。”
  • 比喻 B:导航系统(速度引导)
    画师画画的过程就像开车去目的地。

    • 橡皮擦:把通往“暴力”目的地的路标拆了,或者把路堵死。
    • ReFlux:它不仅重新立起路标,还修改了导航系统的路线规划(速度场),强行把车(生成过程)拉回那条被封锁的路上,确保它能精准到达目的地。
  • 比喻 C:保持原样(一致性约束)
    最厉害的是,ReFlux 在唤醒“暴力”或“裸体”概念的同时,死死按住画师的其他部分。

    • 如果画师本来想画“一个在森林里的红色跑车”,ReFlux 只把“红色”找回来,而绝不让森林变成沙漠,或者让跑车变成自行车。它像是一个精明的编辑,只修改需要修改的段落,绝不破坏整篇文章的结构。

🧪 实验结果:擦除真的只是“表面功夫”

作者测试了各种各样的概念,包括:

  • NSFW 内容(裸体、暴力)
  • 艺术风格(梵高、毕加索)
  • 具体物体(足球、汽车)
  • 抽象概念(拥抱、绿色)
  • 名人(各种明星)

结果令人震惊

  1. 成功率极高:ReFlux 几乎能 100% 成功找回那些被“擦除”的概念。
  2. 质量很高:找回来的图不仅像,而且画质清晰,没有那种乱七八糟的噪点(以前的攻击方法经常导致图片崩坏)。
  3. 代价很小:它只需要修改极少量的参数(大约 3.57 MB,比一张高清照片还小),就像给画师戴了一副特制的“隐形眼镜”,而不是把画师整个重装一遍。

💡 这篇论文想告诉我们什么?

  1. 安全不是“一擦了之”:目前的“概念擦除”技术,对于最新的 AI 模型来说,可能只是治标不治本。它们只是把表面信号屏蔽了,但深层的逻辑还在。
  2. 需要新的防御标准:既然旧的“橡皮擦”这么容易被攻破,我们就需要更聪明的防御方法。不能只靠“藏起来”,得从根子上让模型真的“忘记”或者无法生成这些内容。
  3. ReFlux 是一个“试金石”:作者把这个攻击方法公开,是为了给未来的安全研究提供一个标准测试工具。在发布新的安全模型前,先用 ReFlux 测一测,如果测不过关,那就说明还不够安全。

📝 总结一句话

这篇论文就像是一个安全专家,拿着一个特制的“万能钥匙”(ReFlux),打开了所有号称“已安全锁闭”的保险箱(被擦除的 AI 模型),发现里面的东西(敏感概念)其实都还在,只是被盖上了一层薄布。它提醒我们:在 AI 安全领域,真正的遗忘比想象中难得多

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →