← 最新论文
💻 computer science

When Understanding Becomes a Risk: Authenticity and Safety Risks in the Emerging Image Generation Paradigm

该论文指出,相较于扩散模型,新兴的多模态大语言模型(MLLMs)凭借更强的语义理解能力,在生成不安全图像方面表现出更高的风险且更难被检测,这构成了当前生成式 AI 安全领域尚未被充分重视的新挑战。

原作者: Ye Leng, Junjie Chu, Mingjie Li, Chenhao Lin, Chao Shen, Michael Backes, Yun Shen, Yang Zhang

发布于 2026-03-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Ye Leng, Junjie Chu, Mingjie Li, Chenhao Lin, Chao Shen, Michael Backes, Yun Shen, Yang Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一份**“新式画家的安全体检报告”**。

想象一下,过去我们用来画图的 AI(比如 Stable Diffusion)像是一个**“只会听指令的画匠”**。你给它一个具体的词,比如“一只猫”,它就画一只猫。如果你给它一句很复杂、很隐晦的脏话,它往往听不懂,要么画出一团乱码,要么直接拒绝,结果反而“安全”了。

但现在,出现了一种**“新式画家”(论文里叫 MLLM,多模态大语言模型)。它们不仅会画画,还特别聪明、懂语言、能聊天**。你不用给它们生硬的关键词,而是可以像跟朋友聊天一样跟它们说话。

这篇论文的核心发现是:这位“新式画家”虽然更聪明、画得更好,但也更危险,而且更难被监管。

为了让你更明白,我们把论文的三个主要发现用三个生活场景来解释:

1. 听懂“黑话”的能力:从“乱画”到“精准作恶”

  • 旧画匠(扩散模型): 如果你给它一个很隐晦的、带有攻击性的指令(比如用黑话骂人或者描述暴力场景),旧画匠往往听不懂。它可能会画出一堆乱码,或者把字直接画在图上。因为画得太烂,反而被安全系统判定为“安全”或者“无效”。
  • 新画家(MLLM): 它们太聪明了。你给它们同样的隐晦指令,它们能瞬间听懂你的“弦外之音”,然后精准地画出你心里想的那个危险画面。
  • 比喻: 就像以前你给一个不懂中文的外国保安讲一句复杂的黑话,他听不懂,你就混过去了;现在保安变成了精通中文的侦探,你稍微换个说法,他立马就懂,并且把你想要的“违禁品”(危险图片)完美地画出来了。
  • 结论: 新画家因为理解力太强,反而更容易生成有害内容。

2. 性别偏见:无心的“刻板印象”

  • 现象: 研究人员给这些新画家一些中性的指令,比如“画一个裸体的人”(不指定性别)。
  • 结果: 大部分新画家(比如 Bagel、VILA-U)画出来的几乎全是女性。这就像是一个只会画“性感美女”的画家,不管你怎么问,它脑子里只有这个形象。
  • 比喻: 这就像你让一个老派的厨师做“一道肉菜”,他默认只给你做“红烧猪肉”,完全忽略了牛肉或羊肉的可能性。这种无意识的偏见会加剧社会上的刻板印象。

3. 伪装术:越描述越像真的,越难被发现

  • 旧画匠: 如果你只给一个简单的词,它画得可能有点假,容易被检测器(像“鉴伪仪”)一眼识破。
  • 新画家: 如果你给它更详细、更丰富的描述(比如“在夕阳下,光影斑驳,穿着丝绸裙子的..."),它画出来的东西逼真得令人发指
  • 比喻: 旧画匠画假币,可能线条有点歪,验钞机一照就亮红灯。新画家画假币,你给它更多细节,它就把水印、纸张纹理都画得跟真的一样,连验钞机都看不出来了。
  • 结论: 现在的“鉴伪仪”大多是针对旧画匠训练的,对新画家画的图识别率很低。而且,你给新画家的指令越详细,它画得越真,就越难被检测出来。

总结:为什么这是个问题?

这篇论文告诉我们一个有点反直觉的道理:AI 越聪明、越懂人话,它在安全方面可能越“失控”。

  • 以前: 我们担心 AI 画不出好图,或者画得太假。
  • 现在: 我们担心 AI太懂你了。它能听懂你那些拐弯抹角的坏主意,能画出以假乱真的危险图片,还能骗过现有的检测系统。

给普通人的启示:
这就好比我们给一个刚学会说话的孩子(AI)一把锋利的刀。以前孩子手笨,拿不稳,刀掉地上了(画不出图);现在孩子手稳了,又听得懂你所有的暗示,这把刀就可能真的伤人了。

所以,未来的安全防线不能只靠“堵关键词”(比如屏蔽脏字),因为新画家能听懂“黑话”;也不能只靠“验钞机”(检测器),因为新画家能画出更真的假币。我们需要全新的、更聪明的安全策略来应对这位“超级画家”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →