想象你身处一个繁忙的高端艺术工作室,那里有一位魔法机器人(即扩散模型)会根据你的口头描述(提示词)作画。绘制这些画作既缓慢又昂贵,因为机器人必须从一块空白且充满噪点的画布开始,逐步细化,一步步完成。
为了让这一过程更快、更便宜,工作室引入了一本"智能速写本"(近似缓存)。其工作原理如下:如果你要求画一个“红苹果”,而刚才有人要求画一个“闪亮的红苹果”,机器人就不必从头开始。它会查阅速写本,找到那幅已画到一半的红苹果画作,只需完成最后几处细节即可。这节省了时间和金钱。
然而,本文的研究人员发现,这本“智能速写本”存在一个重大安全漏洞。由于工作室在所有客户之间共享这本速写本,这就形成了一个秘密后门,黑客可以通过三种巧妙的方式加以利用。
1. 秘密耳语网络(隐蔽信道)
类比:想象两名间谍,爱丽丝和鲍勃,他们无法直接交谈。他们都在参观这家艺术工作室。
- 诡计:爱丽丝想给鲍勃发送一条秘密消息。她向机器人耳语一个非常具体、奇怪的词(例如"Apricity",这是阳光的古语)。机器人画出一幅画,并将这幅“半途”的速写保存到共享速写本中。
- 信号:鲍勃随后请求机器人用同一个奇怪的词来作画。
- 如果机器人很快,意味着它在速写本中找到了爱丽丝的速写(即“命中”)。
- 如果机器人很慢,意味着它不得不从头开始(即“未命中”)。
- 编码:爱丽丝和鲍勃约定,“快”代表字母1,“慢”代表字母0。通过发送一系列奇怪的词,他们可以通过机器人作画的速度互相传递秘密文本消息。
- 隐蔽性:由于速写本会将这些“半途”的速写保留数天,鲍勃可以随时检查是否有消息。这就像在公共图书馆的书中留下一张便条,那张便条会在那里停留数周。
2. 提示词窃贼(CacheExposer)
类比:想象一位专业艺术家花费数小时精心构思完美的复杂描述,以便从机器人那里获得一幅杰作。这个描述就是他们的秘密配方。
- 诡计:一个小偷想要这个配方。他无法看到艺术家的屏幕,但他可以要求机器人绘制数千幅略有不同的画作。
- 线索:小偷注意到,当他们要求绘制一幅与艺术家的秘密配方相似的画作时,机器人反应很快(因为它命中了艺术家缓存的速写)。
- 盗窃:通过分析他们数千次猜测中哪些让机器人变快了,并观察生成图像中的细微相似之处,小偷可以在数学上逆向推导出艺术家原本的秘密配方。
- 结果:小偷窃取了“提示词”(即配方),现在无需向艺术家付费或费力设计提示词,就能生成同样的杰作。
3. 商标贴纸炸弹(CachePoison)
类比:想象一个恶作剧者想在不知情的情况下,把他们的商标贴在每个人的画作上。
- 诡计:首先,恶作剧者利用上述方法窃取一个流行的配方。然后,他们秘密地将自己商标的描述(例如“耐克钩形标志”)加入该配方,并将其保存回共享速写本中。
- 投毒:现在,当一位无辜的客户要求绘制一幅与该配方相似的画作时,机器人会从速写本中抓取被投毒的速写。
- 结果:即使客户从未要求过商标,机器人也会利用被投毒的速写完成画作,最终图像中神奇地包含了恶作剧者的商标。客户得到了一张带有不受欢迎品牌的图片,而恶作剧者则获得了免费广告。
为何这很重要
本文表明,虽然“智能速写本”让 AI 艺术创作更快,但它们破坏了系统的隐私和安全性。
- 隐私:如果系统将“半途”的工作与所有人共享,你就无法保守你的秘密消息或定制艺术配方。
- 安全:恶意行为者可以利用这个共享空间监视你、窃取你的作品,或强行将他们的内容植入你的图像中。
研究人员提出了一些简单的修复方案,例如随机选择使用哪幅速写(这样间谍就无法预测速度)、过滤掉可疑的商标,或监控那些提问过于频繁的用户。在这些修复方案实施之前,使用这些共享的“智能速写本”就像把你的日记本摊开在公共公园的长椅上一样。
技术摘要:针对文本到图像扩散模型中近似缓存的攻击
问题陈述
文本到图像扩散模型计算密集,需要迭代去噪步骤以生成高质量图像。为了缓解这一开销,近期的工业界和学术界工作(例如 Adobe 的 NIRVANA)已采用近似缓存。该技术当新提示词与已缓存的提示词在语义上相似时,会重用先前生成过程中的中间状态,从而允许系统跳过去噪步骤。
尽管高效,但这种优化引入了一个关键的安全漏洞:它破坏了用户之间的隔离。通过基于提示词相似性存储和重用中间状态,系统创建了一个可被利用的共享状态。本文认为,现有的扩散模型安全研究主要集中在模型权重或训练数据上,而服务系统(特别是近似缓存)的漏洞尚未得到充分探索。
方法论
作者复现了最先进的 NIRVANA 近似缓存系统,并将其部署在两个领先的文本到图像模型上:FLUX 和 Stable Diffusion 3 (SD3)。他们利用真实世界的提示词数据集(DiffusionDB 和 Lexica)以及基于云 GPU 的环境(H100 和 A100)来模拟真实的服务系统。
研究识别出近似缓存中固有的两个基本攻击原语:
- 计时信道(攻击原语 1):由于跳过了去噪步骤,缓存命中(Cache Hit)的延迟显著低于缓存未命中(Cache Miss)。延迟降低的幅度与新提示词和已缓存提示词之间的语义相似性相关。
- 结构相似性(攻击原语 2):即使最终提示词略有不同,从同一缓存中间状态生成的图像,其结构相似性(通过 SSIM 衡量)也高于从不同状态生成的图像。
基于这些原语,作者在一种威胁模型下展示了三种不同的攻击,该模型中攻击者对已缓存的提示词没有任何先验知识,仅拥有服务系统的标准用户访问权限。
1. 远程隐蔽信道
- 机制:发送者和接收者异步交换消息。发送者将包含特定罕见关键词(例如"Apricity")的提示词注入缓存。接收者使用相同的关键词探测缓存。
- 检测:接收者使用两级检测过程:
- 延迟分类器:判断探测是否命中了任何已缓存的提示词。
- 内容检测器:使用目标检测模型(DINOv2)验证输出图像是否包含发送者嵌入的特定“标记”(例如狗或麦当劳标志)。
- 编码:命中带有标记的缓存编码为'1';未命中或命中但不带标记的缓存编码为'0'。
2. 提示词窃取攻击(CacheExposer)
- 目标:在不访问受害者生成图像的情况下,恢复受害者的原始提示词。
- 机制:攻击者向系统发送大量“探测”提示词。
- 聚类:利用计时信道,攻击者识别哪些探测命中了缓存。随后,一个结构分类器根据生成图像的相似性对这些探测进行分组,假设同一组中的探测命中了相同的底层缓存提示词。
- 恢复:一个嵌入预测器(使用 SGD)生成一个目标嵌入,使其与分组探测的相似度最大化。随后,一个提示词恢复器(基于 GPT-2 的模型)将该嵌入转换回文本,重构出受害者的提示词。
3. 图像投毒攻击(CachePoison)
- 目标:将攻击者的内容(例如标志)注入到其他用户生成的图像中。
- 机制:攻击者首先使用 CacheExposer 窃取提示词。然后,他们使用一个标志注入器(基于注意力的模型)将标志描述嵌入到被盗提示词的嵌入空间中。
- 执行:攻击者将此投毒后的嵌入转换回文本并将其注入缓存。当受害者的提示词命中这个被投毒的缓存条目时,系统会重用该中间状态,导致受害者生成的图像无意中包含攻击者的标志,尽管受害者从未请求过该内容。
关键结果
隐蔽信道性能
- 准确率:结合延迟和内容检测,该信道在 FLUX 上实现了97.8%的准确率,在 SD3 上实现了95.8%。
- 隐蔽性:注入的提示词在缓存中保留长达44 小时(取决于缓存大小和替换策略如 LCBFU),支持长期、异步的通信。
- 带宽:虽然带宽低于同步信道,但其异步性质和高隐蔽性使其成为一种可行的威胁。
提示词窃取(CacheExposer)性能
- 语义相似性:恢复的提示词与原始提示词的平均余弦相似度为 0.78,显著优于朴素基线(0.67)。
- 图像保真度:由被盗提示词生成的图像与原始图像几乎相同,PSNR 分数超过 25,且 SSIM 分数很高。
- 效率:该攻击每次恢复的中位探测提示词数量为4,385个,但随着单次探测会话可恢复多个提示词,这一成本被分摊了。
投毒(CachePoison)性能
- 命中率:CachePoison 的命中率显著高于朴素直接注入基线(例如,在 DiffusionDB 上,FLUX 为 3,646 次命中对比 2,624 次)。
- 渲染成功率:该攻击在 FLUX 的命中中成功渲染了约**57%**的标志(朴素注入约为 40%)。SD3 显示出较低的胜率,这是由于早期去噪步骤中文本与图像的对齐较弱。
- 持久性:该攻击在不同缓存大小和替换策略下均保持有效,尽管较小的缓存以及 FIFO/LRU 策略通过更快地驱逐竞争条目而增加了命中次数。
意义与主张
本文声称是第一项工作,专门利用文本到图像扩散模型中近似缓存机制内的安全漏洞。其意义在于:
- 转变攻击面:它证明了服务系统中的效率优化会产生严重的安全风险(隐蔽信道、数据窃取和内容投毒),这些风险独立于模型架构或训练数据投毒。
- 实用性:攻击是在远程针对真实的云服务平台执行的,无需模型访问权限或训练数据操纵。
- 隐蔽性与持久性:隐蔽信道的异步性质以及缓存条目的长生命周期,使得这些攻击难以检测和缓解。
- 防御的紧迫性:作者认为,随着近似缓存成为商业部署(例如 Adobe、Google、OpenAI)的标准,必须在广泛采用之前解决这些漏洞。
本文结论指出,虽然近似缓存提高了性能,但它从根本上破坏了用户隔离,因此需要新的防御机制,如随机缓存选择、内容过滤和恶意行为检测。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。