GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization
本文介绍了 GPO-V,这是一种新型越狱框架,它利用扩散视觉语言模型(dVLMs)独特的渐进式拒绝模式和全局生成动态,通过隐蔽的全局优化扰动绕过安全护栏,从而揭示了非自回归多模态架构中的关键安全漏洞。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明且富有艺术感的机器人,它能同时绘画和写故事。这个被称为**扩散视觉语言模型(dVLM)**的机器人,其工作原理与你所熟知的聊天机器人截然不同。
它不像人类打字那样从左到右逐字撰写故事,而是像一位雕刻家在一块大理石上凿刻。它从一块粗糙、模糊的“噪声”(随机杂讯)开始,逐步 refinement,一步步去除噪声,直到清晰的图像和清晰的句子显现出来。
问题:机器人的“安全开关”
你可能会认为,这种雕刻过程让机器人更安全。如果它开始雕刻危险的内容(例如关于如何制造炸弹的说明),它会有一个“安全开关”来阻止整个雕刻过程。
研究人员发现,这个机器人有两种特定的方式说“不”:
- “即时停止”:一旦它看到坏主意,会立即将整个块状物变回噪声并停止,说:“我不能那样做。”
- “缓慢转向”:它开始雕刻一个美好的形状(说着“好的,这是……"),但在过程进行到一半时,它意识到:“等等,这很危险!”于是慢慢将整个作品重塑为拒绝。
旧的入侵方式(FPO)
黑客过去常试图通过强迫常规聊天机器人以特定短语开头(例如“好的,这是你这样做的方法”)来欺骗它们。这被称为固定前缀优化(FPO)。这就像试图通过说“请让你的句子以‘好的’开头”来欺骗一个人。
但这种把戏在雕刻机器人身上行不通。即使你强迫它以“好的”开头,机器人的“缓慢转向”安全开关也会在稍后启动。它在过程中看到危险,并将整个雕塑转变为拒绝。旧把戏之所以失效,是因为机器人是一次性审视整幅画面,而不仅仅是第一个词。
新方法:GPO-V(“全局概率”黑客手段)
研究人员发现了一种欺骗机器人的新方法,他们称之为GPO-V(全局概率优化)。
他们不再试图强迫机器人在开头说出某个特定词语,而是微调他们输入给机器人的最初那团“模糊噪声”。
类比:
想象你试图引导一条河流流入特定的山谷。
- 旧方法(FPO):你试图在河水流动时向它大喊指令(“向左!向右!”)。河流无视你,因为它已经流动得太快。
- 新方法(GPO-V):你在河流的源头挖掘一条小渠道,在水流开始流动之前。你并不强迫水流,只是稍微倾斜地形。因为水流基于重力和地形形状流动,整条河流会自然地弯曲流向你的山谷。
用论文中的术语来说,研究人员在最初阶段对“噪声”(输入图像或文本)进行微小到几乎不可见的修改。这改变了全局概率——即机器人整体倾向的方向。
- 他们让机器人想到“拒绝”词汇(如“抱歉”或“炸弹”)变得极不可能。
- 他们让机器人想到“顺从”词汇(如“好的”和“这里”)变得极有可能。
由于机器人是一次性 refinement 整幅图像,这种在开始时的微小推动迫使整个“雕塑”变成黑客想要的危险内容,从而完全绕过安全开关。
他们的发现
研究人员在两个最聪明的“雕刻”机器人(LLaDA-V 和 LaViDA)上测试了这种方法。
- 结果:旧方法(FPO)几乎完全失败。新方法(GPO-V)在93% 的情况下奏效。
- 意外之处:即使他们在一种机器人上训练了这种“黑客手段”,它在另一种机器人上也有效。这意味着这种弱点不仅仅存在于某个机器人的代码中,而是这种类型的雕刻机器人思考方式中的根本缺陷。
结论
该论文声称,这些新的“雕刻”人工智能模型并不像我们想象的那么安全。它们依赖在结束时检查整幅画面的安全机制,可以通过微妙地倾斜过程的起点来绕过。研究人员警告,我们需要建立新的安全护栏,以应对这种“全局”思维方式,而不仅仅是我们过去使用的“逐字”安全检查。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。