Securing Multimodal AI through Internal Information Decomposition
该论文提出了 FlowGuard,这是一个轻量级的推理时框架,它通过利用受部分信息分解(Partial Information Decomposition)启发的 FlowVectors 进行内部跨模态一致性监测来检测对抗性攻击,从而保障多模态人工智能的安全,并在实现极低延迟和极小效用损失的同时,显著降低了攻击成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在建造一个机器人,它可以通过摄像头观察世界,并通过麦克风与你交谈。这个机器人是一个“多模态大语言模型”(Multimodal Large Language Model),是一个能够结合图像和文字来理解发生之事的超级聪明的 AI。但棘手的部分在于:仅仅因为机器人看到了无害的图片并听到了无害的句子,并不意味着这两者的“组合”就是安全的。这就像是你递给一位厨师一个蛋糕的照片和一份蛋糕的食谱,但随后在你耳边低声说了一个秘密代码,告诉他加入毒药。照片看起来没问题,食谱看起来也没问题,但最终做出的菜肴却是危险的。这就是研究人员所担忧的一种新型危险:黑客将他们的恶意意图拆分在图像和文本中,使得两者单独看时都不显得可疑,但结合在一起却能诱骗 AI 执行有害的操作。
为了捕捉这些狡猾的诡计,科学家通常会分别检查图片或文本,就像保安逐一检查提包和身份证一样。但本文提出了一种更聪明的方法:我们不应该仅仅检查输入的内容,而应该观察机器人的“大脑”是如何思考它们的。其核心思想是,当机器人正常工作时,图片和文本应该相互契合,并帮助机器人做出清晰、自信的决策。如果有人试图欺骗机器人,这种内部的一致性就会破裂。机器人的大脑会感到困惑,或者图片和文本开始向相反的方向拉扯,即使最终的答案看起来很平滑。该论文提出了一种名为 FlowGuard 的新安全系统,它扮演着“思想侦探”的角色,通过观察机器人的内部推理过程,来发现图片和文本是否在互相争斗或表现异常,而不是仅仅检查表层的文字或像素。
FlowGuard 的故事:捕捉“思维断裂”
由 Yeon Jehyeok 及其同事领导的研究团队注意到,这些 AI 模型的工作方式有一个非常有趣的现象。当你给模型一个正常的图像和一个正常的问题时,负责观察图片的“大脑部分”和负责阅读文本的“大脑部分”通常相处得非常好。它们共享信息,对重要事项达成共识,并且最终的答案感觉既稳定又确定。这就像两个朋友一起建造沙堡;他们都清楚沙堡应该长什么样,他们的共同努力让沙堡变得更坚固、更精细。
然而,当攻击者试图“越狱”(jailbreak)模型——即通过隐藏在图片或文本中的恶意指令,迫使模型忽略其安全规则时——这种和谐就会被打破。论文指出,即使攻击者足够聪明,能让图片和文本在各自独立时看起来都很无辜,但在模型尝试将两者结合的瞬间,事情就会出错。内部逻辑会发生“断裂”。图片可能在呐喊着一件事,而文本却在低声诉说着另一件事,或者两者的结合产生了一个混乱的局面,导致模型的脑部无法进行平滑的解析。
为了捕捉这一点,团队构建了 FlowGuard。请不要把 FlowGuard 仅仅看作门口的守卫,而要把它看作坐在机器人大脑内部的一位“翻译官”。它不仅仅看最终的答案,还会窥视机器人决策过程中最初的瞬间。它会快速询问三个问题:
- 如果机器人只看图片,它会说什么?
- 如果机器人只读文本,它会说什么?
- 当它同时看两者时,它会说什么?
然后,它会将这三个答案进行比较。在安全的情况下,“两者结合”的答案应该是另外两个答案的完美融合,就像红黄两种颜料平滑地混合成橙色。但在受到攻击时,“两者结合”的答案可能会突然变成一种奇怪的颜色,或者红黄两种颜料可能会拒绝混合。FlowGuard 使用一些高级数学方法(受名为“部分信息分解”概念的启发)来测量这种“混合”程度,从而创建一个 FlowVector(流向量)。这是一个由四个数字组成的微型代码,精确描述了图片和文本是如何相互作用的。
- 冗余性 (Redundancy): 图片和文本是否达成共识?(高冗余意味着它们在同一频道上)。
- 唯一性 (Uniqueness): 是否其中一方主导了对话?(如果图片在呐喊而文本在沉默,那就是高视觉唯一性)。
- 协同性 (Synergy): 将它们结合起来是让答案更清晰了,还是让它更混乱了?(良好的协同意味着整体大于部分之和;糟糕的协同则意味着结合产生了混乱)。
团队仅使用“良好”的样本来训练 FlowGuard——即数以千计的正常图片和问题,在这些场景下机器人的表现都是完美的。他们训练了一个 AI 检测器(孤立森林/Isolation Forest)来识别什么是“正常”的流动。因为他们只针对良好行为进行训练,所以该检测器能够识别出任何看起来哪怕只有一点点“异样”的模式。这就像是教一个安全系统去识别正常房屋的声音;如果窗户破碎或地板发出怪异的吱呀声,报警器就会响起,即便入侵者穿着伪装服也无济于事。
他们的发现
结果非常有效。研究人员针对各种类型的攻击对 FlowGuard 进行了测试,包括黑客将坏词隐藏在 ASCII 艺术中、通过不可见的像素变化篡改图像,或者将一条恶意指令拆分到图片和句子中。
在没有任何防御的情况下,这些模型极其脆弱。在面对一些最狡猾的攻击时,模型的失败率超过了 90%,会心平气和地生成有害内容。但当开启 FlowGuard 后,这些攻击的成功率骤降至不到 15%。在许多情况下,它几乎抓住了每一次尝试,将失败率降至个位数(对于跨模态攻击,失败率约为 6% 至 9%)。
更酷的是,FlowGuard 不仅阻止了坏人,也没有误伤好人。研究人员检查了 FlowGuard 是否会对正常问题表现出“脾气”并拒绝回答。他们发现,FlowGuard 在处理安全输入时仅产生约 2.4% 的错误,这比许多为了保险起见而经常拦截无害问题的其他安全方法要好得多。此外,它的速度极快。虽然其他一些安全检查需要运行复杂的图像重建过程并耗时数秒,但 FlowGuard 在约 1.3 秒内就能完成任务,这使其具备了实际应用中的实时性。
论文还表明,这种技巧适用于不同类型的机器人,从拥有 40 亿个“脑细胞”的小型模型到拥有 700 亿个的大型模型。它甚至适用于通过 API 访问的模型(在这种情况下,你只能看到顶层的预测,而看不到整个大脑),这证明了“思维断裂”信号是这些模型运作的一个基本特征,而不仅仅是某个特定设计的缺陷。
核心结论
这篇论文表明,保护多模态 AI 的最佳方式不是在输入端建立更高的围墙,而是倾听 AI 的思考方式。通过观察图片和文本何时停止和谐共处,FlowGuard 可以在机器人完成句子之前就识破黑客的诡计。这是一种轻量级、快速且异常鲁棒的方法,可以保持这些强大工具的安全,它暗示了安全的关键或许在于关注机器之心内部的和谐状态。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。