Visual Token Compression Enhances Robustness of MLLMs
本文提出了一种视觉标记剪枝方法,通过识别并移除失配的、分布外(out-of-distribution)的视觉标记,在降低推理成本的同时,增强了多模态大语言模型针对越狱攻击和幻觉现象的鲁棒性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:计算机不仅能阅读文字,还能“看到”图片,并将两者结合起来回答问题、讲述故事或解决问题。这些被称为多模态大语言模型(Multimodal Large Language Models,简称 MLLMs)。把它们想象成超级聪明的学生,他们不仅读遍了图书馆里的每一本书,还能通过看照片来理解语境。然而,就像任何学生一样,他们也会感到困惑。有时,如果你给他们看一张棘手的图片,或者问一个带有陷阱的问题,他们可能会被诱导说出危险的内容(这被称为“越狱”,jailbreak),或者编造一些听起来很真实但完全错误的事实(这被称为“幻觉”,hallucination)。
为了理解为什么会发生这种情况,我们需要观察这些模型是如何处理信息的。它们接收一张图片,将其切碎成被称为“视觉标记”(visual tokens)的微小数字碎片,并将其与文本标记混合在一起。问题在于,计算机的“眼睛”和“耳朵”并不总是能完美地使用同一种语言。有时,一个视觉标记可能显得格格不入或令人困惑,就像无线电信号中的静电噪声一样。这种噪声会使模型失去平衡,使其容易受到攻击或导致它凭空捏造虚假信息。科学家们早就知道清理这些噪声有助于提升性能,但他们通常认为这只是为了让计算机运行得更快,而不是为了更安全。
这篇论文介绍了一个聪明的技巧,叫做视觉标记压缩(Visual Token Compression),具体是一种名为 OOD-VTP(分布外视觉标记剪枝,Out-of-Distribution Visual Token Pruning)的方法。研究人员发现,通过识别并剔除那些“奇怪”的视觉标记——即那些与文本不匹配的标记——模型实际上会变得更加强韧,不易受到攻击,也不太容易撒谎。这就像是一个俱乐部的保镖,把那些不属于这里的闹事者踢出去,让派对变得安全有序。研究表明,这不仅仅是一个理论;当他们在七个不同的流行基准测试中进行测试时,模型的抗干扰能力显著增强,准确性也更高,而且运行速度更快。
嘈杂房间的故事
想象你身处一个巨大的、嘈杂的房间里,一群朋友(文本)正试图进行一场严肃的交谈。突然,一群陌生人(视觉标记)闯了进来。大多数陌生人都是有帮助的;他们带来了零食,并指出了房间里与对话相符的事物。但其中也有一些是恶作剧者。他们戴着面具,大喊着胡言乱语,或者举着一些与你的朋友正在谈论的话题完全不搭调的牌子。
在 AI 的世界里,这些恶作剧者就是失配的视觉标记(misaligned visual tokens)。因为计算机的视觉系统和语言系统没有完美同步,这些标记充当了**分布外(OOD)**输入。用通俗的话说,它们是“不合时宜”的。当 AI 尝试处理它们时,会感到困惑。这种困惑正是黑客能够“越狱”AI(诱骗其忽略安全规则)或导致 AI 产生“幻觉”(编造事实)的原因。
保镖的策略
本文作者意识到,以往的方法试图通过踢走随机的标记或仅仅是那些看起来“冗余”的标记(比如踢走那些声音最小的人)来加速 AI。但他们发现,这样做并不能让 AI 更安全。事实上,有时这会让情况变得更糟!
他们的新方法 OOD-VTP 扮演着一名超级聪明的保镖角色。它是这样工作的:
- 测量距离: 保镖检查每一个视觉标记(图像的每一部分),并问道:“这个人离这场对话有多远?”他们测量视觉标记与“语言特征空间”(文本标记组)之间的距离。
- 识别恶作剧者: 那些距离文本最远的——也就是完全不同步的标记——会被标记为 OOD 标记。这些才是制造麻烦的源头。
- 完美的时机: 研究人员发现,你不能随心所欲地踢人。存在特定的“鲁棒剪枝层”(可以理解为对话中的特定时刻),在这些时刻移除坏标记效果最好。如果你移除得太早或太晚,并不会有帮助。但如果你在正确的时刻(例如在他们的测试中是第 13 层或第 17 层)进行操作,AI 会突然变得更加强韧。
结果:更安全、更聪明、更快速
团队在两个流行的 AI 模型上测试了这种保镖策略:LLaVA-OneVision 和 Qwen-2.5-VL。他们使用了七个不同的基准测试来观察效果。
- 阻止越狱: 当尝试诱导 AI 做坏事(比如解释如何制作炸弹或植入恶意软件)时,OOD-VTP 方法取得了巨大成功。平均而言,它将模型的“拒绝回答率”(即成功拦截不当请求的能力)提高了 13.29%。特别是对于 Qwen-2.5-VL 模型,其“拒绝回答率”从 20.38% 跳升至 33.67%。
- 阻止幻觉: 该方法也帮助 AI 停止了编造事实。在 HallusionBench 测试中,Qwen 模型的准确率提升了 8.00%。
- 速度: 作为额外奖励,由于移除了一些标记,AI 运行得更快了。它处理的标记数量减少了(从 16,128 降至 10,512),使用的计算量也降低了(TFlops 从 4.29 降至 2.78),在不损失智能的前提下提高了效率。
他们没有做的事情(以及他们排除了什么)
需要注意的是,这篇论文并没有做某些事情。他们没有从头开始重新训练 AI。他们没有添加新的安全规则,也没有改变模型的脑权重。他们只是在处理过程中进行了“剪枝”(即剔除)掉那些坏的视觉标记。
他们还明确排除了“任何标记剪枝都能让 AI 更安全”的观点。事实上,他们证明了如果你剪掉了错误的标记——即那些配合良好且有帮助的标记——AI 会变得更不安全。他们通过剪掉“距离最小”的标记(即好的标记)进行了测试,结果发现模型的安全性大幅下降。这证明了这不仅仅是关于“减法”的问题,而是关于精准地切除那些引起麻烦的特定噪声。
核心结论
这篇论文表明,让多模态 AI 更安全的方法可能非常简单,那就是清理视觉噪声。通过识别并移除那些与文本不匹配的视觉标记,模型会变得更加稳定,不易被诱骗,也不太容易编造事实。这是一种“即插即用”的解决方案,意味着它可以添加到现有模型中,而无需进行大规模的重构。虽然论文显示这些结果在多次测试中表现一致且稳健,但这仍然是一种增强鲁棒性的方法,而非解决世界上所有安全问题的“万灵药”。但对于一个好奇的青少年(或是有安全意识的 AI 开发人员)来说,这是一个迷人的视角,展示了少量的“修剪”如何能为保护我们的数字伙伴带来巨大的改变。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。