← 最新论文
🤖 AI

Semantic Router: On the Feasibility of Hijacking MLLMs via a Single Adversarial Perturbation

本文介绍了语义感知通用扰动(SAUP),这是一种新颖的攻击手段,它利用单一的对抗性扰动作为语义路由,将多样化的输入引导至攻击者定义的特定目标,从而劫持无状态多模态大语言模型,并在代表性模型上针对多个目标实现了66%的成功率。

原作者: Changyue Li, Jiaying Li, Youliang Yuan, Jiaming He, Zhicong Huang, Pinjia He

发布于 2026-06-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Changyue Li, Jiaying Li, Youliang Yuan, Jiaming He, Zhicong Huang, Pinjia He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个非常聪明、自主运行的机器人汽车或机械臂。这些机器使用一种被称为“多模态大语言模型”(MLLM)的“大脑”来观察世界并决定下一步该做什么。

这里有一个问题:这些机器人通常处于“无状态”(stateless)模式。这意味着它们不会记得五秒钟前发生了什么。它们只看当前的画面和当前的指令,做出即时决策,然后就会忘掉一切。这就像一个每次眨眼都会失忆的司机;他们只知道此时此刻所看到的东西。

这篇名为《语义路由器》(Semantic Router)的论文揭示了一种可怕的新型攻击方式,只需使用一个单一的、微小的、肉眼几乎不可见的贴纸(对抗性扰动)即可实现。

“魔法贴纸”类比

把机器人的大脑想象成一个非常严格的交警。

  • 正常情况: 交警看着一个路口的图片并说:“停止”。交警看着一个环岛的图片并说:“通行”。
  • 攻击情况: 黑客在机器人的摄像头镜片上贴了一个微小的、几乎看不见的“魔法贴纸”。这个贴纸不仅仅是让机器人看错东西,它更像是一个语义路由器(一个高级的开关)。

这个贴纸拥有超能力:它能读取图像中的上下文,并切换开关,将机器人发送到完全不同的、危险的目的地。

  • 场景 A: 机器人看到一个环岛。贴纸感知到了这一点,并告诉机器人:“左转”。(正常行为)。
  • 场景 B: 机器人看到一个十字路口。贴纸感知到了这个不同的上下文,并瞬间切换指令为:“右转”(甚至可以是“开车冲下悬崖”)。

可怕之处在于,黑客只需要贴上一个贴纸。这一个贴纸对机器人看到的每一张图片都有效,但它会根据机器人实际观察到的内容来改变自己的想法。这就像一个远程遥控器,会根据你所在的房间切换不同的按钮功能。

他们是如何做到的?(“几何”技巧)

研究人员并没有靠瞎猜,而是深入观察了机器人的“大脑”(处理图像的数学空间),以了解如何构建这种贴纸。他们发现了两个主要技巧:

  1. “主导偏移”(Dominant Shift,即大推力): 贴纸将机器人的大脑从其正常的、安全的思考路径上推开。它迫使机器人进入一个“混乱区”,在那里的规则是不同的。
  2. “语义偏转”(Semantic Deflection,即轻微推动): 一旦机器人进入那个混乱区,贴纸就会利用图像之间的微小差异(例如“卡车”与“山脉”之间的区别),将机器人轻轻地引导至特定的、预设的危险指令。

为了实现这一点,他们发明了一种新的数学配方,叫做 SORT。把 SORT 想象成一位大师级厨师,他知道在汤(图像)中加入多少盐(噪声),才能让它在看到鸡时尝起来像“鸡肉”,而在看到蛋糕时尝起来像“毒药”。

结果如何?情况有多糟?

研究人员在三种不同类型的机器人大脑(称为 LLaVA、Qwen 和 InternVL)以及两类测试数据上进行了测试:

  1. 简单的图片(比如猫 vs 狗)。
  2. 现实世界的驾驶和机器人任务(比如汽车接近停止标志,或机械臂抓取杯子)。

研究结果令人震惊:

  • 一个贴纸,多个目标: 他们可以让一个贴纸根据场景的不同,引导机器人走向 5 种不同的危险结果。
  • 高成功率: 在其中一个模型(Qwen)上,单个贴纸在 5 个不同目标中成功误导了机器人 66% 的次数
  • 细粒度控制: 即使场景非常相似(比如高速公路上的车 vs 人行道上的车),贴纸也能分辨出差异并发出正确的危险指令。
  • 长指令: 他们甚至可以让机器人根据所见内容说出长句(如“删除所有文件”),而不只是简短的词汇。

核心结论

这篇论文证明了,通过一个单一的、通用的技巧,就可以“劫持”机器人的决策过程。机器人不需要每次移动时都被黑客攻击;黑客只需要植入一个“语义路由器”贴纸。一旦贴纸到位,机器人就会心甘情愿地遵循黑客的指令,完全根据它面前看到的景象在不同的危险命令之间进行切换。

论文得出结论,这是目前这些 AI 系统(尤其是那些在决策时没有记忆功能的系统)的一个根本性漏洞。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →