Vision Token Manipulation Attacks on Cloud-Edge Inference of Large Vision-Language Models
本文通过证明黑盒对手仅需操纵低至 10% 的传输视觉标记(vision tokens),即可在多种最先进的模型中将准确率降低高达 88.31%,揭示了云边协同大视觉语言模型(LVLM)推理中的一个关键漏洞。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个超级聪明的机器人助手(一个大型视觉语言模型),它居住在位于“云端”的一个巨大且强大的数据中心里。然而,你却是在一台像智能手机或智能摄像头这样的小型、电池供电的设备上,处于“边缘侧”。
为了让机器人回答关于你拍摄的一张图片的问题,你并不会把整张沉重的图片发送到云端。相反,你的手机会对图像进行一次快速、轻量级的扫描,并将图像转化为一组数字“笔记”,称为视觉标记(Vision Tokens)。然后,它通过互联网将这些笔记发送到云端,在那里,那个“大脑袋”会完成剩下的工作,并将答案传回。
新的弱点:信使
这篇论文指出,你的手机与云端之间的这种“交接”过程,创造了一个新的、危险的弱点。把互联网连接想象成一个在您和机器人之间奔跑的信使。
研究人员发现,一名黑客(对手)可以拦截这条路径上的这些数字笔记。他们不需要攻破机器人的大脑,也不需要黑掉你的手机;他们只需要在这些笔记被携带的过程中篡改笔记。
攻击方式:“视觉标记操纵”
研究人员将这种攻击称为 VTM 攻击(视觉标记操纵攻击)。他们测试了黑客可能干扰这些笔记的四种不同方式,即使黑客只能改变极小比例的笔记(仅 10%):
- 洗牌(置换/Permutation): 想象这些笔记是一副描述照片的扑克牌。黑客交换了几张牌的顺序。机器人看到的仍然是同样的牌,但它们讲述的故事现在变得混乱且令人困惑。
- 橡皮擦(掩码/Masking): 黑客将一些笔记变成了白纸(零)。这就像看一张照片时,其中几个关键的拼图碎片突然消失了。
- 静电噪声(高斯扰动/Gaussian Perturbation): 黑客在笔记中加入了一点“静电”或噪声,使它们变得略微模糊或扭曲,就像带有干扰的无线电信号。
- 翻转(符号翻转/Sign Flip): 这是最具破坏性的。想象一个笔记说“红色”,黑客将其翻转为意味着“非红色”或大脑中完全相反的方向。这就像拿着一张地图,把北箭头翻转到了南方向。机器人完全迷失了方向。
结果:纸牌屋
团队在目前最智能的六个视觉机器人(从小型到大规模模型不等)上进行了测试。结果令人震惊:
- 微小的变化,巨大的崩溃: 通过改变仅仅 10% 的笔记,他们就能让机器人的智能崩溃。
- “翻转”是致命的: 在某些情况下,“符号翻转”攻击将机器人的准确率从接近 88% 降低到了几乎 0%。这就像一个聪明人在听到一声细微的耳语后,突然忘记了如何阅读或观察。
- 并非所有机器人都是平等的: 一些机器人模型(如 Qwen 系列)在这些攻击下几乎瞬间崩溃。其他的模型(如 InternVL 系列)稍显强韧,但仍然脆弱。
“聪明”的黑客手段
研究人员还发现了一种让攻击变得更严重的办法。他们并没有随机选择要搞乱哪些笔记,而是使用一种数学方法来寻找最重要的笔记(即机器人最依赖的那些笔记)并专门针对这些笔记进行攻击。这使得机器人的失败发生得更快。
核心结论
论文得出结论,虽然在你的手机和云端之间拆分工作是非常高效的,但这同时也为黑客通过篡改传输中的数据来破坏系统打开了一扇门。即使是对从边缘侧发送到云端的“笔记”进行微小且有针对性的篡改,也能导致最先进的 AI 视觉系统彻底失效。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。