← 最新论文
🤖 AI

Bit-Flip Attacks on Vision-Language-Action Models: Action-Decoding Architecture Shapes the Vulnerability

本文证明了量化视觉-语言-动作模型对针对性的比特翻转攻击具有极高的脆弱性,即在特定的动作生成层中通过极少量的梯度选择权重损坏,即可使具身智能体完全失效,且所需的攻击预算随动作解码架构的不同而显著变化。

原作者: Yudong Gao, Linghan Chen, Wenhan Wu, Mia Zhou, Jiyao Wang, Kaiyan Ji, Mingyu Guo, Honglong Chen

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Yudong Gao, Linghan Chen, Wenhan Wu, Mia Zhou, Jiyao Wang, Kaiyan Ji, Mingyu Guo, Honglong Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代机器人正开始通过观察和聆听来学习如何移动,而不是遵循僵化的、预先写好的指令。这些被称为视觉-语言-动作模型(vision-language-action models)的系统,通过拍摄一张房间的照片并接收类似“拿起红杯子”的句子,随后计算出完成任务所需的精确动作。它们通过将人类语言和视觉数据转化为一串数字,从而指挥机器人的电机如何转动。为了让这些强大的系统能在仓库或家庭中使用的廉价小型计算机上运行,工程师们通常会压缩模型的内部记忆。这种被称为“量化”(quantification)的过程,将模型复杂的数学权重转化为更容易存储和快速处理的简单整数。虽然这使得该技术在日常使用中变得切实可行,但也改变了机器“大脑”的本质,使其变成了一个在特定方面异常脆弱的系统。

一个研究小组发现,这种压缩过程创造了一个隐藏的漏洞。他们发现,如果攻击者能够翻转压缩内存中极少数微小的比特位(bits),整个系统就会彻底失效。这并非由摄像头故障或指令模糊引起的错误,而是对机器人内部指令的直接破坏。研究人员展示了,通过精心选择要翻转哪些比特位,他们可以让机器人在执行任务时的成功率从接近完美降至零。这一发现至关重要,因为它揭示了机器人的安全性不仅取决于其软件代码,还取决于其内存中存储的数字的物理完整性。

研究人员在几种不同类型的机器人“大脑”上测试了这个想法,其范围涵盖了从直接计算动作的简单模型,到使用多步流程生成动作的更复杂模型。他们首先提出了一个简单的问题:需要多少个微小的错误才能让机器人瘫痪?在现实世界中,随机错误经常发生,比如收音机里的杂音。团队发现,如果他们在机器人的记忆中引入数百个随机错误,机器几乎察觉不到。它能像之前一样正常工作。这表明该系统对于日常生活中预期的噪声具有鲁棒性(robustness)。然而,当错误不再是随机的时候,情况发生了彻底的变化。

通过使用一种分析机器人决策过程的方法,研究人员识别出了哪些比特位对机器人的成功最为关键。随后,他们只翻转了这些特定的比特位。结果令人震惊。对于那些直接计算动作的简单模型,仅翻转三个或五个精心挑选的比特位,就足以让机器人在尝试完成任务时每次都失败。在一场模拟实验中,一个成功率高达88%的机器人,在仅经过三次针对性修改后,成功率便跌至零。机器人不仅仅是犯了一个小错,而是完全失去了功能,经常做出物理上不可能或危险的动作。

机器人的“大脑”复杂度起到了很大作用。那些使用更高级方法来平滑运动轨迹的模型更难被破坏。它们需要数百次针对性的比特翻转才能失效,而不是仅仅几个。然而,即使是这些具有鲁棒性的系统也并非免疫。研究人员开发了一种特定的策略来寻找这些复杂模型的弱点,将破坏它们所需的翻转次数减少了十倍。他们证明,通过以一致的方式引导错误,可以压垮机器人的自我纠正能力。这证明了这种脆弱性并非单个模型的偶然现象,而是这些系统处理信息的根本特征。

为了确保这些发现不仅仅是计算机模拟的结果,团队在真实的机械臂上测试了他们的理论。他们采用了一个已在现实世界中训练用于执行任务的模型,并对其记忆应用了与模拟实验中相同的逻辑变更。他们并没有物理损坏机器人的硬件;相反,他们通过改变机器人用于计算动作的数字来模拟比特翻转的效果。当他们运行任务时,机器人在二十次尝试中无一成功。相比之下,运行干净数据或带有随机错误的同一台机器人,在二十次尝试中能成功十四到十六次。这证实了对模型权重的逻辑性破坏足以摧毁其工作能力,即便没有对硬件进行物理攻击。

这项研究还探讨了如何保护这些系统。研究人员发现,危险的比特位并非随机散布在机器人的记忆中。相反,它们集中在负责生成最终动作的极少数特定层中。通过保护极小比例的总内存——特别是那些直接控制机器人动作的部分——就可以让系统变得更加稳健。在一种情况下,仅保护大约3%的权重,就能让机器人在数百个比特被破坏时仍保持较高的成功率。这表明,实际的防御并不需要检查每一件数据,而是应该专注于机器人决定如何移动的最关键路径。

这项工作的意义对于机器人技术的未来至关重要。随着这些模型在家庭和工厂中变得越来越普遍,确保其内部数据的完整性成为了一个安全优先级。研究人员表明,目前压缩这些模型的方法虽然高效,但也使它们容易受到一种标准安全检查无法察觉的攻击。机器人不会崩溃,也不会显示出被黑客攻击的迹象;它只是单纯地停止了工作。研究结论指出,具身智能(embodied intelligence)的安全性取决于其权重的稳定性,而理解这些系统究竟在哪里以及如何被破坏,是构建真正可靠机器人的第一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →