← 最新论文
🤖 AI

When State Becomes an Attack Surface: State-Semantic Injection in LLM-Driven Embodied Agents

本文引入了“状态语义注入”(State-Semantic Injection),这是一种新型攻击面,即攻击者通过操纵由大语言模型驱动的具身智能体所感知的环境状态信息,来破坏其任务理解、规划与执行,从而危害机器人系统的安全性与可靠性。

原作者: Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao, Chi Guo, Keyan Guo, Hongxin Hu

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao, Chi Guo, Keyan Guo, Hongxin Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个能够理解你的声音、环顾房间并决定如何移动手臂来帮助你的机器人。这些被称为“具身智能体”(embodied agents)的机器正变得越来越普遍。它们不仅仅是遵循死板的指令列表;相反,它们利用强大的语言模型,根据所见所闻以及你的要求来判断下一步该做什么。为了做出决策,机器人会构建一张周围环境的心理图景,记录物体在哪里、叫什么名字以及它们是如何相互关联的。它将这张心理图景视为一个可靠的事实,一个坚实的基础,并以此为基础制定计划,去拿起一个杯子、打开一扇门或整理一个架子。如果那张心理图景中的信息是错误的,机器人的计划也会出错。这创造了一种新的风险:如果有人在不改变你所说的话的情况下,悄悄改变了机器人脑海中的事实,会发生什么?

研究人员早已知道,人工智能会被隐藏在文本或图像中的混淆指令所欺骗。但一项新的研究提出了一个更深层的问题,即关于与物理世界互动的机器人。它探讨了这样一种场景:攻击者并不向机器人大喊虚假的命令,而是悄悄修改了机器人用来思考的房间描述。研究人员想知道:如果机器人被喂入了一个错误的描述,它会相信这个谎言、改变计划,并在现实世界中真的去做错事吗?他们发现答案是肯定的,机器人甚至会在人类完全没有察觉到诡计的情况下,去抓错物体或移动到错误的地方。

由武汉大学和布法罗大学科学家领导的团队开发了一种被称为“环境状态-文本注入”(Environment State-Text Injection)的方法。为了理解其原理,请想象一个任务是在书架上寻找特定书籍的机器人。通常,机器人观察书架,看到一本书,并记录其位置。在这个实验中,研究人员破坏了机器人系统中负责报告其所见内容的单一环节。他们既没有改变人类的要求,也没有黑进机器人的大脑或电机。相反,他们只是改变了机器人阅读关于那本书的文本。他们将书的描述替换成了另一个物体(如西红柿)的描述,或者将书的位置改到了书架上的另一个位置。至关重要的一点是,他们确保这种虚假描述看起来与机器人传感器发出的正常、诚实的报告完全一致。这并不是一条命令让机器人去“抓取西红柿”;这是一个关于机器人“正在看到什么”的谎言。

研究人员在三个不同的模拟世界中测试了这个想法,每个世界都旨在模仿真实的家庭或办公环境。他们使用先进的语言模型作为机器人的大脑。在一次测试中,机器人被要求将一个方块移动到桌子中心。研究人员修改了状态报告,称该方块实际上是另一个方块。机器人信任这份虚假报告,计划移动错误的方块。在另一次测试中,机器人被告知去拿面包。研究人员改变了状态,称面包实际上是一个西红柿。于是机器人计划去拿那个西红柿 instead。结果令人震惊。当虚假信息传递给机器人的规划系统时,机器人在几乎所有案例中都采纳了新的目标。在一种特定的设置中,机器人百分之百地改变了计划以匹配那个谎言。

然而,故事并没有在机器人仅仅改变主意时结束。研究人员还观察了机器人是否能在物理世界中实际执行新计划。这正是测试变得困难的地方。即使机器人决定去抓西红м柿而不是面包,它仍必须能够触及那个西红柿,且西红柿必须确实在那里供它抓取。研究发现,虽然机器人几乎总是改变了计划,但并不总是能成功完成动作。在模拟中,机器人成功执行错误动作的概率约为 43% 到 48%,具体取决于环境。这种改变计划与成功执行动作之间的差距非常重要。它表明,虽然机器人很容易被诱导产生不同的目标,但物理定律仍然适用。机器人无法抓取不存在的物体,也无法到达被阻挡的位置。

为了证明这不仅仅是模拟实验的产物,研究人员还在一台真实的物理机器人上测试了该方法。他们给机器人一个简单的指令,让它沿着路径行驶并返回起点。然后,他们向机器人输入了一份关于其周围环境的虚假报告,暗示一台电脑位于实际位置之外的地方。机器人相信了这个谎言,改变了路径。它没有按照指令完成循环,而是转向了电脑并偏离了预定路线。这个实验证实,通过机器人的内部状态传递关于环境的谎言,可以导致真实的机器做出并非人类操作员本意的行为。

该研究还将这种方法与其他已知的攻击机器人方式进行了比较。以前的攻击通常涉及大喊一个隐藏命令或使用“越狱”(jailbreak)来强迫机器人忽略安全规则。研究人员发现,在让机器人执行特定物理动作方面,这些旧方法的效果较差。新方法之所以更有效,是因为它并不试图用一个命令去对抗机器人的程序;相反,它只是替换了机器人赖以生存的事实。这就像是改变了食谱中的配料,而不是对着厨师大喊大叫。机器人完美地执行了食谱,但因为配料错了,最终做出的菜肴并不是顾客订购的那道。

研究人员谨慎地指出,他们的研究并未证明什么。他们并没有展示攻击者最初是如何获得进入机器人系统的权限的。他们假设攻击者已经有一种方法可以修改机器人内部报告的一个微小部分。他们也没有声称这种情况会发生在每一个机器人或每一种情况下。他们的工作针对的是一类使用语言来规划行动的机器人。他们发现,对于这些机器而言,机器人认为的事实与真实事实之间的界限非常薄弱。如果这条界限被跨越,机器人就会根据谎言采取行动。

这项研究凸显了下一代辅助型机器人的一个根本性脆弱点。随着机器人越来越多地融入我们的家庭和工作场所,依赖它们来理解周围环境,其理解的完整性就变成了一个安全问题。如果机器人无法信任它对世界的描述,它就无法被信任在那个世界中安全行动。研究表明,保护这些机器不仅需要保障其软件的安全,还需要确保它们用于决策的事实是真实的。研究人员计划继续这项工作,探索这些攻击在更长的时间跨度和更复杂、多变的环境中会如何演变。目前,结论是明确的:一个相信谎言的机器人会根据谎言采取行动,而且有时,这种行动会就在我们面前发生。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →