← 最新论文
💻 computer science

SABER: A Stealthy Agentic Black-Box Attack Framework for Vision-Language-Action Models

本文提出了 SABER 框架,这是一种基于智能体的黑盒攻击方法,能够通过生成微小且合理的指令扰动,在 LIBERO 基准测试中有效降低多种视觉 - 语言 - 动作(VLA)模型的机器人任务成功率并增加其执行错误,从而为机器人基础模型提供了一种高效可扩展的红队测试方案。

原作者: Xiyang Wu, Guangyao Shi, Qingzi Wang, Zongxia Li, Amrit Singh Bedi, Dinesh Manocha

发布于 2026-03-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiyang Wu, Guangyao Shi, Qingzi Wang, Zongxia Li, Amrit Singh Bedi, Dinesh Manocha

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章介绍了一个名为 SABER 的新系统,它就像是一个专门给机器人“找茬”的隐形黑客。

为了让你更容易理解,我们可以把机器人想象成一个听话但有点死脑筋的管家,而 SABER 就是一个擅长玩弄文字游戏的恶作剧大师。

1. 背景:机器人为什么容易“被骗”?

现在的机器人(特别是那些结合了视觉和语言的 VLA 模型)非常聪明,它们能看懂图片,也能听懂人话,然后动手干活。比如你让它:“把碗放进上面的抽屉里”,它就能照做。

但是,这就好比管家只认字面意思。如果你故意把指令改得极其微小,比如把“抽屉(drawer)”改成“抽届(drawee)”,或者加一句看似无害的废话,机器人可能会:

  • 彻底罢工(任务失败);
  • 瞎忙活半天(动作变得特别长,效率极低);
  • 甚至干出危险的事(比如撞坏东西,违反安全规则)。

以前的攻击方法要么太笨重(需要人工一个个改),要么太明显(改得面目全非,一眼就能看出是假的)。

2. SABER 是什么?(核心概念)

SABER 是一个自动化的“红队”(Red Team,即模拟攻击者)智能体。它不像人类那样手动去改字,而是像一个拥有超能力的侦探,自己想办法去修改指令。

  • 它的目标:在不被人发现的前提下,用最小的改动,让机器人“翻车”。
  • 它的限制:它不能直接黑进机器人的大脑(因为机器人是“黑盒”,代码不公开),也不能把指令改得面目全非(那样太容易被发现)。它必须在有限的修改次数内完成攻击。

3. SABER 是怎么工作的?(创意比喻)

想象 SABER 是一个正在接受特训的“文字魔术师”,它的训练过程分为两个阶段:

第一阶段:冷启动(Cold-Start)—— 先学“怎么拿笔”

刚开始,这个魔术师是个新手,不知道该怎么改字。研究人员先给它看一些人类专家(GPT)改过的例子,让它学会基本的“找茬”套路。

  • 比喻:就像教小孩写字,先让他临摹字帖,学会怎么拿笔、怎么下笔,而不是让他直接去创作。

第二阶段:GRPO 强化训练 —— 在实战中“悟道”

这是 SABER 最厉害的地方。它不再看字帖,而是直接去实战演练:

  1. 找位置(FIND):它看着指令,思考:“改哪个词最有效?是改‘抽屉’,还是加个‘请确认’?”
  2. 动手改(APPLY):它使用三种“魔法工具”:
    • 字符级:像打字错误一样,把“碗(bowl)”改成“玻(boowl)”。
    • 词级:把“打开”改成“半开”。
    • 句子级:加一句“在打开之前,先确认抽屉是空的”。
  3. 看结果:它把改好的指令发给机器人,看机器人是成功了还是失败了。
  4. 得奖励:
    • 如果机器人失败了,或者动作变慢了,SABER 就得到高分奖励。
    • 如果它改得太明显(比如改了很多字),或者用了太多工具,就会被扣分(惩罚)。

通过成千上万次的试错,SABER 学会了:“原来只要把‘打开’改成‘半开’,机器人就会卡住,而且没人能看出来!”

4. 实验结果:它有多强?

研究人员在 6 种 最先进的机器人模型上测试了 SABER,结果非常惊人:

  • 破坏力大:
    • 机器人的成功率下降了 20.6%(本来能做成 10 次,现在只能做成 8 次)。
    • 机器人的动作长度增加了 55%(本来 10 步做完,现在要 15 步,效率极低)。
    • 违反安全规则的情况增加了 33%。
  • 隐蔽性高:
    • 它比那些用大模型(GPT)硬算出来的攻击者更聪明。
    • 它用的修改次数少了一半以上(54.7% 的字符改动更少)。
    • 它调用工具的频率更低(21.1% 更少)。

比喻:如果说以前的攻击者是用大锤砸门(动静大,容易被发现),SABER 就是用一根细针(改动极小,悄无声息)就能让门锁卡死。

5. 为什么这很重要?

这就好比在机器人真正上岗工作(比如照顾老人、在工厂干活)之前,我们需要一个严格的“压力测试员”。

  • 以前:我们只能靠人工想一些奇怪的指令来测试,很难覆盖所有情况。
  • 现在:SABER 可以自动、大规模地生成各种“隐形陷阱”,帮我们提前发现机器人的弱点。
  • 意义:只有知道机器人会在什么情况下“发疯”或“变傻”,我们才能在它真正进入家庭或工厂前,把漏洞补上,确保它的安全。

总结

SABER 就是一个经过强化学习训练的“文字黑客”。它不需要知道机器人的内部代码,只需要通过极其微小、看似合理的文字修改,就能让最先进的机器人效率大降、任务失败甚至违反安全规则。

这项研究告诉我们:哪怕是一点点文字上的“小瑕疵”,也可能让机器人彻底“翻车”。 因此,在机器人普及之前,我们需要像 SABER 这样的工具来不断“找茬”,确保它们足够安全、稳健。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →