← 最新论文
🤖 AI

AdvNav: Behavior-Guided Black-Box Adversarial Attacks on Vision-Language Navigation

本文介绍了 AdvNav,这是一个行为引导的黑盒对抗攻击框架,它通过利用双粒度行为反馈来引导一种混合优化策略,从而在不需要模型梯度的情况下生成具有破坏性的视觉扰动,有效地干扰视觉语言导航智能体。

原作者: Chenyang Li, Kaige Li, Zeyu Jiang, Changhao Chen

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenyang Li, Kaige Li, Zeyu Jiang, Changhao Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个超级聪明的机器人朋友,它非常喜欢探索各种新房子。你给它一个语音指令,比如:“走过沙发,穿过餐厅,然后在外面等待。”这个机器人利用它的眼睛(摄像头)和大脑(人工智能)来判断下一步该往哪里走。这被称为视觉-语言导航(Vision-and-Language Navigation, VLN)

但这里有一个转折:如果有人能在机器人完全不知情的情况下,欺骗它的眼睛,会发生什么?这正是开发 AdvNav 的研究人员所发现的。他们制造了一个“魔力透镜”,可以迷惑机器人,让它偏离航线,而且完全不需要窥探机器人的大脑内部。

“黑盒”之谜

通常情况下,要欺骗一个机器人,黑客需要成为“白盒”专家。这意味着他们需要掌握机器人的秘密蓝图(其内部代码和数学逻辑),以便精确计算如何干扰它的视觉。但在现实世界中,你无法看到一家公司机器人的内部构造。它是一个黑盒。你只能通过观察它的行为并与其交流来了解它。

论文指出,旧的招数在这里并不奏效。试图一步步猜测机器人的动作,就像试图通过一次只猜一个转弯来破解迷宫;这既耗时又容易失败,因为机器人可能会在过程中自我纠正错误。研究人员表示,我们需要一种新的攻击方式,这种方式既不需要蓝图,也不会卡在单一的步骤上。

“雾状透镜”诡计

那么,他们是怎么做到的呢?他们没有尝试破解代码,而是把机器人想象成一个走在雾气弥漫房间里的人。

他们创造了一种特殊的噪声,看起来就像相机镜头上的一层柔软、朦胧的尘埃或雾气。他们并没有只是向机器人投射随机的静电噪声(就像电视雪花点),而是使用了一种智能的进化策略,去寻找那种能让机器人失去方向感的“完美”雾气。

你可以这样理解:如果你在机器人的眼睛上贴一个小贴纸,它可能只会忽略它。但如果你在整个镜头上覆盖一层特定的“雾气”图案,机器人可能会把墙壁误认为是一扇门,或者把走廊误认为是一个死胡同。研究人员将这种方法称为 AdvNav

“行为 GPS”

由于无法看到机器人的内心想法,他们必须通过观察机器人的行为来判断他们的“雾气”是否奏效。他们构建了一个**双粒度反馈(dual-granularity feedback)**系统。想象一位教练正在观察一名跑步者:

  1. 宏观层面(轨迹层面): 跑步者完成比赛了吗?如果机器人迷路了或提前停止了,教练就会给出“差评”。
  2. 微观层面(动作层面): 即使跑步者完成了比赛,他们是否有踉跄?是否差点摔倒?教练会观察机器人迈出的每一步。如果机器人犹豫了或者差点选错了门,教练会将此记录为“风险”。

通过观察这两点,研究人员可以告诉他们的“雾气”该如何变得更强。他们使用了一种叫做**遗传进化(genetic evolution)**的方法,这就像是针对计算机噪声进行的自然选择。他们一次尝试 10 种不同类型的雾气。那些让机器人最容易踉跄的雾气会存活下来,并结合在一起,创造出下一轮更强大的雾气。

结果:情况有多糟?

团队在两种不同类型的机器人大脑上进行了测试:

  1. HAMT: 一种标准的、功能强大的机器人大脑。
  2. MapGPT: 一种由庞大语言模型(类似于那些写文章或与你聊天的模型)驱动的超聪明大脑。

他们在 11 个不同的室内场景中,使用了数千条指令进行了测试。结果如下:

  • 在 HAMT 机器人上: 攻击成功率达到了 49.70%。这意味着在近一半的尝试中,机器人未能到达目标点。其路径效率(行走表现)下降到了 29.35%,并且最终偏离预定位置 6.05 米
  • 在搭载 Qwen3-VL 大脑的 MapGPT 机器人上: 攻击成功率达到了 65.96%
  • 在搭载 GPT-4V 大脑的 MapGPT 机器人上: 攻击效果甚至更显著,成功率高达 87.30%

研究人员发现,虽然有些机器人对简单的技巧(比如用黑色色块遮住部分摄像头)具有一定的抵抗力,但面对这种“雾状透镜”噪声时却显得异常脆弱。即使是拥有强大推理能力的超聪明 GPT-4V 机器人,也会感到困惑并走失。

这意味着什么(以及并不意味着什么)

论文表明,即使是最先进的导航机器人,在视觉受到轻微扭曲时也是脆弱的。研究人员认为,这不仅仅是一个有趣的技巧,更是一个警告。如果机器人在工厂或医院中使用,相机上的一点点“雾气”就可能导致它撞车或停止工作。

然而,论文谨慎地指出,这只是一个模拟实验。他们在名为“Matterport3D”的计算机世界中进行了测试,而不是在真实的房子里测试真实的物理机器人。他们也没有发明一种新的机器人来解决这个问题,而只是展示了当前的机器人是存在漏洞的。

核心结论是:我们不能仅仅因为机器人很聪明就假设它们是安全的。只要它们依赖摄像头,一点点看不见的“雾气”就能让它们迷失方向,因此我们需要制造能够看穿迷雾的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →