想象一下,你构建了一个能够观察世界并进行交流的超级智能机器人助手。你希望这个机器人能驾驶汽车、捡起物体或在人们的家中提供帮助。但在你让它进入现实世界之前,你需要确保它不会被诱导去做危险的事情,比如撞车或抓错工具。
这篇论文介绍了一个名为 REALM 的新“压力测试”,专门用于观察这些机器人大脑在处理现实物理任务时,有多容易被欺骗。
以下是该论文内容的详细拆解,使用了简单的类比:
1. 问题所在:“聊天机器人”测试 vs. “现实世界”测试
想象你有一个保安(AI)。
- 旧的测试(聊天机器人基准测试): 这些测试会问保安:“你会说脏话或违法的话吗?”如果保安回答“不,我不会那样做”,他们就算通过了。这就像是在测试一个保安是否会违反对话规则。
- 真正的难题: 在物理世界中,危险不仅仅在于说坏话,而是在于做出错误的动作。如果一个正在驾驶汽车的机器人看到一个贴了小贴纸的停止标志,它可能会误以为那是让行标志并继续行驶。旧的测试没有捕捉到这一点。它们在寻找“坏话”,而不是“坏动作”。
REALM 是这项新测试,它在问:“如果我欺骗你的眼睛或你的指令,你会犯物理错误吗?”
2. 解决方案:一个统一的 AI “健身房”
在此之前,每位研究人员都有自己的不同健身房、不同的杠铃重量和不同的规则。要比较谁更强是非常困难的。
- REALM 健身房: 作者构建了一个巨大的、标准化的健身房。他们收集了 12 种不同的欺骗 AI 的方式(攻击)、3 种保护 AI 的方式(防御) 以及 13 个不同的 AI 模型 进行测试。
- “代理型”教练: 测试中最难的部分之一是决定要寻找什么样的错误。如果你展示一张汽车的照片,AI 应该认为它是自行车吗?还是应该认为汽车正在倒车?
- 论文创建了一个特殊的“教练 AI”(一个代理流水线)。这个教练会观察每一个场景,并构思出一个特定的、真实的错误让 AI 去犯。例如,在驾驶场景中,教练可能会决定:“今天,AI 应该把红灯看成绿灯。”这确保了每个 AI 都在接受完全相同的“诡计”测试,从而使比较变得公平。
3. 实验结果:发生了什么?
研究人员对 13 个不同的 AI 模型(有些规模小,有些规模大)进行了这些测试,并发现了一些令人惊讶的事实:
- “墙上的纸条”诡计是最有效的: 打破这些机器人的最有效方法并不是通过干扰图像的像素(比如添加看不见的噪声),而是通过改变文本指令或在图片中放置一个假标志。
- 类比: 通过在机器人耳边低语“忽略停止标志”(文本注入),比通过在停止标志上画一个微小的、肉眼看不见的点(视觉扰动)更容易欺骗机器人。
- “一击即中”的诡计: 有些攻击需要黑客尝试数百次,通过微调图像来观察哪种方法奏效。研究人员发现,一些“一击即中”(只尝试一次)的攻击效果几乎与那些尝试数百次的攻击一样好。这意味着黑客不需要很有耐心就能破解这些系统。
- 越大并不一定越安全: 你可能会认为一个巨大的、超级昂贵的 AI(拥有 1000 亿参数)会比一个小型的 AI 更难被欺骗。论文发现,规模并不重要。 如果诡计设计得当,巨大的 AI 和小的 AI 一样容易被骗。
- 专门化训练没有帮助: 有些 AI 经过专门训练,擅长物理和推理。你会认为它们会更聪明、更难被骗。然而事实并非如此。它们和其它的 AI 一样脆弱。
4. 防御措施:我们能阻止这些诡计吗?
研究人员还尝试了三种不同的“盾牌”来保护 AI:
- 文本盾牌: 其中一种盾牌非常擅长阻止“低语”类的文本诡计。
- 视觉盾牌: 另一种盾牌可以较好地阻止“看不见的点”这类图像诡计。
- 问题所在: 没有一种单一的盾牌能阻止所有事情。如果你使用了文本盾牌,图像诡计仍然有效;如果你使用了视觉盾牌,文本诡计仍然有效。你需要一个多层防御系统。
总结
REALM 是第一个检查 AI 机器人在现实世界中是否安全的标准化方法。它发现:
- 文本诡计是目前最大的危险。
- 大型模型并不自动意味着安全。
- 专门化训练并不能让它们对诡计免疫。
- 我们需要更好的、多层次的防御措施来确保我们的物理 AI 安全。
论文的结论是,我们不能仅仅依赖于测试 AI 是否会说“坏话”,我们必须测试它是否会在物理世界中做出“坏动作”。
技术摘要:REALM —— 一个统一的物理世界 VLM 红队测试基准
1. 问题陈述
视觉语言模型(VLMs)正越来越多地被部署为具身智能在自动驾驶、机器人操作器等安全关键型物理系统中的感知-推理骨干。在这些场景中,感知或推理错误可能导致不安全的物理动作。虽然存在许多红队测试方法来探测 VLM 的漏洞,但目前的评估格局是碎片化的。现有的基准测试主要关注以聊天机器人为中心的安全性(例如,越狱、生成毒性内容),缺乏针对具有物理基础的功能性失效的标准协议。
当前的挑战包括:
- 评估碎片化: 多样化的数据集、指标和威胁模型阻碍了对攻击有效性的直接比较。
- 目标不一致: 聊天机器人基准测试衡量的是拒绝率或毒性,而物理世界 VLM 则需要评估动作预测、任务完成度和空间推理错误。
- 缺乏统一协议: 现有的物理世界基准测试(如 PhysBench、PAI-Bench)侧重于评估干净性能,但并未提供在不同方法间具有共享攻击目标的统一红队测试协议。
2. 方法论:REALM 框架
作者引入了 REALM(物理世界 VLM 红队测试基准),这是首个旨在实用黑盒威胁模型下评估物理世界设置中对抗鲁棒性的统一基准。
2.1 基准结构
REALM 从三个维度组织评估:
- 物理领域: 包括驾驶、操控、抓取、物理、第一视角辅助、诊断和场景级问答在内的七个领域。
- 任务族: 感知、预测、推理、评估和规划。
- 失效模式: 具有物理基础的输出错误,例如动作预测错误、任务成功错误、空间推理错误和具身规划错误。
该数据集包含从现有物理 AI 基准中提取的 832 个测试用例,并扩展至涵盖 12 种红队测试方法和 13 种受害者 VLM 的 9,984 个对抗测试用例。
2.2 智能体目标生成流水线
REALM 的核心创新在于其智能体目标生成流水线,它解决了为特定场景物理任务定义固定攻击目标时的困难。
- 流程: 给定源图像、问题和标准答案,推理 VLM 智能体会分析场景,以识别一个合理的失效模式(例如,误解车辆的转向动作)。
- 输出: 该流水线生成一个特定场景的目标答案 (aitar) 和一个目标图像 (Iitar),用于视觉化呈现预期的误感知。
- 效用: 这些共享的目标允许将多样化的红队测试方法(视觉扰动、提示词注入等)应用于相同的特定场景对抗目标进行评估,从而确保公平比较。
2.3 威胁模型与评估
- 威胁模型: 一种现实的黑盒设置。攻击方法和防御方法都无法访问受害者模型的参数、梯度或内部状态。
- 攻击生成: 使用代理模型或外部生成器离线生成对抗样本,并将其迁移到受害者模型进行单次评估。
- 指标: 主要指标是攻击成功率(ASR),定义为对抗输入导致 VLM 产生反映任务相关物理错误的错误响应的比率。同时也会报告干净准确率以进行基准对比。
2.4 被评估组件
- 受害者模型: 13 个 VLM(参数量从 7B 到 100B+),包括专有模型(Gemini-3-Flash, GPT-4.1-Mini)和开源家族(Qwen3.5, Qwen3-VL, Cosmos-Reason)。
- 红队测试方法: 涵盖 12 种方法的 12 种方法:
- 视觉扰动: 基于梯度的(FOA, M-Attack, V-Attack)、协同优化(Chain-of-Attack)以及基于扩散模型的(AdvDiffVLM)。
- 物理约束: PhysPatch(局部补丁)。
- 生成/编辑: AdvEDM, ImageMix。
- 注入: 文字型(FigStep)、提示词型(PromptInject)和单次通过型(AnyAttack)。
- 防御措施: 3 种模型无关的预处理防御:PAD(补丁移除)、FreqPure(频率纯化)和 BlueSuffix(文本/图像纯化)。
3. 关键结果
3.1 攻击有效性
- 文本与文字型注入: 这些攻击诱发的失效最多。PromptInject 实现了最高的平均 ASR (64.8%),其次是 FigStep (49.4%)。这表明 VLM 在文本和辅助指令通道的操纵面前仍然高度脆弱。
- 视觉扰动: 在视觉攻击中,通过协同优化扰动与动态重新生成的描述的 Chain-of-Attack (CoA) 展现了最强的迁移性 (54.6% ASR),优于标准的基于梯度的攻击。这表明多模态协同优化比仅针对视觉特征的优化能更好地利用跨模态对齐。
- 效率: 单次通过方法 AnyAttack 达到了 49.9% 的 ASR,在显著降低计算成本的同时,接近了迭代方法(如 FOA 的 48.1%)的性能。
- 物理约束: 空间受限的扰动(PhysPatch)与全图扰动相比表现出较低的迁移性 (33.0% ASR),表明物理合理性约束增加了黑盒迁移的难度。
3.2 模型脆弱性
- 规模 vs. 鲁棒性: 增加模型规模(例如 Qwen3.5 从 9B 增加到 122B)虽然提高了干净准确率,但并不保证对抗鲁棒性。针对特定攻击(如 PromptInject)的 ASR 几乎没有变化,甚至随着规模增加而上升。
- 领域专业化: 经过物理推理后训练的模型(Cosmos-Reason)并未表现出更优的鲁棒性;事实上,它们表现出了高度的脆弱性,Cosmos-Reason2-8B 在 PromptInject 下的 ASR 达到了 76.8%。
- 专有模型 vs. 开源模型: 专有模型(Gemini, GPT)表现出的脆弱程度与具有相似干净准确率的开源模型相当,这表明闭源部署本身并不一定能确保鲁棒性。
- 领域差异: 脆弱性随领域变化显著。操控和驾驶任务显示出最高的中间 ASR,而 场景问答 的 ASR 最低。
3.3 防御分析
- 通道特异性: 防御措施具有高度的通道特异性。BlueSuffix(文本纯化)平均降低了 PromptInject 21.7% 的 ASR。FreqPure(频率过滤)降低了基于梯度的攻击(FOA)5.8%。
- 局限性: 没有一种单一的预处理防御能泛化到所有攻击范式。例如,视觉防御(PAD, FreqPure)无法缓解文本注入攻击,且没有任何防御能影响 FigStep。
4. 重要性与贡献
论文声称 REALM 提供了第一个用于比较物理世界 VLM 红队测试方法的统一框架。其重要性在于:
- 统一基准: 将 12 种攻击方法、3 种防御措施和 13 个 VLM 集成在一个共享协议下,实现了对有效性和覆盖范围的直接比较。
- 智能体目标生成: 解决了场景特定目标对齐的问题,使得多样化的攻击可以针对具有物理基础且场景一致的失效模式进行评估。
- 实证洞察: 确立了文本通道漏洞是当前最关键的失效点,多模态协同优化增强了视觉迁移性,并且仅靠模型规模不足以实现鲁棒性。
作者总结道,未来的工作必须超越以聊天机器人为中心的对话安全性,转而开发专门针对落地物理任务的功能鲁棒性的基准测试和防御措施。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。