← 最新论文
💻 computer science

REALM: A Unified Red-Teaming Benchmark for Physical-World VLMs

本文介绍了 REALM,这是首个针对物理世界视觉语言模型的统一红队测试基准,它通过一个共享的、具有物理基础的目标生成流水线,将多样化的攻击方法与防御手段标准化,以解决当前安全性评估中的碎片化问题。

原作者: Yifei Zhao, Qian Lou, Mengxin Zheng

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Yifei Zhao, Qian Lou, Mengxin Zheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你构建了一个能够观察世界并进行交流的超级智能机器人助手。你希望这个机器人能驾驶汽车、捡起物体或在人们的家中提供帮助。但在你让它进入现实世界之前,你需要确保它不会被诱导去做危险的事情,比如撞车或抓错工具。

这篇论文介绍了一个名为 REALM 的新“压力测试”,专门用于观察这些机器人大脑在处理现实物理任务时,有多容易被欺骗。

以下是该论文内容的详细拆解,使用了简单的类比:

1. 问题所在:“聊天机器人”测试 vs. “现实世界”测试

想象你有一个保安(AI)。

  • 旧的测试(聊天机器人基准测试): 这些测试会问保安:“你会说脏话或违法的话吗?”如果保安回答“不,我不会那样做”,他们就算通过了。这就像是在测试一个保安是否会违反对话规则。
  • 真正的难题: 在物理世界中,危险不仅仅在于说坏话,而是在于做出错误的动作。如果一个正在驾驶汽车的机器人看到一个贴了小贴纸的停止标志,它可能会误以为那是让行标志并继续行驶。旧的测试没有捕捉到这一点。它们在寻找“坏话”,而不是“坏动作”。

REALM 是这项新测试,它在问:“如果我欺骗你的眼睛或你的指令,你会犯物理错误吗?”

2. 解决方案:一个统一的 AI “健身房”

在此之前,每位研究人员都有自己的不同健身房、不同的杠铃重量和不同的规则。要比较谁更强是非常困难的。

  • REALM 健身房: 作者构建了一个巨大的、标准化的健身房。他们收集了 12 种不同的欺骗 AI 的方式(攻击)3 种保护 AI 的方式(防御) 以及 13 个不同的 AI 模型 进行测试。
  • “代理型”教练: 测试中最难的部分之一是决定要寻找什么样的错误。如果你展示一张汽车的照片,AI 应该认为它是自行车吗?还是应该认为汽车正在倒车?
    • 论文创建了一个特殊的“教练 AI”(一个代理流水线)。这个教练会观察每一个场景,并构思出一个特定的、真实的错误让 AI 去犯。例如,在驾驶场景中,教练可能会决定:“今天,AI 应该把红灯看成绿灯。”这确保了每个 AI 都在接受完全相同的“诡计”测试,从而使比较变得公平。

3. 实验结果:发生了什么?

研究人员对 13 个不同的 AI 模型(有些规模小,有些规模大)进行了这些测试,并发现了一些令人惊讶的事实:

  • “墙上的纸条”诡计是最有效的: 打破这些机器人的最有效方法并不是通过干扰图像的像素(比如添加看不见的噪声),而是通过改变文本指令或在图片中放置一个假标志
    • 类比: 通过在机器人耳边低语“忽略停止标志”(文本注入),比通过在停止标志上画一个微小的、肉眼看不见的点(视觉扰动)更容易欺骗机器人。
  • “一击即中”的诡计: 有些攻击需要黑客尝试数百次,通过微调图像来观察哪种方法奏效。研究人员发现,一些“一击即中”(只尝试一次)的攻击效果几乎与那些尝试数百次的攻击一样好。这意味着黑客不需要很有耐心就能破解这些系统。
  • 越大并不一定越安全: 你可能会认为一个巨大的、超级昂贵的 AI(拥有 1000 亿参数)会比一个小型的 AI 更难被欺骗。论文发现,规模并不重要。 如果诡计设计得当,巨大的 AI 和小的 AI 一样容易被骗。
  • 专门化训练没有帮助: 有些 AI 经过专门训练,擅长物理和推理。你会认为它们会更聪明、更难被骗。然而事实并非如此。它们和其它的 AI 一样脆弱。

4. 防御措施:我们能阻止这些诡计吗?

研究人员还尝试了三种不同的“盾牌”来保护 AI:

  • 文本盾牌: 其中一种盾牌非常擅长阻止“低语”类的文本诡计。
  • 视觉盾牌: 另一种盾牌可以较好地阻止“看不见的点”这类图像诡计。
  • 问题所在: 没有一种单一的盾牌能阻止所有事情。如果你使用了文本盾牌,图像诡计仍然有效;如果你使用了视觉盾牌,文本诡计仍然有效。你需要一个多层防御系统。

总结

REALM 是第一个检查 AI 机器人在现实世界中是否安全的标准化方法。它发现:

  1. 文本诡计是目前最大的危险。
  2. 大型模型并不自动意味着安全。
  3. 专门化训练并不能让它们对诡计免疫。
  4. 我们需要更好的、多层次的防御措施来确保我们的物理 AI 安全。

论文的结论是,我们不能仅仅依赖于测试 AI 是否会说“坏话”,我们必须测试它是否会在物理世界中做出“坏动作”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →