← 最新论文
💬 NLP

Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration

本文介绍了 TouchSafeBench,这是一个在 Habitat 3.0 中基于物理原理的基准测试,用于评估视觉语言模型推断碰撞风险以实现安全人机协作的能力,并揭示了当前模型缺乏必要的物理问责能力和显式的几何推理能力,从而无法可靠地区分安全、碰撞以及即将接触的状态。

原作者: Jun Wang, Xiaohao Xu, Xiaonan Huang

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Jun Wang, Xiaohao Xu, Xiaonan Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何在繁忙的房屋中行走,而不撞到任何人或任何物体。你给了这个机器人一双“智能眼睛”(视觉语言模型),让它能够通过观察视频并用人类语言来描述它所看到的内容。

核心问题在于:仅仅因为机器人能完美地“描述”这个房间,它是否真的“理解”自己是否即将发生碰撞?

作者指出,答案目前是否定的。他们发现,虽然这些 AI 模型非常擅长说“我看到一个人和一把椅子”,但它们却很难意识到:“噢不,我的机器人躯体现在正挤压到那把椅子”或者“我在两秒钟之内就要撞到那个人了”。

以下是利用简单的类比对这项工作的拆解:

1. 问题所在:“描述艺术家” vs. “安全检查员”

把目前的 AI 机器人想象成描述艺术家。如果你给它们看一段机器人手臂非常靠近墙壁的视频,艺术家可能会说:“哇,墙看起来离摄像机非常近!”

但一个安全检查员需要知道更具体的信息:“机器人的实际金属躯体是否正在接触墙壁?”

论文将这两种技能之间的差距称为**“碰撞接地差距”(Collision Grounding Gap)**。AI 可以描述图像,但它无法将图像与机器人的身体、尺寸及其运动的物理现实“接地”(连接)起来。这就像是一个坐在汽车里的乘客,他可以把窗外的风景描述得非常优美,却没意识到司机正要撞上一棵树。

2. 解决方案:“TouchSafeBench”(碰撞测试假人)

为了测试这一点,研究人员构建了一个新的视频游戏——TouchSafeBench

  • 场景设置: 他们使用了一个超真实的模拟器(Habitat 3.0),创建了 2,940 个不同的场景,在这些场景中,机器人和人类共同处于一个房间内。
  • 地面真值(Ground Truth): 与其他依靠人类猜测是否发生碰撞的测试不同,这个模拟器拥有一个“物理引擎”,它能精确知道机器人的金属躯体何时接触到墙壁或人。这就像有一个带着秒表的裁判,知道碰撞发生的精确毫秒。
  • 视角: 他们从四个角度记录了动作:
    1. 机器人自身的眼睛(从其手臂处向外看)。
    2. 人类的眼睛。
    3. 机器人的第三人称视角。
    4. “鸟瞰视角”(类似于天花板上的地图)。

3. 两项测试

他们向 AI 模型提出了两个具体问题:

  1. “此时此刻”测试: “看这段 3 秒钟的剪辑。机器人是安全的,还是已经撞到了墙,或者已经撞到了人?”
  2. “预警”测试: “看这段剪辑。机器人在接下来的几秒钟内是否即将撞到某个物体?”

4. 结果:AI 是“视觉流利”但“物理无知”的

结果令人惊讶且有些令人担忧,因为这关乎机器人安全:

  • 得分: 即使是最聪明、最先进的 AI 模型(如最新版本的 GPT 和 Gemini),平均得分也低于 50%。这几乎和瞎猜差不多。
  • “深度”陷阱: 研究人员曾想:“也许如果我们给 AI 一个 3D 深度图(类似于激光扫描),它能更好地理解空间。” 但结果并不如预期。AI 可以看到深度数值,但它无法将其转化为“哦,这意味着我的机器人躯体正在接触墙壁”。这就像是给了某人一把尺子,但他们仍然无法判断门是开着的还是关着的。
  • “人类偏见”: AI 在察觉人类处于危险时表现得更好。如果一个人靠得很近,AI 会感到紧张。但如果机器人即将撞上一张桌子或一面墙(这同样很危险),AI 经常会完全忽略它。看起来 AI 被人类分散了注意力,从而忽视了家具。
  • “相机困惑”: 当机器人的摄像头非常靠近墙壁时,AI 经常会说:“相机离得很近,但机器人的身体在相机后面,所以我们是安全的!” AI 未能意识到,如果相机正在接触墙壁,那么机器人也一定正在接触墙壁。

5. 总结

论文得出结论:视觉流利度并不等于物理责任感。

仅仅因为一个 AI 能为房间写一首诗,并不意味着它能在其中安全驾驶。为了让机器人真正安全,我们不能仅仅依赖那些擅长描述图像的模型。我们需要构建能够明确理解机器人形状、相机位置以及运动物理规律的系统,而不是仅仅基于图像看起来如何来进行猜测。

简而言之: 当前机器人的“智能眼睛”擅长讲故事,但在预防碰撞方面却表现糟糕。我们需要教会它们区分“看起来很近”和“实际正在碰撞”之间的区别。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →