← 最新论文
💻 computer science

Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?

本研究评估了用于评估第一视角机器人图像中近距交互风险(proxemic risk)的开源视觉语言模型,发现虽然微调仅带来了适度的整体提升,但高级提示词技术显著提高了如 Qwen-VL 等特定模型在高危险检测方面的表现,尽管正确的安全分类并不一定与准确的空间定位相关联。

原作者: Vladyslava Rudas, Dmytro Kuzmenko

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Vladyslava Rudas, Dmytro Kuzmenko

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何在繁忙的咖啡馆里行走。你不仅希望它能看到桌子,还希望它能“感受”周围的空间。这就是**近体学(proxemics)**的世界——这是一个关于人类需要多少个人空间才能感到舒适的专业术语。你可以把它想象成一个个隐形的泡泡:给最好的朋友一个紧凑的泡泡,给同事一个中等的泡泡,给陌生人一个宽大的泡泡。如果机器人未经询问就闯入你的紧凑泡泡,那是既没礼貌又可能带来危险的行为。

现在,想象给这个机器人头上装一个摄像头(即“自我中心”视角),让它能像我们一样观察世界。科学家们正在探讨的一个大问题是:我们能否教会机器人通过看一张照片,就能瞬间明白:“噢不,我离那个人太近了!”或者“呼,我有足够的空间”。这就是**视觉语言模型(VLMs)**发挥作用的地方。这些是超级智能的 AI 程序,它们可以观察图像并对其进行描述,就像一个能看懂图画书并给你讲故事的机器人。研究人员对此感到兴奋,因为如果这些 AI 仅凭视觉就能理解个人空间,我们可能就不再需要在每个机器人身上都安装昂贵且沉重的传感器了。我们只需要给它们一个摄像头和一个大脑。

但转折点在于:仅仅因为一个 AI 能够描述一张图片,并不意味着它真正理解了物体在 3D 空间中的具体位置。这篇论文测试了三种不同的 AI“大脑”,以观察它们是否能充当机器人的安全卫士。

实验:AI 能发现危险吗?

研究人员利用 1,243 张从机器人视角拍摄的真实场景照片构建了一个特殊的训练集。他们根据人们距离机器人的远近,为每张照片标注了一个“危险等级”:

  • 高危险: 有人就在机器人的脸跟前(碰撞迫在眉睫!)。
  • 中等危险: 有人靠得很近,机器人需要小心移动。
  • 低危险: 有人在附近,但机器人只需要留意一下。
  • 最低危险: 一路平安。

他们测试了三种不同的开源 AI 模型:InternVLSmolVLMQwen-VL。他们尝试了两种方式来教导这些模型:首先是通过以不同的风格向它们提问(比如给出一个简单的指令 vs. 一个复杂的、循序渐进的推理谜题);其次是通过给它们一点额外的训练(称为“微调”),使用了 200 张特定的图像。

结果:一位英雄,两位挣扎者

研究结果喜忧参半,既有“还不错”的表现,也有“不够好”的情况。

1. “随机猜测”问题
在没有任何特殊训练的情况下,所有三个模型的表现几乎和一名在做选择题时瞎猜的学生一模一样。它们的整体准确率仅仅比抛硬币猜正反面好那么一点点。即使经过额外的训练,它们正确分类所有四个危险等级的总体能力也没有显著提升。这就像这些模型虽然擅长描述咖啡馆,却对何时该停下脚步一窍不通。

2. Qwen 的例外情况
然而,出现了一位突出的英雄:Qwen-VL。当其他两个模型(InternVL 和 SmolVLM)基本上无法识别出最危险的情况(几乎漏掉了所有的危险情况)时,Qwen-VL 实际上在识别“高危险”场景方面做得更好。

  • 至关重要的是,这种进步来自于提问方式训练模型方式的特定组合。当使用一种非常具体的、复杂的提示词(要求 AI “一步步思考”)并结合第一轮微调时,效果最好。在这种设置下,Qwen-VL 成功捕捉到了约 79% 的高危险情况。
  • 其他模型即使使用相同的复杂提示词和训练,仍然几乎漏掉了所有情况。
  • 有趣的是,给 Qwen-VL 进行第二轮额外的训练(第二次微调)并没有带来更多帮助;最大的提升来自于那种特定的“深度思考”提示词与初始微调阶段的结合。

3. “盲区”惊喜
这是最有趣的部分。研究人员检查了 AI 是否真的在“盯着”那个人来判断危险。他们要求 AI 在它认为危险的人周围画一个框。

  • 令人震惊的是: 即便当 Qwen-VL 正确喊出“危险!”时,它经常也没能把框画在正确的人身上。它有时指向地板,有时指向墙壁,有时指向了正确的人。
  • 结论: 论文指出,该模型可能是在根据整幅图像的“感觉”或模式来判断危险等级,而不是真正理解了与人的具体距离。这就像一个学生在数学考试中得了正确答案,却无法展示解题过程或指出他所使用的数字。

这对机器人安全意味着什么

论文总结道,虽然这些 AI 模型正在变得越来越聪明,但它们还没准备好成为机器人在人群中行走的唯一安全卫士。

  • 它们还不能完全信任: 如果你依赖它们,可能会因为模型认为安全而导致碰撞,或者在安全时却产生恐慌。
  • 提示词和特定训练至关重要: 给模型一点额外的训练虽然对 Qwen-VL 自身提升很小,但并没有解决其他模型的问题。最大的收益来自于将“深度推理”的提示词与特定的微调配置相结合。
  • “盲目”的危险: 最核心的启示是,得到正确的标签(高危险)并不意味着机器人知道为什么危险。它可能是因为错误的原因而判断正确的。

简而言之,这些视觉语言模型就像是非常健谈的游客,它们能把场景描述得天花乱坠,但在被要求导航时却经常迷路。它们展现出了潜力,尤其是当被要求仔细思考并经过精准训练的 Qwen 模型,但在我们允许它们在没有人类监护的情况下穿过繁忙街道之前,它们还需要大量的练习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →