← 最新论文
💬 NLP

HomeSafeBench: A Benchmark for Embodied Vision-Language Models in Free-Exploration Home Safety Inspection

本文介绍了 HomeSafeBench,这是首个针对具身智能体通过第一视角进行自由探索式家庭安全检查的基准测试,并提出了 CueBack,一种通过利用危险检测的时间结构来缩小 AI 与人类检查员之间差距,从而显著提升视觉语言模型性能的数据构建方法。

原作者: Jiashu Yao, Haoyu Wen, Siyuan Gao, Yuhang Guo, Zeming Liu, Heyan Huang

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiashu Yao, Haoyu Wen, Siyuan Gao, Yuhang Guo, Zeming Liu, Heyan Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个超级聪明的机器人朋友,它能通过眼睛观察世界并向你讲述它所看到的一切。这就是具身智能(Embodied AI)的世界——在这里,计算机不再仅仅是坐在屏幕里的程序,而是拥有“身体”的智能体,它们可以在 3D 世界中移动、观察并做出决策。你可以把它们想象成背着背包的数字探险家,随时准备解决谜题或寻找丢失的物品。但有一个限制:这些机器人只能看到它们“脸部”正前方的视野(称为第一视角/自我中心视角)。除非它们物理性地走过去并注视,否则它们看不见沙发后面或地毯下面的情况。这使得它们非常擅长遵循指令,但在主动侦查方面却表现得很糟糕。

现在,想象你想让这个机器人成为你家的安全检查员。它的工作是在你的家中四处游走,发现像台面上留下的刀具或可能导致绊倒的地毯这类危险物品,并在任何人受伤之前提醒你。这具有重大意义,因为大多数家庭事故都是因为我们忽略了显而易见的危险而发生的。核心问题在于研究人员正在追问:这些 AI 探险家真的能胜任这份工作吗?还是说它们太笨拙且对风险视而不见了?


论文:HomeSafeBench 与 “CueBack” 妙招

这项研究背后的研究人员开发了 HomeSafeBench,他们决定建立一个巨大的数字障碍赛场来测试这一点。他们创建了一个基准测试(一个标准测试),要求 AI 智能体在一个完全可交互的 3D 住宅中自由探索,像人类一样环顾四周并从一个房间移动到另一个房间。目标是什么?是寻找五种特定类型的危险:火灾隐患(如炉灶旁的纸张)、触电风险(如水槽里的烤面包机)、坠落物体(如高架上的重箱子)、绊倒隐患(如地板上的香蕉皮)以及儿童安全风险(如孩子伸手可及范围内的尖锐刀具)。

他们构建了 1,000 个不同的场景,每个场景包含一到五个隐藏的危险,并邀请了世界上最优秀的 AI 模型来寻找它们。结果令人清醒。即使是最强大的商业 AI 模型,通常在这些测试中表现出色,也表现得非常吃力。表现最好的模型仅找到了大约 34.7% 的危险(以 F1 分数衡量),而人类检查员的发现率则高达 98.0%

这里有个奇怪的地方:AI 并不是随机地“错过”事物,而是表现得过于谨慎。它具有很高的“精确度”(当它说某物危险时,通常是正确的),但“召回率”极低(它错过了几乎所有其他东西)。这就像一名保安,只有在建筑起火时才会大喊“着火了!”,却忽略了桌上正在冒烟的蜡烛。AI 只捕捉到了那些最明显、最响亮的危险,而忽略了那些安静、隐蔽的危险,尤其是那些可能掉落或伤害儿童的事物。

解决方案:“CueBack”

研究人员意识到,通过让这些机器人在模拟器中一遍又一遍地行走来进行训练,既太慢又太昂贵。因此,他们发明了一个聪明且低成本的技巧,叫做 CueBack

你可以这样理解:想象你正在看一段关于侦探破案的视频。在视频中,侦探走进房间,看到了一个泥脚印(线索),然后走到窗边去确认嫌疑人是否曾出现在那里(确认)。如果你只是展示给侦探最终的答案(“嫌疑人在窗边!”),他们就无法学会如何首先找到那个线索。

CueBack 方法观察一条“完美”的路径,在这条路径中,人类(或一位超级聪明的老师)已经知道危险所在。然后,它会将视频倒回到危险从远处变得可见的第一个瞬间。它告诉 AI:“嘿,在你确定之前,你只是在探索。但就在这里,你看到了一个暗示。从这一刻起,你应该更近距离地观察以进行确认。”

通过教导 AI 在“确认”之前识别这些“线索”,他们创造了一套全新的训练数据,而无需运行昂贵的模拟过程。他们采用了一个小型开源 AI 模型(称为 Qwen3-VL-4B),并使用这种新方法对其进行训练。

实验结果

结果令人惊喜。经过这种 “CueBack” 训练后,这个小型 AI 模型的性能从微弱的 18.7% 跳升到了强劲的 45.3%。这意义重大,因为这意味着这个免费的小型模型实际上比那些昂贵的、闭源的商业模型(仅达到 34.7%)更能发现家庭危险。

这项研究表明,主要问题不在于 AI 无法移动或观察,而在于它不知道如何寻找细微的风险。通过教导它识别早期暗示并随后进行调查,研究人员证明了你并不需要一台超级计算机来构建一个好的家庭安全检查员;你只需要一种正确的方法来教它如何保持关注。该团队已经发布了他们的测试、训练数据和代码,以便任何人都可以在未来构建更好的安全机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →