← 最新论文
💻 computer science

Towards Spatial Supersensing in the Wild

本文介绍了 VSI-Super-Wild,这是一个旨在评估空间超感能力的大规模真实世界长视频基准测试,它揭示了当前的跨模态模型由于空间坍缩和更新不足等问题,在本质上无法维持随时间变化的连贯世界状态追踪。

原作者: Tianjun Gu, Tianyu Xin, Kuan Zhang, Bowen Yang, Kok-Chung Chua, Peize Li, Xinran Zhang, Yupeng Chen, Qiyue Zhao, Qinlei Xie, Jianhang Liu, Yucheng Lu, Yinan Han, Marco Pavone, Yiming Li

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianjun Gu, Tianyu Xin, Kuan Zhang, Bowen Yang, Kok-Chung Chua, Peize Li, Xinran Zhang, Yupeng Chen, Qiyue Zhao, Qinlei Xie, Jianhang Liu, Yucheng Lu, Yinan Han, Marco Pavone, Yiming Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正走在一条繁华的城市街道上。你看到的不仅仅是一系列互不相连的画面;你正在构建一张心理地图。你知道咖啡馆就在你的左侧,你知道你在银行处转了弯,你也知道自己已经经过了同一辆红色自行车三次。这种将所见、所处位置以及所做之事缝合在一起,形成一个连续故事的能力,正是人类感知世界的方式。科学家称之为“世界建模”(world modeling)。长期以来,计算机程序在识别单张猫或汽车的照片方面表现出色。但当涉及到观看一段长视频并追踪其中的故事时——比如在漫长的一天游历之后,记住你究竟把钥匙丢在了哪里——计算机却显得力不从心。它们往往会迷失方向,忘记情节或混淆角色。这篇论文深入探讨了这一特定的困境:人工智能在观看视频流时,究竟是真的能建立起一个可靠的内部世界地图,还是仅仅根据当前帧的画面进行猜测?

这项研究背后的研究人员来自清华大学、英伟达(NVIDIA)和斯坦福大学,他们决定给世界上最聪明的视频阅读AI模型进行一次极其严苛的测试。他们创建了一个名为 VSI-SUPER-WILD 的新基准测试。可以将它想象成一场针对AI的“生存挑战”。之前的测试就像是在一个安静、空旷的房间里训练一只学会几个特定动作的小狗。而这个新测试则将AI投入到现实世界中未经编辑、混乱且真实的荒野之中。他们从互联网上收集了 442 段真实世界的视频,涵盖了从繁忙的街道、购物中心到医院和办公大楼的一切场景。这些并非拼接而成的短片;有些甚至超过 4 小时,捕捉了生活中杂乱且连续的流动过程。

其目标是观察这些AI模型是否能够回答那些需要具备真正“心理地图”的问题。他们基于人类记忆的方式设计了四种类型的挑战:

  1. “往哪走?”测试: 在观看视频后,AI能否判断摄像机(即持机人)是在向前、向后、向左还是向右移动?
  2. “我在哪儿?”测试: 即使摄像机旋转并从不同角度观察同一个地点,AI能否记住访问过的地点顺序?
  3. “什么时候发生的?”测试: AI能否准确记住一个特定物体(如蓝色背包)首次出现和消失的时间?
  4. “有多少个?”测试: AI能否在不重复计数的情况下,统计出独特物品的数量(例如:“我们经过了多少个不同的消防栓?”)。

结果令人警醒。尽管这些AI模型已经非常先进,但在测试的 13 种不同 AI 模型(包括来自谷歌的顶尖模型和开源项目)中表现都很差。表现最好的模型总体的正确率仅为 44% 左右,这仅仅比随机猜测好一点点。论文指出,这些模型之所以表现不佳,是因为它们依赖于“捷径”。它们并没有建立起一个三维的世界地图,而是通过观察单帧画面来进行猜测。例如,如果它们看到一条路,就会假设人在向前走,因为通常都是这样,即便视频实际显示的是人在向后退。

研究人员确定了这些 AI 模型失效的四个具体方式:

  • 空间坍缩(Spatial Collapse): 如果旋转摄像机视角,AI 会忘记这是同一个地方。它会将旋转后的视角视为一个全新的位置,从而丧失了空间感。
  • 语义捷径(Semantic Shortcuts): AI 根据事物的“外观”进行猜测,而不是根据其“运动方式”。它看到一条路就假设是“向前运动”,而没有实际去追踪运动轨迹。
  • 更新不足(Insufficient Update): AI 擅长记住视频的开头,但无法随着新信息的到来更新其记忆。它会固守第一印象,并忽略随后的证据。
  • 实例混淆(Instance Confusion): AI 会被现实世界的混乱所迷惑。如果一个物体模糊不清或被部分遮挡,它可能会认为这是一个全新的物体,而不是之前见过的那一个。

研究还发现,视频时间越长,AI 的表现就越差。随着视频长度增加(从 10 分钟到超过 2 小时),模型的持续叙事能力显著下降。这表明,虽然 AI 在理解单个瞬间方面正在进步,但在维持一个连贯的长时记忆方面仍然缺乏能力。论文总结道,如果 AI 要像人类一样真正理解世界,它需要超越仅仅识别图片,转而学习如何建立稳定且不断更新的空间与时间地图。在此之前,如果你问 AI 在漫长的一天结束后把钥匙丢在了哪里,它给出的可能只是一个听起来不错但并不真实的故事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →