← 最新论文
💻 computer science

Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models

本文对视觉 - 语言模型(VLMs)与视频生成模型(VGMs)在空间智能方面进行了系统性比较,揭示了它们在语义理解与几何推理上的互补优势,并证明融合其特征可为空间任务构建更优越的骨干网络。

原作者: Haozhan Shen, Tiancheng Zhao, Kangjia Zhao, Jianwei Yin

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Haozhan Shen, Tiancheng Zhao, Kangjia Zhao, Jianwei Yin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教导两种不同类型的机器人去理解一个物理房间。其中一个机器人是“超级阅读者”(视觉 - 语言模型,或 VLM),另一个是“导演大师”(视频生成模型,或 VGM)。

这篇论文提出的核心问题是:哪种机器人更擅长理解“空间智能”?

为了回答这个问题,研究人员并没有让机器人学习新技能或参加最终考试。相反,他们将这些机器人置于“冻结”状态——就像在视频游戏角色开始游戏前暂停一样——并提出了一个简单的问题:“此刻你的大脑里已经存储了哪些信息?”

他们使用一种微小、轻量级的“探针”(可以把它想象成一次快速测验)来测试这些冻结的大脑,看看每个机器人能回忆起什么。

三项测试

  1. “那是什么?”测试(语义标签):

    • 任务: 观看一段视频并列出你看到的物体(例如,“沙发”、“门”、“桌子”)。
    • 结果: “超级阅读者”(VLM)彻底征服了这项测试。因为它通过阅读书籍和观看带 captions 的图片进行训练,它确切地知道物体的名称以及它们的外观。而“导演大师”(VGM)表现尚可,但它经常遗漏关键物品(例如忘记那里有沙发)。
  2. “谁属于谁?”测试(实例分组):

    • 任务: 如果你从三个不同的相机角度看到一把红色的椅子,你能判断出这三张照片里是同一把椅子吗?
    • 结果: “超级阅读者”再次获胜。它非常擅长说:“那组像素是一把椅子,那边那组像素也是那同一把椅子。”“导演大师”则有些吃力,有时会将不同物体合并在一起,或者无法将它们区分开来。
  3. “一切都在哪里?”测试(3D 几何):

    • 任务: 你能构建房间的 3D 地图吗?架子有多深?相机离得多远?
    • 结果: “导演大师”(VGM)在这里夺得了金牌。因为它被训练为从头开始创作视频,它学会了物体必须保持在正确的位置并以现实的方式移动。这赋予了它极强的深度、距离和 3D 结构感。“超级阅读者”知道架子是什么,但它的 3D 地图却模糊不清。

重大发现:完美的团队

最令人兴奋的发现是,没有任何一个机器人单独是完美的。 它们就像整体中的两个半部分:

  • “超级阅读者”名称和身份(语义)方面的专家。
  • “导演大师”形状和空间(几何)方面的专家。

研究人员尝试了一种“朴素融合”(简单的混合搭配)。他们将“超级阅读者”的冻结大脑和“导演大师”的冻结大脑取出来并粘合在一起。

结果如何? 组合后的机器人变成了超级英雄。它既能完美地命名每一个物体,又能构建出完美的房间 3D 地图。论文指出,为机器人或自动驾驶汽车构建未来 AI 的最佳方式,不是选择单一模型,而是将语言专家的“大脑”与视频创作者的“大脑”结合起来。

一句话总结

  • VLM(超级阅读者): 擅长知道事物是什么
  • VGM(导演大师): 擅长知道事物在 3D 空间中的位置
  • 解决方案: 将它们混合在一起,从而获得一个能完美理解世界名称和布局的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →