← 最新论文
💻 computer science

MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models

该论文提出了模型无关的 MASS 方法,通过深度 3D 编码、视觉定位和运动追踪将时空信号注入视觉语言模型,并构建了包含 4350 个视频的 MASS-Bench 基准,显著提升了模型在物理推理与运动理解方面的能力,使其性能接近闭源顶尖模型。

原作者: Xiyang Wu, Zongxia Li, Jihui Jin, Guangyao Shi, Gouthaman KV, Vishnu Raj, Nilotpal Sinha, Jingxi Chen, Fan Du, Dinesh Manocha

发布于 2026-04-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiyang Wu, Zongxia Li, Jihui Jin, Guangyao Shi, Gouthaman KV, Vishnu Raj, Nilotpal Sinha, Jingxi Chen, Fan Du, Dinesh Manocha

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 MASS 的新方法,旨在教会人工智能(特别是“视觉语言模型”,即能看懂视频并回答问题的 AI)如何像人类一样理解物理世界,尤其是物体是如何运动的、它们之间有什么空间关系。

为了让你更容易理解,我们可以把现在的 AI 比作一个**“只读过书但没下过地”的学霸**,而 MASS 就是给这个学霸配了一副**“物理眼镜”和一个“运动追踪手环”**。

以下是用通俗语言和比喻对这篇论文的详细解读:

1. 核心问题:AI 为什么不懂“物理”?

现在的 AI 在看视频时,往往只能“看个热闹”。

  • 现状:如果你给 AI 看一个苹果从树上掉下来,它可能因为背过“苹果会掉”这句话,就回答“苹果掉下来了”。但如果视频里苹果是上去的(这是违反物理常识的 AIGC 生成视频),AI 可能会因为太依赖它学过的“常识”而瞎编,或者完全没发现不对劲。
  • 比喻:这就好比一个只看过电影剧本的人,让他去现场指挥交通。他背熟了“红灯停绿灯行”,但真到了路口,他可能分不清哪辆车是倒着开的,哪辆车是悬空的,因为他没有实时的空间感运动轨迹感

2. 解决方案:MASS 是什么?

MASS(Motion-Aware Spatial–temporal Grounding,运动感知时空定位)就是给 AI 装上了“物理外挂”。它不重新训练整个 AI(那样太贵太慢),而是给 AI 加了一个**“翻译器”**。

  • 它是怎么工作的?
    1. 戴上“深度眼镜”(3D 编码):普通的视频是平面的(2D),MASS 先给视频加上深度信息,让 AI 知道物体离镜头有多远,就像给视频加上了 3D 眼镜。
    2. 戴上“运动手环”(运动追踪):MASS 会死死盯住视频里的关键物体(比如那个篮球),记录它每一帧的位置、速度、方向。
    3. 翻译成“人话”(注入语言空间):这是最关键的一步。MASS 把这些复杂的 3D 坐标和运动数据,翻译成 AI 能读懂的文字描述
      • 比喻:以前 AI 看视频是“看图说话”,现在 MASS 是先把图里的运动轨迹画成一张详细的“运动说明书”(比如:“篮球在 0-31 帧从 A 点移动到 B 点,速度是 X"),然后把这张说明书直接递给 AI 看。AI 不需要自己去猜,直接读说明书就能知道物理规律。

3. 新玩具:MASS-Bench(考试卷)

为了测试这个新方法有没有用,作者们还出了一套**“物理常识考试卷”**,叫 MASS-Bench

  • 内容:包含了 4350 个视频,既有真实的,也有 AI 生成的(里面故意藏了很多违反物理规律的“假动作”)。
  • 题目:不是简单的“这是什么?”,而是问“篮球是从下往上穿过篮筐的吗?”或者“这个人的走路姿势符合重力吗?”。
  • 特点:这套卷子不仅考 AI 认不认识物体,更考它懂不懂物理逻辑

4. 训练方法:强化学习(RFT)

光有说明书还不够,AI 还得学会怎么推理

  • 方法:作者用了强化微调(RFT)
  • 比喻:这就像给 AI 请了一位**“严厉的物理老师”。AI 做完题后,老师不仅告诉它对错,还要求 AI 写出“解题思路”**(Chain-of-Thought)。如果 AI 只是瞎猜,老师就扣分;如果 AI 能结合“运动说明书”一步步推导出结论,老师就奖励。慢慢地,AI 就学会了像物理学家一样思考,而不是靠死记硬背。

5. 结果:小模型也能打败大模型

实验结果非常惊人:

  • 以前:只有像 Gemini-2.5-Flash 这种超级大模型(参数巨大,像博士)才能在物理推理上表现好。小模型(像本科生)通常很笨。
  • 现在:给一个70 亿参数的小模型(Qwen2.5-VL-7B)装上 MASS 后,它的物理推理能力直接逆袭,成绩甚至超过了那些没装 MASS 的超大模型,和顶级闭源大模型(Gemini-2.5-Flash)几乎平起平坐(只差 2%)。
  • 结论:这说明,“懂物理”的关键不在于模型有多大,而在于它有没有拿到正确的“运动说明书”和“推理方法”。

总结

这篇论文的核心思想就是:不要试图让 AI 重新发明轮子(重新训练大模型),而是直接给它装上轮子(MASS 模块)。

通过把视频里的空间位置运动轨迹变成 AI 能读懂的结构化文字,再教它逻辑推理,我们就能让普通的 AI 瞬间变成**“物理大师”**,不仅能看懂视频,还能发现视频里那些违反物理定律的“假动作”。这对于未来让 AI 理解真实世界、识别 AI 生成的虚假视频(Deepfake)有着巨大的意义。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →