GMOS: Grounding Moving Object Segmentation in 3D Space and Time
本文介绍了 GMOS,这是一个新颖的框架,将移动物体分割建立在三维空间和时间基础上,以克服依赖二维和序列级方法的局限性,在精心策划的 GMOS-2K 数据集上实现了最先进的性能,并采用时间细粒度的评估协议,同时支持快速、在线的推理。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你正透过一扇窗户观察繁忙的街景。有人在行走,一辆汽车驶过,但树木和建筑物保持静止。现在,想象窗户本身(即相机)也在移动,也许是因为手持不稳,也许是因为安装在疾驰的车辆上。
问题所在:
当前试图判断“什么在移动”的计算机视觉工具,就像一位只拥有一幅模糊二维草图的侦探。它们依赖预先计算好的线索(如光流),而这些线索无法理解深度或三维空间。因此,一旦相机移动,这些工具就会陷入混乱,误以为整个世界都在移动,或者漏掉那些停止后又开始移动的物体。
此外,这些工具通常审视“整个视频”,然后说:“那只鸟在某个时刻移动过,所以我要在整个影片中为它画一个框。”它们并不关心这只鸟此刻是否正安静地停在树枝上;它们只知道它之前动过。这对于实时应用来说太过笨拙。
解决方案:GMOS
作者提出了GMOS(Grounding Moving Object Segmentation,定位移动物体分割)。你可以将 GMOS 想象成一位超级聪明、具备三维感知能力的保安,它逐帧地观看视频。
以下是其工作原理,辅以简单的类比:
1. “提议者”(The Detective,侦探)
GMOS 并非一次性审视整个视频,而是观察短短 0.5 秒的时间切片(就像一张快速快照)。
- 三维大脑:它利用一个“几何编码器”(在三维重建任务上训练过)来理解场景的深度。它能分辨出树木摇曳是因为相机在抖动,还是鸟儿飞翔是因为它自己在移动。
- 分割大脑:它利用一个强大的视觉模型(SAM2)来识别形状和物体。
- 决策:它将这两个大脑融合,提出一个问题:“这个特定物体此刻是否在移动?”如果是,它就为该物体绘制掩膜;如果物体静止,它就忽略它。
2. “传播者”(The Tracker,追踪器)
一旦“提议者”在短时间窗口内发现移动物体,“传播者”便接手工作。这就像一条由人组成的链条,将信息依次传递下去。它将短期的检测结果串联起来,在整个视频中为物体构建平滑、连续的轨迹,确保即使鸟儿暂时消失在树后,它依然能保持其身份标识。
3. “GMOS-S"(The Speedster,极速者)
对于速度至上的场景(如实时视频流),他们开发了GMOS-S。这个版本跳过了对单个物体的复杂追踪,只回答一个问题:“这一帧中是否有任何东西在移动?”它生成一个单一的“移动 vs. 静止”掩膜。这就像一个运动传感器,只报出“检测到运动!”,而不指出是谁在移动。
4. 新规则书:MOS-I
论文还引入了一种测试这些系统的新方法,称为MOS-I("I"代表 Instantaneous,瞬时)。
- 旧规则:“如果鸟儿在视频的任何时刻移动过,那么即使它在睡觉,每一帧都必须将其高亮显示。”
- 新规则(MOS-I):“只有当鸟儿真正在扇动翅膀时才将其高亮。如果它在睡觉,就让它保持原样。”
这迫使 AI 精确判断事物何时在移动,而不仅仅是是否移动过。
5. 训练场:GMOS-2K
为了训练这个系统,作者构建了一个名为GMOS-2K的大型新数据集。他们选取了数千个现有视频,并手动标注,精确标记每个物体何时在移动、何时静止。这就像编写一本教科书,其中的答案不再是简单的“鸟儿移动过”,而是“鸟儿在第 1 秒到第 5 秒移动,然后停止,接着在第 10 秒再次移动”。
结果
- 准确性:即使在相机抖动或场景拥挤的情况下,GMOS 在三维空间中定位移动物体的能力也优于以往的方法。
- 速度:它的运行速度比之前的最佳方法快约三倍,因为它无需等待缓慢的预计算二维线索。
- 通用性:它在标准视频物体分割任务中表现同样出色,证明了理解运动有助于通用的视频理解。
简而言之,GMOS 是一个能同时理解三维世界和时间流逝的系统,使它能够说出“那辆车此刻正在移动”,同时忽略该车五分钟前曾停泊的事实。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。