← 最新论文
💻 computer science

Robust Multimodal Dynamic Object Segmentation

本文提出了一种鲁棒的多模态动态物体分割框架,该框架通过基于 Transformer 的网络以及一种新颖的点查询 SAM 后处理方法,集成了 2D 点轨迹、3D 重建和语义信息,以实现精确、一致的分割和高质量的静态场景重建,其性能优于现有的最先进方法。

原作者: Zhe Xin, Hanzhi Chang, Penghui Huang, Yinian Mao, Guoquan Huang

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhe Xin, Hanzhi Chang, Penghui Huang, Yinian Mao, Guoquan Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图制作一个完美的、冻结的繁忙城市街道微缩景观,但你用来构建它的视频里到处是奔跑的人、疾驰的车和拍打翅膀的鸟。如果你只是尝试冻结整个场景,移动的人影会变成模糊的幽灵,毁掉你的杰作。为了解决这个问题,计算机需要一种特殊的技能,叫做“动态物体分割”(dynamic object segmentation)。你可以把它想象成一把超级强大的剪刀,能够瞬间剪出视频中每一个移动的事物,只留下静止、坚实的背景。

长期以来,计算机尝试通过观察两件事来进行这项工作:一是像素如何在屏幕上移动(就像观察一群蚂蚁在爬行),二是尝试从头开始重建世界的 3D 形状。但这些方法都有缺陷。“像素运动”方法经常会在物体的边缘出错,比如剪掉了人的手臂却留下了头部。而“3D 形状”方法则像是要在暴风雨中建造沙堡;如果风(或相机抖动)稍微弄乱了测量数据,整个结构就会坍塌。科学家们需要一种结合了这两者优点的方法——同时追踪运动、测量深度并理解物体“是什么”——从而实现精准的切割。

这正是新论文《鲁棒多模态动态物体分割》(Robust Multimodal Dynamic Object Segmentation)所提出的巧妙解决方案。作者利用来自美团无人机(Meituan UAV)和特拉华大学的数据,提出了一种系统,它像是一个侦探团队,通过整合三种不同类型的线索来破解“什么是移动的,什么是静止的”这一谜题。该方法并没有依赖单一类型的证据,而是采用了一种“多模态”方法,结合了 2D 点追踪(跟随移动的点)、3D 重建(推测场景的深度)以及语义信息(知道“狗”是一个通常会移动的物体)。

他们发明的核心是一个智能网络,充当着交通控制器的角色。它接收所有这些不同的线索,并将它们通过一个“Transformer”(一种擅长连接各个关联点的 AI 大脑)和一个“聚类”(clustering)模块进行处理。这使得系统可以观察一个场景并判断:“好吧,在这个部分,3D 深度线索不太可靠,所以我们更多地信任运动线索”;或者“在这里,运动情况很混乱,所以我们要听取语义线索,它告诉我们这是一个人”。通过让系统根据具体情况决定信任哪种线索,它避免了仅依赖单一方法时产生的错误。

然而,即使有优秀的侦探,最初的草图也可能有些凌乱。论文引入了第二个非常具有创意的技巧来清理边缘。以往的方法试图通过将整个模糊的形状交给一个叫做 SAM(Segment Anything Model,万物分割模型)的工具,并询问:“这是一个大的物体吗?”来修复凌乱的草图。但在现实世界中,一个单一的模糊色块可能包含三只朝不同方向奔跑的狗。作者意识到,把整个色块交给这个工具是个坏主意。相反,他们开发了一种“点查询”(point-query)策略。想象一下,从那个凌乱的色块中取出一个像素点,然后问工具:“这个特定的点是属于一只狗吗?”如果工具回答是,且形状看起来正确,我们就保留它。我们重复这个过程,一个点接一个点地进行,直到凌乱的色块被完美地切割成一个个清晰的个体。

他们的研究结果非常令人印象深刻。在包括合成数据集 PointOdyssey 和真实世界视频 DAVIS2017 在内的多个数据集上测试时,该方法达到了最先进的性能水平。在 PointOdesty 数据集上,他们的模型达到了 93.69% 的准确率(使用了额外的清理步骤),击败了之前的顶尖方法如 DAS3R(得分为 92.22%)。他们还展示了该方法速度更快,处理每一帧仅需 0.2833 秒,而其他一些先进模型则需要超过 27 秒。

论文明确反对仅依赖单一模态线索(仅靠流或仅靠 3D)以及使用旧有的 SAM 处理方式(即将整个掩码视为一个整体物体)。他们发现,当物体被遮挡或相机发生复杂运动时,这些旧方法会失效。他们的实验表明,通过结合多种线索并使用逐点清理的方法,他们能更好地处理这些棘手的场景。虽然该方法非常有效,但作者也指出,当动态物体占据整个图像时,它仍然面临挑战,因为在这种情况下,背景线索变得过于稀缺,难以发挥作用。

最终,这项工作不仅能制作出更好的视频掩码,还能实现更好的 3D 重建。通过精确地移除那些移动的“幽灵”,系统可以高清晰度地重建背后的静态世界,在 DAVIS 数据集上实现了 30.60 的 PSNR(一种图像质量衡量标准),高于所有测试过的其他方法。这是在教计算机如何不只是看一部平面的电影,而是看作一个动态的、3D 的世界,从而将演员与舞台分离。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →