← 最新论文
💻 computer science

DVPSFormer: Efficient Online Depth-aware Video Panoptic Segmentation for Autonomous Driving

本文介绍了 DVPSFormer,这是一种统一的在线架构,通过采用显式场景离散化和在线多数投票机制,高效地统一了度量深度估计、语义分割和实例跟踪,从而在自动驾驶的深度感知视频全景分割任务中实现了最先进的性能。

原作者: Yung-Hsu Yang, Luigi Piccinelli, Siyuan Li, Mattia Segu, Lei Ke, Martin Danelljan, Yuqian Fu, Zuria Bauer, Fisher Yu, Hermann Blum, Marc Pollefeys

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Yung-Hsu Yang, Luigi Piccinelli, Siyuan Li, Mattia Segu, Lei Ke, Martin Danelljan, Yuqian Fu, Zuria Bauer, Fisher Yu, Hermann Blum, Marc Pollefeys

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一辆自动驾驶汽车的大脑。你的工作不仅仅是观察道路,而是要理解整个四维世界。你需要知道物体是什么(那是行人还是信箱?),它们在三维空间中的位置(那辆车有多远?),以及它们的去向(那个骑行者是在左转吗?)。这就是“自主导航”的终极目标。长期以来,科学家们一直试图将这些难题分开解决,就像有三个不同的专家在对着同一张地图争论不休。但为了安全驾驶,你需要一个能够同时处理这一切的、超级快速的单一大脑。挑战在于,实时进行这些操作对计算机的脑力消耗极大,往往会导致汽车反应迟钝。这篇论文深入探讨了计算机视觉领域,特别是被称为“深度感知视频全景分割”(Depth-aware Video Panoptic Segmentation)的一个领域,这是一种高级说法,意思就是“看到整个视频世界、了解其中一切的深度,并追踪每一个移动物体”。

这项研究背后的研究人员来自包括苏黎世联邦理工学院(ETH Zürich)和微软在内的机构,他们构建了一个名为 DVPSFormer 的新系统。把他们之前解决这个问题的方法想象成一条复杂的装配线:先造出一辆车,然后将其拆解以测量深度,最后再重新组装以追踪其运动。这种方法很精确,但很慢。作者认为,这种“多阶段”方法对于需要做出瞬时决策的真实汽车来说过于笨重。相反,他们提出了一个统一的、“在线”的架构,它更像是一位指挥家在领导一支管弦乐队,让每种乐器都能瞬间完美同步地演奏。

他们的核心创新是一个被称为**显式场景离散化(Explicit Scene Discretization, ESD)**的巧妙技巧。想象一下你正在观察一个凌乱的房间并试图向朋友描述它。旧方法可能会尝试单独猜测每个像素的深度,就像在数每一粒沙子一样。然而,DVPSFormer 首先将房间划分为清晰的“物体”(床、地毯、墙壁)和“背景”(空旷的空气)。它将这种分组过程视为将场景分解为易于处理的块的过程。一旦有了这些清晰的块,它就会使用一种特殊的“从离散到连续”的解码器,通过单次处理即刻填补整个房间的深度。这就像是先勾勒出房间的轮廓,然后瞬间填补距离感,而不是逐一测量地板上的每一寸空间。这种方法将“是什么”(语义)与“有多远”(几何)紧密结合在一起,使系统学习得更快,且消耗更少的计算能力。

为了处理移动物体,该系统使用了**在线多数投票(Online Majority Voting)**机制。想象一群朋友试图识别人群中走过的一个人。如果一个朋友认为那是狗,而另一个认为那是猫,他们可能会感到困惑。但如果连续五个朋友都说“那是狗”,那么这群人就会投票判定为“狗”,并纠正之前的错误。DVPSFormer 对视频帧也这样做。当它在时间维度上追踪一辆车或一个人时,它会查看过去几秒钟的视频。如果系统在某一瞬间误判了一辆车,来自周围帧的“多数投票”会立即对其进行纠正。这使得汽车能够在不需要“预见未来”(这在实时驾驶中是不可能的)的情况下保持警觉。

结果令人印象深刻。团队在两个主要的基准数据集 Cityscapes-DVPSSemKITTI-DVPS 上测试了他们的系统,这两个数据集就像是自动驾驶视觉领域的“期末考试”。他们发现,DVPSFormer 不仅在这些测试中取得了有史以来的最高分(刷新了“最先进水平”/state-of-the-art),而且运行速度显著提升。事实上,在处理 20 帧的序列时,他们的方法比之前的最佳方法快了约 18 倍。他们还展示了他们的系统可以在 Cityscapes 上以 12.8 帧/秒的速度运行,在 SemKITetti 上达到 46.9 帧/秒,而之前的顶尖方法在视频变长时会难以维持速度或大幅减速。

作者明确排除了复杂的多阶段流水线或“离线”追踪(即需要看到未来帧的追踪方式)是实现现实世界自动驾驶正确路径的想法。他们证明了这种单次通过、在线处理的方法不仅是理论上的改进,更是速度和效率方面的实际必然要求。通过简化流水线,并让分割过程自然地引导深度估计,他们创造出了一个既更聪明又更快速的系统,为更安全、响应更迅速的自动驾驶汽车铺平了道路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →