DynEoMT: Learning Object Dynamicity from Online Segmentation Queries
DynEoMT 是一个在线框架,它通过增强基于查询的视频分割,在不需要光流、深度或相机位姿的情况下预测区域级物体动态性(运动与静态),并通过一种利用经过相机补偿的光流进行训练的新颖离线监督流水线实现了强大的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在计算机视觉领域,机器在识别图像内容方面正变得异常出色。它们可以识别出一辆汽车、一个人或一棵树,并围绕其绘制出精确的轮廓。但在“看到”一个物体与“理解”它的运动方式之间,存在着微妙的区别。当摄像机在场景中移动时,视野中的一切都会显得在发生位移。一辆停放的汽车可能看起来在屏幕上滑动,仅仅是因为摄像机正在转向;而一名行走的行人则是为了自身的运动原因而在移动。对于机器而言,要真正理解一个场景,它必须能够区分哪些是由于自身在运动的物体,以及哪些仅仅是因为摄像机移动而显得在运动的物体。这种辨别能力对于需要进行环境导航的机器人或构建周围环境地图的系统至关重要。如果机器人将一座静止的建筑误认为移动的障碍物,或者因为认为建筑在移动而忽略了一辆真实的行驶汽车,那么它对世界的理解就会崩溃。
长期以来,研究人员一直致力于教计算机在时间维度上追踪物体,即在物体穿过视频的过程中为其保持一个一致的标签。然而,这些系统通常止步于识别物体及其位置,并未明确说明该物体是在独立运动,还是仅仅作为背景的静态部分。一项名为 DynEoMT 的新研究引入了一种方法,为这种理解增加了缺失的这一层。该系统学习观察视频帧以及它已经收集到的关于物体的各种数据,然后决定每个被追踪区域是动态的还是静态的。这里的关键成就在于,该系统无需计算复杂的运动模式、测量深度或了解摄像机的物理位置,就能实现这一目标。它通过学习直接从追踪物体本身的方式中推断出运动状态。
为了教会计算机这项技能,研究人员首先必须创造一种标注数据的方法,因为现有的视频数据集并不包含这一特定信息。他们构建了一个类似于“老师”的离线处理过程。这个过程观察成对的视频帧,并计算像素在帧间的移动情况。随后,它会估算其中有多少移动是由摄像机本身引起的,并将这部分移动剔除。剩下的便是“残余”运动,它代表了现实世界中物体的实际运动。如果一个区域在剔除了摄像机运动后仍显示出显著运动,则将其标记为动态;如果显示出极少或没有运动,则标记为静态。研究人员将这一逻辑应用于四个主要的视频数据集,涵盖了从语义分割(即每个像素都被赋予一个类别)到实例分割(即分别追踪单个物体)的所有领域。这创建了一套庞大的训练样本集,其中每个物体掩码都附带了一个指示其是在运动还是静止的标签。
利用这些新的训练数据,研究人员修改了一个现有的视频分割模型。他们在系统中添加了一个微小的、轻量级的决策组件,或者称为“头部”。该组件观察模型正在追踪的每个物体的内部表示,并预测其是运动还是静止。至关重要的是,这种预测是在视频播放时实时发生的。该系统仅使用当前的图像以及从前一帧传递过来的信息。它不会回溯旧图像,不计算光流,也不需要任何额外的传感器。该模型在执行其主要任务(即绘制物体轮廓)的同时学习进行这种预测,从而确保新任务不会干扰其观察和追踪的能力。
结果表明,这种方法在不同类型的视频数据上都表现得非常有效。在一个大型视频全景分割数据集上,该系统正确识别物体运动状态的准确率达到了 84.3%。在其他专注于追踪单个实例的数据集上,准确率在 68.0% 到 87.6% 之间波动。或许最重要的一点是,增加这种新能力并没有损害系统的原始性能。绘制精确掩码和追踪物体身份的能力与之前几乎完全相同。研究人员发现,模型用于追踪物体的内部信号已经包含了足以判断这些物体是否在运动的信息。通过简单地添加一个解释这些信号的小层,系统便获得了一种对世界的全新理解,而无需一个独立的、复杂的运动处理流水线。
这项工作证明,区分运动物体与静态物体可以直接从模型追踪物体的方式中学习。这表明,未来用于机器人技术或自主导航的系统,可以在不需要专门的运动分析工具所带来的沉重计算成本的情况下,获得对环境更稳健的理解。该方法依赖于一个简单的原则:如果你能追踪一个物体,你很可能就能判断它是否在自主运动。研究人员已向公众开放了他们的代码,允许他人复现这些发现,并基于一个不仅能看到存在之物、还能理解其行为方式的系统进行开发。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。