← 最新论文
🤖 AI

DRMOT: A Dataset and Framework for RGBD Referring Multi-Object Tracking

本文介绍了 DRMOT,一种新颖的 RGBD 指代式多目标跟踪任务,以及用于解决仅 2D 模型局限性的 DRSet 数据集和 DRTrack 框架,通过利用融合的 RGB、深度和语言模态来实现鲁棒的 3D 感知目标跟踪和空间-语义定位。

原作者: Sijia Chen, Lijuan Ma, Yanqiu Yu, En Yu, Liman Liu, Wenbing Tao

发布于 2026-02-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Sijia Chen, Lijuan Ma, Yanqiu Yu, En Yu, Liman Liu, Wenbing Tao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一个拥挤、嘈杂的房间里寻找一位特定的朋友。你向你的智能助手问道:“找到离摄像头最近的那个人。”

如果你的助手只有一张 2D 照片(比如手机上的平面照片),它就会感到困惑。在平面照片中,所有人看起来都处在同一个平面上。站在镜头旁边的和站在后方很远的人,如果穿着类似的衣服,看起来可能一样大。助手可能会猜错,指着后面的人而不是前面的人。这就是当前追踪技术的缺陷:它看到的像是平面的绘画,而不是一个真实的房间。

这篇论文介绍了一种解决此问题的新方法,即给助手戴上 3D 眼镜(深度信息)并植入一个超级大脑(大语言模型)。

以下是作者所做工作的简单拆解:

1. 新的游戏:DRMOT

作者创建了一个新的挑战赛,叫做 DRMOT(深度指代多目标追踪)。

  • 旧方式: 你给计算机一段视频和一句话,比如“追踪那个戴红帽子的家伙”。计算机尝试仅通过视频中的颜色来追踪他。
  • 新方式: 你给计算机视频、句子,以及一张“深度图”(一张告诉计算机每个像素具体距离有多远的特殊图像)。现在,如果你说“追踪离摄像头最近的那个人”,计算机实际上可以测量距离并选出正确的人,即使那个人看起来和远处的人一模一样。

2. 新的地图:DRSet

为了教会计算机这项新技能,作者构建了一个特殊的训练库,叫做 DRSet

  • 可以把它想象成一个包含 187 个不同“场景”(如公园、客厅或街道)的庞大图书馆。
  • 对于每个场景,他们都有常规视频、3D 深度图以及 240 条特定的语言指令
  • 至关重要的一点是,其中 56 条指令依赖于距离(例如“树后面的那辆车”或“离我们最近的人”)。这迫使计算机学习如何利用 3D 空间来理解语言。

3. 新的大脑:DRTrack

他们还构建了一个名为 DRTrack 的新系统来解决这些谜题。它分两步运行,就像一个拥有两种工具的侦探:

  • 第一步:“鹰眼”(MLLM):
    他们使用了一个强大的 AI 大脑(多模态大语言模型),它同时观察视频、深度图和句子。这就像一个能看到 3D 房间的侦探。当你说“找到最近的那个人”时,这个大脑会利用深度图立即知道谁在前,谁在后。它会在正确的人周围画一个框。

    • 类比: 这就像是在读地图的同时,还拿着一个测量距离的激光测距仪。
  • 第二步:“胶带”(追踪器):
    一旦大脑在第一帧中找到了那个人,系统就需要持续追踪他,即使他在移动过程中被墙壁或人群挡住。作者在追踪方法中加入了“深度胶带”。

    • 通常情况下,如果两个人走得很近,计算机可能会把他们搞混(交换身份)。
    • 有了 DRTrack,计算机会检查 3D 距离。如果 A 人在 2 米处,B 人在 5 米处,即使他们看起来非常相似,计算机也能知道他们是不同的人。这保持了他们的身份独立,防止了混淆。

4. 结果

作者将他们的新系统与仅使用平面 2D 视频的旧系统进行了对比测试。

  • 结果: 新系统(DRTrack)在寻找正确的人以及持续追踪而不产生混淆方面表现得好得多。
  • 意义所在: 这证明了赋予 AI “深度视觉”是理解涉及空间和距离指令的关键,而这正是单纯的平面 2D 摄像头无法独立完成的任务。

简而言之: 论文指出,“如果你想让 AI 理解像‘离我们最近的那个’这样的指令,你不能只给它看一段平面的视频。你也必须向它展示房间的 3D 深度。我们构建了一个新的数据集和一个新的 AI 大脑,来证明这是行之有效的。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →