← 最新论文
💻 computer science

CD-RMOT-Bench: Benchmarking the Cross-Domain Referring Multi-Object Tracking

本文引入了 CD-RMOT-Bench,这是一个用于评估不同视觉条件下跨域指代多目标跟踪(CD-RMOT)的统一基准,并提出了一个查询中心自适应(QCA)框架,以解决语言引导跟踪中由领域偏移引起的性能下降问题。

原作者: Xiangqun Zhang, Likai Wang, Zekun Qian, Ruize Han, Wei Feng

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiangqun Zhang, Likai Wang, Zekun Qian, Ruize Han, Wei Feng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人成为一名完美的城市导游。你不仅仅是想让它找到“一辆车”或“一个人”;你更希望它能根据你的口头指令,比如“跟随那辆左转的蓝色巴士”,去找到“那辆特定的、正在驶离的红色汽车”,或是“那群一起行走的伙伴”。这就是**指代性多目标跟踪(Referring Multi-Object Tracking, RMOT)**的世界。这是一种高级的说法,意为:“观察视频,听取我的句子,并将你的目光锁定在我所说的那个特定物体上。”

长期以来,科学家们一直在完美的晴朗条件下训练这些机器人导游。他们向机器人展示清晰的街道视频,并教它们如何理解指令。但问题在于,现实世界是混乱的。有时会倾盆大雨,有时会雾气弥漫,有时摄像机的角度还会发生奇怪的倾斜。一个巨大的疑问是:如果你的机器人导游是在晴天接受的训练,当天气变差或视角发生变化时,它会感到困惑并丢失目标吗?这篇论文深入探讨了这个问题,即我们的语言引导跟踪器是否能够在无需从头开始重新学习的情况下,应对场景的突然变化。

这项研究背后的研究人员,Xiangqun Zhang 及其团队,决定不再凭空猜测,而是开始测试。他们意识到,虽然我们在完美条件下拥有出色的跟踪工具,但我们并不真正了解这些工具在视觉世界发生剧烈变化时表现如何。为了解决这个问题,他们构建了一个全新的游乐场,名为 CD-RMOT-Bench。把这个基准测试想象成一个大规模的受控模拟实验室。他们利用带有指令的真实世界视频,创建了它们的“数字孪生”——即同一场景的精确副本,但改变了天气(如变为雨天或雾天),或者改变了摄像机的角度(如向左或向右偏移)。他们还加入了在恶劣天气下拍摄的真实视频,以观察机器人在从洁净的数字世界跳转到混乱的现实世界时表现如何。

他们的发现令人震惊。尽管机器人仍然能够“看见”物体(例如在雨中识别出一辆汽车),但当指令给出时,它们却完全忘记了应该跟随“哪一辆”车。问题不在于机器人看不见汽车,而在于一旦开始下雨,机器人就会在“哪辆车符合‘右侧那辆红车’的描述”这一点上产生困惑。这项研究表明,最大的失败点不在于识别物体,而在于当视觉条件发生变化时,如何保持语言描述与移动目标之间的联系。

为了帮助解决这个问题,该团队提出了一种名为 QCA(查询中心自适应,Query-Centric Adaptation)的新方法。想象一下,机器人脑子里有一张写着“跟随那辆红车”的“便利贴”。当天气变化时,这张便利贴开始滑动或变得模糊。QCA 就像是一个新的系统,它不断地重新锚定这张便利贴,确保机器人的内在焦点即使在雨水让一切看起来都变得不同时,也能牢牢粘在正确的目标上。他们的实验表明,这种方法显著帮助了机器人保持追踪,恢复了许多因天气和视角变化而损失的性能。

简而言之,这篇论文证明了仅仅给机器人一个语言指令是不够的;机器人需要足够强大,以便在面对世界的突然变化时,不会丢失它的思路。他们构建了一个新的测试来衡量这种弱点,并为让未来的机器人导游在无论是阳光明媚的城市还是雾气弥漫的风暴中都能更加可靠,提供了一个强有力的起点。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →