← 最新论文
💻 computer science

TAPNext++: What's Next for Tracking Any Point (TAP)?

本文提出了 TAPNext++,一种通过序列并行训练和针对重检测的几何增强策略,显著提升了 TAPNext 模型在长视频序列及遮挡点重检测任务中性能并刷新多项基准记录的跟踪任意点(TAP)新架构。

原作者: Sebastian Jung, Artem Zholus, Martin Sundermeyer, Carl Doersch, Ross Goroshin, David Joseph Tan, Sarath Chandar, Rudolph Triebel, Federico Tombari

发布于 2026-04-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Sebastian Jung, Artem Zholus, Martin Sundermeyer, Carl Doersch, Ross Goroshin, David Joseph Tan, Sarath Chandar, Rudolph Triebel, Federico Tombari

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 TAPNext++ 的新人工智能模型,它的核心任务是:在视频里“死死盯住”任何一个你指定的点,无论这个点怎么动、怎么被挡住、甚至怎么跑出画面再回来。

想象一下,你在看一段复杂的视频(比如一群人在跳舞,或者机器人在搬东西),你指着视频里的某个人说:“我要一直盯着他。”以前的 AI 要么跟丢了,要么人一旦转身或消失就彻底找不到了。TAPNext++ 就是为了解决这些痛点而生的“超级追踪者”。

下面我用几个生活中的比喻来解释这篇论文做了什么:

1. 以前的痛点:记性差和“断片”

  • 短视的追踪者: 以前的模型(比如 TAPNext 的旧版本)就像是一个记性只有几秒的短跑运动员。如果你让他盯着一个人跑 100 米,他跑得很稳;但如果你让他跑马拉松(长视频),他的脑子就“断片”了,忘了最初那个人的特征,跟丢了。
  • 消失即遗忘: 如果一个人被墙挡住了(遮挡),或者走出了画面,以前的模型就会想:“哦,他不见了,那我也别找了。”等这个人从墙后或画面另一边重新出现时,模型就彻底懵了,认不出那是同一个人。这就像你在玩捉迷藏,朋友躲起来再出来,你却以为来了个陌生人。

2. TAPNext++ 的三大绝招

绝招一:把“短跑训练”变成“马拉松训练” (长序列训练)

  • 比喻: 以前的模型只在短跑道上训练(只看几十帧画面)。TAPNext++ 的开发者们给它换了一个超级大的训练场,让它看长达 1024 帧(甚至更长)的视频。
  • 怎么做到的? 就像一个人背不动 1000 本书,但可以几个人分工合作。他们利用了一种叫“序列并行”的技术,让多台显卡(GPU)像接力赛一样,共同处理这一长串视频数据。
  • 效果: 现在这个模型拥有了超长的记忆力。即使视频很长,它也能记住最初那个点的样子,不会“断片”。

绝招二:玩“捉迷藏”特训 (重新检测与数据增强)

  • 痛点: 以前模型最怕点“消失”再“出现”。
  • 比喻: 为了训练模型,开发者们故意在训练数据里捣乱。他们把视频画面像卷地毯一样旋转、平移,甚至让点从画面左边跑出去,又从右边跑进来(这叫“周期性滚动增强”)。
  • 效果: 这就像给模型做“脱敏训练”。它被迫学会:“即使这个人刚才跑出了画面,或者被挡住了,只要他再出现,我依然能认出他!” 这让模型在面对物体遮挡或进出画面时,变得非常顽强。

绝招三:发明了新的“考试评分表” (AJRD 指标)

  • 问题: 以前的考试(评估标准)只问:“你全程跟住了吗?”如果跟丢了再找回,以前的评分表可能不算分,或者算得很模糊。
  • 创新: 作者发现大家忽略了“重新认人”的能力。于是他们发明了一个新指标叫 AJRD(重检测平均杰卡德指数)。
  • 比喻: 这就像考试不仅看你全程有没有跑丢,还专门考你:“当你的朋友躲了 10 秒钟再出来时,你能多快认出他?” 这个新指标迫使模型必须学会“重新认人”,而不仅仅是“一直盯着”。

3. 它有多快?有多强?

  • 速度快如闪电: 这个模型非常轻量级,不需要巨大的内存。它能在 H100 显卡 上以每秒 193 帧 的速度运行(比很多其他模型快得多),而且延迟极低。这意味着它非常适合用在手机 AR 眼镜机器人上,因为它们需要实时反应,不能卡顿。
  • 全能冠军: 在多个测试榜单(DAVIS, PointOdyssey 等)上,它都拿到了第一名。特别是在长视频和物体遮挡的场景下,它把第二名远远甩在身后。

总结

TAPNext++ 就像是一个拥有“超级记忆力”和“火眼金睛”的侦探。

  • 它不再因为视频太长而忘记目标;
  • 它不再因为目标被挡住或跑出画面就放弃;
  • 它反应极快,能实时工作。

这项技术对于增强现实(AR)(比如把虚拟物体牢牢固定在现实世界的桌面上)、机器人(让机器人能持续跟踪移动的物体)以及视频编辑等领域来说,是一个巨大的进步。它证明了:有时候不需要发明全新的复杂架构,只要训练方法数据策略对头,现有的模型也能变得无比强大。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →