← 最新论文
💻 computer science

SAM 2++: Tracking Anything at Any Granularity

本文介绍了 SAM 2++,这是一个统一的视频跟踪框架,它将提示编码、输出解码和记忆表示集成于单一模型中以处理多种目标粒度(掩码、框和点),并伴随创建了首个大规模多粒度数据集,从而在各种跟踪任务中实现了最先进的性能。

原作者: Jiaming Zhang, Cheng Liang, Yichun Yang, Chenkai Zeng, Yutao Cui, Xinwen Zhang, Xin Zhou, Kai Ma, Gangshan Wu, Limin Wang

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiaming Zhang, Cheng Liang, Yichun Yang, Chenkai Zeng, Yutao Cui, Xinwen Zhang, Xin Zhou, Kai Ma, Gangshan Wu, Limin Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明的机器人助手,它的工作是观看视频并紧盯特定目标。在这篇新论文出现之前,如果你希望机器人追踪一辆移动的汽车,你必须用一种特定的方法训练它;如果你希望它追踪一个人的脸,就必须用完全不同的另一种方法训练它;如果你希望它追踪球上的一个小点,则需要第三位完全独立的“老师”来专门训练。

SAM 2++ 背后的研究人员提出了一个简单的问题:为什么完成同一项工作,我们需要三位不同的“老师”? 他们意识到,无论你是要追踪整辆汽车(一个框)、一个人的身体(一个掩膜),还是单个点(一个点),机器人所做的“脑力工作”完全相同:“记住这个东西一秒钟前是什么样子,然后现在再次找到它。”

以下是他们如何构建一个能完成所有任务的“通用追踪器”的简单解释:

1. 问题:工具过于专业化

可以把旧方法想象成一把瑞士军刀:你不得不为了用螺丝刀而不是剪刀,而更换整个手柄。现有的视频追踪器只为单一任务而构建。

  • 框追踪器只知道如何围绕物体画一个矩形。
  • 掩膜追踪器只知道如何填充物体的精确形状。
  • 点追踪器只知道如何跟随单个点。

这意味着机器人必须携带三个不同的“大脑”,这不仅浪费,还使其难以同时从所有类型的视频中学习。

2. 解决方案:一个大脑,三种语言

团队创建了 SAM 2++,它就像一个精通多种语言的(polyglot)机器人。它拥有一个主大脑,但能理解三种不同的“指令语言”:

  • “框”语言:“这是围绕汽车的矩形。”
  • “掩膜”语言:“这是人体的精确轮廓。”
  • “点”语言:“这是球上的一个小点。”

翻译器(任务特定提示):
当你给机器人一个框、一个掩膜或一个点时,一个特殊的翻译器会立即将该指令转换为机器人“大脑”能理解的通用“想法”。这样,机器人不在乎你给的是框还是点;它只知道:“好的,我需要追踪这个。”

通用输出(统一解码器):
一旦机器人找到物体,它不会只输出一个框或一个点。它首先会画出物体的完美“阴影”(即掩膜)。然后,如果你要求的是框,它会快速测量这个“阴影”来画出一个框;如果你要求的是点,它会找到“阴影”的中心。这使整个过程保持简单且一致。

3. 记忆:“智能笔记本”

视频追踪中最难的部分是:当物体被树遮挡或快速移动时,记住它原本的样子。机器人使用“记忆笔记本”来存储过去的帧。

研究人员发现,如果强迫机器人对框、掩膜和点使用完全相同的笔记本页面,机器人就会感到困惑。框需要粗略的草图;掩膜需要详细的绘图;点需要精确的坐标。

修复方案(任务自适应记忆):
他们不再使用一本僵化的笔记本,而是给了机器人一本智能、灵活的笔记本

  • 当追踪框时,它以“粗略草图”风格书写。
  • 当追踪掩膜时,它以“精细艺术”风格书写。
  • 当追踪点时,它以“精确数学”风格书写。

这使得机器人能够保持一个主大脑,但根据任务切换书写风格,从而避免混淆,并大幅提升其记忆能力。

4. 训练场:"TAG"数据集

为了训练这个机器人,他们不能只使用旧教科书,因为那些书只包含一种类型的练习。他们建立了一个全新的、庞大的图书馆,名为 TAG(Tracking-Any-Granularity,任意粒度追踪)

  • 构建方式:他们使用了一种巧妙的“人在回路”(human-in-the-loop)系统。人类标注少量帧(如片段的开始和结束),机器人则填充其余部分。随后,人类检查机器人的工作并修正错误。
  • 独特之处:该图书馆中的每一段视频,对同一个物体都有三个标签:一个框、一个掩膜和一个点。这使得机器人能够同时学习这三种技能,成为真正的追踪大师。

结果

当他们测试这个新机器人时,它不仅在所有三项任务上表现“尚可”,而且击败了那些经过多年训练、擅长单一任务的专用机器人。

  • 它在追踪框方面胜过框专家。
  • 它在追踪掩膜方面胜过掩膜专家。
  • 它在追踪点方面胜过点专家。

简而言之:SAM 2++ 证明,你不需要为每项工作准备不同的工具。凭借正确的设计,一个智能、灵活的系统只需对机器人说对“语言”,就能在任何地方、以任何细节程度追踪任何事物。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →