← 最新论文
💻 computer science

TACO: Towards Task-Consistent Open-Vocabulary Adaptation in Video Recognition

本文介绍了 TACO,这是一个用于开放词汇视频识别的框架,它通过采用相对结构蒸馏以保持分布外对齐,并利用专门化投影将任务特定适配与测试时表示空间解耦,从而缓解了由目标不一致引起的表示偏差,并在多种基准测试中实现了最先进的性能。

原作者: Minghao Zhu, Xiao Lin, Mengxian Hu, Xun Zhou, Liuyi Wang, Xiaoyan Qi, Chengju Liu, Qijun Chen

发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Minghao Zhu, Xiao Lin, Mengxian Hu, Xun Zhou, Liuyi Wang, Xiaoyan Qi, Chengju Liu, Qijun Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一位才华横溢、见多识广的向导,名叫 CLIP。这位向导读过数百万本书,看过数百万张照片,因此仅仅通过看一张图片或读一段描述,就能识别出什么是“猫”、“日落”或“开心的狗”。由于见识过如此丰富的多样性,他们非常擅长泛化。

现在,你想教这位向导如何识别视频(即随时间移动和变化的画面),并且特别要让他们学会识别那些他们从未见过的视频类别(比如“玩火로耍杂技”或“与机器人共舞”)。这就是**开放词汇视频识别(Open-Vocabulary Video Recognition)**所面临的挑战。

问题在于,当你试图针对特定的视频示例(比如一个包含 400 种常见动作的数据集)来训练这位向导时,他们往往会变得“过于专业化”。他们会开始忘记自己原本博大精深的通用知识,而只成为刚才被教过的那些特定事物的专家。如果你随后要求他们识别一段全新的视频,他们就会感到吃力,因为他们已经失去了原有的“地图”。

这篇论文的作者们提出了 TACO,他们认为目前训练这些向导的方式是有缺陷的。目前的做法是在“已知”领地(训练数据)上训练向导,却期望他们在稍后能够驾驭“未知”领地(新类别)。这会导致向导的内在地图发生扭曲和变形。

以下是 TACO 如何解决这一问题的,它使用了两个主要的技巧:

1. “几何锚点”技巧(相对结构蒸馏)

想象一下,向导的大脑是一个巨大的 3D 地图,其中的每一个概念(如“跑步”、“游泳”或“烹饪”)都是空间中的一个点。在一个好的地图中,即使你加入了新的点(如“冲刺”),“跑步”和“走路”之间的距离和方向也应该保持一致。

当你在新的视频数据上训练向导时,地图会被挤压和拉伸。代表“跑步”和“走路”的点可能会漂移得太远,或者靠得太近,从而破坏了原始地图的逻辑。

TACO 的解决方案:
TACO 不仅仅关注已知的点,而是在地图的各个角落(包括向导尚未涉足的空白区域)投放了成千上万个隐形的、随机的“信标”(称为几何锚点)。

  • 运作方式: 在训练过程中,系统会不断检查:“嘿,如果‘跑步’移动了,它与这些随机信标之间的距离是否与之前保持一致?”
  • 结果: 这迫使向导保持其内在地图的形状完整。即使这些信标并不代表真实的物体(它们只是空间中的随机点),它们也能起到一种刚性支架的作用。它们防止了向导的大脑过度扭曲,确保当以后遇到新类别时,概念之间的关系仍然符合逻辑。

2. “专业化帽子”技巧(解耦空间)

想象一下,向导戴着两顶不同的帽子:

  1. “思考”帽: 这是他们的永久大脑,用于理解世界并识别新事物。
  2. “考试”帽: 这是一个临时的工具,仅用于解决目前正在进行的特定作业问题。

在标准训练中,向导直接把“考试”帽戴在自己的大脑上。随着他们解决作业,他们的大脑会被塑造成专门针对该作业的形式,从而导致他们忘记如何进行通用思考。

TACO 的解决方案:
TACO 在向导的大脑和考试之间放置了一个轻量级的、可丢弃的层(专业化投影)。

  • 运作方式: 向导利用其永久大脑来理解视频,然后将这种理解通过一个临时的“适配器”传递出去,以解决特定的训练任务。训练是发生在适配器上的,而不是直接作用于大脑。
  • 结果: 当进行真正的测试(识别新视频)时,向导脱掉“考试”帽和适配器。他们留下的是最初那颗未被扭曲的大脑,这颗大脑现在已经针对任务进行了完美调优,但并未失去识别新事物的通用能力。

总结

论文声称,通过使用这两个方法——用随机信标保持地图形状的刚性以及将训练与永久大脑分离——TACO 创建了一个在识别未见过的视频类别方面比以往方法表现得好得多的视频识别系统。

他们在许多不同的视频数据集(如 UCF-101、HMDB-51 和 Kinetics)上进行了测试,发现他们的方法始终优于现有技术,证明了你可以在教模型新技能的同时,不让它忘记原有的智慧。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →