← 最新论文
💻 computer science

TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

TimeLens2 引入了一个通用的视频时序定位框架,该框架利用多模态大语言模型,结合一种新颖的多片段监督策略和时序 Wasserstein 奖励,在多种基准测试中实现了最先进的性能,显著超越了规模相当的基线模型以及规模大得多的开源模型。

原作者: Yuhan Zhu, Changlian Ma, Xiangyu Zeng, Xinhao Li, Zhiqiu Zhang, Songze Li, Jun Zhang, Tianxiang Jiang, Yuandong Yang, Ziang Yan, Zikang Wang, Xinyu Chen, Haoran Chen, Shaowei Zhang, Limin Wang

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuhan Zhu, Changlian Ma, Xiangyu Zeng, Xinhao Li, Zhiqiu Zhang, Songze Li, Jun Zhang, Tianxiang Jiang, Yuandong Yang, Ziang Yan, Zikang Wang, Xinyu Chen, Haoran Chen, Shaowei Zhang, Limin Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个超级聪明的机器人朋友,它可以观看世界上任何视频并准确描述正在发生的事情。这就像拥有一个从不错过任何细节的私人解说员。但问题在于,如果你问:“狗什么时候接住了飞盘?”机器人可能会说:“狗接住了飞盘!”听起来非常自信,但它不会告诉你应该在视频的哪个时间点暂停才能看到这一幕。这就像在读一本由叙述者描述情节,却拒绝告诉你页码的书。没有了这些“页码”(或者说时间戳),你就无法验证故事,也无法亲自找到证据。这就是“时间基准定位”(temporal grounding)的问题。科学家们正试图教会人工智能不仅要描述视频,还要指出动作发生的精确秒数,即使这些秒数分散在一部长篇电影中,或者视频是以晃动的第一人称视角拍摄的。

于是有了 TimeLens2,一个旨在成为终极视频侦探的新型 AI 模型。以往的 AI 模型就像是那些能描述犯罪现场、却找不到嫌疑人丢掉枪支的具体瞬间的侦探;而 TimeLens2 则被训练去寻找精确的时间间隔,无论是一个秒钟,还是在两小时电影中散落的十几个时刻。研究人员发现,为了实现这一点,他们必须彻底改变教导 AI 的方式。他们没有仅仅向 AI 展示一段视频并询问答案,而是构建了一个特殊的“验证流水线”,让多个 AI 智能体充当评审团成员,互相核对工作,以确保时间戳是真实的,而不仅仅是猜测。他们还发明了一种新的评分方式,即使 AI 错过了起始或结束时间,也会给予“接近”的局部加分,而不是因为任何错误就直接给零分。结果是:一个紧凑的 AI 模型(小至 20 亿参数)在寻找视频证据方面的表现,优于那些规模大得多的、昂贵的模型,这证明了通过正确的训练,小脑瓜也可以比巨脑更敏锐。

侦探的新工具箱

那么,TimeLens2 是如何变得如此擅长寻找视频中的“何时”的呢?研究人员意识到,传统的 AI 训练方式已经失效了。想象一下,你要教一名学生在干草堆里找针,但你只是把整个干草堆递给他们,然后说:“找针。”如果学生猜错了,你只会说“不对”,而他们完全不知道自己离正确答案有多近。在视频 AI 世界中,这意味着如果模型猜错了一秒钟,它就会得到零分,即使它只差了一秒。这使得学习过程变得非常缓慢且令人沮丧。

为了解决这个问题,团队创建了 TimeLens2-93K,这是一个通过巧妙的多步流程构建的海量数据集。把它想象成一条生产完美视频线索的流水线:

  1. 草稿阶段: 首先,他们使用一种聪明的 AI 为整个视频编写故事(说明文字),并将其分解为较小的场景。
  2. 提问阶段: 从这些场景中,他们生成了诸如“酱汁是在什么时候被搅拌的?”之类的问题。
  3. 双重检查: 这是神奇之处。他们并没有信任单一答案,而是将视频发送给两个不同的 AI “侦探”。这些侦探独立工作以寻找时间间隔。
  4. 共识阶段: 如果两个侦探对时间达成一致,该答案就会被保留。如果他们意见不一,则会被丢弃。这确保了训练数据极其可靠。
  5. 精修阶段: 最后,他们使用第三个更聪明的 AI 来锐化精确的起始和结束时间,使边界更加精准。

这个过程将一个混乱、不可靠的数据集变成了一个拥有 93,000 个高质量样本的金矿,在这些样本中,AI 明确知道事情发生的精确时间。

“Wasserstein”评分:一种新的评分方式

一旦 AI 有了好的数据进行学习,研究人员就必须教它如何为自己的工作评分。他们引入了一种名为 Temporal Wasserstein 奖励 的新评分方法。

想象你在玩一个游戏,你必须在一条时间轴上猜出隐藏宝藏的位置。

  • 旧方法 (tIoU): 如果你猜错了位置,你会得到零分。无论你是差了一英寸还是差了一英里,你都一无所获。这就像老师因为你写错了日期就给你一个“不及格”,即便你只差了一天。
  • TimeLens2 方法 (Wasserstein): 这种新方法就像是一个 GPS。如果你离目标只有一英寸,它会说:“你快到了!”并给你高分。如果你离目标有一英里,它会说:“离得太远了,”并给你低分。它测量的是你的猜测与真相之间的距离

这至关重要,因为它教会了 AI 即使在尚未找到确切答案时,也要不断尝试向目标靠近。论文表明,这种方法帮助 AI 更快地从错误中恢复,将“沉默”的失败(即 AI 得到零分且学不到任何东西)转化为有价值的学习时刻。

结果:小脑瓜,大技能

团队在七个不同的视频挑战赛上测试了 TimeLens2,范围从人们做动作的短片到从个人视角(如头盔上的 GoPro)拍摄的长篇复杂视频。他们测试了三个版本的模型:一个小型的 20 亿参数版本、一个中型的 40 亿参数版本和一个大型的 80 亿参数版本。

结果令人惊喜。微小的 20 亿 参数版 TimeLens2 在每一项测试中都击败了所有同规模的其他 AI 模型。更令人印象深刻的是,40 亿 参数版本表现优于那些规模大出数百倍的庞大商业模型(例如一个 3970 亿参数的模型)。简单来说,一个经过精心训练的小型 TimeLens2 模型,就是一个比那些缺乏细致训练的巨型、昂贵模型更优秀的视频侦探。

例如,在一个名为“MomentSeeker”的测试中,AI 需要回答诸如“什么东西被放在门口了?”之类的问题,TimeLens2 模型相比其基础版本显著提高了得分。2B 模型提升了 14.2 分,4B 提升了 13.0 分,8B 提升了 18.1 分。这表明,秘诀不在于单纯把 AI 做大,而在于教它如何更仔细地寻找证据,以及如何理解“接近”比“错误”更有价值。

为什么这很重要

论文总结道,通过将视频证据视为一组时间间隔,并使用这些更聪明的新方法来训练和评估 AI,我们可以让视频搜索变得更加可靠。用户不再仅仅得到一个模糊的描述,现在可以获得精确、可验证的时间戳。这使视频 AI 从一个只会猜测的“黑盒”转变为一个透明的工具,能够展示其推导过程,从而实现搜索数小时的视频以找到你所寻找的精确内容——无论是特定的动作、重复发生的事件,还是从第一人称视角捕捉到的瞬间。研究人员指出,这种方法可以使视频存档变得易于搜索且值得信赖,造福从研究人员到普通用户的每一个人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →