← 最新论文
💻 computer science

OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding

本文介绍了OmniVTG,这是一个通过语义覆盖扩展和以字幕为中心的标注流程构建的大规模开放世界视频时序定位数据集,并提出了一个利用多模态大语言模型卓越理解能力来优化预测的自修正思维链训练范式,该范式在新数据集和现有基准测试上均实现了最先进的性能。

原作者: Minghang Zheng, Zihao Yin, Yi Yang, Yuxin Peng, Yang Liu

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Minghang Zheng, Zihao Yin, Yi Yang, Yuxin Peng, Yang Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个巨大的未剪辑家庭视频图书馆,而有人递给你一句具体的话,比如“找到猫打翻花瓶的那部分”。你的任务是精确指出那一刻何时发生。这项任务被称为视频时间定位(Video Temporal Grounding)

问题在于,大多数 AI 模型就像只为特定考试而学习的学生。它们擅长寻找常见事物(如“一个人在跑步”),但当被要求寻找罕见或棘手的事物(如“一个人一丝不苟地组装一只微型手表”)时,就会完全迷失。它们之所以挣扎,是因为它们没有见过足够多的这类罕见概念的示例,且其训练数据过于狭小和重复。

本文的作者 OmniVTG 决定通过构建一本更好的“教科书”和一种更聪明的“学习方法”来解决这个问题。

1. 新教科书:OmniVTG 数据集

将现有的视频数据集想象成一个只收录烹饪和体育类书籍的图书馆。如果你要求 AI 寻找关于“天文学”的视频,它将不知如何是好。

作者构建了 OmniVTG,这是一个包含超过 2000 小时视频的巨大新图书馆。但他们并非随意抓取视频,而是采用了一种名为**语义覆盖迭代扩展(Semantic Coverage Iterative Expansion)**的巧妙策略。

  • 类比:想象你是一名侦探,正在字典中寻找缺失的词汇。你发现字典里缺少了诸如“一丝不苟”或“扁带行走”这样的词。
  • 过程:AI 不再凭空猜测,而是请求一个强大的语言模型(如同一位超级聪明的图书管理员)将这些缺失的词汇转化为具体的搜索词(例如,将“一丝不苟”转化为“钟表匠组装齿轮”)。随后,它便根据这些具体描述去搜寻匹配的视频。
  • 结果:他们创建了一个规模庞大且涵盖广泛主题的数据集,从日常活动到非常罕见、具体的事件无所不包。

他们是如何标注的?
手动标注视频既缓慢又昂贵。作者发现了一个有趣的现象:AI 实际上更擅长用时间戳描述视频(例如“在第 10 秒,一名男子拿起杯子”),而不是根据特定句子去猜测时间戳。因此,他们反其道而行之。他们先让 AI 为视频撰写带有详细时间戳的故事,然后利用这些故事来教导 AI 如何稍后找到正确的时刻。这就像让 AI 先写日记,再利用这本日记来学习如何寻找特定事件。

2. 更聪明的学习方法:自修正思维链(Self-Correction CoT)

即使有了更好的教科书,AI 在处理罕见概念时仍显吃力。作者意识到 AI 存在一种“分裂人格”:

  • 理解大脑:它擅长观看视频并判断“是的,这符合描述”或“不,这个事件尚未开始”。
  • 猜测大脑:它极不擅长直接猜测开始和结束时间。

解决方案:“先预测,后修正”策略
与其强迫 AI 立即猜测答案,不如教导它分步思考,采用一种名为**自修正思维链(Self-Correction Chain-of-Thought, CoT)**的方法。

  • 类比:想象你正在参加数学考试。
    • 旧方法:你写下脑海中浮现的第一个答案。如果你错了,那就错了。
    • OmniVTG 方法:你先写下一个粗略的猜测。然后,你停下来问自己:“等等,这真的符合题目吗?我是否漏掉了什么细节?”你利用强大的“理解大脑”来检查你的工作,意识到自己犯了错误,然后写下正确的答案。

训练分为三个阶段:

  1. 监督微调(SFT):教导 AI 基础知识以及如何判断视频是否与描述相符。
  2. 自修正思维链(Self-Correction CoT):教导 AI 先做出粗略猜测,然后“放大”细节,利用其理解能力进行修正。
  3. 强化学习:在 AI 完成自我修正的艰苦工作后,如果最终答案正确,则给予奖励机制。

3. 结果

当他们测试这种新方法时:

  • 在他们自己的数据集上:AI 在寻找罕见和常见事件方面都变得更好,缩小了两者之间的差距。
  • 在其他现有测试中:即使未经过针对这些特定测试的训练,该 AI 的表现也优于任何其他现有模型(最先进水平)。这证明了通过教导 AI“思考并自我修正”,它已成为一个更可靠的视频事件侦探。

简而言之:论文指出,“我们构建了一个更大、更多样化的视频图书馆,并教导 AI 停止猜测,开始双重检查自己的工作。这使得它在寻找视频中的特定时刻(甚至是那些怪异和罕见的时刻)时变得更加聪明。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →