← 最新论文
💻 computer science

Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning

Video-o3 是一个用于长视频多跳推理的新颖框架,它通过任务解耦的注意力掩码和可验证的轨迹引导奖励,实现原生、迭代的线索搜索,从而克服了均匀采样的局限性,并在 MLVU 和 Video-Holmes 等基准测试中实现了最先进的性能。

原作者: Xiangyu Zeng, Zhiqiu Zhang, Yuhan Zhu, Xinhao Li, Zikang Wang, Changlian Ma, Qingyu Zhang, Zizheng Huang, Kun Ouyang, Tianxiang Jiang, Ziang Yan, Yi Wang, Hongjie Zhang, Yali Wang, Limin Wang

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiangyu Zeng, Zhiqiu Zhang, Yuhan Zhu, Xinhao Li, Zikang Wang, Changlian Ma, Qingyu Zhang, Zizheng Huang, Kun Ouyang, Tianxiang Jiang, Ziang Yan, Yi Wang, Hongjie Zhang, Yali Wang, Limin Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图解构一部 30 分钟电影中的谜团,但你只有几秒钟的时间来观看它。大多数当前的人工智能模型试图通过每隔几秒对整个电影拍一张快速、模糊的快照,然后立即猜测答案来解决这个问题。这就像试图通过扫视整个干草堆一次并希望看到它,来在干草堆中找到一根特定的针。你经常找不到那根针,因为它隐藏在“干草”(无聊的部分)中,或者你被过多的信息所淹没。

Video-o3 是一个改变游戏规则的新人工智能框架。它不像只是扫视一眼,而是像一位手持放大镜的侦探。以下是其工作原理,分解为简单的概念:

1. 侦探的方法(原生交错线索搜寻)

Video-o3 不是看完整部电影后再猜测,而是看一点,思考一下,然后决定:“我需要放大这个特定的 5 秒片段,看看发生了什么。”

  • 工作原理:它要求系统对视频的特定片段进行“裁剪”(就像从胶卷中剪下一小段),以便仔细观察。
  • 循环:它重复这个过程。看一点 \rightarrow 思考 \rightarrow 放大线索 \rightarrow 再次思考 \rightarrow 放大另一个线索。
  • 结果:它一点一点地构建答案,只查看视频中真正重要的部分,忽略其余部分。

2. “注意力分裂”的问题(任务解耦注意力掩码)

想象一位侦探试图在撰写报告的同时观察犯罪现场。如果他们试图完全同时做这两件事,可能会感到困惑。他们可能会看着犯罪现场,却写下记忆中的内容,而不是他们实际看到的内容。这被称为“虚假思考”。

  • 解决方案:Video-o3 使用一种特殊的“掩码”技术。
    • 当人工智能寻找线索(扫描视频)时,它被迫忽略它可能正在编写的最终答案。它完全专注于发现证据。
    • 当人工智能编写答案时,它被迫忽略原始视频画面,只专注于它刚刚找到的线索。
  • 类比:这就像一名学生,只被允许在“学习”阶段查看教科书,只被允许在“考试”阶段查看笔记。这防止了他们作弊或感到困惑,确保他们的最终答案基于确凿的证据。

3. “停止标志”(可验证轨迹引导奖励)

从理论上讲,侦探可以无限地放大,查看每一帧,但这将花费太长时间并消耗太多资金(计算能力)。

  • 解决方案:Video-o3 通过一种特殊的奖励系统进行训练。
    • 如果人工智能快速且准确地找到答案,它会获得一颗巨大的“金星”(奖励)。
    • 如果人工智能在已经获得答案后仍不必要地继续放大,它会受到“惩罚”(奖励变小)。
  • 类比:这就像“热与冷”的游戏。人工智能学会在感觉“热”(拥有足够证据)的那一刻停止搜索。它学会变得高效,在刚好解决谜题时停止,而不是浪费时间查看空房间。

4. 训练场(Seeker-173K)

要教会人工智能成为侦探,你不能只给它一本教科书;你需要给它成千上万个它必须搜寻线索的练习案例。

  • 数据集:研究人员创建了一个名为 Seeker-173K 的大型数据集。其中包含 173,000 个“视频谜团”示例,人工智能被迫练习“观察 \rightarrow 放大 \rightarrow 思考 \rightarrow 再次观察 \rightarrow 解决”的循环。
  • 结果:因为它在这些特定的“线索搜寻”任务上进行了大量练习,所以在解决复杂的视频问题方面,它比之前的模型表现得更好。

核心结论

Video-o3 是计算机观看长视频的一种更聪明的方式。它不像试图一次性记住整部电影,而是像人类侦探一样行动:它扫描场景,放大重要细节,将点连成线,并在获得证据后立即停止。这使其速度更快、更准确,并且更擅长解决隐藏在长视频中的复杂谜题。

性能:在测试中,与那些只是“扫视”视频的旧方法相比,这种方法使人工智能解决视频谜题的准确率显著提高(例如,在一个主要基准测试中达到 72.1%)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →