← 最新论文
💻 computer science

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

OmniReasoner 是一个工具使用后训练框架,它使全模态大语言模型能够通过动态决定何时调用“放大”工具以对稀疏证据进行高保真检查,并由一种用于保证时间一致性的新型 TimeAnchor 机制以及用于规模化训练的 Temporal Augmented Data Engine 提供支持,从而实现对长音频-视频流的高效推理。

原作者: Yu Chen, Caorui Li, Ziyu Xiong, Yidong Wang, Mingqi Gao, Shuman Liu, Biao Liu, Chunfeng Yang, Anxiang Zeng, Haibo Zhang, Chaofan Chen

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Yu Chen, Caorui Li, Ziyu Xiong, Yidong Wang, Mingqi Gao, Shuman Liu, Biao Liu, Chunfeng Yang, Anxiang Zeng, Haibo Zhang, Chaofan Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一个永无止境的图书馆里破解一个谜题。图书馆里堆满了成千上万本书,但你需要寻找的线索却极其微小:也许是第 4,002 页上一个被低声念出的单词,或者是第 12,500 页边角里隐藏的一个特定图案。如果你试图以同样的速度阅读每一页,你的大脑会感到疲劳,并且因为在阅读整本书时过于匆忙而错过那些微小的细节。这正是计算机在试图理解长视频和音频时面临的精确问题。它们是“全模态”(omni-modal)模型,意味着它们能看也能听,但当一段视频长达一小时时,最重要的线索可能只是转瞬即逝的声音或是一个短暂的视觉动作。如果计算机试图以高细节处理整个小时的内容,它会耗尽内存;如果它快速扫过一切,它就会错过线索。科学家们一直试图教会计算机如何成为更好的侦探:如何快速地略读整个故事,发现可疑的部分,然后只在重要的地方慢下来仔细观察。

于是有了 OmniReasoner,这是一个全新的“思考”框架,它教会这些 AI 侦探使用一种特殊的工具:一个**“放大(zoom-in)”按钮**。OmniReasoner 不再盯着整小时的视频看,而是首先对整个时间轴进行一次快速、低质量的“瞥视”,就像翻阅书籍以获取大意一样。如果它认为答案就在那里,它就会给出答案。但如果它感觉到线索隐藏在某个特定时刻——比如一个角色说了一句特定的短语,或者一条鱼出现在鱼缸里——它就会停下来并请求一次**“放大”**。它会请求一段仅有几秒钟的高清、高速剪辑。随后,AI 会将这段“放大”后的证据与其最初的快速瞥视结合起来,从而解开谜题。

这里的魔术技巧在于 AI 如何知道在哪里进行放大。在过去,计算机之所以难以应对,是因为它们通过计算“帧”(就像数页码一样),但如果视频加速或减速,页码就会发生变化。OmniReasoner 使用了一个被称为 TimeAnchor 的巧妙系统。把它想象成一个基于时钟时间(例如,“查看 2 分 49 秒”)的 GPS 坐标,而不是一个页码。这样一来,无论 AI 是在看模糊的快进版本,还是在看清晰的放大版本,“2:49”始终指向完全相同的时刻。这确保了 AI 在在大局观和特写镜头之间切换时不会迷失方向。

为了教会 AI 这项技能,研究人员并没有仅仅要求人类去标注每一个视频,因为那会耗费太长时间。相反,他们构建了一个时间增强数据引擎(Temporal Augmented Data Engine)。想象一下一个视频编辑器,它将短片段拼接成一部长电影,并在新生成的缝隙中秘密隐藏了一个“线索”。然后,AI 被训练去寻找那个隐藏的线索。有时,AI 被要求直接从整部电影中进行猜测,有时则被迫使用放大工具。通过一个试错的过程(强化学习),AI 学会了使用放大工具可以获得更高的分数,但前提是确实有必要使用它。

结果表明,这种方法行之有效。在各种视频和音频挑战测试中,OmniReasoner 在寻找答案方面表现得显著更好,尤其是在线索稀缺的长视频中。它不仅变得更聪明,能更好地回答问题,还学会了变得更高效,只在重要的时刻投入它的“脑力”。该论文表明,通过教导 AI 决定何时观察得更仔细,而不是强迫它平等地观察一切,我们可以解决以前难以破解的长音频-视频流中的复杂谜题。这是向着让 AI 不仅仅是“观看”视频,而是真正“思考”视频迈出的一步,让它知道何时该停下来并集中注意力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →