于是有了 OmniReasoner,这是一个全新的“思考”框架,它教会这些 AI 侦探使用一种特殊的工具:一个**“放大(zoom-in)”按钮**。OmniReasoner 不再盯着整小时的视频看,而是首先对整个时间轴进行一次快速、低质量的“瞥视”,就像翻阅书籍以获取大意一样。如果它认为答案就在那里,它就会给出答案。但如果它感觉到线索隐藏在某个特定时刻——比如一个角色说了一句特定的短语,或者一条鱼出现在鱼缸里——它就会停下来并请求一次**“放大”**。它会请求一段仅有几秒钟的高清、高速剪辑。随后,AI 会将这段“放大”后的证据与其最初的快速瞥视结合起来,从而解开谜题。
这里的魔术技巧在于 AI 如何知道在哪里进行放大。在过去,计算机之所以难以应对,是因为它们通过计算“帧”(就像数页码一样),但如果视频加速或减速,页码就会发生变化。OmniReasoner 使用了一个被称为 TimeAnchor 的巧妙系统。把它想象成一个基于时钟时间(例如,“查看 2 分 49 秒”)的 GPS 坐标,而不是一个页码。这样一来,无论 AI 是在看模糊的快进版本,还是在看清晰的放大版本,“2:49”始终指向完全相同的时刻。这确保了 AI 在在大局观和特写镜头之间切换时不会迷失方向。
为了教会 AI 这项技能,研究人员并没有仅仅要求人类去标注每一个视频,因为那会耗费太长时间。相反,他们构建了一个时间增强数据引擎(Temporal Augmented Data Engine)。想象一下一个视频编辑器,它将短片段拼接成一部长电影,并在新生成的缝隙中秘密隐藏了一个“线索”。然后,AI 被训练去寻找那个隐藏的线索。有时,AI 被要求直接从整部电影中进行猜测,有时则被迫使用放大工具。通过一个试错的过程(强化学习),AI 学会了使用放大工具可以获得更高的分数,但前提是确实有必要使用它。
结果表明,这种方法行之有效。在各种视频和音频挑战测试中,OmniReasoner 在寻找答案方面表现得显著更好,尤其是在线索稀缺的长视频中。它不仅变得更聪明,能更好地回答问题,还学会了变得更高效,只在重要的时刻投入它的“脑力”。该论文表明,通过教导 AI 决定何时观察得更仔细,而不是强迫它平等地观察一切,我们可以解决以前难以破解的长音频-视频流中的复杂谜题。这是向着让 AI 不仅仅是“观看”视频,而是真正“思考”视频迈出的一步,让它知道何时该停下来并集中注意力。