Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision
本文提出了片段到视频监督(Segment-to-Video Supervision, S2V),这是一种高效的训练方法,通过从局部视频片段中生成细粒度的问答对来增强多模态大语言模型的长视频理解能力,在实现比现有基于推理的方法更高的准确性和效率的同时,避免了复杂强化微调框架的高昂成本和延迟。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能的广阔领域中,一个特定的挑战长期以来一直十分显著:教机器理解长视频。虽然现代系统可以轻松描述一段猫弹钢琴的短片,但面对一部长篇电影或两小时的纪录片时,它们往往会陷入困境。问题不在于缺乏记忆力,而在于缺乏专注力。当计算机分析长视频时,它会被成千上万帧画面所轰炸,其中大部分对于被问到的特定问题而言都是无关紧要的。这种视觉信息的洪流就像静态噪音,淹没了寻找答案所需的微小且关键的细节。为了解决这个问题,研究人员曾尝试构建能够更努力“思考”的系统,迫使它们像侦探一样逐步搜索视频。然而,这些复杂的思考过程训练成本高昂且运行缓慢,通常需要海量的数据和时间才能产生一个答案。
由南京大学和蚂蚁集团的研究人员开发的一种新方法提供了一条不同的路径。他们并没有强迫机器盯着整个视频并猜测答案可能在哪里,而是教会它先观察细小、易于处理的部分。该团队创建了一种名为“片段到视频监督”(Segment-to-Video Supervision)的方法。想象一下试图在一本厚书中寻找一个特定的单词。如果你被要求阅读整本书来寻找它,你可能会迷失在故事情节中。但如果你被展示了该单词出现的那一页,你就会准确地了解到那个单词看起来是什么样子以及它位于什么位置。研究人员将这种逻辑应用到了视频上。他们将长视频分解成简短、清晰的场景。然后,他们要求一个强大的计算机模型仅基于这些短场景来生成问题和答案。因为场景很短,模型可以轻松捕捉到精细的细节,例如秤上的确切重量或三个动作的具体顺序,而不会被视频的其他部分干扰。
一旦模型学会了根据这些短片段正确回答问题,研究人员又做了一件聪明的事。他们将同样的问题和答案再次呈现给模型,但这一次,他们展示了整个长视频。他们添加了一个简单的指令,告诉模型长视频中的哪一部分包含了答案。这迫使模型将对小场景那种敏锐、清晰的理解,与完整视频中嘈程、复杂的现实联系起来。目标是训练模型忽略干扰性的背景,即使在数小时的素材中,也能专注于相关的证据。这个训练过程出奇地高效。团队仅使用了1万个这类专门制作的问题和答案对来教导模型,这只是其他方法所需数十万个示例的一小部分。他们还避免了复杂的、多步推理的循环,使得模型能够通过单次快速处理给出答案。
这一方法的结果令人瞩目。在旨在衡量长视频理解能力的各种基准测试中,这个新模型始终优于通用人工智能系统和其他专门的视频模型。它在需要精确观察的任务中表现尤为出色,例如计数物体或回忆长篇叙事中的确切事件顺序。与其他可能需要长时间“思考”问题或需要巨大计算能力的系统不同,该模型能够快速且准确地给出答案,并且所需的训练数据也少得多。研究人员发现,该模型学会区分有用细节与无关噪音的能力如此之强,以至于在测试期间移除特定的时间戳指令后,它仍能正确回答问题。这表明模型已经真正学会了如何在干草堆中寻找针头,而不仅仅是记住了针头的位置。通过将重点从观察更多数据转向以正确的方式观察正确的数据,这项工作展示了一种更高效、更有效的方法,来教机器理解长视频所讲述的复杂且详细的故事。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。