A Closer Look at Dynamic Scene Graph Generation In the Era of Multimodal Large Language Models
本文通过引入一个包含五项新指标的全面评估框架,并提出一种采用“自顶向下、先推理后定位”策略、时间关系集预测以及重要性感知微调的强力多模态大语言模型(MLLM)基准模型,从而实现了最先进的性能,旨在解决当前动态场景图生成中的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在看一部电影,但你不仅仅是看动作场面,而是希望机器人能理解故事,以便回答诸如“角色为什么跑了?”或“那个人手里拿着什么?”之类的问题。为了实现这一目标,计算机需要一种将视频分解为结构化事实列表的方法:谁在对谁做什么,以及这些关系随时间如何变化。这被称为动态场景图生成(Dynamic Scene Graph Generation)。你可以把它想象成计算机试图为视频的每一秒都编写一份“演职人员表”,不仅记录存在一个“人”和一只“狗”,还要记录“人正在遛狗”,随后又是“狗正在睡觉”。
长期以来,计算机一直在变得越来越强大,但它们往往难以兼顾准确性和实用性。它们可能会列出数百个事实,但其中许多是乏味的或错误的,比如在故事的核心是“人正在做饭”时,却说“地板在人的下方”。与此同时,新一代超级智能的 AI 模型——被称为多模态大语言模型(MLLMs)——已经问世了。这些 AI 系统可以看图写诗,或者通过观看视频来解释情节。它们极其擅长理解“大局”和故事,但直到现在,还没有人想过如何利用它们来构建这些特定的、结构化的视频事实列表。这篇论文提出了一个问题:我们能否利用这些讲故事的 AI 巨头来构建更好的视频事实列表?如果可以,我们该如何阻止它们仅仅列出那些乏味、冗余的事实呢?
论文作者指出,旧的方法已经失效了。他们认为,以往的方法就像是一个试图通过写尽可能多的句子来获得高分的学生,即便其中大部分都是废话,只要其中有一些是对的就行。这造成了一种混乱,即计算机是在“回忆”大量事实,但真正正确的却寥寥无几。为了解决这个问题,研究人员决定不再使用那些陈旧、笨拙的规则,而是直接使用强大的 MLLM。
首先,他们通过引入新的衡量标准改变了游戏规则。他们不再仅仅计算 AI 答对了多少事实(因为这可以通过瞎猜来实现),而是增加了测试来询问:“这些事实真的有用吗?”他们创建了一个“裁判”AI 来检查一个事实是否合理,一个测试要求 AI 根据它生成的事实来回答问题,以及一个测试来观察这些事实是否能帮助在数据库中找到正确的视频。他们发现,旧方法擅长于猜测大量事物,但在猜测“重要事物”方面表现极差。
接下来,他们重新设计了 AI 的工作方式。旧的方法是“自下而上”的:计算机先找到每一个物体(如人、杯子、桌子),然后再尝试推测它们之间的关系。作者说,这就像是在理解一个笑话之前,先试图列出句子里的每一个单词,却不理解笑点在哪里。相反,他们采用了“自上而下”的方法。他们让 MLLM 先观看视频,理清故事和主要动作(即“推理”),然后再精准地指出这些事物发生的具体位置(即“定位”)。这非常符合人类观看电影的方式:我们先理解情节,然后再注意到细节。
此外,他们还解决了一个主要的效率问题。旧方法会对视频的每一帧都描述“人与杯子”的关系,即使在十秒钟内没有任何变化。这就像是连续一千次地写下“人正拿着杯子”。作者将其改为“时序关系集(Temporal Relation Set)”,这就像是说:“人在第 5 秒到第 15 秒之间拿着杯子。”这节省了大量时间,并使 AI 运行得更快。
最后,他们教会了 AI 去关注重点。他们使用了一种特殊的训练方法,称为“重要性感知微调(Importance-Aware Finetuning)”。这就像是告诉那个学生:“不要只写下你知道的所有事实,要先把最有趣的事实写下来。”这阻止了 AI 用“地板在人下方”这类乏味、重复的事实来填充列表,并迫使它专注于更有趣的内容,比如“人正在倒咖啡”。
结果令人印象深刻。当他们在三个不同的视频数据集上测试新方法时,它不仅在寻找事实方面做得更好,而且在寻找“正确事实”方面表现更优。它比之前的最优方法更准确、更快速。这种新方法生成的场景图不仅更加精确,而且对于现实世界的任务(如针对视频进行提问或在视频库中寻找特定时刻)也更加有用。论文表明,通过让这些强大的语言模型主导,我们终于可以让计算机像人类一样理解视频故事,而不至于迷失在无用的细节海洋中。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。