← 最新论文
💻 computer science

Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios

本文介绍了 Video-IFBench,这是一个包含 1.5K 个样本和多样化指令分类法的综合基准测试,旨在评估多模态大语言模型在视频理解场景中遵循复杂的、用户指定约束条件的尚未被充分探索的能力,并揭示了当前模型在处理多约束和条件指令时存在显著困难。

原作者: Hongbo Liu, Peixian Chen, Sihan Liu, Peiyuan Zhang, Kai Zou, Dian Zheng, Xiaoxing Hu, Yuhao Dong, Mengdan Zhang, Yunhang Shen, Haoyu Cao, Wei Liu, Weibo Gu, Xing Sun, Shengjie Zhao

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Hongbo Liu, Peixian Chen, Sihan Liu, Peiyuan Zhang, Kai Zou, Dian Zheng, Xiaoxing Hu, Yuhao Dong, Mengdan Zhang, Yunhang Shen, Haoyu Cao, Wei Liu, Weibo Gu, Xing Sun, Shengjie Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的时代,新一代系统已经出现,它们能够看、听、说。这些多模态模型通过对海量文本、图像和视频进行训练,使其能够描述一个场景、回答关于电影的问题或总结一段新闻剪辑。多年来,研究人员通过询问一个简单的问题来衡量它们的成功:答案是否正确?如果一个模型在描述一段烹饪节目的视频时准确识别出了食材,它就会获得高分。然而,在现实世界中,仅仅给出正确的答案往往是不够的。用户可能会要求模型描述一段视频,但坚持特定的规则:“只告诉我水烧开之后发生了什么”、“按顺序列出步骤”、“不要提到锅的颜色”或者“仅用西班牙语表达”。这些请求要求系统不仅要理解内容,还要遵循一套复杂的指令,过滤掉那些它明知属实但被告知要忽略的信息。直到现在,这些先进系统在视频场景中遵循此类详细、类人约束的能力在很大程度上仍未得到充分测试。

一个研究团队通过创建一个名为 Video-IFBench 的新测试场解决了这一空白。该基准测试专门设计用于观察视频理解类人工智能是否真的能在指令棘手时言听计从。研究人员从公开渠道收集了 700 多个视频,涵盖了体育、科学、新闻和日常生活等十个不同的领域。这些片段长度从 10 秒到 10 分钟不等,总计约 49 小时的素材。他们从这些集合中构建了 1,500 个独特的测试用例。每个测试用例都将一段视频与一个特定的请求相匹配,其中包含任务与约束的混合。有些请求要求单一信息,例如“屏幕上的文字是什么?”;而另一些则要求多个步骤,例如“列出动作,但仅限持续时间超过两秒的动作,并以编号列表的形式呈现。”最困难的测试涉及条件逻辑,即模型必须先观看视频以决定采取哪条路径。例如,提示词可能会说:“如果视频以关于修理笔记本电脑的标题开始,则描述维修步骤;否则,描述这个人最后十秒钟的行为。”模型必须正确识别起始条件,以选择要遵循的正确指令集。

为了确保这些测试公平且准确,研究人员构建了一个半自动系统来生成问题和检查答案的规则。他们利用人工智能从视频中提取事实(例如出现了哪些物体以及特定事件发生的时刻),然后利用这些事实编写复杂的指令。至关重要的是,每条指令都附带了一份清单。清单中的某些项目可以通过计算机程序进行检查,例如验证答案是否以 JSON 格式编写,或者是否恰好包含五个要点。而其他需要理解响应含义的项目,则由一个独立的、能力极强的语言模型充当评判员进行检查。这种混合方法使研究人员能够评估模型是否满足了请求中的每一个约束,而不仅仅是完成主要任务。

这项评估的结果揭示了即使是当今最先进的视频模型也存在的显著弱点。在整个基准测试中,表现最好的模型整体得分仅为 54.5%。这意味着在近一半的情况下,模型未能遵循完整的指令集,即使它正确理解了视频内容。研究发现,当指令同时包含许多约束,或者当请求要求模型在回答前根据视频内容做出决策时,模型表现最为吃力。例如,当被要求根据视频中发生的情况在不同路径间做出选择时,模型经常选错路径或完全忽略了条件。随着指令变得更加复杂,难度也随之增加;当一个请求涉及深层的“如果-那么”逻辑链时,成功率大幅下降。

研究人员还发现,约束的类型至关重要。模型在遵循格式规则(如使用特定语言或限制字数)方面表现相对较好。然而,在处理语义约束(即需要理解视频含义以过滤信息)时,它们的表现很差。例如,模型可能会被要求仅描述某个特定人的动作而忽略其他人,或者列出发生在精确时间窗口内的事件。在这种情况下,模型经常会包含被告知要排除的信息,或者遗漏了本应找到的细节。研究表明,仅仅扩大模型规模或增加计算能力并不能解决问题。虽然更大的模型通常表现更好,但它们仍然无法稳定地遵循严格指令,这表明理解视频内容的能力与遵循复杂规则的能力是两种不同的技能,而当前的技术尚未能将两者完全结合。

这项工作表明,对于人工智能要在现实世界的应用中真正发挥作用,它必须学会像观察世界一样仔细地倾听。研究结果表明,目前的系统在可靠性方面尚不足以部署在用户期望精确遵循其特定需求的场景中。研究人员希望,通过提供衡量这种能力的清晰标准,Video-IFBench 能引导未来的开发方向,使模型不仅能看到世界,还能遵循人类使用者那细微且往往具有矛盾性的指令。前进的道路需要将重心从单纯获得正确答案,转向以用户要求的确切方式获得正确答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →