VCIFBench: Evaluating Complex Instruction Following for Video Understanding
本文介绍了 VCIFBench,这是一个旨在评估并提升多模态大语言模型在视频理解任务中遵循复杂且富含约束指令能力的综合基准测试,该基准揭示了当前的性能差距,并证明了通过 DPO 训练进行增强的有效性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在雇佣一位非常聪明、动作极快的助手,让你帮你看一段视频并写一份报告。你不仅仅是想让他们说:“一只狗在追一只猫。”你想要给他们一个非常具体且复杂的规则列表:
- “准确告诉我发生了什么,但仅使用以字母‘B’开头的单词。”
- “将报告写成一个 JSON 代码块。”
- “字数控制在 50 字以内。”
- “不要提到那只狗的颜色。”
- “以‘Once upon a time’(从前)开头,以‘The End’(结束)结尾。”
这就是 VCIFBench 这篇论文试图解决的问题。
问题所在:“聪明但笨拙”的助手
作者发现,虽然现代 AI 模型(称为多模态大语言模型,Multimodal Large Language Models)在理解视频方面变得非常出色,但在遵循严格、复杂的规则方面却表现得很糟糕。
把这些 AI 模型想象成一位才华横溢的大厨,他能烹饪出美味佳肴(理解视频),但总是会忘记遵循顾客特定的饮食限制(约束条件)。
- 大厨可能做了一份很棒的汤,但他忘了放盐。
- 他可能写了一个美丽的故事,但他用了错误的字体或超过了字数限制。
- 有时,如果你要求他们做两件相互矛盾的事情(比如“要短”且“包含所有细节”),他们就会忽略规则,直接给出一个正常的答案。
解决方案:一个新的“压力测试”(VCIFBench)
研究人员构建了一个新的测试场,名为 VCIFBench(视频复杂指令遵循基准测试)。这就像是AI 的驾驶考试,但他们检查的不只是司机是否能沿着街道行驶,而是检查司机是否能:
- 在右侧行驶。
- 在每个红灯前停车。
- 将速度精确保持在每小时 30 英里。
- 在驾驶的同时唱歌。
- 完成这一切且不撞到任何一个锥桶。
他们是如何构建它的:
- 他们采用了现有的视频数据集(如烹饪节目、科学片段和日常生活视频)。
- 他们为 AI 编写了 306 个具体的“指令”,混合了不同类型的规则:
- 格式: “以列表形式书写”、“使用 JSON”、“不要使用项目符号”。
- 内容: “只谈论那辆红色的车”、“不要提到背景音乐”。
- 风格: “听起来像个海盗”、“语气非常正式”。
- 结构: „将最重要的内容放在最前面”、“按时间分组”。
他们还包含了一个特殊的“陷阱”部分,其中有 30 个不可能完成的指令(例如:“描述一只视频中并不存在的蓝色大象,但只能描述你能看到的东西”)。一个好的 AI 应该回答:“我无法做到那样”,而一个坏的 AI 则会幻觉出一只蓝色的大象。
结果:AI 仍在学习中
研究人员在这一新测试上测试了 10 个不同的 AI 模型(包括来自大型科技公司的模型和开源模型)。以下是他们的发现:
“单项任务”与“全能任务”的差距:
大多数模型在遵循单一规则时表现尚可。如果你要求“用 JSON 编写”,它们可以做到;如果你要求“总结视频”,它们也能做到。但当你要求它们同时完成这两件事时,它们就开始出错。- 类比: 这就像一个学生可以完美地解数学题,也可以写出优秀的论文,但如果要求他们在写论文的过程中解数学题,且不能犯任何拼写错误,他们就会感到困惑并出错。
“差一点就成功”的问题:
最好的模型(如来自 Google 和 OpenAI 的模型)表现得很接近。它们理解对了视频,也掌握了风格,但经常会错过一个小细节,比如忘记了一个逗号,或者多用了一个词。- 类比: 他们盖好了一座完美的房子,但忘了把前门装在右边。
“盲目服从”的问题:
当面对不可能的指令(“陷阱”问题)时,较弱的模型会直接编造内容。它们没有意识到请求本身是自相矛盾的。- 类比: 如果你告诉一个机器人,“同时把墙涂成蓝色和红色”,聪明的机器人会说,“我做不到”。而笨拙的机器人只会涂出一面杂乱的紫色墙壁,并希望你没注意到。
更多的视频并不一定意味着更好:
研究人员尝试提供更高质量的视频(更多的帧数、更高的分辨率),以观察这是否会有所帮助。令人惊讶的是,这并不总是有效。有时,看到更多的内容反而会让 AI 变得话多,从而忘记字数限制。- 类比: 给一个学生一本 1000 页的教科书而不是 10 页的摘要,并不会帮助他们写出一篇 1 页的论文;反而会让他们变得啰嗦。
好消息:训练确实有效
作者还尝试使用一种特殊的技巧——DPO(直接偏好优化)来“教导”其中一个模型。他们向模型展示了“好”的答案(遵循了所有规则)和“坏”的答案(违反了规则)的示例。
- 经过这种训练,模型的复杂规则遵循能力显著提高。它从大部分时间都在失败,提升到了大约 33% 的通过率。
- 类比: 这就像给大厨一份具体的清单,并奖励他完美执行指令的行为。经过几次练习后,他终于开始按照要求做对了。
总结
论文得出结论:虽然 AI 在“观看”视频方面已经变得非常出色,但在成为一个能够遵循长且严格指令的“好员工”方面仍处于挣扎阶段。为了让这些模型在实际任务(如自动化报告或工具)中发挥作用,我们不仅需要教它们理解视频,还需要教它们尊重我们给出的边界和规则。
作者警告说,这个测试只是针对规则的“压力测试”,而不是衡量 AI 整体智能水平的完整标准,但它强调了一个关键的差距,在这些模型被信任处理复杂工作之前,必须予以解决。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。