← 最新论文
💻 computer science

MVEB: Massive Video Embedding Benchmark

本文介绍了 MVEB,这是一个由包含 184 个任务的更大任务池衍生而来的、包含 23 个任务的综合基准测试,用于评估 33 个涵盖多种模态和任务的视频嵌入模型,研究表明没有单一模型能在所有类别中占据主导地位,并强调了音频对性能具有关键且依赖于上下文的影响。

原作者: Adnan El Assadi, Roman Solomatin, Isaac Chung, Chenghao Xiao, Deep Shah, Manan Dey, Shriya Sudhakar, Zacharie Bugaud, Wissam Siblini, Ayush Sunil Munot, Yashwanth Devavarapu, Rakshitha Ireddi, Michell
发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Adnan El Assadi, Roman Solomatin, Isaac Chung, Chenghao Xiao, Deep Shah, Manan Dey, Shriya Sudhakar, Zacharie Bugaud, Wissam Siblini, Ayush Sunil Munot, Yashwanth Devavarapu, Rakshitha Ireddi, Michelle Yang, Márton Kardos, Niklas Muennighoff, Kenneth Enevoldsen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图为一家非常繁忙、高科技的图书馆招聘一名新员工。这家图书馆不仅有书(文本),还有电影(视频)和原声带(音频)。你需要一个能够理解、组织并能瞬间找到任何东西的人。

长期以来,测试这些“AI图书管理员”的人一次只给他们一种类型的测试。有一天,他们会问:“你能识别出一只猫吗?”(动作识别)。第二天,他们会问:“你能找到一段关于烹饪的视频吗?”(检索)。问题在于,一个 AI 可能在识别猫方面是个天才,但在寻找烹饪视频方面却表现糟糕。这就像是因为一个人擅长切洋葱就聘请他当厨师,却从未测试过他是否真的能做出一顿饭。

迎来 MVEB:全能型视频考试

论文的作者创建了 MVEB(大规模视频嵌入基准)。可以将 MVEB 想象成一场包含 23 个章节的巨型期末考试,旨在同时测试视频 AI 模型的所有方面。

以下是该论文如何使用简单的类比进行拆解的:

1. 考试结构(23 项任务)

MVEB 不仅仅是一个问题,它提出了 23 种不同类型的题目,以观察 AI 对视频的理解程度。这些问题分为六个类别:

  • 分类 (Classification): “这段视频里正在发生什么?”(例如:是在跳舞还是在烹饪?)
  • 零样本分类 (Zero-Shot Classification): “正在发生什么?”——即使没有事先专门教过它特定的活动。
  • 聚类 (Clustering): “根据这些视频的共同点将这 100 个视频归为一类”,且无需告知类别。
  • 成对分类 (Pair Classification): “这两个视频展示的是同一种活动吗?”
  • 检索 (Retrieval): “找到与这段文本描述相匹配的视频”(或反之亦然)。
  • 问答 (Question Answering): “观看这段视频并回答关于它的特定问题。”

2. 重大发现:没有“超级学生”

研究人员测试了 33 种不同的 AI 模型(即“学生”)。

  • 结果: 没有一个模型能在所有项目上都拿到“A+”。
  • 类比: 想象一支运动队。一名球员最擅长进球(分类),另一名球员最擅长传球(检索),而第三名球员则擅长防守(聚类)。目前还没有出现单一的“完美球员”。
  • 获胜者:
    • 基于大语言模型 (MLLM) 的模型在理解复杂问题和对视频进行分组方面表现最好。
    • 设计用于将不同感官结合在一起(多模态绑定)的模型在根据文本寻找视频方面表现最好。
    • 关键警告: 最初为了生成新视频或文本而构建的模型(生成式 MLLM)在被要求仅仅进行视频理解和索引时,表现得非常糟糕。这就像是要求一位诗人去当图书管理员;他可以写出优美的故事,但并没有接受过高效整理书架的训练。

3. “声音”因素:何时音频有帮助(以及何时有害)

论文中最有趣的环节之一是他们如何测试音频轨道。对于许多视频,他们对 AI 进行了两次测试:一次仅使用画面,另一次使用画面加上声音。

  • 发现: 音频是否有帮助,完全取决于测试题是如何编写的
    • 场景 A(音画同步/基于音频视觉): 如果测试问题是由听到了声音并观看了视频的人类创建的(例如:“正在演奏什么乐器?”),那么向 AI 添加声音会帮助它得到正确答案。
    • 场景 B(仅基于视觉): 如果测试问题仅通过观察视频创建(例如:“那个人在跳跃吗?”),添加声音实际上会损害 AI 的表现。声音变成了让模型感到困惑的“噪声”。
  • 启示: 音频并不自动意味着“更好”。只有当任务确实需要倾听时,它才有用。

4. “短”考试 vs. “长”考试

完整的潜在测试列表(MVEB+)共有 184 项任务,运行起来会非常耗时。作者使用了一种智能过滤器,从中挑选了 23 项最重要的任务(MVEB)。

  • 类比: 这就像医生开具了一份包含 184 项血液检查的完整检查单。他们意识到,如果只做其中最关键的 23 项,就能获得 99% 相同的健康信息,但所需的时间和成本要少 10 倍。

5. “仅视频” vs. “全栈”排行榜

论文还为无法处理音频(仅看视频)或无法处理文本(仅看视频)的模型创建了特殊的排行榜。

  • 惊喜: 当你把音频从等式中移除时,排名会发生彻底的变化。一个在全项考试中排名第 5 的模型,在“仅视频”考试中跃升至第 1 名。这证明了不同的模型是为不同的“理解口味”而构建的。

总结

这篇论文引入了一种新的、公平且全面的测试视频 AI 的方法。它告诉我们:

  1. 专业化很重要: 不同的 AI 模型擅长不同的领域;目前还没有“一劳永逸”的方案。
  2. 训练是关键: 你不能直接拿一个用于写故事的模型,就指望它能擅长整理视频;它需要针对这项工作进行专门训练。
  3. 语境是核心: 向视频中添加声音只有在任务确实需要倾听时才有帮助。如果任务纯粹是视觉性的,声音可能只会成为干扰。

作者已经发布了所有的代码和数据,以便社区可以在新的 AI 模型发明时不断更新这个“考试”,确保测试永远不会过时。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →