← 最新论文
💻 computer science

VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing

本文介绍了 VEBench,这是首个综合性基准,包含 3.9K 个高质量编辑视频和 3,080 个人工验证的问答对,用于评估大型多模态模型在现实世界视频编辑知识与操作推理方面的能力,揭示了当前模型与人类级编辑认知之间存在显著的性能差距。

原作者: Andong Deng, Dawei Du, Zhenfang Chen, Wen Zhong, Fan Chen, Guang Chen, Chia-Wen Kuo, Longyin Wen, Chen Chen, Sijie Zhu

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Andong Deng, Dawei Du, Zhenfang Chen, Wen Zhong, Fan Chen, Guang Chen, Chia-Wen Kuo, Longyin Wen, Chen Chen, Sijie Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名电影剪辑师。你的工作不仅仅是观看电影,而是要理解导演为何从一个场景切换到另一个场景,并找到完美的缺失片段来完成一个故事。

本文介绍了VEBENCH,这是一项全新的“期末考试”,旨在测试人工智能(AI)完成这项工作的能力。研究人员发现,即便是当今最智能的 AI 模型,也像是那些背熟了字典却从未真正剪辑过电影的学生。它们可以描述一个场景,但难以理解节奏、声音,或是将两个不同视频片段组合在一起的逻辑。

以下是用简单类比对论文核心思想的拆解:

1. 问题所在:AI 是“被动观察者”,而非“创意剪辑师”

当前的 AI 模型擅长观看单个视频并告诉你发生了什么(例如,“一只狗在奔跑”)。但真正的视频剪辑截然不同,它需要主动推理

  • 类比:想象一个能完美背诵语法规则的学生,但当被要求写诗时却僵住了。同样,AI 可以识别视频中的“跳切”,但它不理解剪辑师为何要跳切,也不知道如何找到下一个符合情绪氛围的片段。
  • 差距:论文表明,虽然 AI 在视觉和听觉感知方面不断进步,但在剪辑的“创意逻辑”方面仍然表现糟糕。

2. 解决方案:两部分测试(VEBENCH)

为了解决这一问题,研究人员构建了一个名为VEBENCH的基准测试。你可以把它想象成 AI 的驾驶考试,只不过 AI 不是开车,而是要“驾驶”视频剪辑师的时间轴。它包含两个主要挑战:

第一部分:“识破技巧”测试(技术识别)

  • 任务:AI 观看一段视频,必须识别特定的剪辑技巧,例如J 型剪辑(在看到下一个场景画面之前先听到其声音)或硬切(突然且生硬地切换到完全不同的场景)。
  • 挑战:这不仅仅是观察画面的变化。AI 必须聆听声音并感受节奏。
  • 结果:AI 在此处表现挣扎。它经常错过那些向人类剪辑师发出“嘿,声音在引领方向!”的微妙音频线索。

第二部分:“拼图碎片”测试(操作模拟)

  • 任务:这是更难的部分。AI 会获得一段“参考视频”(例如一段演员谈论电影的片段)。随后,它会看到另外四个视频片段(选项 A、B、C、D)。它必须选出唯一完美契合的那个片段,并准确指出在该片段中契合发生的具体位置。
  • 类比:想象你在搭建一座乐高城堡。你刚刚建好了一座塔楼(即参考视频)。你被递来四堆不同的积木。你必须选出那堆拥有恰好能完成屋顶所需的正确积木的堆,并指出你需要哪些具体的积木。
  • 结果:AI 在此处惨败。它经常完全选错了积木堆,或者指出了错误的位置。它无法理解采访片段与电影片段之间的故事联系。

3. 数据集:一个包含“真实”剪辑的庞大图书馆

为了创建这项测试,研究人员并非凭空捏造虚假视频,而是从采访和电影片段等来源收集了3,900 个真实世界的剪辑视频(超过 257 小时的素材)。

  • 过程:他们采用了一种“人在回路”(Human-in-the-Loop)系统。想象一个由专家剪辑师组成的团队与 AI 协作,对每一个剪辑点、转场和音效进行标注。这确保了测试的准确性和公平性。
  • 规模:这是首次有测试要求 AI 跨越多个不同的视频源进行推理以构建故事,而不是仅仅一次分析一个视频。

4. 结果:AI 与人类之间存在巨大差距

研究人员在 VEBENCH 上测试了世界上最智能的 AI 模型(如 Gemini 和各种开源模型)。

  • 分数:结果令人谦卑。即便是最好的模型,其表现也远低于人类水平。
  • “音频”因素:论文发现,当 AI 无法“听”到视频(或当字幕被移除)时,其表现会下降。这证明剪辑不仅仅是关于画面,而是声音与视觉之间的共舞。
  • “时间”因素:AI 在寻找确切的剪辑时刻方面表现糟糕。当正确时刻实际上在视频中间时,它却会猜测视频的开头。这就像试图赶火车,却提前或晚到车站一个小时。

总结

VEBENCH是一次现实检验。它表明,虽然 AI 在描述其所见方面日益精进,但在理解剪辑的艺术方面仍相去甚远。它尚无法像人类剪辑师那样思考,后者懂得如何将声音、视觉和故事编织成无缝的体验。该基准测试现已可用,旨在帮助研究人员构建下一代能够真正以创造力和逻辑进行“剪辑”的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →