← 最新论文
🤖 AI

Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models

本文通过引入视频理解奖励基准(VURB)、大规模视频理解偏好数据集(VUP-35K)以及最先进的判别式与生成式奖励模型(VideoDRM 和 VideoGRM),解决了视频理解奖励建模中缺乏稳健基准和高质量数据的问题,这些模型显著提升了性能与推理能力。

原作者: Yuancheng Wei, Linli Yao, Lei Li, Haojie Zhang, Hao Zhou, Fandong Meng, Xu Sun

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuancheng Wei, Linli Yao, Lei Li, Haojie Zhang, Hao Zhou, Fandong Meng, Xu Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是由一群 AI 机器人组成的球队的主教练。这些机器人正在学习观看视频并回答相关问题。有时,它们能答对但解释得很差;有时,它们答错了却表现得非常自信。

你的工作是担任裁判。你需要审视机器人给出的答案,并判断哪一个更好,以便球队能从错误中学习。本文讲述的是如何为视频任务构建一个更优秀的裁判。

以下是作者所构建内容的简要故事:

1. 问题:裁判们“视而不见”

作者发现,虽然 AI 在评判文本(如文章)和图像(如照片)方面已非常出色,但在评判视频方面却表现糟糕。

  • 旧测试存在缺陷:现有的测试就像只有 5 道题的随堂测验。它们涵盖的话题不够广泛,问题也太短。这就像试图通过观察某人系鞋带来评判一名马拉松选手的表现。
  • 数据缺失:要训练一名优秀的裁判,你需要成千上万个“好答案”与“坏答案”的示例。对于视频而言,这类数据几乎不存在,因为制作起来既困难又昂贵。
  • 结果:当前的 AI 裁判实际上是在猜测。它们的表现 barely 优于抛硬币(准确率仅为 50%)。它们无法区分真正理解视频的机器人与仅仅猜对选项字母的机器人。

2. 解决方案:建造更好的赛场与新规则

为了解决这个问题,团队构建了一个全新的系统,包含三个主要部分:

A. 新赛场:VURB(基准测试)

他们建立了一个大规模、高质量的测试场地,名为VURB

  • 规模:他们创建了2,100个复杂的视频挑战,而不是仅仅 5 道题。
  • 深度:他们不只是问“发生了什么?”,而是要求机器人逐步解释“为什么会发生”。这就像要求学生不仅要解出一道数学题,还要写出完整的思考过程。该测试中的答案非常长(平均超过 1,000 字),以迫使 AI 真正进行思考。
  • 公平性:为了防止 AI 通过仅选择它看到的第一个答案来作弊,他们采用了“多数投票”规则。他们让 AI 对同一段视频进行 8 次评判,每次交换答案的顺序。如果 AI 大多数时候都能选出正确的那个,它才算通过。

B. 新训练营:VUP-35K(数据集)

没有练习赛,你就无法训练裁判。由于没有人拥有足够的练习数据,他们制造了一台机器来生成这些数据。

  • 工厂:他们创建了一个完全自动化的流水线(无需人工参与),为视频生成了35,000对“好答案”与“坏答案”。
  • 技巧:为了确保“坏答案”确实很糟糕,他们有时会故意给视频添加一点“故障”(例如降低画质或移除帧),以此诱骗 AI 犯错。这创建了一个庞大的示例库,清晰地展示了 AI 在视频推理中是如何以及为何失败的。

C. 新裁判:VideoDRM 与 VideoGRM

利用新的训练数据,他们构建了两类新型裁判:

  1. VideoDRM(记分员):这位裁判审视两个答案,并给它们打分(例如 9.8 分对 2.9 分),以决定哪个更好。
  2. VideoGRM(解说员):这位裁判不仅选出胜者,还会详细解释为什么一个答案更好,就像体育分析师拆解比赛动作一样。

3. 结果:新裁判获胜

当他们让新裁判接受测试时:

  • 旧裁判:表现最好的现有 AI 模型得分约为55-60%。它们 barely 优于随机猜测。
  • 新裁判:他们的新模型(VideoDRM 和 VideoGRM)跃升至63-64%
  • 对比:在这些特定的视频任务上,他们的新模型甚至击败了最昂贵、闭源的商用 AI 模型(如最新版本的 GPT 或 Gemini)。

4. "N 选优”的超能力

该论文还表明,这些新裁判能帮助 AI 球队在实际比赛中变得更聪明。

  • 想象一下,AI 机器人被问到一个难题。它不再只给出一个答案,而是生成8 个不同的可能答案
  • 新裁判审视所有 8 个答案,选出最好的一个,机器人便将其作为最终答案提交。
  • 结果:这个简单的技巧显著提高了 AI 的准确率,证明了拥有一位优秀的裁判与拥有一名聪明的选手同样重要。

总结

简而言之,作者表示:“我们无法很好地评判视频 AI,因为我们缺乏好的测试和足够的练习数据。”因此,他们构建了一个巨大的新测试、一个制造练习数据的工厂,以及两个新的 AI 裁判。这些裁判如今在观看视频并判断哪些答案合理方面,是世界顶尖的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →