Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models
本文通过引入视频理解奖励基准(VURB)、大规模视频理解偏好数据集(VUP-35K)以及最先进的判别式与生成式奖励模型(VideoDRM 和 VideoGRM),解决了视频理解奖励建模中缺乏稳健基准和高质量数据的问题,这些模型显著提升了性能与推理能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是由一群 AI 机器人组成的球队的主教练。这些机器人正在学习观看视频并回答相关问题。有时,它们能答对但解释得很差;有时,它们答错了却表现得非常自信。
你的工作是担任裁判。你需要审视机器人给出的答案,并判断哪一个更好,以便球队能从错误中学习。本文讲述的是如何为视频任务构建一个更优秀的裁判。
以下是作者所构建内容的简要故事:
1. 问题:裁判们“视而不见”
作者发现,虽然 AI 在评判文本(如文章)和图像(如照片)方面已非常出色,但在评判视频方面却表现糟糕。
- 旧测试存在缺陷:现有的测试就像只有 5 道题的随堂测验。它们涵盖的话题不够广泛,问题也太短。这就像试图通过观察某人系鞋带来评判一名马拉松选手的表现。
- 数据缺失:要训练一名优秀的裁判,你需要成千上万个“好答案”与“坏答案”的示例。对于视频而言,这类数据几乎不存在,因为制作起来既困难又昂贵。
- 结果:当前的 AI 裁判实际上是在猜测。它们的表现 barely 优于抛硬币(准确率仅为 50%)。它们无法区分真正理解视频的机器人与仅仅猜对选项字母的机器人。
2. 解决方案:建造更好的赛场与新规则
为了解决这个问题,团队构建了一个全新的系统,包含三个主要部分:
A. 新赛场:VURB(基准测试)
他们建立了一个大规模、高质量的测试场地,名为VURB。
- 规模:他们创建了2,100个复杂的视频挑战,而不是仅仅 5 道题。
- 深度:他们不只是问“发生了什么?”,而是要求机器人逐步解释“为什么会发生”。这就像要求学生不仅要解出一道数学题,还要写出完整的思考过程。该测试中的答案非常长(平均超过 1,000 字),以迫使 AI 真正进行思考。
- 公平性:为了防止 AI 通过仅选择它看到的第一个答案来作弊,他们采用了“多数投票”规则。他们让 AI 对同一段视频进行 8 次评判,每次交换答案的顺序。如果 AI 大多数时候都能选出正确的那个,它才算通过。
B. 新训练营:VUP-35K(数据集)
没有练习赛,你就无法训练裁判。由于没有人拥有足够的练习数据,他们制造了一台机器来生成这些数据。
- 工厂:他们创建了一个完全自动化的流水线(无需人工参与),为视频生成了35,000对“好答案”与“坏答案”。
- 技巧:为了确保“坏答案”确实很糟糕,他们有时会故意给视频添加一点“故障”(例如降低画质或移除帧),以此诱骗 AI 犯错。这创建了一个庞大的示例库,清晰地展示了 AI 在视频推理中是如何以及为何失败的。
C. 新裁判:VideoDRM 与 VideoGRM
利用新的训练数据,他们构建了两类新型裁判:
- VideoDRM(记分员):这位裁判审视两个答案,并给它们打分(例如 9.8 分对 2.9 分),以决定哪个更好。
- VideoGRM(解说员):这位裁判不仅选出胜者,还会详细解释为什么一个答案更好,就像体育分析师拆解比赛动作一样。
3. 结果:新裁判获胜
当他们让新裁判接受测试时:
- 旧裁判:表现最好的现有 AI 模型得分约为55-60%。它们 barely 优于随机猜测。
- 新裁判:他们的新模型(VideoDRM 和 VideoGRM)跃升至63-64%。
- 对比:在这些特定的视频任务上,他们的新模型甚至击败了最昂贵、闭源的商用 AI 模型(如最新版本的 GPT 或 Gemini)。
4. "N 选优”的超能力
该论文还表明,这些新裁判能帮助 AI 球队在实际比赛中变得更聪明。
- 想象一下,AI 机器人被问到一个难题。它不再只给出一个答案,而是生成8 个不同的可能答案。
- 新裁判审视所有 8 个答案,选出最好的一个,机器人便将其作为最终答案提交。
- 结果:这个简单的技巧显著提高了 AI 的准确率,证明了拥有一位优秀的裁判与拥有一名聪明的选手同样重要。
总结
简而言之,作者表示:“我们无法很好地评判视频 AI,因为我们缺乏好的测试和足够的练习数据。”因此,他们构建了一个巨大的新测试、一个制造练习数据的工厂,以及两个新的 AI 裁判。这些裁判如今在观看视频并判断哪些答案合理方面,是世界顶尖的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。