← 最新论文
💻 computer science

Learning Spatiotemporal Sensitivity in Video LLMs via Counterfactual Reinforcement Learning

本文提出了反事实关系策略优化(CRPO),这是一种双分支强化学习框架,它利用反事实视频变换和基于关系的奖励来训练视频大语言模型,使其在避免依赖静态捷径的同时发展出真正的时空敏感性。

原作者: Dazhao Du, Jian Liu, Jialong Qin, Tao Han, Bohai Gu, Fangqi Zhu, Yujia Zhang, Eric Liu, Xi Chen, Song Guo

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Dazhao Du, Jian Liu, Jialong Qin, Tao Han, Bohai Gu, Fangqi Zhu, Yujia Zhang, Eric Liu, Xi Chen, Song Guo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教导一位非常聪明的学生(一个视频 AI)如何观看电影并回答相关问题。目前,这位学生在考试中能取得高分,但他们在作弊。他们并没有真正观看整部电影并追踪事物的运动,而是走捷径。他们可能只看单帧画面,根据问题的措辞进行猜测,或者依赖其训练数据中认为“应该”发生的情况。

例如,如果你问:“球是向左还是向右移动?”这位学生可能会每次都猜“向右”,因为这是一个常见答案,或者因为他们在另一段视频中看到过球向右移动。他们实际上并没有追踪球的运动。

这篇论文的作者 CRPO 意识到,标准的训练方法实际上会加剧这种作弊行为。如果学生仅仅因为猜对了答案(即使是通过作弊)就获得“做得好”的奖励,他们就会继续作弊。

解决方案:“如果……会怎样?”游戏

为了解决这个问题,研究人员引入了一种基于反事实(Counterfactuals,即“如果……会怎样?”的 fancy 说法)的新训练游戏。

游戏是这样进行的:

  1. 设置:你向学生展示一段视频并提出一个问题。
  2. 转折:在学生回答之前,老师会秘密地以特定方式修改视频:
    • 镜像技巧:他们将视频水平翻转(就像照镜子一样)。如果球原本向左移动,现在看起来就像向右移动。
    • 倒带技巧:他们将视频倒放。如果一朵花原本在绽放,现在看起来就像在闭合。
  3. 测试:学生必须为修改后的视频回答相同的问题。

游戏的黄金法则

  • 如果问题涉及运动(例如:“球往哪个方向走?”),当视频被翻转或倒放时,学生必须改变他们的答案。如果他们对原视频回答“右”,对镜像视频也回答“右”,他们就失败了。他们需要对镜像视频回答“左”。
  • 如果问题涉及静态事实(例如:“球是什么颜色的?”),学生必须保持答案不变。如果原视频中球是红色的,在镜像视频中它仍然是红色的。

“双分支”教练

研究人员建立了一位特殊的教练(称为 CRPO),它同时监视学生在两个屏幕上进行这个游戏:

  • 屏幕 A:原始视频。
  • 屏幕 B:“如果……会怎样”视频(翻转或倒放)。

教练不仅检查答案是对是错,还检查两个答案之间的关系

  • 学生是否在他们应该改变答案时改变了答案?(做得好!)
  • 学生是否在他们应该保持答案不变时保持了答案不变?(做得好!)

如果学生试图通过给两个屏幕提供相同的答案来作弊(走捷径),教练会给予惩罚。这迫使学生真正观看视频,并理解事物如何随时间运动和变化。

新测试:DyBench

为了证明他们的学生不再作弊,研究人员创建了一个名为 DyBench 的新测试。

  • 他们不再只问一个问题,而是问一对问题:一个针对原始视频,另一个针对“如果……会怎样”视频。
  • 要通过测试,学生必须同时答对这两个答案。
  • 这是一条严格的规则。如果学生只是对所有问题都猜“蓝色”,他们可能碰巧答对其中一个,但当视频发生变化时,由于无法同时答对两个,他们会在这一对中失败。

结果

当他们在强大的 AI 模型(Qwen3-VL)上测试这种新方法时:

  • AI 在理解运动、方向和事件顺序方面变得更好。
  • 它不再依赖懒惰的捷径。
  • 它没有失去回答一般问题的能力;它只是变得更聪明地如何观看视频。

简而言之:这篇论文通过迫使视频 AI 玩“如果……会怎样”游戏,要求它证明自己理解世界如何变化,而不仅仅是世界看起来像什么,从而教会视频 AI 停止猜测,开始观看。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →