← 最新论文
💻 computer science

VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning

本文提出了 VR-Thinker 框架,通过引入“带图思考”机制(如帧选择与可配置视觉记忆窗口)及强化微调流程,解决了现有视频奖励模型因上下文限制导致的细节丢失与幻觉问题,从而在长视频偏好基准测试中实现了开源模型的最优性能。

原作者: Qunzhong Wang, Jie Liu, Jiajun Liang, Yilei Jiang, Yuanxing Zhang, Yaozhi Zheng, Xintao Wang, Pengfei Wan, Xiangyu Yue, Jiaheng Liu

发布于 2026-03-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Qunzhong Wang, Jie Liu, Jiajun Liang, Yilei Jiang, Yuanxing Zhang, Yaozhi Zheng, Xintao Wang, Pengfei Wan, Xiangyu Yue, Jiaheng Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 VR-Thinker 的新系统,它的核心任务是给 AI 生成的视频“打分”和“挑刺”

想象一下,你是一位电影评论家,但你的工作不是看一部完整的电影,而是看 AI 根据一句话(提示词)生成的短视频。现在的 AI 视频生成技术很火,但生成的视频质量参差不齐,有的甚至很荒谬。我们需要一个“裁判”来告诉 AI 哪个视频更好,以便 AI 能自我进化。

以前的裁判(现有的奖励模型)有两个大毛病:

  1. 记性不好,看得太粗略:视频太长,裁判的“眼睛”(显存/上下文窗口)装不下所有画面,只能像看缩略图一样,随机挑几帧看。结果就是,很多精彩的细节(比如手指的动作、光影的变化)被漏掉了。
  2. 容易“幻觉”和“遗忘”:裁判把所有画面都塞进脑子里,然后开始写评论。写着写着,它忘了刚才看到的细节,或者开始瞎编(幻觉),因为它没法在写评论的过程中重新去“看”那些画面。

VR-Thinker 是怎么解决这些问题的呢?

它引入了一个叫做 “带着图像思考” (Thinking-with-Image) 的新模式。我们可以用三个生动的比喻来理解它:

1. 从“一次性看完”变成“侦探式查案”

  • 旧模式:像是一个走马观花的游客。导游(AI)把视频快速闪过,游客只记住了大概,然后就要写游记。如果游客没看清某个细节,他就只能瞎编,或者干脆忽略。
  • VR-Thinker 模式:像是一个福尔摩斯式的侦探
    • 侦探先快速浏览现场(初始几帧视频)。
    • 如果发现线索不足(比如“那个人的手指动作看起来有点怪,但我没看清”),他不会瞎猜
    • 他会主动要求:“请调取第 12 秒到第 20 秒的高清画面,我要放大看细节!”
    • 拿到新画面后,他更新自己的判断,继续推理。
    • 核心能力:它有一个**“可调节的视觉记忆窗口”**。就像侦探的记事本,他不需要把整个案发现场(所有视频帧)都背下来,而是只保留最新、最重要的线索。如果发现了新证据,他就把旧证据“擦掉”,换上新证据,这样他的脑子(显存)永远够用,但又能看清所有关键细节。

2. 它的“特训”过程(三步走)

为了让这个“侦探”变得超级聪明,作者设计了三个阶段的特训:

  • 第一阶段:冷启动(Cold Start)—— 教规矩
    • 就像教一个刚入职的实习生。先用精心挑选的“标准答案”教它:遇到看不清的地方要怎么说?怎么调用工具去查画面?怎么把观察到的细节用语言总结出来(比如把 1000 个像素点压缩成一句“手指动作流畅”)。
  • 第二阶段:拒绝采样微调(Rejection Sampling Fine-Tuning)—— 去伪存真
    • 让实习生做大量的练习题。做完后,只保留那些每一步推理都正确、最终结论也正确的作业。把那些推理过程乱七八糟、或者结论蒙对但过程错误的作业全部扔掉(拒绝)。
    • 用这些高质量的“完美作业”反复训练,让它养成严谨的逻辑习惯。
  • 第三阶段:强化学习(GRPO)—— 实战演练
    • 这是最高级的训练。让侦探在实战中不断尝试。如果它通过“主动查画面”发现了关键证据并修正了判断,就给它大奖励;如果它偷懒只用文字瞎猜,或者查了画面却没发现新东西,就给它小惩罚
    • 特别的是,它鼓励侦探多维度思考:不仅要看“整体好不好”,还要分别看“画面美不美”、“动作顺不顺”、“跟提示词像不像”。

3. 效果如何?

经过这套“侦探特训”后,VR-Thinker 的表现令人惊艳:

  • 看得更准:在处理长视频时,它的准确率远超其他模型。因为它能主动去“看”那些被忽略的细节,而不是靠猜。
  • 更可靠:它不会轻易被视频里的假象迷惑,因为它会反复验证。
  • 效率更高:虽然它看起来步骤多(查画面、总结、再查),但因为它的“记事本”(记忆窗口)设计得很聪明,它实际上比那些试图一次性吞下所有画面的笨重模型更节省资源,跑得更快。

总结

VR-Thinker 就像是一个拥有“上帝视角”且懂得“主动求证”的超级影评人

以前的 AI 裁判是“盲人摸象”,摸到哪儿说到哪儿;而 VR-Thinker 是“拿着放大镜的侦探”,哪里看不清就去哪里看,看清楚了再下结论。这让 AI 生成的视频能接受更严格、更真实的反馈,从而进化出更高质量的作品。

一句话概括:它让 AI 裁判学会了“不懂就问,看不清就查”,不再瞎编乱造,从而成为了视频生成领域最靠谱的“质检员”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →