← 最新论文
💻 computer science

AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization

本文提出了 AR-CoPO 框架,通过引入分块级对齐机制与半在线策略训练,有效解决了流式自回归视频生成在强化学习对齐中的初始化敏感与轨迹探索难题,显著提升了生成质量、泛化能力及人类偏好对齐度。

原作者: Dailan He, Guanlin Feng, Xingtong Ge, Yi Zhang, Bingqi Ma, Guanglu Song, Yu Liu, Hongsheng Li

发布于 2026-03-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Dailan He, Guanlin Feng, Xingtong Ge, Yi Zhang, Bingqi Ma, Guanglu Song, Yu Liu, Hongsheng Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 AR-CoPO 的新方法,旨在让 AI 生成视频变得更聪明、更符合人类的喜好。为了让你轻松理解,我们可以把整个过程想象成**“教一个天才但有点固执的厨师做新菜”**。

1. 背景:那个“快但难教”的厨师

现在的 AI 视频生成模型(比如 Self-Forcing)就像一位**“快手厨师”**。

  • 优点:他做菜速度极快(低延迟),而且能像流水一样一段接一段地做(流式生成),非常适合实时应用。
  • 缺点:他太依赖“第一口汤”的味道了。一旦开始做,他几乎就是按部就班地执行,中间很难再插话或修改。
  • 问题:以前教这种厨师(用强化学习 RLHF),通常是用一种叫"SDE"的方法,相当于在厨师做菜的过程中,不断往锅里扔各种奇怪的调料(随机噪声),指望他尝出好坏。
    • 但是,对于这位“快手厨师”来说,中间扔调料根本没用!因为他的菜味主要取决于最开始的那勺汤(初始噪声)。中间乱加调料,不仅尝不出区别,反而把锅搞乱了,导致训练失败。

2. 核心创新:AR-CoPO 的“分叉路口”策略

AR-CoPO 发现,既然中间乱加调料没用,不如在关键的分叉路口做文章

想象一下,厨师做一部长视频,就像做一套**“分块套餐”**(比如前菜、主菜、甜点)。

  • 传统方法:试图在整个做菜过程中随机改变,结果因为厨师太固执,根本改不动。
  • AR-CoPO 的方法(分叉机制)
    1. 选定路口:随机选一个“分叉路口”(比如决定做第 3 块蛋糕的时候)。
    2. 制造平行宇宙:在这个路口,让厨师基于同一个基础,尝试12 种不同的初始手法(比如 12 种不同的撒糖方式),然后让他把剩下的菜做完。
    3. 打分:最后,让评委(奖励模型)给这 12 套完整的套餐打分。
    4. 只改路口:既然只有第 3 块蛋糕的撒糖方式不同,如果某套套餐得分高,我们就告诉厨师:“你第 3 块蛋糕的撒糖方式很棒,以后就照着这个做!”
    5. 精准打击:我们只调整第 3 块蛋糕的“撒糖逻辑”,而不需要重新做整桌菜。这样既省资源,又精准。

比喻:这就好比你在写小说,想改结局。传统方法是想在故事中间乱改,结果后面全崩了。AR-CoPO 是说:“咱们就在第 10 章那个关键选择点,让你选 12 种不同的写法,看哪种写法能让整本书结局最好,然后只优化第 10 章的写法。”

3. 两大绝招:既要“探索”也要“利用”

为了让厨师不仅会做,还能做得稳定且高质量,AR-CoPO 用了两套训练策略,就像**“学徒”和“大师”**的配合:

绝招一:在线探索(On-Policy)—— 让学徒去“试错”

  • 做法:让厨师(模型)自己不断尝试新的撒糖方式,看看能不能做出更惊艳的菜。
  • 作用:这能发现新的创意,提高人类喜欢的程度(比如更酷的动作、更有趣的画面)。
  • 风险:如果只靠这个,厨师可能会为了讨好评委而“走捷径”(比如为了画面好看,让动作变得像鬼打墙一样不连贯),这就是所谓的“奖励黑客”行为。

绝招二:半在线利用(Semi-On-Policy)—— 让大师“复习”

  • 做法:厨师手里有一份**“经典菜谱库”(参考回放缓冲区),里面都是以前做得很好的菜。我们不再让他瞎试,而是让他反复练习这些经典菜谱,但这次要挑出其中评分最高**的那几道,重点强化。
  • 作用:这能保证视频的基本质量(比如画面稳定、动作流畅),防止厨师为了追求新奇而把菜做砸了。
  • 比喻:就像让厨师在“创新大赛”(在线探索)和“经典复刻”(半在线利用)之间找平衡。

4. 最终成果:完美的“融合菜”

训练结束后,AR-CoPO 把“学徒的创新精神”和“大师的稳健风格”合并在一起(LoRA 合并)。

  • 结果:生成的视频既符合人类喜好(动作自然、画面美、听指挥),又没有牺牲质量(不会出现乱跳、画面崩坏的情况)。
  • 验证:实验证明,以前的方法(SDE-GRPO)在这种快手模型上完全失效(就像在流水线上乱加调料,毫无作用),而 AR-CoPO 让视频质量稳步提升。

总结

AR-CoPO 就像是一个聪明的教练,他不再盲目地让 AI 视频生成器在过程中乱试错,而是:

  1. 找准关键点(在视频生成的“分叉路口”进行对比);
  2. 精准反馈(只修改导致差异的那个关键点);
  3. 双管齐下(既鼓励创新,又守住质量底线)。

最终,它让那些原本很难调教的“快手”AI 视频模型,也能变得既听话又高质量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →