← 最新论文
💻 computer science

Relax Forcing: Relaxed KV-Memory for Consistent Long Video Generation

本文针对自回归视频扩散在生成长视频时面临的渐进式退化问题,提出了一种名为"Relax Forcing"的机制,通过将时序记忆解耦为全局稳定、短期连续和动态结构引导三个功能角色,在降低注意力开销的同时显著提升了长视频生成的运动动态与时间一致性。

原作者: Zengqun Zhao, Yanzuo Lu, Ziquan Liu, Jifei Song, Jiankang Deng, Ioannis Patras

发布于 2026-03-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Zengqun Zhao, Yanzuo Lu, Ziquan Liu, Jifei Song, Jiankang Deng, Ioannis Patras

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种名为 "Relax Forcing"(放松强制) 的新方法,旨在解决 AI 生成超长视频(比如长达 1 分钟甚至更久)时的一个核心难题:随着时间推移,视频会变得越来越奇怪、变形,或者动作变得僵硬重复。

为了让你轻松理解,我们可以把生成视频的过程想象成**“让一个画家连续画一小时的连环画”**。

1. 核心问题:为什么现在的 AI 画不出长视频?

想象一下,你让一个画家(AI 模型)根据你的一句话(提示词)画一个故事。

  • 前几秒(短视频): 画家画得很完美,宇航员在月球上跑,猫在街上跳。
  • 几分钟后(长视频): 问题出现了。
    • 方法 A(传统做法): 画家只盯着上一张刚画好的图来画下一张。结果就是,画着画着,宇航员的脸变了,或者猫突然长出了翅膀(时间漂移/变形)。
    • 方法 B(旧改进): 画家把之前画过的所有图都堆在面前参考。结果就是,画家被这么多图吓傻了,不敢动笔,画出来的猫一直在原地踏步,或者动作像机器人一样僵硬(动作受限/重复)。

论文发现: 问题的关键不在于画家“记性”不够好(存多少张图),而在于他怎么使用这些参考图。把过去所有的图都堆在一起,反而会让画家“顾此失彼”。

2. 解决方案:Relax Forcing(放松强制)

作者给画家设计了一套**“聪明的参考图管理策略”**,把过去的参考图分成了三类,每类只取最有用的部分:

🌟 角色一:Anchor(锚点/Sink)—— “定海神针”

  • 作用: 就像船上的
  • 比喻: 无论故事怎么发展,画家必须时不时看一眼最开始的那几张图,确保主角(比如宇航员)长得还是一样的,场景(月球)没有变。
  • 目的: 防止主角“变脸”或场景“崩塌”,保证身份一致性

🚀 角色二:Tail(尾巴)—— “最近的朋友”

  • 作用: 就像你刚刚画完的那几笔。
  • 比喻: 画家需要看一眼上一秒的动作,确保猫跳起来的姿势是连贯的,不会突然瞬移。
  • 目的: 保证动作流畅自然,不生硬。

🔍 角色三:History(历史/中间层)—— “精选的回忆”

  • 作用: 这是最聪明的部分。画家看所有中间的图,而是像翻相册一样,只挑几张最有代表性的中间画面。
  • 比喻: 假设要画猫跑了一分钟,画家不需要看第 10 秒、第 11 秒、第 12 秒……的图。他只需要挑出第 20 秒(猫刚起跑)、第 40 秒(猫跳得最高)这几张关键帧。
  • 目的: 既保留了动作的变化感(让猫跑起来有动感),又避免了因为参考太多相似画面而导致的动作重复

3. 这个方法的妙处在哪里?

以前的方法像是**“死记硬背”**,把过去所有的信息都硬塞进脑子,结果脑子乱了,动作就僵了。

Relax Forcing 像是**“灵活应变”**:

  1. 少即是多: 它只保留最有用的几张图(锚点 + 关键回忆 + 最近动作),把那些重复、没用的废图扔掉。
  2. 动态选择: 它不是死板地按顺序看图,而是根据当前画什么,动态地去“回忆”过去哪张图最有用。
  3. 结果:
    • 更稳: 宇航员还是那个宇航员,不会变成外星人。
    • 更活: 动作不再像机器人,而是有起有伏,充满活力。
    • 更快: 因为参考的图少了,画家(AI)算得更快,生成视频的速度也提升了。

4. 总结

这就好比你在写一部长篇小说:

  • 旧方法是每写一章,就把前 100 章的内容全部重读一遍,结果越写越乱,主角性格都变了。
  • Relax Forcing 是:
    • 偶尔翻翻第一章(锚点),记住主角是谁;
    • 看看刚写完的上一段(尾巴),保证剧情连贯;
    • 从中间挑几个关键情节(精选历史)来参考,确保故事有起伏。

通过这种**“结构化、稀疏化”**的记忆管理,AI 终于能稳定地生成长达 1 分钟甚至更久的精彩视频,既不会“变脸”,也不会“卡壳”。这就是这篇论文的核心贡献。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →