这篇论文提出了一种名为 "Relax Forcing"(放松强制) 的新方法,旨在解决 AI 生成超长视频(比如长达 1 分钟甚至更久)时的一个核心难题:随着时间推移,视频会变得越来越奇怪、变形,或者动作变得僵硬重复。
为了让你轻松理解,我们可以把生成视频的过程想象成**“让一个画家连续画一小时的连环画”**。
1. 核心问题:为什么现在的 AI 画不出长视频?
想象一下,你让一个画家(AI 模型)根据你的一句话(提示词)画一个故事。
- 前几秒(短视频): 画家画得很完美,宇航员在月球上跑,猫在街上跳。
- 几分钟后(长视频): 问题出现了。
- 方法 A(传统做法): 画家只盯着上一张刚画好的图来画下一张。结果就是,画着画着,宇航员的脸变了,或者猫突然长出了翅膀(时间漂移/变形)。
- 方法 B(旧改进): 画家把之前画过的所有图都堆在面前参考。结果就是,画家被这么多图吓傻了,不敢动笔,画出来的猫一直在原地踏步,或者动作像机器人一样僵硬(动作受限/重复)。
论文发现: 问题的关键不在于画家“记性”不够好(存多少张图),而在于他怎么使用这些参考图。把过去所有的图都堆在一起,反而会让画家“顾此失彼”。
2. 解决方案:Relax Forcing(放松强制)
作者给画家设计了一套**“聪明的参考图管理策略”**,把过去的参考图分成了三类,每类只取最有用的部分:
🌟 角色一:Anchor(锚点/Sink)—— “定海神针”
- 作用: 就像船上的锚。
- 比喻: 无论故事怎么发展,画家必须时不时看一眼最开始的那几张图,确保主角(比如宇航员)长得还是一样的,场景(月球)没有变。
- 目的: 防止主角“变脸”或场景“崩塌”,保证身份一致性。
🚀 角色二:Tail(尾巴)—— “最近的朋友”
- 作用: 就像你刚刚画完的那几笔。
- 比喻: 画家需要看一眼上一秒的动作,确保猫跳起来的姿势是连贯的,不会突然瞬移。
- 目的: 保证动作流畅自然,不生硬。
🔍 角色三:History(历史/中间层)—— “精选的回忆”
- 作用: 这是最聪明的部分。画家不看所有中间的图,而是像翻相册一样,只挑几张最有代表性的中间画面。
- 比喻: 假设要画猫跑了一分钟,画家不需要看第 10 秒、第 11 秒、第 12 秒……的图。他只需要挑出第 20 秒(猫刚起跑)、第 40 秒(猫跳得最高)这几张关键帧。
- 目的: 既保留了动作的变化感(让猫跑起来有动感),又避免了因为参考太多相似画面而导致的动作重复。
3. 这个方法的妙处在哪里?
以前的方法像是**“死记硬背”**,把过去所有的信息都硬塞进脑子,结果脑子乱了,动作就僵了。
Relax Forcing 像是**“灵活应变”**:
- 少即是多: 它只保留最有用的几张图(锚点 + 关键回忆 + 最近动作),把那些重复、没用的废图扔掉。
- 动态选择: 它不是死板地按顺序看图,而是根据当前画什么,动态地去“回忆”过去哪张图最有用。
- 结果:
- 更稳: 宇航员还是那个宇航员,不会变成外星人。
- 更活: 动作不再像机器人,而是有起有伏,充满活力。
- 更快: 因为参考的图少了,画家(AI)算得更快,生成视频的速度也提升了。
4. 总结
这就好比你在写一部长篇小说:
- 旧方法是每写一章,就把前 100 章的内容全部重读一遍,结果越写越乱,主角性格都变了。
- Relax Forcing 是:
- 偶尔翻翻第一章(锚点),记住主角是谁;
- 看看刚写完的上一段(尾巴),保证剧情连贯;
- 从中间挑几个关键情节(精选历史)来参考,确保故事有起伏。
通过这种**“结构化、稀疏化”**的记忆管理,AI 终于能稳定地生成长达 1 分钟甚至更久的精彩视频,既不会“变脸”,也不会“卡壳”。这就是这篇论文的核心贡献。
这篇论文提出了一种名为 Relax Forcing(松弛强制)的新方法,旨在解决自回归(Autoregressive, AR)视频扩散模型在生成长视频(分钟级)时面临的时间漂移(Temporal Drift)和视觉退化问题。
以下是该论文的详细技术总结:
1. 研究背景与问题 (Problem)
- 背景:自回归视频扩散模型通过因果生成(Causal Synthesis)和 KV 缓存机制,成为生成长视频(如交互式、流媒体应用)的可行方案。现有的训练策略(如 Self Forcing)通过让模型在训练时基于自身预测进行条件生成,缓解了训练 - 推理不匹配(Exposure Bias)的问题。
- 核心痛点:尽管训练策略有所改进,但在推理阶段将生成扩展到分钟级时,模型仍面临严重的渐进式时间退化。
- 误差累积:模型反复基于自身生成的(有噪声的)帧进行条件生成,导致残差误差随时间累积。
- 现有方法的局限:
- Self Forcing (基线):随着生成时间延长,出现严重的时间漂移和视觉质量下降。
- Attention Sink:虽然能稳定早期帧,但限制了运动的多样性。
- Rolling Forcing:改善了短期连贯性,但长期模式仍不一致。
- 关键发现:作者通过实证分析发现,限制长视频生成的主要瓶颈并非记忆容量不足,而是推理过程中如何使用时序记忆。简单地增加历史帧数量(密集记忆)不仅不能提升质量,反而会因为冗余信息引入而限制运动动态,甚至导致生成崩溃。
2. 方法论:Relax Forcing (Methodology)
作者提出了一种结构化的稀疏时序记忆机制,称为 Relaxed KV Memory。其核心思想是将时序上下文分解为三个具有不同功能角色的部分,而不是将其视为同质的历史缓冲区。
2.1 记忆分解 (Memory Decomposition)
在生成步骤 i,历史帧被划分为三个部分:
- Sink (全局锚点):
- 角色:提供长期的全局稳定性和身份一致性(Identity Preservation)。
- 实现:固定保留最初的几帧(如 2 帧),作为全局参考,防止场景和主体发生漂移。
- Tail (近期上下文):
- 角色:确保短期的时间连贯性(Short-term Continuity)。
- 实现:保留最近生成的几帧(如 1 帧),保证动作的平滑过渡。
- History (动态选择的中程结构):
- 角色:提供中程的运动结构指导(Structural Motion Guidance),平衡稳定性与运动演化。
- 实现:这是该方法的核心创新。不保留所有中间帧,而是从候选区域(通常是中间区域的后半部分)中动态选择最具信息量的帧。
2.2 松弛评分与选择机制 (Relaxation Scoring & Selection)
为了从候选历史帧中选择最合适的帧,作者设计了一个基于**松弛(Relaxation)**的评分机制,旨在平衡“全局稳定性”与“局部冗余”:
- 原型计算:计算 Sink 和 Tail 的 Key 原型(Prototype),以及每个候选历史帧 h 的 Key 原型 K~h。
- 评分公式:
r(h)=S(h)−λR(h)
- S(h)=K~h⊤K~S:候选帧与 Sink 的相似度(越高越稳定)。
- R(h)=K~h⊤K~Ti:候选帧与 Tail 的相似度(越高越冗余)。
- λ:权衡系数,控制稳定性与冗余抑制之间的平衡。
- 选择策略:根据 r(h) 得分进行 Top-K 排序,选择得分最高的帧作为 History 部分。这确保了选中的帧既与全局锚点一致,又与近期上下文保持足够的差异(避免重复和运动僵化)。
2.3 混合位置编码 (Hybrid Positional Indexing)
由于选出的记忆帧在时间上是不连续的(Non-contiguous),标准的滑动窗口 RoPE(旋转位置编码)重置策略不再适用。作者提出了一种混合方案:
- Tail:使用绝对帧索引,保持其在时间轴上的真实位置。
- Sink & History:使用相对索引,紧接在 Tail 之前进行锚定。
- 效果:这种设计既保留了长程锚点和中程结构,又避免了将它们错误地映射为与最新帧相邻,从而在保持全局一致性的同时允许运动演化。
3. 关键贡献 (Key Contributions)
- 系统性分析:首次系统性地研究了时序记忆在 AR 视频扩散长视频外推中的作用,揭示了“密集历史条件”是限制运动演化的关键瓶颈,并证明了记忆的位置(Placement)比单纯的数量(Quantity)更重要。
- Relaxed KV Memory 机制:提出了一种无需额外训练(Training-Free)的稀疏记忆机制。通过将记忆分解为 Sink、Tail 和动态选择的 History,实现了结构化条件生成。
- 性能提升:在 VBench-Long 基准测试中,该方法显著提升了长视频生成的运动动态和整体时间一致性,同时降低了注意力计算的开销。
4. 实验结果 (Results)
实验在 VBench-Long 基准上进行,对比了 Self Forcing、Deep Forcing、Rolling Forcing 等 SOTA 方法。
- 定量指标:
- 60 秒生成:Relax Forcing 取得了 80.88% 的平均分,优于 Deep Forcing (79.64%)。
- 运动动态 (Dynamic Degree):这是提升最显著的指标,达到 66.49%(相比基线 Self Forcing 的 31.98% 有巨大飞跃,比 Deep Forcing 的 57.19% 高出近 10 个百分点)。这表明该方法有效解决了运动僵化和重复的问题。
- 一致性:主体一致性(Subject Consistency)和背景一致性(Background Consistency)保持在高水平,未因稀疏记忆而牺牲视觉稳定性。
- 效率提升:
- 由于减少了参与自注意力计算的 Token 数量(从 21 帧减少到 7 帧),Flash Attention 耗时减少了 2.64 倍,端到端生成速度提升了 1.26 倍。
- 人类评估:
- 在视觉质量、运动质量和文本 - 视频对齐度上,用户偏好率最高(平均 53.8%),特别是在运动质量(MQ)上优势明显(65.4%)。
5. 意义与影响 (Significance)
- 范式转变:该工作表明,长视频生成的瓶颈不在于“存更多”,而在于“存什么”和“怎么用”。它推动了从“容量导向”的记忆管理向“功能导向”的结构化记忆管理转变。
- 无需训练:作为一种推理时的优化策略,Relax Forcing 可以直接应用于现有的自回归视频模型,无需重新训练,具有极高的实用价值。
- 可扩展性:通过减少注意力计算量,该方法为生成更长(如小时级)的视频提供了可扩展的解决方案,同时保持了生成的连贯性和动态丰富性。
总结:Relax Forcing 通过解构时序记忆的功能角色,利用动态选择机制在“全局稳定”与“运动演化”之间找到了最佳平衡点,显著解决了自回归视频扩散模型在长视频生成中的时间漂移和运动僵化问题,是目前该领域的一项突破性进展。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。