← 最新论文
💻 computer science

Self Gradient Forcing: Native Long Video Extrapolation

本文提出了自梯度强制(Self Gradient Forcing, SGF),这是一种两阶段训练策略,通过使未来的损失能够监督早期生成的潜变量如何被编码进因果记忆,从而弥合了自回归视频扩散中的历史上下文梯度差距,进而显著提升了在主体身份、一致性和时间稳定性方面的原生长视频外推能力。

原作者: Junhao Zhuang, Shiyi Zhang, Yuxuan Bian, Yaowei Li, Yawen Luo, Yijun Liu, Weiyang Jin, Songchun Zhang, Xianglong He, Xuying Zhang, Haoran Li, Haoyang Huang, Zeyue Xue, Nan Duan

发布于 2026-07-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Junhao Zhuang, Shiyi Zhang, Yuxuan Bian, Yaowei Li, Yawen Luo, Yijun Liu, Weiyang Jin, Songchun Zhang, Xianglong He, Xuying Zhang, Haoran Li, Haoyang Huang, Zeyue Xue, Nan Duan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人一帧一帧地绘制电影场景。这个机器人是一位艺术家,它观察自己刚刚画出的画面,添加一点新的细节,然后画出下一个瞬间。这就是现代 AI 视频生成器的工作方式:它们通过将微小的、自我生成的步骤串联起来,构建出长篇故事。但这里有一个棘手的问题。当机器人在学习时,它通常是通过观察完美的人类制作视频来进行练习的(就像老师展示正确答案一样)。然而,当它真正制作电影时,它必须依赖于自己之前画出的那些不完美的草图。这种不匹配就像是用节拍器练习钢琴,却在没有节拍器的环境下进行音乐会;机器人会感到困惑,开始产生幻觉,忘记了角色是谁,或者背景在哪里。

为了解决这个问题,科学家们开发了一种叫做“自我强迫”(Self Forcing)的方法,让机器人通过观察自己凌乱的画作而不是完美的画作来进行练习。这有助于它习惯自己的错误。但这种练习中隐藏着一个缺陷:虽然机器人学会了如何“阅读”它过去的画作来创作新的画作,但它并没有学会如何最初将那些旧画作“写入”它的记忆中。这就像一个学生学会了如何阅读历史书,却从未学会如何把笔记写进书里。随着电影变得越来越长,笔记变得混乱不堪,故事也随之崩塌。机器人会忘记主角的面孔,背景会随机变化,镜头也会前后跳跃。

这就是一个新概念——**自我梯度强迫(Self Gradient Forcing, SGF)*登场的地方。这项论文背后的研究人员意识到,要让长视频真正具有连贯性,机器人不仅需要学会如何“阅读”过去,还需要学会如何将过去“写入”一种有用的记忆格式。他们提出了一个巧妙的两步训练技巧。首先,机器人像在现实生活中一样正常生成一段视频,但不保存任何来自该过程的“学习笔记”(梯度)。然后,在第二步中,机器人会对这段凌乱的视频进行快照处理,并以一种特殊的方式对其进行重新处理,这种方式允许*它学习如何为未来写下更好的笔记。这就像是机器人先写一个草稿,把它扔掉,然后立即根据那个草稿编写一份“学习指南”,以教会自己下次如何更好地记忆事物。

结果令人印象深刻。使用这种方法,AI 可以利用仅有的 5 秒素材,成功将其扩展到 60 秒甚至 240 秒(4 分钟),而不会让角色变成怪物或让场景消融成混沌。在测试中,使用 SGF 制作的视频在保持主体身份、背景布局和相机运动方面,比之前的方法要稳定得多。研究人员发现,虽然旧方法最终会变得混乱并产生偏差,但 SGF 保持了故事的连贯性,这证明了教会 AI 如何“书写自己的历史”是制作长篇、逼真电影的秘诀。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →