← 最新论文
💻 computer science

FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring

本文介绍了 FreqForcing,这是一个无需训练的框架,它通过采用频谱自锚定(Spectral Self-Anchoring)来稳定低频分量并保留高频运动,从而缓解自回归长视频生成中的误差累积,进而使基于短视频预训练的模型能够实现高质量的两分钟视频合成。

原作者: Jiatong Li, Leo Liang, Linghe Kong, Yulun Zhang

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiatong Li, Leo Liang, Linghe Kong, Yulun Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象这样一个世界:你只需输入一句话,就能亲眼看到一部电影在眼前逐帧展开。这就是“自回归视频生成”(autoregressive video generation)的梦想——这是人工智能领域的一个前沿角落,在这里,计算机不仅能预测故事中的下一个词,还能预测电影中的下一张图像。为了实现这一点,AI 就像一个观察自己画出的最后几张图片来决定下一步该画什么的讲故事的人。这有点像一场用图像进行的“传声筒”游戏:计算机获取前一帧,加入一点新的细节,然后将其传递下去。问题在于?如果计算机在第一张图片上犯了一个微小的错误,这个错误就会被传递到第二张、第三张,以此类推。在漫长的电影中,这些微小的错误会像滚下山坡的雪球一样不断堆积,最终将一段美丽的场景变成一片模糊、色彩漂移的混乱景象。科学家们一直试图修复这种“误差累积”(error accumulation)问题,以便我们能够生成长久且稳定的视频,而不至于让画面崩塌。

这篇题为《FreqForcing》的论文通过一个不同的视角——声音波——来解决这个难题。作者意识到,当这些 AI 电影开始出错时,这不仅仅是视觉上的小故障;它是图像“频率”的变化,就像一首歌可能会跑调一样。他们发现,以往修复此问题的尝试(例如在记忆中保留几个“锚点”帧以提醒 AI)虽然有所帮助,但并不能完全阻止这种漂移。该团队提出了一种名为“谱向自锚定”(Spectral Self-Anchoring)的新技巧。可以把它想象成 AI 的双脑系统:一部分大脑专注于快速、激烈的细节(如角色快速的动作),而另一部分则紧紧抓住视频开头的稳定、低频“锚点”,以防止颜色和布局发生漂移。通过将这两个信号混合在一起,他们成功阻止了视频的崩溃。这种方法无需从头开始重新训练 AI,就成功地将一个原本只能生成 5 秒短片的模型扩展到了能够生成稳定的两分钟视频——长度增加了 24 倍——且没有出现视觉质量下降的问题。

问题所在:视频的“传声筒”游戏

想象你正在和朋友玩一场“传声筒”游戏,但你们不是在低声传递句子,而是在画画。你画了一只猫,传给你的朋友,他加了一个尾巴,再传回给你。如果你的朋友不小心把尾巴画歪了一点,而你试图修正它却把它画得稍微大了一点,下一个人又把它画得更大,很快你就得到了一只巨大的、扭曲的怪物,而不是一只可爱的猫。这正是自回归视频生成中所发生的情况。AI 一次生成一段视频,利用前一段来预测下一段。随着视频变长,颜色、形状和运动中的微小误差会不断累积。结果是什么?视频开始“漂移”。颜色可能从蓝色变成紫色,角色可能停止移动,或者整个场景可能消解成静电噪声。

发现:聆听视频的“嗡鸣声”

这篇论文的作者决定不通过观察图像,而是通过“聆听”图像来研究这种漂移。他们使用了一种被称为傅里叶变换(Fourier Transform)的数学工具,这就像是声音或图像的棱镜。正如棱镜将白光分解成彩虹一样,这个工具将图像分解成不同的“频率”:

  • 高频 像是锐利、清晰的细节:蜡烛的闪烁、毛发的质感或快速的手挥动。
  • 低频 像是深沉的低音:房间的整体形状、总体的色调以及场景的大致布局。

当他们分析那些失败的视频时,发现了一个奇怪的模式。随着视频生成的进行,图像中低频部分的“能量”开始发生漂移。这就像歌曲中的深沉低音正慢慢改变音高,导致整个视频失去了稳定性。高频细节(运动)也变得抖动,但根本原因在于这种低频漂移。

旧的修复方案:“锚点”不够强壮

在此之前,研究人员尝试通过使用一种叫做“注意力汇聚”(attention sink)的技术来修复这个问题。想象你在背诵一个长故事。如果你只记得最后几句话,你可能会忘记开头。 “注意力汇聚”就像是在讲述剩余故事时,将故事最初的几句话永久地留在脑海中。在视频术语中,AI 会保留最初几帧完美的帧并在记忆中保持对它们的关注。

作者测试了这一点,发现它确实有所帮助。这就像拥有了一个更强的锚:视频漂移的速度变慢了。然而,这并不是完美的解决方案。即使有了锚点,低频能量仍会随着时间的推移缓慢漂移,视频质量最终仍会受损。锚点虽然在那里,但它的拉力不足以阻挡水流。

新的解决方案:FreqForcing 与谱向自锚定

团队意识到他们需要一种更聪明的方式来使用那个锚点。他们提出了一个名为 FreqForcing 的新框架,其中使用了他们命名为**谱向自锚定(Spectral Self-Anchoring, SSA)**的技术。

它是如何工作的,我们可以用一个创意类比:
想象 AI 是一位正在创作巨幅壁画的画家。

  1. 局部画家(高频): 一位画家专注于眼前的动作。他们描绘快速的运动、闪烁的光影和小细节。他们擅长捕捉“当下”,但可能会因为过于投入而忽略了大局。
  2. 锚定画家(低频): 第二位画家是一位大师,他只注视着壁画最初那份完美的草图。他不画新的细节,只是守护着图像稳定的、低频的“灵魂”——即颜色、布局和角色的身份。
  3. 混合: 为了不让“局部画家”脱缰,AI 会将局部画家的作品与锚定画家稳定的低频信号进行温柔的混合。这就像一位 DJ 将充满活力的现场音乐与稳定的深沉低音线混合在一起,以确保舞池不会陷入混乱。

这种“混合”发生在频率域中。AI 获取当前帧中的快速运动部分和来自“锚点”帧的稳定低频部分,并将它们融合在一起。这阻止了颜色的漂移并保持了布局的稳定,同时仍允许视频自然地运动和变化。

结果:从 5 秒到 2 分钟

团队在原本只能生成 5 秒视频片段的模型上测试了这种新方法。如果没有他们的修复,如果你尝试让它生成更长的内容,模型就会崩溃。通过使用 FreqForcing,他们能够将生成长度扩展到 两分钟。这实现了 24 倍 的长度增长!

他们将自己的方法与包括需要昂贵重训 AI 的顶尖技术进行了对比。结果显示,FreqForcing 生成的视频更加连贯,运动效果更好,且视觉瑕疵更少。它成功地让视频看起来像一部连贯的电影,而不是一场融化的梦境。

为什么这很重要

这是一个重大突破,因为它提供了一种无需花费数月时间重新训练 AI 模型(这极其昂贵且耗能)即可创建长篇、高质量视频的方法。通过仅仅改变 AI “思考”其历史的方式——使用基于频率的锚点——他们解锁了生成更长内容的能力。这表明,我们并不一定需要更大、更复杂的模型来解决这些问题;有时,我们只需要更仔细地聆听数据的“音乐”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →