← 最新论文
💻 computer science

Towards Holistic Modeling for Video Frame Interpolation with Auto-regressive Diffusion Transformers

本文提出了一种名为 LDF-VFI 的基于自回归扩散 Transformer 的全局视频帧插值框架,通过引入跳连采样策略、稀疏局部注意力机制及分块 VAE 编码,有效解决了传统方法的时间不一致性问题,实现了长序列、高分辨率下的高质量视频插值。

原作者: Xinyu Peng, Han Li, Yuyang Huang, Ziyang Zheng, Yaoming Wang, Xin Chen, Wenrui Dai, Chenglin Li, Junni Zou, Hongkai Xiong

发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinyu Peng, Han Li, Yuyang Huang, Ziyang Zheng, Yaoming Wang, Xin Chen, Wenrui Dai, Chenglin Li, Junni Zou, Hongkai Xiong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 LDF-VFI 的新技术,它能让视频“插帧”(即在两帧画面之间生成中间帧,让视频变流畅)的效果变得前所未有的自然和连贯。

为了让你更容易理解,我们可以把视频插帧想象成**“补全一本被撕掉几页的漫画书”**。

1. 以前的做法:像“拼凑碎片”的笨办法

现状(Frame-centric):
以前的视频插帧方法,就像是一个只盯着**“三张图”**看的修补匠。

  • 做法: 给你第 1 张和第 3 张图,它只负责画出第 2 张图。然后给你第 2 张和第 4 张,它再画第 3 张。
  • 问题: 这个修补匠每次只关注眼前这一小段,完全不管第 2 张图和第 3 张图连起来是否顺畅。
  • 后果: 就像你拼凑漫画,虽然每一页单独看都还行,但翻起来时,人物的动作会突然“抽搐”、变形,或者背景突然跳动。这就是论文里说的**“时间不一致”“运动伪影”**。

2. 我们的新做法:像“导演”一样统筹全局

LDF-VFI 的核心理念(Video-centric):
作者认为,要补全漫画,不能只看局部,得让**“导演”**(AI 模型)一次性看完整个故事片段,然后一气呵成地画出所有缺失的页面。

核心创新一:自动续写,但防止“记错” (Auto-regressive + Skip-Concatenate)

  • 挑战: 如果视频特别长(比如几分钟),AI 没法一次性全画出来,内存会爆。所以它只能一段一段地画(分块处理)。
  • 老问题(误差累积): 如果 AI 画完第一段,把第一段的结果作为第二段的基础,第二段画完再作为第三段的基础……就像**“传话游戏”**。传到最后,第 100 段可能已经和第 1 段完全不一样了,动作会严重走样。
  • 我们的妙招(Skip-Concatenate):
    • 想象你在写长篇小说。如果你每写一章都只参考上一章,写到最后可能会跑题。
    • 我们的方法是:每隔几章,强制“重置”一下。我们不看刚才写的那一章(哪怕它有点小瑕疵),而是直接参考**最初的大纲(原始输入视频)**来重新起头写这一章。
    • 写完这一章后,再把它和前面的内容无缝拼接起来。
    • 效果: 这样既保证了长视频能一直写下去,又防止了错误像滚雪球一样越滚越大,让整部小说(视频)从头到尾动作流畅、逻辑通顺。

核心创新二:像“切披萨”一样处理高清视频 (Sparse Attention & Tiled VAE)

  • 挑战: 现在的视频动不动就是 4K 甚至 8K 分辨率。如果要把整个 4K 视频的所有像素都塞进 AI 脑子里,就像试图把整个太平洋的水装进一个水杯,根本装不下,计算量也太大。
  • 我们的妙招:
    • 切披萨(Tiled): 我们不把整张 4K 大图一次性塞进去,而是把它切成很多小块(像切披萨一样),一块一块地处理。
    • 只关注邻居(Sparse Attention): AI 在画某一块时,只需要看它周围的邻居(局部注意力),不需要看全宇宙。
    • 效果: 这样即使视频再大、分辨率再高(比如 4K),AI 也能轻松处理,而且不需要重新训练就能直接上手。

核心创新三:给 AI 配个“高清参考图” (Conditional VAE Decoder)

  • 挑战: AI 在生成画面时,容易把细节弄模糊,就像画素描时把人物的五官画糊了。
  • 我们的妙招: 我们给 AI 的“画笔”(解码器)配了一个**“高清参考图”**(原始的低帧率视频)。
    • 在绘画过程中,AI 会不断偷看这张参考图,确保画出来的每一笔都符合原始场景的细节。
    • 效果: 生成的画面不仅动作连贯,而且清晰锐利,没有那种朦胧的“雾感”。

3. 总结:这技术有多牛?

  • 以前: 补帧后的视频,看久了会觉得人物在“跳舞”(动作不连贯),或者画面有鬼影。
  • 现在 (LDF-VFI):
    • 动作更自然: 即使是快速挥动的翅膀、奔跑的人腿,也能补得丝滑流畅。
    • 超长视频无压力: 无论视频多长,动作都不会“跑偏”。
    • 超高清支持: 直接支持 4K 甚至更高清的视频,不需要把视频压缩得面目全非。

一句话总结:
这项技术就像是从**“拼凑碎片”进化到了“全局导演”**,它不仅能补全视频,还能保证整部片子从头到尾动作连贯、细节清晰,让慢动作视频看起来像真的一样流畅。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →