Accelerating Video Inverse Problem Solvers with Autoregressive Diffusion Models
原作者: Taesung Kwon, Jonghyun Park, Hyungjin Chung, Jong Chul Ye
原作者: Taesung Kwon, Jonghyun Park, Hyungjin Chung, Jong Chul Ye
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:利用自回归扩散模型加速视频逆问题求解器
问题陈述
视频逆问题旨在从退化测量值 y(例如低分辨率、掩码或模糊)中重建干净视频 x,其定义为 y=A(x)+n。尽管扩散和流基模型已成为这些任务的强大零样本先验,但其实时部署目前受到两个关键低效因素的阻碍:
- 高初始延迟:现有的基于扩散模型的视频逆问题求解器(DVIS)通常整体恢复视频,同时采样整个序列。因此,直到整个视频恢复完毕,第一帧才能显示,从而造成等于总恢复时间的延迟瓶颈。
- 低吞吐量:现代视频扩散模型通常在变分自编码器(VAE)的潜在空间中运行。为了强制测量一致性,当前的求解器在恢复过程中需要多次 VAE 传递(编码和解码),将吞吐量限制在低于 1 FPS。
方法论
作者提出了自回归视频逆问题求解器(AVIS)及其加速变体AVIS Flash,它们利用自回归(AR)视频扩散模型来解决这些瓶颈。
核心框架:AVIS
与处理整个视频的非自回归求解器不同,AVIS 以流式方式恢复视频,按顺序生成视频块。这种架构自然地消除了初始延迟瓶颈。为了解决吞吐量问题以及扩散模型固有的速度缓慢问题,AVIS 引入了测量一致性初始化:
- 初始化:AVIS 不是从纯高斯噪声开始反向扩散,而是首先使用多步优化算法(共轭梯度法)最小化目标 ∥y−A(x)∥2,在像素空间中计算出一个粗略的、测量一致的估计值 xinit。
- 加速采样:该估计值被编码到潜在空间并扩散到中间时间步 t0。随后,反向扩散过程从 t0 而非 t=1 开始,显著减少了所需的采样步数。
- 迭代引导:对于每个视频块,AVIS 使用分解扩散采样(DDS)框架在每次去噪步骤中强制测量一致性。这涉及解码潜在估计值、求解一个与测量值对齐的邻近优化问题,然后重新编码,整个过程无需昂贵的雅可比矩阵计算。
加速变体:AVIS Flash
为了进一步提高效率,AVIS Flash修改了引导策略:
- 单块引导:它仅在第一个视频块上强制测量一致性(通过多次 VAE 传递)。
- 自回归传播:随后的块(n≥2)仅通过从修正前缀的自回归传播(使用 KV 缓存)生成,绕过显式的测量引导。
- 理论依据:作者提供了误差分解分析(命题 1),表明最终误差受初始误差(通过初始化缓解)和从前序块传播的上下文误差的限制。他们观察到,上下文误差表现为加性扰动而非乘性放大器,使得系统能够在无需持续引导的情况下保持保真度。
- 长视频稳定性:对于非常长的序列,该框架可以定期重新注入测量一致性(例如每 N 个块),以防止时间漂移。
主要贡献
- AVIS 框架:研究了自回归视频扩散模型在零样本视频恢复中的应用。AVIS 通过用测量一致的估计值初始化反向扩散过程来加速恢复,在保持每个块一致性的同时减少了采样步数。
- AVIS Flash:一种高度加速的变体,仅在第一个块上强制测量一致性。这种方法在保持竞争力的性能的同时,大幅提高了吞吐量,提供了有利的效率 - 性能权衡。
- 性能提升:论文表明,与领先的非自回归求解器相比,这些方法极大地降低了初始延迟并提高了吞吐量,为实时部署铺平了道路。
实验结果
该方法在 100 个高分辨率视频上进行了评估,涵盖五个逆问题:超分辨率(4×)、随机修复(50% 掩码)、高斯去模糊、时间平均和时空平均。
- 效率:
- 延迟:AVIS 将初始延迟从 114 秒(LVTINO)降低至 4 秒。
- 吞吐量:AVIS 将吞吐量从 0.71 FPS 提升至 1.18 FPS。AVIS Flash 在单块 RTX 4090 GPU 上实现了 5.91 FPS(在 H100 上为 10.2 FPS),相比基线实现了 8 倍至 12 倍的加速。
- 恢复质量:
- 与 DiffIR2VR-Zero、VISION-XL 和 LVTINO 等基线相比,AVIS 在保真度指标(PSNR、SSIM、LPIPS、FVD)和感知指标(VBench)上取得了更优或极具竞争力的结果。
- AVIS Flash 保持了竞争力的性能,与 AVIS 相比仅在特定指标上有轻微下降,但在速度上提供了显著改进。
- 消融研究:
- 移除自回归 KV 缓存会降低性能,证实了上下文传播的价值。
- 从纯噪声开始反向过程(无初始化)会导致漂移;测量一致性初始化对于保真度至关重要。
- 发现起始时间 t0=0.1 和 K=2 的采样步数在速度和质量之间提供了最佳平衡。
意义与主张
论文声称,AVIS 和 AVIS Flash 为基于扩散的视频逆问题求解器的实际实时部署奠定了坚实基础。通过利用自回归生成和一种新颖的初始化策略,该框架弥合了扩散模型的高质量生成先验与现实应用严格的延迟/吞吐量要求之间的差距。
作者指出,虽然这些方法显著推进了最先进水平,但它们仍依赖多次 VAE 传递来进行初始像素空间引导。未来的工作可以探索直接在潜在空间中强制测量一致性,以进一步加速该过程。此外,从退化输入中恢复高保真视频的能力引发了关于错误信息传播和敏感数据重建的伦理考量,作者承认这是需要考虑的更广泛影响。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。