SQuad: Sub-Quadratic Attention Distillation for Efficient Video Generation
SQuad 是一个亚二次方注意力蒸馏框架,它通过压缩预训练的视频扩散 Transformer 来实现 的复杂度,在显著降低计算成本和提升推理速度的同时,提供了二次方级别的视频生成质量。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
利用人工智能创造动态图像已成为现代计算领域最令人兴奋的前沿领域之一。这些被称为视频扩散模型的系统,其工作原理是从一团混乱的静态噪声开始,根据文本描述,逐帧将其逐渐细化为一个连贯的场景。要理解它们是如何实现这一点的,请想象一个由微小数字像素组成的巨大网格,其中每个像素都是一个携带颜色、形状和时间信息的令牌(token)。驱动这些模型的引擎是一种被称为“自注意力”(self-attention)的机制。这种机制允许视频中的每一个令牌都能观察其他所有令牌,以决定它们之间应如何相互关联。正是这种持续的、全方位的连接,赋予了视频逼真的质感,并确保了角色在第一秒的动作与他们在最后一秒的外观保持一致。然而,这种力量也伴随着高昂的代价。随着视频变得更长或更精细,系统必须计算的连接数量会呈爆炸式增长,使得过程变得极其缓慢且昂贵,通常将创作者限制在仅能生成几秒钟的片段。
高通 AI 研究院(Qualcomm AI Research)的研究人员开发了一种名为 SQuad 的新方法来解决这个问题,且无需牺牲视频质量。他们并没有试图简化复杂的连接,也没有用更廉价、更弱的替代方案来替换核心机制,而是找到了一种重新组织系统观察数据方式的方法。在标准方法中,每个令牌都必须向其他每个令牌进行检查,随着视频规模的增加,这一过程变得难以管理。研究团队意识到,在视频生成过程中,这些连接中的大多数实际上是非常微弱的;在任何给定时刻,只有一小部分关键的令牌真正需要彼此密切关注。基于这一观察,他们设计了一个两步走的流程。首先,系统将附近的令牌分组为小的窗口,并让它们在局部进行信息混合。然后,它进行第二次处理,让这些窗口在整个视频范围内进行通信。这种结构使模型能够保持对场景的全景视野,同时大幅减少所需的计算量。
将这种方法应用于名为 Wan 2.2 的大型视频生成模型所取得的结果是惊人的。研究人员通过一种称为“蒸馏”(distillation)的过程,教导一个强大的预训练模型使用这种新的、精简的注意力方法,即新系统学习模仿原始系统的行为。结果是,该模型生成的视频在视觉质量上与原始模型几乎完全相同,在严格的质量测试中得分也几乎一致,但成本却大幅降低。原始模型需要 100 步才能生成一段视频,而新版本仅需 6 步即可达到类似的效果。在速度方面,处理单步视频生成所需的时间从大约 47 毫秒降至仅 4 毫秒。完成这些步骤所需的计算能力下降了近 67 倍。
这种效率的提升不仅仅是理论上的改进,它直接转化为用户的体验。在针对标准高清视频生成任务的测试中,即使考虑到整个生成流水线,新方法生成的视频总耗时也仅为原始系统的一半左右。研究人员将他们的方法与其他加速视频生成的尝试进行了对比,其中一些尝试依赖于复杂的混合架构,这会为模型增加数百万个额外的参数。相比之下,SQuad 方法不需要额外的内存或专门的硬件,能够完美融入现有系统。用户研究证实,人们无法可靠地分辨出由原始沉重模型生成的视频与由新的高效版本生成的视频之间的区别。事实上,在面对面的对比中,很大一部分人类观众甚至更倾向于由新方法生成的视频。
这项工作的意义在于其平衡性。以往试图让这些模型变快的方法通常涉及用更简单的线性近似来替换强大的注意力机制,但这往往会导致视频质量出现明显的下降。SQuad 方法通过保持核心数学运算不变,而是改变其应用顺序,从而避开了这个陷阱。它证明了检查每个令牌与每个其他令牌之间关系的完整二次复杂度,对于实现高保真结果并非严格必要。通过仔细构建信息流,研究人员展示了以极小的计算成本生成长篇、高分辨率视频的可能性。这为在标准硬件上生成更长、更复杂的场景打开了大门,推动该领域向着实现无限、高质量视频内容的目标迈进,而不再受限于目前的时效和能源瓶颈。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。