Timeripple: Accelerating vDiTs by Understanding the Spatio-Temporal Correlations in Latent Space
该论文介绍了 Timeripple,这是一种轻量级且具有自适应性的策略,它通过利用潜在空间中固有的时空相关性来复用注意力分数,从而加速视频扩散 Transformer,在对视频质量影响微乎其微的情况下,实现了 85% 的计算成本降低。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人一帧一帧地绘制一部电影。这不仅仅是在画一张静态图,而是在创造一个完整的故事,其中每一帧都依赖于前后的帧。在人工智能的世界里,这项工作是由一种被称为“视频扩散 Transformer”的特殊大脑完成的。你可以把它想象成一位超级聪明的艺术家,它从一团混乱的静态噪声(就像电视雪花一样)开始,一步步将其清理干净,直到出现一段清晰的视频。为了做到这一点,艺术家必须观察图像中的每一个点,并询问:“这个点与整个视频中的其他所有点有什么关系?”这个过程被称为“自注意力”(self-attention)。这种方式非常彻底,但也像是在要求一名图书管理员检查图书馆里的每一本书,并将它们与每一本进行对比以寻找联系——这既耗时又耗能。
因为这些制作视频的机器人对计算能力有着极高的渴求,所以它们运行起来既慢又贵。科学家们一直试图让它们变得更快,通常是借鉴文本生成 AI(比如那些写故事的 AI)的技巧。这些技巧通常涉及忽略掉那些看起来不重要的部分,有点像一个学生在略读教科书,并希望自己不会错过精华部分。但问题在于:电影并不像书籍。电影有一种独特的节奏,即事物在空间(从左到右)和时间(帧与帧之间)上的运动。大问题是:我们能否通过理解这种节奏,而不是盲目地跳过工作,来让这些视频机器人变得更快?
这正是开发 TIMERIPPLE 的研究人员想要探索的。他们深入研究了这些视频 AI 模型究竟是如何思考的。他们并没有仅仅猜测哪些部分的计算是无聊的,而是发现了一个隐藏的模式:AI 的大脑中充满了“回声”。因为视频中的物体在相邻帧之间不会发生瞬间变化,而且由于汽车的轮子在屏幕各处看起来都很相似,所以 AI 为视频某一部分所做的数学运算,往往与它为相邻部分所做的运算几乎完全相同。
团队意识到,AI 正在做大量的重复检查工作。它计算了两个相似帧之间的关系,然后又为下一对帧做了完全相同的计算,尽管答案几乎是一样的。为了解决这个问题,他们发明了一种聪明的“重用”策略。想象一下你在做一份很长的数学作业。如果你注意到第 5 题的答案与第 6 题完全一样,一个聪明的学生不会从头开始重新解第 6 题,而是会直接写下已经找到的答案。TIMERIPPLE 正是这样做的。它会检查视频特定部分的“数学运算”是否与它刚刚计算过的部分相似。如果是,它就会跳过繁重的计算工作,直接重用旧的结果。
该论文认为,简单地复制用于文本 AI 的“略读”技巧在视频领域效果并不理想,因为这会忽略掉这些特定的时空回声。通过专注于这些相关性,TIMERIPPLE 能够跳过大量的计算工作。在针对四种流行视频模型的测试中,这种方法使 AI 节省了高达 85% 的自注意力计算量。最棒的部分是?它生成的视频看起来并不会模糊或破碎。事实上,其质量与缓慢的原始版本几乎完全一致,质量得分的损失不到 0.06%。
研究人员还发现,这种“跳过”操作的最佳时机取决于你在电影制作过程中所处的阶段。在过程初期,当视频还只是一团模糊的云雾时,AI 需要非常谨慎。但随着视频变得越来越清晰,AI 可以更安全地重用越来越多的先前工作。通过在每一步调整重用程度,TIMERIPPLE 在某些情况下成功让视频生成速度提升了 2.7 倍,且没有牺牲最终结果的神奇效果。这提醒了我们,有时解决问题的最快方法并不是更努力地工作,而是意识到你已经做过这些工作了。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。