DiTango: Cost-Effective Parallel Diffusion Generation with Selective Attention State Reuse
DiTango 是一个具有成本效益的并行扩散框架,它通过利用上下文分区的异构性来策略性地重用注意力状态,从而加速多节点 DiT 生成,在保持生成质量的同时实现了高达 3.2 倍的加速及近乎线性的扩展。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下这样一个世界:计算机不仅能构思出静态图像,还能构思出完整的电影——那些流动的、高清晰度的、长达数分钟的故事。这就是“扩散 Transformer”(Diffusion Transformers)的魔力,这是一种通过逐步构建图像和视频,将静态噪声缓慢转化为清晰、美丽场景的人工智能。你可以把它想象成一位雕塑家在从大理石块中凿去多余的部分;人工智能从一团混乱的像素云开始,经过多次精炼,最终呈现出一个完美的视频。
然而,这里有一个问题:这些数字雕塑家极其缓慢。在强大的计算机上,制作一段仅五秒钟的视频可能需要一个多小时。为了提高速度,工程师们通常尝试让许多台计算机协同工作,将长视频序列分成若干块,像接力赛一样分发出去。但问题在于,当这些计算机试图共享它们的工作成果时,会陷入交通拥堵。等待数据来回传递的时间往往抵消了增加工人所带来的速度提升。这造成了一个令人沮丧的瓶颈:增加更多的计算机并不会让视频生成得更快,有时甚至会让它变得更慢。
DiTango 应运而生,这是一个旨在解决这种“交通拥堵”的新系统。研究人员发现了一个迷人的现象,即这些人工智能模型如何“关注”视频的不同部分。他们发现,视频中的所有部分在每一时刻的重要性并不相等。就像你会专注地注视着正对你说话的人,而几乎不会注意到三间房外的人一样,人工智能对邻近部分的注意力最强,而对远处部分的注意力则非常微弱。
DiTango 利用这一洞察力,玩了一场聪明的“跳过与重用”游戏。它不再强迫每台计算机不断地从其他每台计算机那里获取并计算每一个数据碎片(这会导致交通拥堵),而是通过其智能规划器来决定哪些部分必须重新计算,以及哪些部分因为太不重要,计算机可以直接使用几秒钟前的旧缓存结果。这就像一群在大型厨房里工作的厨师:他们意识到,对于远端餐桌上的装饰点缀,手边现有的调料罐已经“足够好”了,不需要每次都跑去储藏室拿新鲜的。
通过这种选择性的处理方式,DiTango 大幅减少了计算机之间相互通信的时间。在针对强大视频模型的测试中,这种方法使端到端的生成过程速度提升了近两倍,并且在 32 台计算机协同工作时,将核心“注意力”计算的速度提高了三倍以上。至关重要的是,研究人员发现这种加速并没有破坏视频的质量;生成的电影与使用较慢的传统方法生成的视频一样清晰且连贯。DiTango 证明了,通过理解人工智能真正需要观察的地方,我们可以停止它在那些它几乎察觉不到的事物上浪费能量,从而让瞬间生成高质量 AI 视频的梦想离现实又近了一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。