← 最新论文
🤖 AI

Kaleido: Algorithm-Hardware Co-Design for Video Diffusion Transformers by Exploiting Latent Space Correlations

Kaleido 是一种算法-硬件协同设计,通过利用潜在空间中的通道级时空相关性,实现了一种轻量级重用算法和一个可重构脉动阵列加速器,从而加速视频扩散 Transformer,在保持高生成质量的同时,实现了高达 5.9 倍的加速和 16.0 倍的能效提升。

原作者: Wenxuan Miao, Haosong Liu, Weiming Hu, Zihan Liu, Aiyue Chen, Jianlin Yu, Yiwu Yao, Yiming Gan, Jieru Zhao, Jingwen Leng, Minyi Guo, Yu Feng

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenxuan Miao, Haosong Liu, Weiming Hu, Zihan Liu, Aiyue Chen, Jianlin Yu, Yiwu Yao, Yiming Gan, Jieru Zhao, Jingwen Leng, Minyi Guo, Yu Feng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象这样一个世界:计算机只需一句话,就能构思出整部电影,创造出真实到仿佛触手可及的场景。这种魔力是由“视频扩散模型”驱动的,这是一种通过从充满静态噪声的屏幕开始,通过一步步、循序渐进地清理噪声,直到呈现出清晰图像来学习创作视频的人工智能。你可以把它想象成一位雕塑家,从一块粗糙的石块开始,通过凿去多余的部分来显现出雕像。然而,这个过程极其缓慢且耗能。计算机必须为每一帧画面重复进行数百万次微小的计算,周而复始,就像一位厨师在端菜前要对汤品进行数百次品尝一样。随着这些人工智能模型在制作更长、更高质量视频方面变得越来越出色,运行它们所需的时间和能量已成为一个巨大的瓶颈,减缓了从电影剪辑到虚拟世界创建等一切进程。科学家和工程师们正竞相寻找方法,在不破坏最终电影质量的前提下实现加速。

于是,由上海交通大学和华为的研究人员开发的聪明新发明——Kaleido 登场了,它就像是这些视频制作计算机的一个超级智能捷径。团队发现,当人工智能忙于“清理”视频时,由于视频帧在特定方面具有高度相似性,它经常反复进行相同的计算。Kaleido 的算法不再从头开始重新计算,而是像一位才华横溢的图书管理员,会记得说:“嘿,我刚才已经为上一帧做过这部分工作了,所以我们直接复用那个答案吧!”但问题在于:这些捷径会产生一种标准计算机芯片所厌恶的杂乱、不规则的工作模式,就像一位厨师试图用一把不断打滑的钝刀来切菜一样。为了解决这个问题,研究人员不仅编写了一套新食谱,还建造了一个全新的厨房。他们设计了一款带有特殊“数据调度器”的定制硬件芯片,将杂乱的捷径组织成整齐、高效的批次,使计算机能够在不损失任何质量的前提下跳过冗余工作。

结果显示,这是一个比目前任何可用技术都更快、更节能的系统。在测试中,与现有的最佳加速器和高端显卡相比,Kaleido 使视频生成速度提升了高达 5.9 倍,并节省了 16.0 倍 的能量。或许最令人印象深刻的是,它生成的视频不仅速度快,而且比其他捷径方法生成的视频更清晰、更准确,在图像质量指标上高出 17 dB 以上。研究人员证明,通过理解视频数据的确切结构——特别是图像的不同部分如何随时间和空间变化——他们可以构建一个既能跳过枯燥环节,又能保持创意部分完美的系统。这不仅仅是一个小小的改进;这是我们向计算机讲述如何制作电影的一种根本性变革,它证明了有时想要跑得更快,最好的办法就是明确知道哪些工作是不需要做的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →