Token Radius Attention for Efficient Video Generation
Token Radius Attention (TRA) 是一个无需训练的框架,它通过将查询熵动态映射到与 Token 相关的注意力半径,从而高效地加速视频扩散 Transformer,在仅保留 9-19% 注意力交互的情况下,实现了显著的加速并保持极小的质量损失。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在一面长达数英里的墙上画一幅巨大的、动态的壁画。为了让画面看起来真实,你需要观察到目前为止所画出的每一笔,并决定它如何与你正在画的这一笔相连。在人工智能的世界里,这正是“视频扩散 Transformer”(Video Diffusion Transformers)所做的事情。它们是凭空创造出惊艳视频的数字艺术家,但为了让视频看起来流畅且逼真,计算机必须检查整个视频中的每一个像素与其它所有像素之间的关系。这就像是在一个体育场里,你站在原地却要与每一位观众握手;这种做法非常彻底,但需要耗费巨大的时间和精力。科学家们称之为“密集注意力”(dense attention),这也是为什么制作高质量 AI 视频目前如此缓慢且昂贵的原因。研究人员提出的重大问题是:我们能否让 AI 变得更聪明,让它知道该和“谁”握手,从而跳过那些无聊的部分,只专注于重要的连接,而不破坏画面的质量?
本文介绍了一种名为**令牌半径注意力(Token Radius Attention, TRA)**的巧妙新策略来解决这个问题。作者发现,与其对视频的每个部分都一视同仁,不如意识到视频的不同部分实际上需要不同程度的注意力。把这想象成一场派对:有些宾客正沉浸在严肃的交谈中,只需要听身边人的说话(低注意力);而另一些人则在疯狂起舞,需要时刻留意整个房间的情况(高注意力)。研究人员发现,他们可以通过测量每个部分当前关注点的“困惑度”或“分散程度”,来精确预测该部分视频需要多少“注意力”。他们将这种测量指标称为“熵”(entropy)。
利用这一洞察,团队构建了一个像“智能半径守卫”一样的系统。对于视频中的每一个微小部分(称为“令牌/token”),系统都会计算出一个定制大小的圆圈。如果这个部分表现得专注且平静,圆圈就会很小,AI 只会观察其紧邻的邻居;如果这个部分显得混乱或复杂,圆圈就会变大,以包含更多的邻居。这个过程是自动完成的,无需 AI 停下来对每一种可能性进行排序,从而节省了大量时间。结果显示,该视频生成器仅保留了原始连接的 9% 到 19%,但运行速度提高了 1.56 到 2.05 倍,且生成的视频效果与那些缓慢、沉重的版本一样出色。作者在几种不同的视频生成模型上进行了测试,发现它表现得非常稳定且出色,这证明了你并不需要检查所有事物才能获得伟大的结果——你只需要检查正确的事物。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。