← 最新论文
🤖 machine learning

MonarchRT: Efficient Attention for Real-Time Video Generation

本文提出了 Monarch-RT,一种基于 Monarch 矩阵的结构化注意力参数化方法,通过结合高表达力与计算效率,在保持视频生成质量的同时实现了高达 95% 的注意力稀疏性,从而在单张 RTX 5090 上首次达成了 Self-Forcing 模型的 16 FPS 实时视频生成。

原作者: Krish Agarwal, Zhuoming Chen, Cheng Luo, Yongqi Chen, Haizhong Zheng, Xun Huang, Atri Rudra, Beidi Chen

发布于 2026-02-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Krish Agarwal, Zhuoming Chen, Cheng Luo, Yongqi Chen, Haizhong Zheng, Xun Huang, Atri Rudra, Beidi Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 MonarchRT 的新技术,它的目标是让 AI 能够实时生成高质量的视频(就像看直播一样快),同时还能保持画面清晰、逻辑连贯。

为了让你轻松理解,我们可以把 AI 生成视频的过程想象成指挥一个巨大的交响乐团,而这篇论文就是解决乐团“指挥太慢”问题的创新方案。

1. 核心难题:指挥太忙了(计算瓶颈)

想象一下,AI 生成视频时,需要让画面中的每一个像素点(比如一辆车的轮子、天空的一朵云)都去“看”其他所有的像素点,以决定自己下一秒该变成什么样子。

  • 传统做法(稠密注意力):就像指挥家必须和乐团里的每一个人都单独对话。如果乐团有 1000 人,指挥家就要说 100 万次话。这在生成长视频或实时视频时,速度慢到让人无法忍受,就像让一个人背着一座山跑步。
  • 之前的尝试(稀疏注意力):为了快,以前的方法让指挥家只跟“离得近的人”说话,或者只跟“看起来像的人”说话。
    • 问题:在实时视频生成中,这种“偷懒”行不通。因为视频是连续流动的,错误会像滚雪球一样越滚越大。而且,视频里的关系很复杂:既有按时间顺序的规律(比如车轮转动),又有跨越时空的语义联系(比如远处的云和近处的山虽然远,但属于同一个场景)。以前的“只跟邻居说话”的方法,要么漏掉了重要的远距离联系,要么把不相关的东西强行拉在一起,导致生成的视频画面扭曲、崩坏。

2. 核心发现:视频里的“节奏”和“故事”

作者发现,视频里的像素点关系其实由两部分组成:

  1. 有规律的“节拍”:就像音乐里的鼓点,时间上、空间上都有固定的周期性(比如帧与帧之间的连续变化)。
  2. 突发的“故事线”:比如画面里突然出现的一个人物,或者一个特定的物体,它需要和画面中其他不相关的部分建立联系。

以前的方法要么只关注“节拍”(太死板),要么只关注“故事”(太随机),无法同时处理好这两者。

3. MonarchRT 的解决方案:智能的“分块指挥法”

MonarchRT 提出了一种新的指挥策略,叫Monarch 参数化。我们可以把它想象成一种**“乐高积木式的分块指挥法”**:

  • 对齐的积木块(Block Alignment)
    以前的方法切分积木时,经常把“时间”和“空间”混在一起切,导致切出来的块里既有“昨天的云”又有“今天的车”,逻辑全乱了。
    MonarchRT 非常聪明,它知道视频是三维的(时间、高、宽)。它确保切分积木时,每一块都完整地包含时间、高度或宽度中的一个维度。这就像切蛋糕时,每一刀都顺着纹理切,保证了每一块蛋糕里的“味道”是纯正的。这样,指挥家就能轻松处理那些有规律的“节拍”。

  • ** tiled Monarch(瓷砖式分块)
    为了处理那些突发的“故事线”(比如远处的人和近处的车),MonarchRT 把大积木块进一步切成更小的“瓷砖”。
    这就好比指挥家手里有一张
    智能地图**。对于规律的部分,他看大地图;对于特殊的、突发的联系,他看小地图。这种“大地图 + 小地图”的组合,让他既能处理宏大的节奏,又能捕捉细微的语义联系,而且不需要像以前那样跟每个人单独对话。

  • 微调训练(Finetuning)
    以前用这种分块法,指挥家需要反复练习很多次才能找到最佳方案,太慢了。MonarchRT 通过预先训练,让指挥家只需要看一眼就能做出完美的决定。这就像让指挥家背熟了乐谱,上台直接就能演,省去了大量的排练时间。

4. 惊人的效果:从“慢动作”到“实时直播”

这项技术带来的改变是巨大的:

  • 速度飞跃:在最新的顶级显卡(如 RTX 5090)上,MonarchRT 比目前最先进的 FlashAttention 技术快了 1.4 倍到 11.8 倍
  • 实时生成:以前生成视频可能需要几分钟,现在用 MonarchRT,可以在单张显卡上以 16 帧/秒(FPS) 的速度实时生成视频。这意味着你可以像玩《我的世界》或《GTA》一样,输入指令,AI 就能实时生成一段流畅的视频,完全没有延迟。
  • 质量不降:即使把计算量减少了 95%(只保留了 5% 的“对话”),生成的视频质量依然和全量计算(100% 对话)一样好,甚至更好。

总结

MonarchRT 就像给 AI 视频生成装上了一套**“智能分块指挥系统”
它不再让 AI 盲目地跟所有像素点“死磕”,而是通过
聪明的切分策略**(对齐时空维度)和灵活的地图查看方式(瓷砖分块),既抓住了视频的节奏,又记住了视频的故事。

最终,它让 AI 视频生成从“慢吞吞的离线渲染”变成了“丝滑的实时直播”,让真正的实时视频生成成为可能。这就像是从“手摇电话”进化到了"5G 视频通话”,彻底改变了我们创造和消费视频内容的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →