← 最新论文
💬 NLP

WorldCache: Content-Aware Caching for Accelerated Video World Models

该论文提出了 WorldCache,一种无需重训练即可通过感知约束动态缓存机制(如运动自适应阈值、漂移估计及特征融合)来加速视频世界模型推理的方法,在 Cosmos-Predict2.5-2B 模型上实现了 2.3 倍推理加速且保持了 99.4% 的基线质量。

原作者: Umair Nawaz, Ahmed Heakl, Ufaq Khan, Abdelrahman Shaker, Salman Khan, Fahad Shahbaz Khan

发布于 2026-03-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Umair Nawaz, Ahmed Heakl, Ufaq Khan, Abdelrahman Shaker, Salman Khan, Fahad Shahbaz Khan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 WorldCache 的新技术,它的目标是让 AI 生成视频(特别是“世界模型”,即能预测未来的 AI)变得更快、更流畅,同时还不糊

为了让你轻松理解,我们可以把 AI 生成视频的过程想象成一位极其严谨的画家在画一幅动态的长卷画

1. 现在的痛点:画家太“较真”了

想象一下,这位画家(AI)要画一段 10 秒钟的赛车视频。

  • 传统做法:画家非常勤奋,每一帧画面(比如每秒 30 帧,一共 300 帧)都要从头到尾重新画一遍。哪怕上一帧和这一帧只有车轮转了一点点,背景里的树完全没动,画家也坚持要把整张画重新画一遍。
  • 结果:画得确实很精细,但太慢了!等你画完,黄花菜都凉了,根本没法实时互动。

2. 以前的尝试:偷懒的“复印机”

为了解决慢的问题,以前的方法(比如 FasterCache 或 DiCache)想出了一个主意:

  • 思路:既然背景没变,我就把上一帧的背景直接复印下来,贴到这一帧上,只重新画一下动得快的车轮。
  • 问题:这种“复印”太生硬了(论文里叫“零阶保持”)。
    • 如果车在转弯,背景里的树虽然没动,但视角变了,直接复印会导致树的位置“飘”在错误的地方。
    • 如果人走过,直接复印上一帧的人,就会在画面里留下一个半透明的鬼影(Ghosting),或者让动作变得像果冻一样抖动。
    • 比喻:就像你开车时,把上一秒的路况直接“复印”在挡风玻璃上,结果你发现前面的车明明已经转弯了,玻璃上却还印着它直行的样子,这会导致严重的视觉错乱。

3. WorldCache 的解决方案:聪明的“老练助手”

WorldCache 不是简单的复印机,它给画家配了一个聪明的老练助手。这个助手懂得什么时候该偷懒,什么时候该认真画,以及怎么偷懒才不露馅

它做了四件聪明的事:

A. 感知运动(CFC):别在赛车时偷懒

  • 以前:不管画面怎么动,只要变化小就偷懒。
  • WorldCache:助手会看“速度”。如果赛车在飞驰(运动剧烈),助手会立刻说:“不行!现在不能偷懒,必须重画,否则鬼影会出来!”如果车停在红绿灯前(静止),助手就说:“好,背景可以复印。”
  • 比喻:就像开车,高速公路上不能看后视镜发呆(必须专注),但在等红灯时可以看看手机(可以复用信息)。

B. 关注重点(SWD):别盯着天空看

  • 以前:助手看整张画的变化。如果天空动了一点点,它就觉得“变化很大”,于是决定不偷懒。
  • WorldCache:助手知道人眼最关心什么。它发现:天空动一点点没关系,但人、手、车动一点点就很关键。所以,它只盯着这些“重要角色”看。如果只有云在飘,它放心大胆地偷懒;如果人抬了手,它立刻停止偷懒。
  • 比喻:就像看魔术表演,如果魔术师的手在动,你必须全神贯注;如果旁边的观众在动,你可以稍微分心。

C. 聪明的“修补”(OFA):不是死板复印,而是“对齐”

  • 以前:直接把上一帧的图贴过来。
  • WorldCache:助手发现车往前开了,它不会直接贴,而是先把上一帧的图平移(Warpping)到正确的位置,再根据趋势微调(Blending)。
  • 比喻:就像你拍视频时,如果人往右走了,你不是把上一帧的人“印”在原地,而是把上一帧的人“剪”下来,到右边去,再补上新的动作。这样就没有鬼影了。

D. 分阶段策略(ATS):起稿要细,上色可快

  • 以前:从头到尾用同一个标准判断能不能偷懒。
  • WorldCache:它知道画画分两个阶段。
    • 起稿阶段(早期):要定好大轮廓和结构,这时候必须认真画,不能偷懒。
    • 上色阶段(晚期):结构已经好了,只是在画一些细微的纹理(比如树叶的抖动),这时候可以大胆偷懒,因为即使稍微偷懒,人也看不出来。
  • 比喻:就像盖房子,打地基和砌墙时必须精确(不能省),但最后刷油漆时,稍微快一点也没关系。

4. 最终效果:快如闪电,画质无损

通过这套组合拳,WorldCache 实现了:

  • 速度提升:生成视频的速度提高了 2.3 倍(以前画 1 分钟要 54 秒,现在只要 26 秒)。
  • 画质保留:保留了 99.4% 的原始画质,几乎看不出区别。
  • 零训练:不需要重新训练 AI 模型,直接给现有的 AI 装上这个“助手”就能用。

总结

WorldCache 就像给 AI 视频生成器装了一个懂眼力见、会预判、手脚麻利的智能助手。它不再盲目地重画每一帧,也不再生硬地复印上一帧,而是根据画面内容的动静、重要程度和绘画阶段,灵活地决定怎么“偷懒”

这让 AI 能够实时地模拟世界,让未来的自动驾驶、机器人规划甚至游戏,都能从“慢吞吞的预渲染”变成“实时的互动体验”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →