← 最新论文
🤖 machine learning

MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation

MilliVid 通过采用层次化自编码器将帧压缩为多尺度标记,并在视频扩散模型中使用由粗到精的展开策略,从而在降低计算成本的同时,解决了视频生成中的长程一致性挑战,进而保持了全局几何结构和物体恒常性。

原作者: Ishaan Preetam Chandratreya, David Charatan, Basile Van Hoorick, Sergey Zakharov, Vitor Guizilini, Phillip Isola, Vincent Sitzmann

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Ishaan Preetam Chandratreya, David Charatan, Basile Van Hoorick, Sergey Zakharov, Vitor Guizilini, Phillip Isola, Vincent Sitzmann

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图向一位朋友讲述一个很长的故事,但你只有一个小小的记事本。如果你试图写下每一个场景的所有细节——每一片树叶、每一道人行道的裂缝、每一处墙壁的纹理——你写不了几句话就会用完空间。到你讲完故事结尾时,你已经把开头忘得一干二净了。

这正是当今视频 AI 模型面临的精确问题。它们想要生成长且连贯的视频,但它们的“记事本”(计算机内存)太小了,无法容纳长序列中的所有细节。因此,它们会开始产生幻觉,忘记物体去了哪里,或者随着视频的进行改变房间的布局。

MILLIVID 这篇论文提出了一个巧妙的解决方案:不要试图一次记住所有事情。 相反,先记住大局,然后再填充微小的细节。

以下是他们是如何实现的,使用了以下日常类比:

1. “俄罗斯套娃”式记忆系统

大多数视频 AI 模型试图以全分辨率存储每一帧。MILLIVID 通过使用**层级分词器(hierarchical tokenizer)**改变了游戏规则。你可以把它想象成一套俄罗斯套娃,或者一张具有不同缩放层级的地图:

  • 粗粒度层级(大局): 这是最小的套娃,或者是最低缩放倍率的地图。它不显示草地的纹理或砖块的颜色。它只记得房间的形状、墙在哪里以及主要物体的位置。因为非常简单,AI 可以同时记住数百个这样的“大局”帧。
  • 细粒度层级(细节): 这是最大的套娃,或者是最大缩放倍率的地图。它增加了草地的纹理、砖块的图案和光影。但由于它非常详细,AI 在内存耗尽前只能记住其中的几帧。

类比: 想象你正在向朋友描述一座城市。

  • 旧方法: 你试图描述整个旅途中每一栋建筑上的每一扇窗户。你很快就累了,并在 10 分钟后忘记了城市的布局。
  • MILLIVID 方法: 首先,你描述整个城市(公园在哪里,河流如何流淌)的布局。然后,当你靠近某个特定建筑时,你再添加细节(门的颜色、窗户里的花朵)。你始终在脑海中保留着“大局”,这样你就永远不会迷失方向。

2. “由粗到精”的展开(Coarse-to-Fine Rollout)

该论文引入了一种称为**由粗到精展开(coarse-to-fine rollout)**的新型视频生成方式。

模型不是通过生成带有全细节的逐帧视频(这会导致 AI 忘记过去),而是分阶段工作:

  1. 第一阶段: 它生成一段长序列的“模糊”或低细节帧。因为这些帧很简单,AI 可以同时追踪 100 多帧。这确保了故事的连贯性(汽车保持在路上行驶,建筑物不会消失)。
  2. 第二阶段: 它回到最近的帧并将其“锐化”,添加高清晰度的细节。
  3. 神奇之处: 至关重要的是,当它为最近的帧添加细节时,它会参考远处帧的低细节版本,以确保故事依然合理。

类比: 把它想象成画一幅素描。

  • 首先,你画出整个场景的粗略火柴人轮廓,以确定姿势和位置。你可以用这种方式画出整个场景而不会出错。
  • 然后,你回到前景的人物身上,添加肌肉、衣服和面部表情。
  • 你不会在还没确定背景人物站立位置之前,就去画他们的肌肉,否则你可能会把肌肉画错位置。

3. “我的世界”测试

为了证明这套方法的有效性,研究人员不仅使用了漂亮的电影画面,还使用了**《我的世界》(Minecraft)**。

  • 为什么? 《我的世界》是一个可以四处走动的 3D 世界。如果 AI 忘记了布局,你可能会穿墙而过,或者看到一棵树消失后又在另一个地方重新出现。
  • 结果: 他们将该方法与现有的顶尖模型(如 FramePack)进行了对比。旧模型生成的视频中,玩家走了一段时间后,世界就会发生“故障”——建筑物发生位移,或者路径错误地循环回自身。
  • MILLIVID 的表现: 因为它在整个过程中都将世界的“粗粒度”地图保存在内存中,所以它可以生成长达数百步的行走视频,玩家转身后能完美地看到之前经过的完全相同的建筑,保持了高度的一致性。

核心结论

该论文声称,通过接受我们无法记住遥远过去的每一个微小细节这一事实,我们可以更好地记住过去的结构

  • 旧方法: “我会完美记住过去 5 秒内的每一个细节,但我会忘记 10 秒前发生的一切。”
  • MILLIVID 方法: “我会记住 10 秒前发生的一切的大致形状和位置,而我只会记住最近 5 秒的微小细节。”

这种权衡让 AI 能够生成连贯性更长的视频,在不需要耗资数百万美元的超级计算机的情况下,保持视频“故事”的一致性。作者专门针对《我的世界》的游戏过程进行了测试,发现其产生的结果比现有方法显著更加一致。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →