← 最新论文
💻 computer science

MemLearner: Learning to Query Context memory for Video World Models

MemLearner 通过引入一种利用预训练视觉先验和多数据集训练策略的学习型自适应上下文查询方法,解决了视频世界模型中的记忆限制问题,从而显著提升了场景一致性,特别是在涉及遮挡和动态物体的场景中。

原作者: Jiwen Yu, Jianxiong Gao, Jianhong Bai, Yiran Qin, Kaiyi Huang, Quande Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xihui Liu

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiwen Yu, Jianxiong Gao, Jianhong Bai, Yiran Qin, Kaiyi Huang, Quande Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xihui Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图向一位朋友讲述一个漫长且连贯的故事,但每当你停下来换气思考下一句话时,你都会忘记故事的开头。你可能会不小心改变主角衬衫的颜色,或者让一栋建筑消失并在另一个形状中重新出现。这正是视频 AI 模型在尝试生成长视频时面临的问题。它们的“记忆跨度”非常短,因此随着视频变长,场景会变得不一致且混乱。

这篇论文介绍了 MemLearner,一种修复这种记忆问题的新方法。以下是它的工作原理,通过简单的概念进行拆解:

1. 问题所在:“失忆症”导演

目前的视频 AI 模型就像是只能记住电影最后几秒钟的导演。如果你要求它们生成一段 2 分钟的视频,其中摄像机绕着房间走动并回到起点,它们往往会忘记房间开始时是什么样子的。它们可能会画出一扇原本不存在的门,或者让一个人凭空消失。

之前的解决方案试图通过使用僵化的规则来解决这个问题。想象一位图书管理员,他只根据书封面的确切颜色来寻找书籍。如果一本书是红色的,但被一个蓝色帘子遮挡住了(遮挡现象),管理员就会错过它。同样,旧的 AI 方法使用诸如“寻找看起来相似的帧”或“寻找摄像机角度重叠的帧”之类的规则。当物体移动或视线被遮挡时,这些规则就会失效。

2. 解决方案:学习如何提出“正确”的问题

与其使用僵化的规则,MemLearner 教会 AI 学习如何搜索自己的记忆

把 AI 的记忆想象成一个庞大的过去视频帧图书馆。

  • 旧的方法: 管理员(AI)盲目地抓取书架上前几个看起来相似的书,而不管它们是否真的有用。
  • MemLearner 的方法: AI 会创建特殊的**“查询标记”(Query Tokens)**(可以把它们想象成便利贴或搜索查询)。在生成视频的下一部分之前,AI 会写下一张便利贴询问:“那辆红色的车在树后是什么样子的?”然后,它利用这张便利贴主动扫描它的帧库,以找到它所需的确切信息。

至关重要的一点是,AI 不需要一个单独的“搜索引擎”模块来完成这项工作。它使用自己的大脑(视频生成模型)来学习如何编写这些便利贴并找到答案。这就像是教学生通过练习在教科书中寻找答案来准备考试,而不是雇佣一名专门的导师来替他们进行搜索。

3. “效率”技巧:不要读整本书

在成千上万个过去的视频帧中进行搜索既慢又昂贵(就像为了寻找一个事实而阅读整部百科全书)。MemLearner 使用了两个聪明的捷径:

  • “第一章”规则: AI 只在其处理层的最开始阶段进行繁重的“搜索与询问”工作。一旦它收集到了必要的信息,它就会停止搜索,转而专注于编写新的故事(生成视频)。
  • “跳过噪音”规则: 它忽略了不需要的记忆部分。它不会要求过去的帧互相观察;它只要求“搜索笔记”去观察“过去的帧”和“未来的故事”。这节省了大量的计算能力。

4. 训练数据:构建一个更好的图书馆

为了教会 AI 这样做,研究人员需要一个特殊的图书馆。现实世界的视频(如 YouTube)很杂乱,通常没有关于摄像机位置的完美记录。纯计算机生成的视频虽然完美,但看起来很假。

因此,团队构建了一个混合图书馆

  • 他们创建了数千小时带有完美摄像机记录的计算机生成视频,专门设计包含了棘手的场景,如移动物体(行人行走)和遮挡(物体躲在墙后)。
  • 他们将这些视频与现实世界的视频混合在一起,使 AI 的输出看起来更自然,而不那么“卡通化”。
  • 他们训练 AI 处理这些困难的情景,教会它:仅仅因为一辆车在当前帧被墙挡住了,并不意味着这辆车永远消失了;它只需要“记住”那辆车在可见时的样子。

5. 结果:一个连贯的故事

在测试中,MemLearner 在保持故事一致性方面表现得更好。

  • 测试: 如果摄像机绕着房间旋转并回到起点,房间应该看起来完全一样。
  • 结果: 旧的方法经常失败,会改变家具或光影。MemLearner 保持了场景的一致性,即使在物体移动或被遮挡的情况下也是如此。它成功地“记住”了隐藏的细节,并将它们正确地带回。

总结: MemLearner 阻止了 AI 对过去发生的事情进行猜测。相反,它教会 AI 主动且智能地搜索自己的历史以找到正确的细节,确保长视频保持一致、真实,并且没有“闪烁/出错”的记忆缺失。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →