← 最新论文
💻 computer science

Recurrent Autoregressive Diffusion: Global Memory Meets Local Attention

本文提出了一种循环自回归扩散(Recurrent Autoregressive Diffusion, RAD)框架,该框架通过将基于 LSTM 的循环层集成到扩散 Transformer 中,以实现有效的全局记忆保留和局部细节保持,从而在没有训练-推理差距的情况下生成高质量的超长视频。

原作者: Taiye Chen, Zihan Ding, Anjian Li, Christina Zhang, Zeqi Xiao, Yisen Wang, Chi Jin

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Taiye Chen, Zihan Ding, Anjian Li, Christina Zhang, Zeqi Xiao, Yisen Wang, Chi Jin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,如果你在写一部小说,但你只能记住最后输入的几句话。如果你试图写一整本书,你会很快忘记情节、角色的名字,甚至连英雄为什么要进行这场冒险都会忘掉。这就是现代“世界模型”(World Models)——旨在模拟现实并生成视频的 AI 系统——所面临的日常挣扎。这些数字故事讲述者在创作短片方面正变得越来越出色,但当被要求构思长达数小时的连续视频时,它们往往会遭受“失忆症”的困扰,要么忘记了刚才发生了什么,要么丢失了场景的细节。为了解决这个问题,科学家们正在结合两个强大的概念:扩散(Diffusion),就像一位艺术家将模糊的静态云团逐渐转化为清晰的图像;以及注意力(Attention),这是 AI 用来聚焦图像特定部分以理解其相互关系的方式。大问题在于:我们如何给这些 AI 艺术家一个既能记住整个故事,又不会让它们的“大脑”崩溃的足够长的记忆?

由此诞生了一个名为 循环自回归扩散(Recurrent Autoregressive Diffusion, RAD) 的新框架,这是一个旨在帮助 AI 生成长且一致的视频,同时又不至于让其“发疯”的聪明系统。研究人员发现,处理这种记忆问题并不一定需要最新、最华丽的技术,而是一个经典且可靠的工具:一种被称为 LSTM(长短期记忆网络) 的记忆循环类型。把 LSTM 想象成一位勤勉的图书管理员,他负责记录故事至今为止的运行摘要。论文表明,通过在 AI 的大脑中加入这位“图书管理员”,系统可以在关注当下的同时记住过去。然而,这里有一个陷阱:如果你要求图书管理员每隔几章才总结一次故事(这种方法称为“分块式/chunk-wise”),细节就会在间隙中丢失。论文证明,秘诀在于让图书管理员在“每一句话”之后都更新笔记(这种方法称为“帧式/frame-wise”),同时还允许 AI 查看重叠的场景以保持细节锐利。

记忆问题:忘记情节

想象你在看电影,但每当屏幕黑掉一秒钟,你就会忘记之前发生的一切。这就是许多当前视频生成 AI 模型所面临的情况。它们使用“滑动窗口”来观察视频,这意味着它们一次只能关注一小块帧。一旦某一帧滑出窗口,它就永远消失了。如果 AI 正在生成一段角色穿过迷宫的长视频,它可能会忘记角色从哪里开始,或者五分钟前迷宫长什么样,从而导致奇怪的故障,比如墙壁变色或角色突然瞬间移动。

为了解决这个问题,研究人员尝试给 AI 一个“全局记忆”。他们测试了构建这种记忆的三种不同方式:

  1. Mamba:一种非常现代、高科技的方法,试图将整个故事压缩成一个微小且高效的摘要。
  2. TTT(测试时训练):一种 AI 在生成视频的过程中尝试实时学习并更新自身记忆权重的方法。
  3. LSTM:一种较旧的、经典的记忆系统,它将短期细节(刚刚发生了什么)与长期上下文(整体情节)区分开来。

发现:老派胜过新派

研究人员在两个截然不同的世界中进行了实验:一个是智能体进行导航的简单迷宫,另一个是复杂的、由方块组成的《我的世界》(Minecraft)世界。他们发现了一些令人惊讶的事实。在充满密集纹理和快速运动的《我的世界》中,那些花哨的新方法(Mamba 和 TTT)表现挣扎。它们试图将过多的信息压缩进记忆,结果导致视频模糊且不一致,场景布局也随之瓦解。

然而,经典的 LSTM 表现得异常出色。为什么呢?因为它被设计为可以同时处理两件事:它保留一个用于大局观的“细胞状态”(长期记忆)和一个用于即时过去的“隐藏状态”(短期记忆)。这种分离让 AI 既能记住迷宫或《我的世界》的总体布局,又能追踪最后几帧的具体细节。

真正的突破:阅读故事的方式至关重要

这篇论文最重要的发现不仅在于使用哪种记忆工具,还在于如何使用它。研究人员比较了向 AI 输入故事的两种方式:

  • 分块式(“章节”法):AI 生成一组帧(例如 20 帧),对它们进行总结,然后移动到下一个区块。这里的缺陷在于,区块之间的间隙是一个“盲点”。AI 必须完全依赖其记忆摘要来弥合间隙,如果这个摘要遗漏了一个微小的细节(比如一棵特定的树或一面墙的纹理),视频就会崩溃。实验表明,在这种模式下,即使是最好的记忆工具在复杂场景面前也显得力不从心。
  • 帧式(“句子”法):AI 一次生成一帧,并在每一帧之后更新其记忆。关键在于,“窗口”是重叠的。这意味着 AI 始终在同时观察当前帧和之前的几帧。

论文发现,帧式方法是一个游戏规则的改变者。通过重叠窗口,AI 不再需要仅仅依靠记忆摘要来保持视频的一致性;它可以直接“看到”帧与帧之间的连接。这减轻了记忆系统的负担。当 AI 能够观察到紧接的过去时,即使是较简单的记忆工具也能表现得更好,而复杂的工具终于赶上了 LSTM 的水平。

秘诀:“预取”技巧

帧式方法有一个主要的障碍:它的训练速度极其缓慢。通常情况下,AI 必须等待第 1 帧完成后才能计算第 2 帧,这就像是在等待多米诺骨牌一个接一个地倒下。为了解决这个问题,研究人员发明了一个“隐藏状态预取(hidden state pre-fetch)”技巧。

想象一位厨师在准备饭菜。他不是先切完洋葱,再切胡萝卜,然后是一个一个切土豆,而是在锅热起来的时候,就先把所有的蔬菜都切好。同样地,RAD 模型首先对干净的视频进行快速扫描,以“预取”所有的记忆状态。一旦这些状态准备就绪,AI 就可以并行处理整个视频,就像普通的视频生成器一样,而不会失去记忆循环带来的好处。这使得训练过程变得足够快,即使对于长序列也是如此。

结论

论文得出结论,对于生成长且一致的视频,最佳策略是将经典的 LSTM 记忆系统与带有重叠窗口的 帧式 生成风格相结合。这种设置允许 AI 在保持对故事全局记忆的同时,依然能敏锐地观察局部细节。

结果显而易见:在《我的世界》数据集上,帧式 RAD 模型生成的视频质量和一致性远高于传统的“分块式”方法。视频始终忠于原始场景,故障更少,环境记忆也更准确。虽然这种方法比标准模型需要更多的计算能力,但为了能够生成长且连贯的故事而不至于让 AI 忘记自己的情节,这种权衡是值得的。研究人员指出,这种方法在记住大局和注意到小细节之间取得了完美的平衡,解决了 AI 视频生成领域的一个主要瓶颈。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →