← 最新论文
🤖 AI

Persistent Computational State: A Session-Centric Runtime for Generative World Models

本文认为,当前生成式世界模型无法支持有状态模拟任务的原因并非源于架构限制,而是源于丢弃持久计算状态的以请求为中心的运行时设计,并据此提出一种以会话为中心的运行时,旨在通过实现不可再计算状态的近乎瞬时的检查点保存与恢复,来促进高效且字节级一致的世界模型演进。

原作者: Zhen Lin

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhen Lin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在开发一款电子游戏,其中的世界不仅仅是播放一段脚本,而是真正地在“生活”。在这种游戏中,如果你走开离开篝火,火会继续燃烧;如果你留下一个正滚下山坡的小球,它会继续滚动。这就是“生成式世界模型”(Generative World Models)的梦想:AI 系统能够模拟出一个连贯的、活生生的现实,而不仅仅是生成漂亮的图像。但问题在于:为了让这个世界保持鲜活,计算机需要记住发生的每一件事,甚至是最微小的细节,即使在玩家转过身离开后再转回来时也是如此。

长期以来,科学家们一直认为这些 AI 模型之所以失败,是因为它们“健忘”或“记性不好”。他们假设 AI 的大脑容量不够大,无法承载整个故事。但本论文提出了一个不同的问题:如果问题不在于 AI 呢?如果问题出在运行这款游戏的计算机系统上——即每次玩家休息时,该系统都会把 AI 的笔记丢掉?作者们发现,AI 维持世界一致性所需的“记忆”并不是一种神奇的超能力,它仅仅是几项特定的数据,而计算机系统却在不经意间删除了它们。


“你忘了吗?”之大谜团

在 AI 视频生成的领域中,存在着一个令人沮衷的故障。你告诉 AI 展示一只猫跳上床,然后你要求它展示猫走开;接着,你又要求它展示猫跳回床上。在一个完美的世界里,猫应该落在完全相同的位置,毛发也以同样的方式凌乱。但在 2026 年,当研究人员使用 MBench(测试了 14 种不同的模型)和 WRBench(测试了 23 种不同的模型)进行测试时,他们发现了同样的遗憾结果:猫没能回到正确的位置。世界发生了“漂移”。床看起来变了,猫的位置不对,物理规律也感觉破碎了。

专家们看着这些破碎的世界说:“这些 AI 模型太弱了。它们需要新的训练、更大的大脑以及特殊的记忆模块来学习如何记忆。”他们认为问题出在模型的“大脑”内部。

但由 Zhen Lin 领导的论文作者们决定扮演侦探的角色。他们怀疑罪魁祸首不是 AI 的大脑,而是运行它的计算机系统——即“运行时”(Runtime)。

侦探的实验:“时空旅行”测试

为了证明他们的理论,研究人员设计了一个聪明的实验。他们选取了一个正在工作的 AI 模型并让它生成一个场景。然后,就在场景变得复杂之前,他们对计算机持有的两个非常具体的东西拍摄了一个“快照”:

  1. AI 看到的最后一帧图像(以简单的数字列表形式存储)。
  2. “随机数生成器”(RNG)状态。可以把它想象成 AI 的内部掷骰子。每当 AI 做出决策或创造新细节时,它都会掷一次数字骰子。如果你没有保存骰子落下的确切数字,下一次掷出的结果就会不同,世界也会随之改变。

在拍摄完快照后,研究人员强迫 AI 进行了一场“旅程”。他们让它生成一段漫长且疯狂的事件序列——足以彻底扰乱 AI 可能试图在脑中保持的任何“隐性”记忆。然后,他们停止了旅程,丢弃了计算机此前持有的所有内容,并恢复了快照

结果令人震惊。当 AI 从快照继续运行并生成视频时,它生成的视频与 AI 从未离开过时生成的视频在字节级上完全一致。它是完美的。猫落在了完全相同的位置。像素是完全一样的。

这证明了 AI 能够 完美地记住一切。问题不在于 AI 健忘,而在于运行 AI 的计算机系统在 AI 使用这些笔记之前就把它们扔掉了。

“请求”与“会话”的混淆

为什么计算机要扔掉这些笔记?事实证明,计算机遵循的是为聊天机器人(比如那些帮你写作业的机器人)设计的规则。聊天机器人在“请求”(Request)模式下工作。你问一个问题,计算机回答,然后它会清理桌面以便为下一个人做好准备。这对于聊天机器人来说效果很好,因为即使丢失了上下文,计算机也可以通过重新阅读你之前的文字来理解情况。

但世界模型不同。它们在“会话”(Session)模式下工作。会话是一个连续的故事。如果你暂停一个故事并在稍后回来,你不希望计算机重新阅读整本书,而是希望它能准确地从中断处继续。

作者们将缺失的数据部分称为持久计算状态(Persistent Computational State, PCS)。这是为了保持世界一致性而必须保存的微小且核心的数据列表。

  • 对于一个简单的模型,PCS 只是最后一帧图像和掷骰子状态(约 1.38 MB)。
  • 对于一个带有“记忆库”的更复杂的模型,它是该记忆库加上掷骰子状态(约 185 KB)。
  • 对于一个使用过去数据“窗口”的模型,它是该窗口加上掷骰子状态(约 1.67 GB)。

论文表明,你不需要保存所有东西(那会非常庞大且缓慢),你只需要保存 PCS。而且最棒的是?保存和恢复这些数据仅需 0.012 毫秒。这比生成单步视频所需的时间(1.85 秒)快了五个数量级。这几乎是免费的。

“相关性”与“新鲜度”的转折

论文还发现了关于在计算机内存满时如何管理记忆的一个惊人发现。在聊天机器人中,计算机通常使用“新鲜度”(Recency)规则:它们会丢弃最旧的消息以腾出空间给新消息。但对于世界模型来说,这简直是灾难。

想象一下你在看电影,计算机决定因为某段画面“太旧了”而丢弃 10 分钟前的场景,只保留 1 分钟前的场景。如果这部电影需要你记住 10 分钟前发生的事情才能理解结局,那么电影就崩塌了。

作者测试了管理记忆的不同方法。他们发现,对于世界模型,你需要使用**“相关性”(Relevance)**规则。你应该保留那些对于“回归时刻”(即相机转回来的那一刻)至关重要的记忆部分,即使它们已经很旧了。

  • 当计算机被迫极其吝啬地使用内存(仅有 2 MB 可用)时,“新鲜度”规则仅成功恢复了 16 个世界中的 6 个。
  • 而“相关性”规则则成功恢复了全部 16 个世界

这是一个巨大的转变。这意味着,要让一个世界保持鲜活,你不能再像对待聊天机器人那样思考,而要像一个知道哪些情节至关重要的“讲故事的人”那样去思考。

核心启示

论文总结道,AI 世界模型的“健忘”并不是 AI 大脑中的 Bug。它是计算机系统家务处理中的一个 Bug。AI 已经准备好去记忆了,只是系统一直在把笔记扔进垃圾桶。

通过将系统改为保存“持久计算状态”(快照和掷骰子状态),并采用更聪明的方法在内存紧张时决定保留什么,研究人员证明了:

  1. 世界可以被完美还原。 AI 可以回到与之前完全相同的状态,即使是在经历了一段漫长的旅程之后。
  2. 成本几乎为零。 保存这种状态仅需微秒级时间。
  3. 你可以运行更多的会话。 因为计算机不必将沉重的完整记忆保存在高速显卡上,它可以将“笔记”存储在普通的硬盘上。这意味着单个显卡可以处理的活跃会话数量比以前增加了约 2,300 倍

作者们不仅找到了修复记忆的方法,他们还发现这个“修复方案”实际上是关于如何管理计算机的时间与空间的简单改变。世界并没有丢失,它只是在等待被重新拾起。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →