ReWorld: An Interactive World Model with Long-Horizon Memory
ReWorld 是一个交互式世界模型,它通过在训练阶段利用混合注意力机制将短时程控制与长时程记忆进行分离,并在推理阶段通过基于姿态索引的地标检索系统将其统一,从而解决了两者之间的结构性张力,在多种视觉领域中实现了卓越的动作保真度、视频质量以及分钟级的时序一致性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一台能够观看视频并随后预测接下来发生什么,逐帧进行,仿佛它就生活在场景之中般的计算机。这就是“世界模型”(world model)的承诺——一种旨在模拟智能体可以在其中移动和行动的环境的人工智能。为了让这些系统真正具有生命感,它们必须同时完成三件困难的事情:它们必须对用户的指令做出即时反应,它们必须准确记住用户离开并返回某处时该地的原貌,并且它们必须能够实时生成新的视频而不会耗尽内存。挑战在于,这些目标往往相互冲突。为了快速反应,系统需要只关注紧迫的过去,但为了记住遥远的地点,它又需要保留一段宏大的历史。如果一个系统试图用同一种简单的方法来处理两者,它通常会在其中之一上失败,要么遗忘过去,要么在处理当下时步履蹒跚。
研究人员现在构建了一个名为 ReWorld 的系统,它通过教计算机同时以两种不同的方式思考,解决了这种紧张关系。这支由香港和阿里巴巴机构组成的团队创建了一个模型,该模型可以跟随用户的摄像机运动,流式传输写实风格和游戏风格的高质量视频,并且即使在摄像机远离并返回后,也能回忆起几分钟前看到的特定场景。关键的发现是,该系统不需要在短期反应和长期记忆之间做出选择;相反,它在学习过程中将这些任务分离,并在实际运行时进行精细管理。
ReWorld 成功的核心在于它如何组织其注意力。在许多人工智能模型中,系统会查看目前为止看到的所有信息来决定下一步生成什么。ReWorld 将这项工作分配给了不同的部分。有些部分被训练为仅观察非常近期的过去(例如过去的几秒钟),以确保按下按钮后能产生即时且准确的摄像机运动。其他部分则被训练为观察整个视频的历史,从而使系统能够识别出很久以前看到的某个特定岩层或建筑就是现在看到的同一个。至关重要的是,研究人员并没有将这些任务分配给系统的固定部分。相反,他们在训练过程中随机切换角色,确保系统的每一个部分都学会了如何处理即时反应和远期记忆。这防止了系统过度依赖于某种特定的回顾过去的方式,这对于现实世界至关重要,因为在现实中,系统无法永远将完整的历史保存在内存中。
当系统投入使用时,它面临着在任何时刻能持有的信息量方面的严格限制。为了应对这一问题,ReWorld 使用了一个聪明的归档系统。随着视频的播放,它保持一个不断更新的、包含最近帧的小窗口。当旧的帧移出这个窗口时,它们并不仅仅是被删除。相反,系统会检查摄像机是否移动得足够远,以至于值得保存该位置的一个快照。如果是这样,系统就会保存该场景的一个高质量“地标”(landmark)。这些地标被存储在一个独立的、容量有限的库中。当摄像机转身并返回到之前访问过的地方时,系统会搜索这个库,寻找与当前视图匹配的地标,并将它拉回到活跃内存中。这使得系统无需存储中间发生的每一帧,就能记住一分钟前的场景。
为了实现这一点,研究人员必须使用一种非常特定的数据来训练模型。他们结合了来自真实世界视频、视频游戏和计算机生成环境的素材,但他们做了一件不同寻常的事:他们确保单一的指令(例如按下按键向前移动)在每种类型的素材中移动的物理距离都是完全相同的。这创造了一种统一的运动语言。他们还使用了一种特殊的训练技术,即有时会向模型隐藏部分视频历史,迫使它学习如何在记忆不完整的情况下重建场景。这为模型应对其有限内存库的现实情况做好了准备,确保它在不得不依赖少量关键地标而非连续数据流时不会感到困惑。
这种方法的成果是令人瞩目的。在测试中,当摄像机移开并返回起点时,即使在移动了一分钟或更长时间后,ReWorld 仍能以惊人的准确度重新生成原始视图。其他依赖于保持简单滑动窗口(即近期帧)的系统,在起始点移出窗口后便无法记住起点。ReWorld 在遵循指令方面也表现优异,摄像机运动完全符合预期,没有偏离航线。该系统可以生成分辨率为 704 x 1280 像素的视频,速度快到足以产生交互感,并且能在从写实景观到风格化游戏世界的不同风格中保持这种质量。
研究人员发现,他们的方法之所以奏效,是因为它尊重了控制与记忆的不同需求。通过训练系统分别处理短期指令和长期回忆,并使用智能检索系统在需要时才调取旧记忆,他们创造了一个既有响应性又具连贯性的世界模型。该系统不需要成为一个庞大的、无所不知的实体来记住过去;它只需要知道在需要时如何找到过去的正确片段。这种方法允许模型在标准计算机硬件上运行,同时保持以往在交互式视频生成中无法实现的连贯感。这项工作表明,交互式人工智能的未来不仅在于让模型变得更大,还在于让它们在组织和访问已学信息的方式上变得更聪明。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。