← 最新论文
🤖 AI

Infinite-World: Scaling Interactive World Models to 1000-Frame Horizons via Pose-Free Hierarchical Memory

该论文介绍了 Infinite-World,这是一个鲁棒的交互式世界模型,通过采用分层无位姿记忆压缩器、不确定性感知动作标注模块以及重访密集型微调策略,克服了由噪声位姿估计和稀缺视角重访所带来的挑战,从而在真实世界环境中实现了连贯的 1000 帧以上视觉生成。

原作者: Ruiqi Wu, Xuanhua He, Meng Cheng, Tianyu Yang, Yong Zhang, Zhuoliang Kang, Xunliang Cai, Xiaoming Wei, Chunle Guo, Chongyi Li, Ming-Ming Cheng

发布于 2026-02-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruiqi Wu, Xuanhua He, Meng Cheng, Tianyu Yang, Yong Zhang, Zhuoliang Kang, Xunliang Cai, Xiaoming Wei, Chunle Guo, Chongyi Li, Ming-Ming Cheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在玩一款电子游戏,你可以走动、观察窗外以及转弯。大多数“世界模型”(试图理解并预测当你移动时世界如何变化的 AI 系统)都像是短期记忆设备。它们可以向你展示几秒钟内发生的事情,但如果你尝试走很长一段路——比如走 1,000 步——它们就会开始变得混乱。它们可能会忘记门长什么样,或者突然让墙壁消失。

名为 “Infinite-World” 的论文介绍了一种全新的 AI 系统,旨在解决这个问题。它可以模拟一个世界超过 1,000 帧(大约是 30–40 秒的连续视频),而不会失去理智或忘记房间的布局。

以下是他们实现这一目标的原理,通过简单的类比进行解释:

1. 问题所在:“模糊的地图”与“抖动的摄像机”

现实世界的视频是杂乱无章的。

  • 抖动: 当你用手持摄像机拍摄视频时,你的手会抖动。AI 并不知道是你移动了摄像机,还是摄像机仅仅是在抖动。这使得很难教 AI 如何准确地移动世界。
  • 记忆限制: 大多数 AI 试图记住它们见过的每一帧。如果要求它们记住 1,000 帧,它们的“大脑”就会过载,导致崩溃或开始产生幻觉(凭空捏造不存在的事物)。

2. 解决方案:三个聪明的技巧

技巧 A:“总结型图书管理员”(分层无位姿记忆压缩器)

想象你正在读一本很长的书。如果你试图记住每一个字,当你读到结尾时,你就会忘记开头。

  • 其他 AI 的做法: 它们试图把整本书都摊在桌子上。这会让过程变得混乱且沉重。
  • Infinite-World 的做法: 它使用了一位“总结型图书管理员”。
    • 短期记忆: 对于最近的几页,管理员会保持细节清晰。
    • 长期记忆: 随着你读得越来越深,管理员不再记录每一个字。相反,他们会为之前的章节写一份摘要
    • 神奇之处: 这个摘要被压缩成固定的大小。无论你读了 10 页还是 1,000 页,管理员只需要在口袋里放一张小小的摘要卡片。这使得 AI 能够记住房间的“大意”(窗户在哪里,书桌在哪里),而不会被数据压垮。它在不需要 GPS 或摄像机地图(无位姿)的情况下完成这一切;它只是学会了如何总结重要的信息。

技巧 B:“运动交通灯”(不确定性感知动作标注)

现实世界的视频数据是有噪声的。有时摄像机移动是因为你在行走;有时是因为你的手在抖。

  • 问题: 如果你根据一段抖动的视频来教 AI “向左移动”,它可能会学到“向左移动”实际上意味着“抖动摄像机”。
  • 解决方案: 作者为运动创建了一个交通灯系统
    • 绿灯(通行): 运动清晰且强烈。AI 将其学习为真实的动作。
    • 红灯(停止): 运动微小或仅是噪声。AI 会忽略它。
    • 黄灯(不确定): 运动模糊或令人困惑。系统不会强迫 AI 去猜测,而是将其标记为“不确定”,并告诉 AI:“不要从这个特定的瞬间中学习。”
    • 结果: AI 只从清晰、强烈的运动中学习,这使得它在响应你的控制指令时表现得更加出色,不会被摄像机的抖动所迷惑。

技巧 C:“练习赛”(重访密集微调)

作者意识到,要教会 AI 记住一条长路径,你不需要数百万小时的随机视频。你需要一种特定类型的练习。

  • 洞察: 如果你沿着直线走 10 英里,你永远看不到起点。但如果你绕圈走并回到起点,你就学会了世界的形状。
  • 策略: 他们使用了一个极小的数据集(仅 30 分钟长),其中的摄像机不断绕圈并反复经过相同的地点。他们利用这个数据集来“唤醒”AI 的长期记忆。这就像给学生进行一次针对特定概念的快速、专注的小测验,以确保他们真正理解了概念,而不是让他们去读完整个图书馆的随机书籍。

结果

当你在这些技巧中组合在一起时,Infinite-World 变成了一位大师级的讲故事者。

  • 它可以观看你在房间里长时间走动。
  • 即使在你走过并绕回来之后,它依然记得窗户在左边。
  • 即使训练视频有些抖动,它也能准确响应你的“向左移动”指令。
  • 它完成这一切时,并不需要一台超级计算机来同时持有所有数据。

简而言之,他们构建了一个能够长时间进行“探索世界”游戏的 AI,它不会迷路、不会遗忘,也不会崩溃,这得益于聪明的总结技术和对杂乱数据的仔细过滤。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →