← 最新论文
💻 computer science

Remember to be Curious: Episodic Context and Persistent Worlds for 3D Exploration

本文介绍了一种好奇心驱动的 3D 探索框架,该框架将用于持久世界建模的在线 3D 重建与用于 episodic 上下文的基于序列的策略相结合,使智能体能够克服局部循环、零样本泛化到未见过的环境,并在无需显式奖励信号的情况下高效适应下游任务。

原作者: Lily Goli, Justin Kerr, Daniele Reda, Alec Jacobson, Andrea Tagliasacchi, Angjoo Kanazawa

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Lily Goli, Justin Kerr, Daniele Reda, Alec Jacobson, Andrea Tagliasacchi, Angjoo Kanazawa

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你把一个蹒跚学步的幼儿扔进一个巨大、全新的游乐场。他们没有地图,没有父母告诉他们该去哪里,也没有特定的玩具在寻找。然而,他们不会只是站在那里。他们会奔跑、攀爬、躲在灌木丛后窥探、原地旋转。为什么?因为他们好奇。他们想知道接下来会发生什么。

这篇题为《记住要好奇》的论文,教导一个人工智能代理在复杂的 3D 世界(如虚拟房屋或办公室)中做完全相同的事情。目标是让机器人在未被告知具体任务的情况下高效地探索,以便它之后能更快地学习特定任务(如寻找一个苹果或一张特定的照片)。

以下是他们如何实现这一点的简要分解,分为几个简单概念:

1. 问题:“健忘”的机器人

以往试图让机器人产生好奇心的尝试往往失败,因为这些机器人是健忘者

  • 循环陷阱:想象一个忘记自己去过哪里的机器人。它看到一条走廊,感到无聊,转身,再次看到同一条走廊,心想:“哦,这是新的!我很兴奋!”它因为看到了同样的东西两次而获得了“好奇心奖励”。最终,它陷入无限循环,以为自己在探索,实际上却只是被困在原地。
  • 缺失的地图:其他机器人试图构建房间的完美 2D 地图来记住去过的地方。但这就像试图仅用一张平纸来导航城市,却忽略了气味、颜色和建筑物的纹理。这限制了机器人深入理解世界的能力。

2. 解决方案:两种超能力

作者意识到,要真正变得好奇,一个代理需要两样东西协同工作:

A. “持久世界模型”(永不遗忘的速写本)

与其让机器人遗忘,不如让该系统保留一个活生生的、3D 的速写本,记录它迄今为止看到的一切。

  • 工作原理:随着机器人移动,它利用一种称为"3D 高斯泼溅”(3D Gaussian Splatting)的技术不断更新房间的 3D 模型(你可以将其理解为一种高质量、实时的 3D 重建)。
  • 好奇心触发:机器人尝试根据其速写本预测它接下来会看到什么。
    • 如果它看向一面它已经知道的墙,速写本能完美预测。 无聊。 没有奖励。
    • 如果它转过拐角,看到一个它从未见过的房间,速写本无法预测。 惊喜! 机器人因为发现新事物而获得“好奇心奖励”。
  • 重要性:因为速写本是持久的(它不会遗忘),机器人知道它已经看过那条走廊。它不会因再次观看而获得奖励。这迫使机器人继续向前移动,去寻找真正新的地方。

B. “情景记忆”(长期讲故事的人)

机器人还需要记住自己的旅程,而不仅仅是房间。

  • 架构:机器人使用一种特殊的人工智能(Transformer),它读取其整个视频帧和行动历史,就像从第一页读到当前页一样。
  • 益处:这使得机器人能够进行规划。如果它沿着一条长走廊走到底并遇到死胡同,它的记忆会告诉它:“我以前来过这里,我知道如何回到我看到过门的那个路口。”它可以智能地回溯以寻找新的分支,而不是仅仅原地打转。

3. 训练:学习探索

机器人在虚拟世界(Habitat)中进行训练,仅使用摄像头输入(RGB 图像)。

  • 无地图,无深度传感器:与需要特殊深度相机或预制地图的其他机器人不同,这个机器人仅从它看到的内容中学习,就像人类一样。
  • “随机漫步”助推:有时,仅靠好奇心不足以让机器人走出困境。研究人员在训练过程中加入了一点随机移动的“推动”。这就像父母在幼儿陷入困境时轻轻推他们一把,引导他们走向新方向,教导他们有时必须穿过无聊的区域才能找到有趣的部分。

4. 结果:从探索者到工作者

一旦机器人被训练得充满好奇心,它在其他任务上就变得极其出色。

  • 零样本泛化:该机器人在一组虚拟房屋上进行了训练,但能够立即探索完全不同的、AI 生成的世界(如宇宙飞船或奇幻世界),无需任何额外训练。它只是知道如何寻找新事物。
  • 微调:当研究人员给机器人一个具体任务——比如“寻找苹果”或“去这张特定的照片”——它只需几分钟就能学会该任务。
    • 类比:想象一个学生花了数年时间在图书馆阅读每一本书(探索)。当最终被要求写一篇特定的文章(任务)时,他们不需要从头开始;他们只需要挑选他们已经知道的那些合适的书。
    • 论文主张:经过好奇心训练并随后针对特定任务进行微调的机器人,其表现优于仅针对该任务从头训练的机器人,尤其是在任务难以发现(奖励稀疏)的情况下。

总结

该论文认为,要让机器人真正探索复杂的 3D 世界,不能仅仅给它短期记忆或简单的地图。你需要赋予它:

  1. 一个持久的 3D 世界模型,让它知道已经看过什么(以免被循环欺骗)。
  2. 一个关于自身旅程的长期记忆,以便它能规划如何到达新地方。

通过结合这两者,机器人学会了真正的好奇心,高效地探索广阔区域,并成为未来任务中更好的学习者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →