想象一下,你把一个蹒跚学步的幼儿扔进一个巨大、全新的游乐场。他们没有地图,没有父母告诉他们该去哪里,也没有特定的玩具在寻找。然而,他们不会只是站在那里。他们会奔跑、攀爬、躲在灌木丛后窥探、原地旋转。为什么?因为他们好奇。他们想知道接下来会发生什么。
这篇题为《记住要好奇》的论文,教导一个人工智能代理在复杂的 3D 世界(如虚拟房屋或办公室)中做完全相同的事情。目标是让机器人在未被告知具体任务的情况下高效地探索,以便它之后能更快地学习特定任务(如寻找一个苹果或一张特定的照片)。
以下是他们如何实现这一点的简要分解,分为几个简单概念:
1. 问题:“健忘”的机器人
以往试图让机器人产生好奇心的尝试往往失败,因为这些机器人是健忘者。
- 循环陷阱:想象一个忘记自己去过哪里的机器人。它看到一条走廊,感到无聊,转身,再次看到同一条走廊,心想:“哦,这是新的!我很兴奋!”它因为看到了同样的东西两次而获得了“好奇心奖励”。最终,它陷入无限循环,以为自己在探索,实际上却只是被困在原地。
- 缺失的地图:其他机器人试图构建房间的完美 2D 地图来记住去过的地方。但这就像试图仅用一张平纸来导航城市,却忽略了气味、颜色和建筑物的纹理。这限制了机器人深入理解世界的能力。
2. 解决方案:两种超能力
作者意识到,要真正变得好奇,一个代理需要两样东西协同工作:
A. “持久世界模型”(永不遗忘的速写本)
与其让机器人遗忘,不如让该系统保留一个活生生的、3D 的速写本,记录它迄今为止看到的一切。
- 工作原理:随着机器人移动,它利用一种称为"3D 高斯泼溅”(3D Gaussian Splatting)的技术不断更新房间的 3D 模型(你可以将其理解为一种高质量、实时的 3D 重建)。
- 好奇心触发:机器人尝试根据其速写本预测它接下来会看到什么。
- 如果它看向一面它已经知道的墙,速写本能完美预测。 无聊。 没有奖励。
- 如果它转过拐角,看到一个它从未见过的房间,速写本无法预测。 惊喜! 机器人因为发现新事物而获得“好奇心奖励”。
- 重要性:因为速写本是持久的(它不会遗忘),机器人知道它已经看过那条走廊。它不会因再次观看而获得奖励。这迫使机器人继续向前移动,去寻找真正新的地方。
B. “情景记忆”(长期讲故事的人)
机器人还需要记住自己的旅程,而不仅仅是房间。
- 架构:机器人使用一种特殊的人工智能(Transformer),它读取其整个视频帧和行动历史,就像从第一页读到当前页一样。
- 益处:这使得机器人能够进行规划。如果它沿着一条长走廊走到底并遇到死胡同,它的记忆会告诉它:“我以前来过这里,我知道如何回到我看到过门的那个路口。”它可以智能地回溯以寻找新的分支,而不是仅仅原地打转。
3. 训练:学习探索
机器人在虚拟世界(Habitat)中进行训练,仅使用摄像头输入(RGB 图像)。
- 无地图,无深度传感器:与需要特殊深度相机或预制地图的其他机器人不同,这个机器人仅从它看到的内容中学习,就像人类一样。
- “随机漫步”助推:有时,仅靠好奇心不足以让机器人走出困境。研究人员在训练过程中加入了一点随机移动的“推动”。这就像父母在幼儿陷入困境时轻轻推他们一把,引导他们走向新方向,教导他们有时必须穿过无聊的区域才能找到有趣的部分。
4. 结果:从探索者到工作者
一旦机器人被训练得充满好奇心,它在其他任务上就变得极其出色。
- 零样本泛化:该机器人在一组虚拟房屋上进行了训练,但能够立即探索完全不同的、AI 生成的世界(如宇宙飞船或奇幻世界),无需任何额外训练。它只是知道如何寻找新事物。
- 微调:当研究人员给机器人一个具体任务——比如“寻找苹果”或“去这张特定的照片”——它只需几分钟就能学会该任务。
- 类比:想象一个学生花了数年时间在图书馆阅读每一本书(探索)。当最终被要求写一篇特定的文章(任务)时,他们不需要从头开始;他们只需要挑选他们已经知道的那些合适的书。
- 论文主张:经过好奇心训练并随后针对特定任务进行微调的机器人,其表现优于仅针对该任务从头训练的机器人,尤其是在任务难以发现(奖励稀疏)的情况下。
总结
该论文认为,要让机器人真正探索复杂的 3D 世界,不能仅仅给它短期记忆或简单的地图。你需要赋予它:
- 一个持久的 3D 世界模型,让它知道已经看过什么(以免被循环欺骗)。
- 一个关于自身旅程的长期记忆,以便它能规划如何到达新地方。
通过结合这两者,机器人学会了真正的好奇心,高效地探索广阔区域,并成为未来任务中更好的学习者。
技术摘要:保持好奇心
问题陈述
在 3D 环境中,探索是在稀疏奖励、长视野任务中学习有用行为的基本前提。虽然基于好奇心的强化学习(RL)提供了一种基于预测误差生成内在奖励的机制,但将其扩展到复杂、照片级逼真的环境中已被证明是困难的。现有方法往往遭受“失忆性”探索的困扰,即智能体被困在局部循环中。这发生的原因是:
- 缺乏情境记忆(Episodic Context): 如果没有过去观察的历史记录,智能体会反复访问相同的位置,从而为它们已经遗忘的状态重新获得“新鲜”的新颖性奖励。
- 缺乏空间持久性(Spatial Persistence): 标准的学习型世界模型(例如逆/前向动力学模块)通常作为经验上的统计先验,而非持久记录。因此,它们无法维持场景的一致性,在重访区域产生虚假的预测误差,并提供错误的新颖性信号。
核心挑战在于使基于好奇心的智能体仅利用视觉输入(RGB)在部署时导航照片级逼真的 3D 场景,而不依赖显式几何地图或深度传感器,同时避免重复行为。
方法论
本文提出了一个端到端框架,名为“保持好奇心(Remember to be Curious)”,它将持久世界模型与情境智能体相结合。
1. 持久 3D 前向模型(世界模型)
为了提供可靠的好奇心信号,作者利用在线**3D 高斯泼溅(3DGS)**模型作为前向世界模型的代理。
- 机制: 该模型摄入特权训练时观察到的流数据(RGB、深度、相机姿态),以构建场景的持久 3D 表示(Gt)。
- 好奇心奖励: 在每一步,模型基于当前 3DGS 状态和智能体的动作,渲染出下一个观察值(o^t+1)的预测。好奇心奖励(rtcur)源自渲染视图与实际观察值(ot+1)之间的视觉预测误差。
- 持久性: 与标准的神经前向模型不同,3DGS 维护着环境的连续、更新记录。这确保了预测误差仅源于真正新颖的区域,而不是模型“遗忘”先前访问过的状态。
- 奖励公式: 误差经过低通滤波和下采样,以关注有意义的结构新颖性而非高频噪声。发出二元奖励:对于未解释的视图给予 rnew,对于模型已解释的视图给予小额惩罚 rold。
2. 情境智能体架构
该智能体是一个基于 Transformer 的策略,仅基于 RGB 观察序列和动作进行操作,在内部维护情境记忆,无需显式几何映射。
- 输入处理: 每一时刻的 RGB 帧与 preceding 动作(编码为 Plücker 射线图像)配对。这些输入由图像编码器处理,并辅以 DINOv2 特征进行增强。
- 记忆机制: 智能体采用混合注意力架构:
- 滑动窗口因果注意力: 高效处理局部时间上下文。
- 全局线性注意力记忆: 受 TTT 和 LoGeR 架构启发,该模块维护一个运行隐藏状态(ht),允许信息在整个回合中传播,从而实现长视野规划(例如,回溯以寻找新分支)。
- 训练: 策略通过 PPO 进行训练,仅使用好奇心奖励作为信号。为了防止在奖励变得稀疏时陷入重复行为的崩溃,训练过程中的 rollout 包含学习策略与均匀随机策略的混合(在训练过程中从 20% 调度至 0%),并辅以熵正则化。
3. 部署
在测试时,智能体仅基于 RGB 帧流进行动作。3DGS 前向模型在部署期间不被使用;智能体完全依赖其学习到的内部情境表示来进行导航。
主要贡献
- 好奇心的双重需求: 本文证明,在照片级逼真的 3D 环境中实现有效的好奇心,既需要持久世界模型(以避免因遗忘状态而产生的虚假新颖性),也需要情境智能体(利用历史上下文规划前往新颖区域)。
- 端到端纯 RGB 策略: 所提出的智能体在部署时不需要显式几何地图、深度传感器或定位模块。它纯粹从视觉输入中学习导航复杂的 3D 场景。
- 持久 3DGS 作为代理: 该工作利用在线 3D 高斯泼溅为好奇心信号提供必要的空间持久性,解决了标准学习型前向模型遭受空间遗忘的局限性。
- 涌现的长视野行为: 智能体学会了穿越已见过的区域(回溯),以发现环境中未见的“分支”,这种行为通常在稀疏奖励设置中,若无分层目标选择或模仿学习,很难习得。
实验结果
该智能体仅使用 Habitat Matterport 3D (HM3D) 数据集上的好奇心进行训练。
- 探索性能: 在 HM3D 和 Gibson 数据集上,该智能体在 3D 场景完整性和到未观察点的平均距离方面,优于最先进的基于 RL 的主动映射基线(ANS, OccAnt)。它仅需 RGB 输入即可实现更快的覆盖率提升,而基线方法通常依赖真实深度或显式地图。
- 消融研究:
- 世界模型: 移除持久性(使用短期记忆或标准 ICM)会导致智能体崩溃进入局部循环或卡住。
- 智能体记忆: 减少智能体的上下文窗口或使用 RNN 会降低性能。非对称记忆(仅评论家拥有上下文)的表现不如完整的情境记忆,证实了策略保留历史记录的必要性。
- 下游适应: 预训练的智能体在稀疏奖励的下游任务上进行了少量回合的微调:
- 摘苹果: 优于从头训练的智能体,特别是在奖励非常稀疏(苹果较少)的场景中。
- 图像目标导航: 成功将其通用探索能力重定向以到达特定的目标视角,优于从头训练的基线。
- 零样本泛化: 该智能体泛化到了分布外、AI 生成的 3D 世界(Hobbit World, Spaceship),无需进一步训练,尽管渲染管道和美学存在差异,它仍能导航走廊并避免碰撞。
意义与主张
本文主张,将世界的持久模型与情境智能体相结合,为将基于好奇心的探索扩展到复杂、照片级逼真的 3D 环境提供了一条实用途径。
- 关于世界模型的适度主张: 作者承认,他们使用 3DGS 是作为“无动力学”世界模型的代理,将智能体限制在静态场景中。他们提出,随着以动作为条件的视频生成模型的成熟,只要它们能够实现类似的空间持久性和闭环在线更新,最终可能取代 3DGS。
- 对未来工作的见解: 该研究作为未来世界模型的指南,强调空间持久性和持续更新内部表示的能力是可靠内在动机所严格必需的。
- 泛化性: 该工作证明,基于持久记忆的好奇心驱动探索,不仅能产生高效的探索者,还能使智能体高度适应各种下游任务,而无需显式映射或模仿学习作为启动。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。