← 最新论文
🤖 machine learning

Reward-free Pretraining for Reinforcement Learning via Occupancy Coverage Maximization

本文介绍了 ROVER,这是一种通过学习到的解算器世界模型(resolvent world model)和虚拟汇聚状态(virtual sink state)来最大化状态空间占用覆盖率的无奖励预训练方法,旨在生成能够快速适应下游任务中稀疏奖励的可迁移探索策略。

原作者: Marco Pratticò, Pietro Novelli, Massimiliano Pontil, Carlo Ciliberto

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Marco Pratticò, Pietro Novelli, Massimiliano Pontil, Carlo Ciliberto

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一个机器人在一个巨大的、黑暗的迷宫中导航。问题在于?机器人在偶然撞到出口之前,得不到任何反馈(没有“做得好”或“再试一次”之类的提示)。这被称为“稀疏奖励”(sparse reward)问题。大多数机器人会陷入原地打转,或者在同一个小角落里反复徘徊,因为它们不知道该往哪里看。

这篇论文介绍了一种名为 ROVER(通过占用覆盖最大化进行的无奖励预训练)的新型训练方法来解决这个问题。以下是通过简单的类比对它的工作原理进行的解释:

1. 问题所在:“反复无常的探险者”

想象一个被告知要“探索迷宫”的机器人。

  • 旧方法就像一个好奇的孩子,跑进一个新房间,觉得没意思了,又跑向另一个新房间。他们最终可能会访问每个房间,但他们不会在那里停留。如果稍后你要求他们去某个特定的房间,他们可能已经忘记了路径,因为他们总是忙着追逐“最新鲜”的事物。
  • 论文指出,为了让机器人以后变得有用,它需要学习绘制一张平衡的地图。它不应该只是访问新地方;它需要学会如何回到它已经知道的地方,从而在整个迷al中建立起稳定且均匀的覆盖。

2. 解决方案:ROVER 的“均匀涂抹”策略

ROVER 还不会尝试寻找出口。相反,它训练机器人表现得就像在往吐司上抹黄油一样。

  • 目标是确保机器人访问迷宫每个部分的时间大致相同。
  • 它使用了一个数学技巧(涉及所谓的“核函数/kernel”)来衡量机器人访问行为的“聚集程度”。如果机器人在一个角落里卡住了,数学公式就会说:“嘿,你太聚集了!快去分散开!”
  • 这确保了当机器人最终被赋予特定任务(如“寻找出口”)时,它已经拥有了一张完整且可靠的整个迷宫地图作为基础。

3. 秘密武器:“汇聚态”(Sink State)

这些探险者面临的最大问题之一是,当它们试图前往机器人尚未理解的地方时,会感到困惑。这就像一个当你驶离已知地图区域时就会崩溃的 GPS。

  • 解决方法: 作者添加了一个虚拟的**“汇聚态”**(你可以把它想象成一个“黑洞”或“未知区域的安全停放区”)。
  • 当机器人试图移动到模型尚不理解的迷宫部分时,数学逻辑不会让它崩溃或进行疯狂的猜测,而是温柔地将这种“未知”的移动推入这个“汇聚态”中。
  • 为什么这有帮助: 它防止了机器人陷入“探索新房间 \rightarrow 感到困惑 \rightarrow 忘记旧房间”的循环。汇聚态充当了一个安全阀,让机器人能够在不失去对已知区域掌控力的前提下,扩大自己的领地。

4. 结果:一个更好的起点

论文在网格状迷宫(有些包含简单的数字,有些是像素化的图像)中测试了 ROVER。

  • 结果: 使用 ROVER 训练的机器人比使用其他方法的机器人探索得更加均匀。
  • 回报: 当这些机器人随后被要求寻找特定目标(即“下游任务”)时,它们的学习速度大大加快。因为它们已经建立了一个稳定的、完整的地图基础,所以不需要浪费时间去重新发现基础知识。

总结

把 ROVER 看作是机器人的预训练训练营。与其让机器人盲目地进入黑暗的迷宫并寄希望于它能找到出口,ROVER 首先训练它成为一名彻底的探险家,让它的注意力均匀地分布在整个区域。它利用“汇聚态”来安全地处理未知领域。等到机器人接到真正的任务时,它不再是一个困惑的流浪者,而是一位拥有完整地形图的资深向导。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →