← 最新论文
🤖 machine learning

Improved Bounds for Reward-Agnostic and Reward-Free Exploration

本文提出了一种新算法,显著放宽了回合式马尔可夫决策过程中奖励无关探索的精度约束,并建立了奖励无关探索的紧下界,从而弥合了已知上下界之间的差距。

原作者: Oran Ridel, Alon Cohen

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Oran Ridel, Alon Cohen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名侦探,被派往一座庞大而陌生的城市,以摸清街道的布局。然而,有一个限制条件:你被禁止询问方向,而且你还不知道最终的使命是什么。

也许明天你需要找到前往医院的最快路线;后天,你可能需要找到风景最美的公园;又或者,你需要定位一家特定的面包店。你并不知道将面临上述哪项任务,但你清楚自己必须为任何一种情况做好准备。

这正是该论文要解决的核心问题:当不知道“奖励”(即目标)是什么时,如何高效地探索一个环境?

作者 Oran Ridel 和 Alon Cohen 提出了一种全新的解决思路,其效率远超以往的方法。以下用简单的类比来拆解他们的工作。

两种情境

该论文考察了这种“盲眼探索”问题的两个略有不同的版本:

  1. 无奖励探索(“空白画布”情境):
    你完全盲目地探索这座城市。你不知道自己将来是否需要去医院、公园或面包店。你只需要将城市绘制得如此详尽,以至于无论之后给你什么目标,你都能立即找出最佳路径。

    • 挑战: 由于目标可能是任何东西,你必须极其详尽。
  2. 奖励无关探索(“菜单”情境):
    你仍然不知道具体目标,但你确实提前知道了所有可能目标的列表。也许你知道唯一的目的地只有“医院”、“公园”或“面包店”。

    • 优势: 因为你知道列表很短,所以你不需要以同样的强度去绘制每一条小巷。你可以稍微更具策略性。

旧方法:“试错”法

以往的方法(如 Li 等人,2024 年提出的方法)试图通过运行许多独立的、小型的实验来解决这个问题。

  • 类比: 想象一下,为了了解这座城市,你为每一个街角雇佣不同的向导。你雇佣向导 A 学习北侧,然后解雇他,再雇佣向导 B 学习南侧,依此类推。
  • 问题: 这极其浪费。你一遍又一遍地重新学习这座城市的基本规则。虽然可行,但这需要大量的时间和数据,尤其是当你需要非常精确时。

新方法:“智能导游”

作者提出了一种新算法,它像一位单一的、高度智能的导游,通过一次连续且聪明的旅程来学习这座城市。

1. “好奇心”策略(第 1 步)
该算法不再运行独立的实验,而是进行一次长期的“在线学习”会话。它生成一系列人为的、临时的目标(奖励),专门设计用来迫使智能体访问那些最难到达或最不被理解的城市区域。

  • 隐喻: 想象导游说:“好吧,今天我们要去那个没人去过的地方。明天,我们去那个最难找的地方。”通过不断将目标转向“最困难”的地点,智能体自然地构建出城市的完整地图,而不会在已经熟知的地方浪费时间。
  • 结果: 这生成了一个单一的“探索策略”(主计划),它收集了足够的数据来理解城市的动态(街道如何连接),所需的行程次数远少于以往。

2. “地图绘制者”(第 2 步)
一旦智能体完成探索,它就利用收集到的所有数据来构建城市转移的精确地图(例如,“如果我在喷泉处左转,我就会到达广场”)。

3. “任务规划者”(第 3 步)
现在,真实的目标揭晓了(例如,“找到面包店”)。智能体查看其高质量地图,并立即计算出前往面包店的最佳路径。由于地图如此准确,这条路径几乎是完美的。

为什么这篇论文很重要

作者取得了两项重大突破:

1. 他们使“菜单”情境变得更加实用。
以往针对“奖励无关”(菜单)情境的方法,只有在需要极其精确(误差范围非常小)时才有效。如果你允许稍大一点的误差范围,旧方法就会变得低效。

  • 解决方案: 新算法放宽了这一要求。即使你不需要完美,它也能高效运行,使其适用于更广泛的现实世界场景。

2. 他们证明了“空白画布”情境正如我们想象的那样困难。
对于“无奖励”(空白画布)情境,最佳已知方法(我们做到的速度)与理论极限(我们必须达到的速度)之间存在差距。

  • 解决方案: 作者证明了一个新的“下界”。他们表明,无论你多么聪明,你无法比某个特定限制更快地完成它。这填补了差距,证明了现有的最佳方法实际上是最优的(即它们可能达到的最好程度)。

总结

可以将这篇论文视为升级了机器人学习新环境的方式。

  • 旧机器人: “我将尝试通过分别访问每条街道 1,000 次来学习。这将耗费永恒的时间。”
  • 新机器人: “我将进行一次聪明且蜿蜒的游览,迫使我恰好访问每一个棘手的角落,并在此过程中构建完美的地图。然后,当你告诉我该去哪里时,我会立刻知道路线。”

作者已经表明,这种“智能游览”方法不仅更快,而且在数学上被证明是某些类型问题可能的最高效方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →