← 最新论文
🤖 machine learning

Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning

本文介绍了期望分位数 nn 步 Q 学习(ENQ),这是一种采用非对称期望分位数损失来缓解多步回报中固有的悲观偏差的离策强化学习算法,该算法提供了收敛性理论保证,并且在多种任务上的经验表现优于现有的长时程 Q 学习(Long-Horizon Q-learning)等方法。

原作者: Abdelghani Ghanem, Mounir Ghogho

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Abdelghani Ghanem, Mounir Ghogho

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何在一个巨大的、复杂的迷宫中导航。你不能带着它走遍每一条路径;相反,你给了它一本记录了其他机器人行进路径的日志,其中一些是专家,而许多则只是在漫无目的地游荡。这就是**离线强化学习(offline reinforcement learning)**的世界:这是一个智能体通过学习过去的数据而非实时的试错来学习的分支。目标是找出到达奖励(比如找到出口或抓取物体)的最佳动作。

为了快速学习,这些机器人使用了一种被称为**多步回报(multi-step returns)**的小技巧。它们不仅仅只看前一步来判断一个动作是否好,而是同时向前看好几步,就像是通过阅读一整个章节来理解情节,而不仅仅是读一个句子。这有助于让奖励在系统中传播得更快。然而,这里有一个陷阱:如果日志中包含许多笨拙机器人走过的糟糕路径,那么看得太远可能会让学习者变得过度悲观。它会开始想:“如果我走这一步,我就会陷入那些糟糕的路径之一,”从而拒绝承担任何风险,即使存在一条好的路径。这篇论文解决的正是一个特定的问题:如何在保持长远观察速度的同时,又不陷入对过去坏数据的悲观情绪中。

研究人员提出了一种名为**期望步数 Q 学习(Expectile n-step Q-learning,简称 ENQ)*的新方法。把从日志中学习想象成试图根据一个赛季过去的比赛来预测一场体育赛事的最终得分。一种标准的方法可能会计算跟随特定战术的所有比赛的平均*得分。但如果日志中充满了球队惨败的比赛,那么这个平均值就会很低,从而打消球员再次尝试该战术的念头。ENQ 改变了游戏规则。它不是计算平均值,而是计算一个“上期望值(upper expectile)”。用通俗的话说,这意味着它忽略了最坏的结果,转而关注日志中确实发生过的更好、更乐观的情景。这就像一位教练,在回顾一名球员的历史时说:“忽略你表现不佳的日子;让我们专注于你表现出色的日子,并弄清楚如何再次达到那种水平。”

论文表明这种方法在数学上是严谨的。作者证明了 ENQ 系统是稳定的,并且即使在向着遥远的未来观察时,最终也会稳定在一种可靠的策略上。他们还证明了,在某些条件下,如果数据中至少包含一条好的路径,这种方法可以完美地恢复出最佳策略。在现实世界中,他们在 27 个不同的任务上测试了 ENQ,范围从堆叠方块的机械臂到在巨型迷宫中导航的人形机器人。他们发现,ENQ 与当前的顶尖方法(称为 LQL)相比具有竞争力,甚至在某些情况下表现更好,尤其是在使用大型“评论家(critics)”团队(即多个 AI 模型协同工作)进行决策时。

其中一个最有趣的发现是关于速度的。因为 ENQ 更简单,不需要像其他方法那样检查长路径中的每一步,所以它的运行速度更快。在测试中,ENQ 处理训练步骤的速度比竞争对手快约 1.27 到 1.77 倍,具体取决于团队中有多少个 AI 模型。这表明,通过更聪明地选择关注过去数据的哪些部分,机器人可以学习得更快、更有效。

作者还探讨了这种方法应该有多“乐观”。他们测试了一种设置,即该方法观察最顶尖的结果(高“期望值”水平)与一种更平衡的视角之间的差异。他们发现,虽然极度乐观对于某些任务效果很好,但如果数据存在噪声,对于其他任务来说可能会带来风险。然而,一个折中的设置(具体而言是 0.8 的期望值水平)在几乎所有任务中都表现得非常稳定,无需针对每个特定的迷宫或机器人进行微调。

总而言之,这篇论文介绍了一种巧妙的方法,通过忽略最坏的情况并专注于实际发生过的最好情况,来教机器人从旧日志中学习。这是一种在数学上被证明是稳定的、运行更快的、且能高效教导机器人在复杂环境中导航的方法,为让 AI 智能体从不完美的过去经验中高效学习提供了一条充满希望的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →