← 最新论文
🤖 machine learning

Decoupling Policy Extraction for Offline Reinforcement Learning

本文提出了一种用于离线强化学习的“解耦策略提取”范式,该范式通过训练一个演员来生成受行为支持的候选动作,并使用一个独立的评论家在推理阶段对其进行重排序,从而将行为建模与策略改进相分离,进而克服了耦合式演员-评论家训练的局限性,并超越了现有方法。

原作者: Xuyao Lin, Yixiang Shan, Jinru Duan, Tao Yang, Xinyu Zhao, Runyu Lei, Yiming Zhao, Jiaxin Fan, Zongbao Feng, Peng Jia

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuyao Lin, Yixiang Shan, Jinru Duan, Tao Yang, Xinyu Zhao, Runyu Lei, Yiming Zhao, Jiaxin Fan, Zongbao Feng, Peng Jia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一名学生正在学习驾驶汽车,但他们不是坐在方向盘后感受路面,而是被迫只能研究一段完美的驾驶员进行的静态视频。他们无法犯错,无法尝试新的转弯,也无法从现实世界中获得反馈。这就是离线强化学习(offline reinforcement learning)所面临的挑战,这是一个人工智能仅利用过去收集的一组固定数据来学习如何做出决策的领域。在这种设定下,计算机必须设法在从未能在现实中测试这些新想法的情况下,学会做得比它所看到的范例更好。教导这些系统的传统方法涉及两个在紧密循环中工作的部分:一部分学习什么是好的动作,另一部分学习如何执行这些动作。第一部分不断引导第二部分,告诉它去尝试那些看起来有价值的动作。然而,由于数据在时间中是冻结的,这种引导可能会变得危险。如果“什么是好的”这一部分犯了错,高估了一个冒险的举动,那么“如何执行”这一部分就会尝试去做它,从而强化错误,并进一步偏离安全、经过验证的行为。

Simplexity Robotics 和应用设计研究学院(Rensseler Polytechnic Institute)的一个研究团队提出了一种解决此问题的新方法,他们建议这两个部分在学习阶段应该停止相互交谈。在他们的新方法中,他们将从数据中学习任务与选择最佳动作的任务完全分离。首先,他们训练一个模型,仅用于模仿数据集中发现的行为,就像一个完美的复制者,既不尝试改进,也不试图猜测新的策略。这个模型会生成一系列已知的、由数据支持的安全动作列表。然后,一个独立训练用于判断价值的单独系统会观察这个列表,并从中选出执行的最佳选项。通过打破通常连接这两者的反馈循环,研究人员发现他们可以避免放大误差的陷阱。他们在三十个复杂的任务(从虚拟迷宫导航到机械臂操控)中的实验表明,这种分离的方法始终优于传统的、紧密耦合的方法。在某些情况下,成功率从不到一半跃升至接近百分之七十,这证明了有时,最好的改进方式是在学习过程中停止试图改进学习者。

研究人员确定的核心问题在于标准人工智能系统如何从固定数据中学习。在典型的设置中,系统有一个“评论家”(critic)来估计动作的价值,以及一个“演员”(actor)来学习如何执行它们。评论家告诉演员哪些动作是好的,而演员则尝试去做。在机器人可以持续与环境互动的真实场景中,这种方法效果很好,因为如果评论家犯了错,演员的新尝试会产生新的数据来纠正错误。但在离线学习中,数据集是锁定的。如果评论家误认为一个危险的动作是有价值的,演员就会尝试去做它,由于没有新数据到达来纠正评论家,错误就会恶化。演员会漂移到数据从未覆盖的动作空间区域,研究人员称之为“分布外放大循环”(out-of-distribution amplification loop)。为了防止这种情况,现有的方法通常试图强迫演员保持靠近原始数据,但这产生了一个困难的权衡:如果你对演员的约束过多,它甚至无法在安全数据范围内找到最好的动作;如果你让它走得太远,它就会陷入错误循环。

为了解决这个问题,研究人员将过程解耦了。他们训练演员只做一件事:建模数据集中发现的动作分布。他们完全不允许评论家影响演员的训练。一旦这个“提议者”(proposer)模型训练完成,它就会被冻结,这意味着它永远不会再改变。当机器人需要做出决策时,提议者会生成一小组候选动作,所有这些动作都是基于安全的、已观察到的数据。一个独立训练用于判断价值的单独评论家随后会查看这个特定的列表,并选出得分最高的选项。这把改进的工作从训练阶段转移到了决策时刻。系统不再试图调整演员的大脑使其变得更好,而是简单地生成几个安全的选项,然后让裁判挑选赢家。这种方法意味着评论家不再需要担心演员会漂移到危险区域,因为演员根本不被允许发生漂移。评论家只需要对提供的安全选项进行排序即可。

实验结果令人瞩目。研究人员在三十个涉及目标导向行为的任务上测试了他们的方法,例如让一只机器人蚂蚁在大型迷宫中导航,或让一个类人机器人穿过复杂环境。他们将这种解耦方法与保持演员和评论家相连的标准技术进行了对比。在名为 AntMaze-Large 的导航任务中,使用特定类型价值学习器的传统方法成功率约为百分之三十一。当研究人员使用相同的价值学习器应用其解耦方法时,成功率上升到了百分之四十九。在涉及立方体的操控任务中,改进更为显著,解耦方法的成功率达到了百分之七十九,而传统方法仅为百分之二十一。或许最令人惊讶的是,研究人员发现,即使是一个非常简单、基础的价值学习系统,在离线设置中通常表现挣扎,但在与这种解耦选择过程配对时,也变得非常高效。在一个解谜任务中,一个简单的价值学习器结合他们的这种方法实现了百分之百的成功率,大大超越了更复杂的标准系统。

研究还通过检查系统在允许查看更多选项时的情况,揭示了为什么这种分离方法如此有效。研究人员发现,让提议者生成几个候选方案,而不是仅仅一个,可以让系统更彻底地探索数据的安全区域。然而,这存在一个极限。如果系统生成的候选方案过多,包含一个风险性的、分布外的动作的可能性就会增加,且价值判断系统可能会误选它。通过调整候选数量,可以找到最佳平衡点,这是一个可以在不重新训练整个系统的情况下进行调整的单一设置。这种灵活性是相对于传统方法的一个显著优势,因为传统方法通常需要昂贵的重新训练来修复安全与性能之间的平衡。研究人员指出,这种方法对于大规模机器人系统特别有前景,因为重新训练一个庞大的模型在计算上是非常昂贵的。通过保持主模型冻结,并仅使用一个轻量级的价值系统来进行最终选择,该方法提供了一条实现更好性能的计算高效路径。

研究人员承认,这种方法有一个边界:系统只能从冻结的提议者能够生成的动作中进行选择。如果最好的可能动作从未在原始数据中出现过,系统就无法创造它。然而,在可能性的范围内,解耦方法始终比传统的耦合方法找到了更好的解决方案。这项工作表明,在从静态数据中学习时,长期以来认为学习与改进必须在单个循环中同时发生的观点,可能是不必要的,甚至是不理想的。通过将安全选项的生成与最佳选项的选择相分离,研究人员为人工智能如何从过去中学习而不被自身的错误所困扰,提供了一条更清晰、更稳定的路径。研究结果表明,对于离线学习,最有效的策略可能是在训练期间不要试图教演员变得聪明,而是让它仅仅记住过去,将改进的工作留给决策时刻的一个独立的、批判性的眼睛。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →