← 最新论文
🤖 AI

EXPO: Stable Reinforcement Learning with Expressive Policies

本文提出了 EXPO,一种样本高效的在线强化学习算法,通过将价值最大化解耦为一个轻量级的高斯编辑策略,该策略从稳定的、基于模仿学习的表达性基础策略中优化动作,从而实现表达性策略的稳定训练,在样本效率上较先前方法提升了 2 至 3 倍。

原作者: Perry Dong, Qiyang Li, Dorsa Sadigh, Chelsea Finn

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Perry Dong, Qiyang Li, Dorsa Sadigh, Chelsea Finn

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教会一位才华横溢但极其僵化的机器人厨师如何烹饪出一顿完美的佳肴。

问题:那位“完美”却无法从错误中学习的厨师
在机器人领域,研究人员利用扩散模型等先进方法构建了“表达性”策略(即厨师的大脑)。可以将这些策略想象成极其详尽的食谱书,能够生成复杂且细腻的动作。它们在模仿所见内容(模仿学习)方面表现出色。

然而,当你试图通过试错(强化学习)来教会这位厨师变得更好时,问题就出现了。

  • 类比:想象厨师的大脑是一条长达 100 步的蜿蜒隧道,连接着“思考”与“行动”。如果你告诉厨师“那个动作不好,再试一次”,这条信息必须传回整整 100 步才能修改食谱。等到信息到达时,它已经变得模糊不清,导致厨师感到困惑或停止学习。这就是论文中提到的“梯度不稳定”问题。

解决方案:EXPO(聪明的副厨师)
作者提出了一种名为EXPO(表达性策略优化)的新方法。与其强行让那个复杂的 100 步大脑直接从奖励中学习,他们引入了一个双人团队:

  1. 基础厨师(专家):这是原始的、复杂的、经过预训练的机器人。它被训练为仅仅复制过去演示数据集中看到的“好”动作。它保持稳定可靠,但不直接尝试“最大化奖励”。
  2. 副厨师(编辑):这是一个微小、简单且快速的助手(高斯策略)。它的唯一工作是观察基础厨师打算做什么,并对动作进行微小、快速的调整,使其略好一些。

工作原理:“试味”策略
以下是 EXPO 的魔力所在,分解为日常步骤:

  • 步骤 1:建议。基础厨师根据其训练提出一个动作。
  • 步骤 2:编辑。副厨师采纳该建议,并添加微小的调整(例如加一撮盐或稍微转动旋钮)。这样做是为了尝试获得更高的“奖励分数”(更好的味道)。
  • 步骤 3:试味(即时选择)。在机器人实际移动之前,系统会模拟几个不同的版本:
    • 版本 A:基础厨师的原始动作。
    • 版本 B:副厨师调整后的动作。
    • 版本 C:也许还有其他几种调整。
  • 步骤 4:选出优胜者。系统检查“记分牌”(Q 值函数),看看哪个版本能获得最高奖励。它选出优胜者并执行那个动作。

为何这是颠覆性的变革

  • 稳定性:复杂的基础厨师无需根据奖励改变其内部的“食谱”。它只需继续做它擅长的事。简单的副厨师负责学习,这要容易得多,且不易崩溃。
  • 速度:由于系统能即时从几个选项中选出最佳动作(就像试味一样),其学习速度远快于那些试图逐步调整复杂大脑的方法。
  • 探索:副厨师被允许稍具创意(添加“噪声”或随机性)以尝试新事物,这有助于机器人在不遗忘基础的情况下探索新策略。

结果
论文在 12 项困难的机器人任务上测试了该方法,例如让蜘蛛机器人穿越迷宫,或让机械臂穿针引线。

  • 主张:EXPO 的学习速度(就数据效率而言)比以前的方法快 2 到 3 倍
  • 关键要点:即使从一个从未见过特定任务的预训练机器人开始,它也能运作良好。它不仅仅是“微调”机器人,而是让机器人在不陷入困惑或不稳定的情况下显著提升性能。

总结
EXPO 就像雇佣了一位擅长遵循食谱的世界级名厨(基础策略),并搭配一位思维敏捷的副厨师(编辑策略),由副厨师对菜肴进行微小而聪明的调整,使其味道更佳。与其试图为每一种新口味重新训练名厨的整个大脑,你只需让副厨师调整菜品,然后端出最佳版本。这使得整个厨房运行得更顺畅、更快速、更可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →