← 最新论文
💻 computer science

Recovering Hidden Reward in Diffusion-Based Policies

本文介绍了 EnergyFlow,这是一个通过参数化标量能量函数来恢复专家奖励并提升策略泛化能力而无需对抗训练的框架,该框架将生成式动作建模与逆强化学习统一起来。

原作者: Yanbiao Ji, Qiuchang Li, Yuting Hu, Shaokai Wu, Wenyuan Xie, Guodong Zhang, Qicheng He, Deyi Ji, Yue Ding, Hongtao Lu

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Yanbiao Ji, Qiuchang Li, Yuting Hu, Shaokai Wu, Wenyuan Xie, Guodong Zhang, Qicheng He, Deyi Ji, Yue Ding, Hongtao Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《基于扩散策略的隐藏奖励恢复》(介绍ENERGYFLOW)的通俗解释,辅以日常类比。

宏观图景:通过观察而非单纯模仿来教导机器人

想象你正在教机器人制作一杯完美的咖啡。

  • 旧方法(行为克隆): 你向机器人展示一段你制作咖啡的视频。机器人试图完全复制你的手部动作。如果因为杯子位置变了,你的手稍微移动了一下,机器人就会困惑并打翻咖啡。它知道做什么,但不知道为什么。
  • 问题所在: 当前的“扩散策略”(最先进的方法)就像一位能完美复制你动作的大师艺术家。但它们不理解目标。它们只知道如何从混乱状态移动到清洁状态。如果情况发生微小变化(例如杯子移动了),它们可能会失败,因为它们只是基于模式猜测下一步动作,而不理解动作的“价值”。

ENERGYFLOW 是一个新框架,它同时做两件事:

  1. 它教导机器人模仿专家的动作(就像旧方法一样)。
  2. 它暗中推导出这些动作背后的奖励系统(即“为什么”),以便机器人能适应新情况。

核心思想:“山丘与山谷”地图

要理解 ENERGYFLOW,请将机器人的决策过程想象成一片由山丘和山谷组成的景观。

  • 景观(能量函数): 想象一张地图,机器人可能做的每一个动作都是地面上的一个点。
    • 山谷(低能量): 这些是“好”动作。山谷越深,动作越好。
    • 山丘(高能量): 这些是“坏”动作。
  • 梯度(坡度): 如果你站在山丘上,重力会将你拉向最陡的斜坡进入山谷。在数学中,这个坡度被称为“梯度”。

其他方法的工作原理:
大多数当前的 AI 方法试图学习每一点的风向(向量场)。它们会说:“如果你在这里,就把风往这个方向吹,以到达目标。”但有时,它们学到的风向彼此不协调。你可能会被吹得转圈(A → B → C → A),却永远无法到达底部。这被称为“非保守”场,会让机器人感到困惑。

ENERGYFLOW 的工作原理:
ENERGYFLOW 不学习风向,而是学习地形本身的形状(标量能量函数)。

  1. 它构建了一张三维的山丘和山谷地图。
  2. 机器人只需顺着坡度滑入山谷。
  3. 因为它遵循的是同一张地图,所以永远不会陷入令人困惑的循环。路径始终合乎逻辑。

“魔法技巧”:发现隐藏奖励

这篇论文最大的突破是一个数学证明,它指出:如果机器人正确学会了地形的形状,那么这个形状本身就是奖励。

  • 类比: 想象你在看一位大厨做饭。你看到的不仅仅是切菜的动作;你可以推断出大厨热爱完美地切洋葱,因为他们总是那样做。
  • 结果: ENERGYFLOW 不需要人类说“干得好!”或“做得不好!”(这很难编程)。通过从专家的视频中学习地形图,机器人自动为每个动作发现了一个“分数”。
    • 低分 = 好动作(深山谷)。
    • 高分 = 坏动作(高山丘)。

这个分数充当奖励信号。现在,机器人可以利用这个分数来教导自己如何更好地完成任务,或者处理它从未见过的新情况。

为何重要:“保守”约束

论文认为,强制机器人学习“地形图”(保守场)而不是仅仅学习“风向”,是一种超能力。

  • 类比: 想象试图在城市中导航。
    • 风向法: 你得到一份箭头列表:“这里向北,那里向东。”如果箭头稍有偏差,你可能会走成一个圆圈。
    • 地形法: 你得到一张地形图。即使你身处从未见过的城市区域,你也可以查看地图,看到坡度,并知道哪条路通向最低点(目标)。
  • 优势: 这种“地图”方法使机器人更加稳健。如果你改变机器人的起始点(即“分布偏移”),地图仍然有效。机器人知道如何从新的起始点滑下山丘。论文从数学上证明,这种方法减少了错误,并帮助机器人比以前的方法更好地泛化到新的、未见过的情况。

现实世界结果

作者在机器人执行以下任务时测试了该方法:

  • 举起一个罐子。
  • 将方形榫头放入方形孔中。
  • 打开抽屉。
  • 拿起一个瓶子。

结果:

  1. 更好的模仿: 机器人比之前的最佳方法(扩散策略)更好地模仿了专家。
  2. 真实机器人成功: 他们将代码部署到真实的物理机器人(AGIBOT G1)上,即使起始位置略有不同,它也成功打开了抽屉并放置了瓶子,且没有摔倒。
  3. 自我改进: 当他们使用“能量分数”作为奖励来进一步训练机器人(强化学习)时,机器人学习得更快,成功率高于使用标准稀疏奖励的情况。

总结

ENERGYFLOW 就像是给机器人一张关于“好坏”的 GPS 地图,而不仅仅是一份逐行转弯的指令列表。

  • 它学习问题的形状(能量景观)。
  • 该形状的坡度告诉机器人做什么(动作)。
  • 该形状的深度告诉机器人做得有多好(奖励)。

这使得机器人不仅能完美地模仿人类,还能理解任务背后的逻辑,使其更聪明、更具适应性,并能够在不需要持续人类反馈的情况下自行学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →