← 最新论文
🤖 machine learning

Scalable Maximum Entropy Reinforcement Learning for Diffusion Policies via Adjoint Matching

本文通过利用伴随匹配(adjoint matching)来克服标准分数匹配(score matching)的局限性,并消除对昂贵的似然估计或通过扩散过程进行反向传播的需求,引入了一种在在线强化学习中训练扩散策略的高效、无模拟算法。

原作者: Serge Thilges, Onur Celik, Denis Blessing, Emiliyan Gospodinov, Gerhard Neumann

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Serge Thilges, Onur Celik, Denis Blessing, Emiliyan Gospodinov, Gerhard Neumann

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人走路、跳舞或玩电子游戏。机器人需要学习采取哪些动作才能获得最高分(奖励)。在过去,机器人通常通过猜测简单的、“钟形曲线”式的动作来学习(比如向左移动一点或向右移动一点)。但现实生活是混乱的;有时候最好的动作是一个复杂的、多步骤的舞蹈,它并不符合简单的曲线。

这就是扩散策略(Diffusion Policies)。你可以把它们想象成一个通过从混乱、嘈杂的状态开始,然后通过不断“去噪”最终找到完美且复杂动作的机器人。这就像是在将一张模糊的照片逐步锐化,直到画面变得清晰。

然而,实时教导这个机器人(在线强化学习)一直是两个难题:

  1. 记忆问题: 为了学习,机器人通常必须在脑海中一遍又一遍地重放整个“去噪”过程,每当它犯错时都要如此。这就像为了修正电影中的一个场景,就必须记住整部电影的每一帧一样。这占用了大量的内存,导致机器人崩溃或学习速度极慢。
  2. “无标准答案”问题: 在教室里,你有一个标准答案。但在实时学习中,机器人并不知道什么是“完美”的动作,它只知道稍后是否获得了奖励。依赖于将猜测与已知答案进行比较的标准教学方法在这里并不适用。

解决方案:AMDP(伴随匹配扩散策略)

该论文的作者引入了一种名为 AMDP 的新方法。他们通过一些巧妙的技巧解决了这些问题:

1. “倒放电影”技巧(无模拟训练)
想象你正在学习如何烤蛋糕。通常情况下,你必须烤完整个蛋糕,品尝一下,然后试图弄清楚是在哪一秒加入糖来修正它的。这很难。
AMDP 则不同。它不需要回放整个烘焙过程,而是使用了一个被称为**伴随匹配(Adjoint Matching)**的数学捷径。

  • 类比: 这就像是看着做好的蛋糕(最终动作),然后瞬间明白:“如果我在那个特定的时刻加入了糖,蛋糕就会很完美。”
  • 结果: 机器人不需要为了学习而向后模拟整个嘈杂的过程。它只需观察最终的动作,计算出“得分”(Q分数),然后更新大脑。这节省了大量的计算机内存,并使训练速度大幅提升。

2. “挤压”函数(保持动作安全)
机器人通常是有极限的。机器人的手臂不能移动到负无穷大;它有一个物理范围(例如,在 -1 到 1 之间)。

  • 问题: 扩散背后的数学逻辑有时会产生过大或过小的数字,从而破坏机器人的限制。
  • 解决方法: 作者使用了一个特殊的数学“挤压”函数(基于误差函数,即 erf)。想象一个弹簧,当你拉它时,它会变得越来越紧,最终撞上一堵硬墙。这确保了无论机器人的内部数学逻辑多么狂野,它输出的最终动作始终是安全的,并且处于其物理极限之内。他们发现这种特定的“挤压”比旧方法要稳定得多。

3. “置信区域”(不要过度反应)
在学习过程中,如果机器人得到了一个坏分数,它可能会陷入恐慌,并在一夜之间改变自己的整个性格,忘记之前学到的一切。

  • 解决方法: 作者增加了一个“置信区域(Trust Region)”规则。这就像是一条安全牵引绳。它告诉机器人:“你可以从这次新经验中学习,但不要过于剧烈地改变你的行为。要保持接近你之前的状态。”这让学习过程保持稳定,防止机器人变得疯狂。

他们发现了什么?

团队在 63 个不同的环境中测试了这种新方法,涵盖了从简单的平衡任务到复杂的类人机器人行走和操纵物体的任务。

  • 速度: AMDP 的训练速度几乎与最简单、最高效的方法(如高斯策略)一样快,但它可以处理复杂得多的动作。
  • 性能: 它学习行走和操纵物体的能力优于许多现有的先进方法。在一些复杂的测试中,它是明显的赢家。
  • 效率: 因为它不需要重放机器人思维过程的整个“电影”,所以它使用的计算机资源非常少。他们展示了即使对于一个巨大的、复杂的机器人模型,其训练时间也仅比简单方法增加了约 10%,而旧的复杂方法则会慢 70 到 80 倍。

总结

这篇论文提出了一种教导机器人完成复杂、多步骤动作的方法,且不会导致计算机崩溃。他们通过发明一种数学捷径(让机器人能从最终结果中学习,而不必重放整个历史)、添加一条“安全牵引绳”来保持学习的稳定性,以及使用一种特殊的“挤压”工具来确保动作处于安全范围内。其结果是,机器人能够快速、高效地学习复杂的技能,且不会迷失在数学之中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →