← 最新论文
💻 computer science

A KL-regularization Framework for Learning to Plan with Adaptive Priors

本文介绍了 PO-MPC,这是一个统一的 KL 正则化框架,它将模型预测规划器作为先验融入策略优化中,以使采样策略与规划器分布对齐,从而提高高维基于模型的强化学习中的样本效率和性能。

原作者: Álvaro Serra-Gomez, Daniel Jarne Ornia, Dhruva Tirumala, Thomas Moerland

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Álvaro Serra-Gomez, Daniel Jarne Ornia, Dhruva Tirumala, Thomas Moerland

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人行走、奔跑或在走钢丝上保持平衡。这是**强化学习(RL)**中的一个经典问题,其中智能体通过试错进行学习。

在这篇论文中,作者介绍了一种教这些机器人的新方法,称为PO-MPC。为了理解其独特之处,让我们用一个简单的类比来分解他们解决的问题及其解决方案。

问题:“教练”与“学生”不同步

将机器人的学习过程想象成两个人之间的伙伴关系:

  1. 学生(策略):这是机器人的大脑。它从经验中学习,以决定采取何种动作。
  2. 教练(规划器/MPPI):这是一个强大、超级聪明的计算器,它在脑海中模拟成千上万种可能的未来动作,以找出完美的前进路径。它实际上并不移动机器人,它只是进行规划。

旧方法:
在以前的方法中,“学生”和“教练”有点脱节。

  • 教练会观察当前情况,然后说:“好吧,如果我是你,我会尝试这些特定的动作。”它会生成一份高质量、有前景的动作列表。
  • 学生会观察教练,尝试从该列表中复制最佳动作,然后独自去练习。
  • 故障点:学生往往会偏离教练的建议。它可能会开始尝试教练从未建议过的动作。当学生尝试这些“偏离”的动作时,教练的计算(基于不同的动作)就会变得无用。这就像学生无视老师的教学计划,转而研读随机的维基百科文章;他们可能会学到一些东西,但无法高效地通过考试。

这种不匹配导致机器人学习缓慢,或者陷入不良习惯,特别是在复杂的高维任务中(例如具有许多关节的人形机器人)。

解决方案:“自适应先验”框架

作者提出了PO-MPC(策略优化–模型预测控制)。他们不再让学生和教练各自为政,而是利用一种称为KL 正则化的概念,迫使它们保持同步。

以下是类比:
想象教练不再只给学生一个“最佳动作”,而是给学生一张概率地图

  • “你有 90% 的概率应该向左走,10% 的概率应该向右走,几乎 0% 的概率应该向上走。”
  • 学生现在的训练目标是在最大化其得分(获得奖励)的同时,保持与教练的地图接近。

论文引入了一种“旋钮”(称为λ\lambda),用于控制学生必须遵循教练的严格程度:

  • 调低旋钮(低 λ\lambda:学生可以自由探索新事物,即使教练没有建议。这有利于发现新解决方案,但具有风险。
  • 调高旋钮(高 λ\lambda:学生必须非常严格地遵循教练的地图。这既安全又高效,但可能会阻止学生发现更好的动作。
  • 甜蜜点(中等 λ\lambda:作者发现,将旋钮设置在中间是“金发姑娘”区域。学生既获得了教练指导的安全性,又拥有足够的自由度去探索和改进。

秘密武器:“自适应先验”

旧方法还有一个问题。教练的建议存储在几天或几周前的“笔记本”(经验回放缓冲区)中。当学生阅读这些笔记时,教练已经改变了主意,使得旧笔记变得令人困惑且自相矛盾。

作者通过教学生一位新的、简化的老师(即自适应先验)解决了这个问题。

  • 学生不再阅读笔记本中杂乱无章、过时的笔记,而是学习教练当前思维的提炼、纯净版本。
  • 这个“自适应先验”充当了护盾。它过滤掉旧数据的噪音和混乱,为学生提供一个清晰、最新的地图供其遵循。

他们证明了什么?

作者在非常困难的任务上测试了这一新框架,例如让数字人行走、奔跑或单腿保持平衡(这些任务来自DeepMind Control SuiteHumanoidBench)。

结果:

  1. 性能提升:机器人学习速度更快,得分高于之前的最先进方法(如 TD-MPC2 和 BMPC)。
  2. 解决不可能的问题:在一些其他机器人完全失败的高难度任务中,PO-MPC 机器人取得了成功。
  3. 灵活性:他们表明,可以调节“旋钮”(λ\lambda),使机器人根据特定任务的需求,成为谨慎的探索者或大胆的冒险者。

总结

简而言之,这篇论文指出:“要教机器人有效地规划和行动,不要让它的‘思考’(规划)和‘行动’(学习)脱节。使用数学‘胶水’(KL 正则化)和一张清晰、最新的地图(自适应先验)将它们紧密耦合。当你这样做时,机器人会学得更快、更稳定,并能解决比以前更难的问题。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →