← 最新论文
🤖 machine learning

Revisiting Mixture Policies in Entropy-Regularized Actor-Critic

本文提出了一种边缘化重参数化(MRP)估计量,以克服混合策略中标准似然比方法的高方差问题,并证明该方法使混合策略在连续动作强化学习任务中能够匹配甚至超越高斯策略的性能。

原作者: Jiamin He, Samuel Neumann, Jincheng Mei, Adam White, Martha White

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiamin He, Samuel Neumann, Jincheng Mei, Adam White, Martha White

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教机器人走路,或者教视频游戏角色解谜。为此,机器人需要一个“大脑”(称为策略),它能根据所见内容决定下一步采取什么行动。

很长一段时间里,构建这种大脑最流行的方法是让它预测一个单一的“最佳猜测”。这就像一位气象预报员总是说:“气温将是 72 华氏度。”这种方法简单,且在大多数情况下行之有效。在人工智能领域,这被称为高斯策略

然而,有时世界是混乱的。也许最佳行动并非只有一种;也许存在两三种截然不同的获胜方式,而机器人需要为其中任何一种做好准备。单一的猜测无法捕捉到这一点。这正是混合策略发挥作用的地方。

问题所在:那把过于笨拙的“瑞士军刀”

这篇论文的作者问道:为什么我们不直接给机器人一个“瑞士军刀”式的大脑,而不是单工具式的大脑呢? 一把瑞士军刀(即混合策略)拥有多种工具(模式),可以在它们之间切换。它更加灵活,能够更好地处理复杂情况。

但这里有个陷阱:虽然这在理论上听起来很棒,但实践中却无人使用。为什么?因为教导机器人如何使用这把“瑞士军刀”的数学方法出了错。教导这些机器人的标准方法(称为似然比)就像试图通过随机猜测并 hoping 能猜对来学习一门新语言。它既缓慢又充满噪声,而且经常导致机器人崩溃。

著名的算法SAC(软演员 - 评论家)是教导机器人的黄金标准,它不得不放弃“瑞士军刀”,回归到“单工具”大脑,因为复杂版本的数学方法效果不够好。

解决方案:“边缘化重参数化”(MRP)技巧

这篇论文的作者发明了一种新的数学技巧,称为边缘化重参数化(MRP)

这里有一个类比:

  • 旧方法(似然比): 想象你试图在雾蒙蒙的山脉中找到最高峰。旧方法就像向地图扔飞镖,看它落在哪里,然后大喊:“好吧,我把大本营移到这里!”但因为地图被雾气笼罩(充满噪声),你经常喊错,导致你的大本营剧烈地四处乱跳。
  • 新方法(MRP): 新方法就像拥有一套超精准的 GPS。它不是靠猜测,而是计算出机器人可能采取的每一条可能路径的确切路线,将它们平均化,然后给出平滑、清晰的指令。它消除了“噪声”和剧烈的跳跃。

该论文从数学上证明,这种新的 GPS 方法更加稳定,且不太可能导致机器人崩溃。

他们的发现

研究人员在从简单的视频游戏物理(如平衡杆)到复杂的机械臂(如捡起篮球或组装玩具)等大量任务中测试了这种新方法。

  1. 通常一样好: 在大多数标准的、设计良好的视频游戏环境中,新的“瑞士军刀”大脑的表现与旧的“单工具”大脑一样好。它没有破坏任何东西。
  2. 在黑暗中表现更佳: 真正的奇迹发生在奖励“未塑形”的环境中。想象一个机器人试图攀登一座山,但只有在到达山顶时才会收到“干得好”的信号。沿途没有任何提示。
    • 旧大脑(单工具)会困在山谷中,认为这就是它能做到的最好结果。
    • 新大脑(瑞士军刀)同时探索不同的路径。因为它能同时持有多个“去哪里”的“想法”,所以在寻找隐藏的山峰方面要出色得多。
  3. 更好地处理“熵”: 在人工智能中,“熵”是“随机性”或“探索”的 fancy 说法。该论文表明,如果你强迫机器人非常随机(以进行更多探索),旧大脑往往会崩溃并停止学习。而新大脑即使在被迫非常混乱的情况下也能保持稳定并继续学习。

结论

这篇论文将一个理论上很酷但实践中无用的复杂概念(混合策略)进行了修正,使其数学方法能够顺畅运行,并证明它是一个可靠的工具。

  • 它是灵丹妙药吗? 不,它并不能让机器人在所有情况下都变得超人。
  • 它有用吗? 是的。它为人工智能提供了一个更灵活的大脑,在简单任务中与旧大脑一样好,但在探索和解那些成功路径不明显的难题时,表现要显著更好。

他们成功地将一个“理论上的好奇”转变为一项实用的工具,工程师们实际上可以用它来构建更智能、更稳健的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →