← 最新论文
🤖 machine learning

Analytic Planning under Uncertainty with Moment Closure

本文提出了一种用于解析模型强化学习的有原则框架,该框架利用高斯转移模型与径向基价值函数之间的相容性原理来推导闭式贝尔曼回溯,从而在不依赖限制性策略结构或随机采样的情况下,实现不确定性下的有效规划。

原作者: Shishir Sharma, Doina Precup

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Shishir Sharma, Doina Precup

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人走路、玩抛接球或平衡一根杆子。为了做好这些动作,机器人需要一个“大脑”,能够观察世界、预测接下来会发生什么,并决定最佳动作。这个领域被称为强化学习(Reinforcement Learning),即智能体通过试错来学习。但现实世界是混乱且不可预测的。如果你推一个手推车,它可能会因为地板上的一处微小凸起而产生略微不同的滑动方式。这种不可预测性被称为不确定性(Uncertainty)

大多数现代机器人大脑试图通过在脑海中进行数千次“如果……会怎样”的情景演练来处理这种不确定性,就像游戏玩家在模拟器中尝试不同的招式一样。它们掷骰子,观察结果,然后取平均值。这虽然可行,但既慢又充满噪声,就像试图通过只询问少数几个人来猜测人群的平均身高一样。另一些机器人则试图表现得超级自信,忽略这些混乱,假设一切都会完全按照预测进行。这种方式很快,但一旦世界给了它们惊喜,它们就会崩溃。研究人员提出的核心问题是:我们能否构建一个不需要进行数千次混乱模拟,就能完美理解不确定性的机器人大脑?

这篇题为《基于矩匹配的解析规划》(Analytic Planning under Uncertainty with Moment Closure)的论文给出了答案:可以。作者 Shishir Sharma 和 Doina Precup 发现了一种巧妙的数学捷径,让机器人可以使用一个精确的公式来计算情况的“平均未来”,而无需进行数千次掷骰子。

问题所在:猜测带来的噪声

想象你正站在悬崖边。你想知道跳下去是否安全。

  • 旧方法(蒙特卡洛法/Monte Carlo): 你闭上眼睛,在脑海中想象跳了 100 次。有时你安全着陆;有时你坠落。你统计了多少次幸存,然后除以 100。如果你只想象了 5 次跳跃,你的答案可能会因为想象中的运气不好而产生巨大的偏差。这就是目前大多数 AI 的做法:它们采样、猜测并取平均值。这容易产生“噪声”,意味着机器人可能仅仅因为其随机猜测运气不佳而做出错误的决策。
  • “过于自信”的方法: 机器人忽略了风力和湿滑的岩石。它假设悬崖是完美的平地。它制定了一个完美的计划,但只要现实中刮起一阵风,计划就会失败。

作者想知道:我们能否利用数学精确地计算跳跃的安全性,从而不再需要猜测或掷骰子?

解决方案:一个神奇的公式

团队开发了一种称为 MoCA(矩兼容解析规划/Moment-Compatible Analytic planning)的方法。他们不再模拟成千上万个未来,而是使用一种特殊的数学方法,将机器人的不确定性视为一个平滑、可预测的云团(高斯分布)。

以下是他们使用的技巧,用简单的类比来解释:

  1. “形状变换”的奖励: 通常,确定最佳动作很难,因为“最佳动作”会根据你具体落在哪一点而改变。这就像试图在一个起伏不定的、不断变化的景观中寻找最高点。作者改变了这个景观。他们设计机器人的“大脑”(具体来说是评估动作价值的部分)具有一种非常特定的、平滑的形状(二次曲线)。这种形状非常可预测,以至于寻找“最佳动作”变得像寻找圆心一样简单。你不需要扫描整个地图,只需要看中心点即可。
  2. “矩”匹配: 一旦“最佳动作”变得容易寻找,机器人只需要知道未来的平均价值。作者将这种平滑的景观与一个可能的未来位置“云团”相匹配。他们发现了一个特别的规则:如果景观的形状和云团的形状以特定方式匹配(他们称之为“矩兼容性”),你就可以使用一个简单的公式来计算平均值。
    • 类比: 想象你有一个水桶(不确定性)和一个特定形状的杯子(价值函数)。如果杯子能完美契合水桶,你就不需要一滴一滴地舀水来了解容量。你只需根据水桶的大小和形状使用公式即可。作者找到了这对完美的“杯子与桶”。

研究发现

研究人员在机器人平衡杆(Cartpole)和摆钟(Pendulum)的计算机模拟中测试了该方法。他们加入了“噪声”到机器人的视觉中,使机器人的视觉效果就像隔着一层雾气观察世界。

  • 结果: 新方法(MoCA)学习平衡杆的速度更快,效果也更好。
    • 与“猜测型”机器人(蒙特卡洛法)相比,MoCA 更稳定。它不会被模糊的视觉所迷惑。
    • 与“过于自信”的机器人(忽略雾气的机器人)相比,MoCA 知道何时该保持谨慎。
    • 即使在噪声非常高的环境下,MoCA 依然表现良好,而其他方法则开始失效或出现异常波动。

他们还检查了机器人的“猜测”关于其自身不确定性的准确性。他们发现,机器人的内部“我有多不确定?”的感觉是经过校准的(well-calibrated)。如果它说有 68% 的把握,那么它在实际中确实大约有 68% 的时间是正确的,在整个训练过程中始终紧贴这一标称水平。

为什么这很重要

这篇论文不仅仅是在说“也许这行得通”。在他们的模拟中,他们展示了通过使用这种数学捷径,机器人可以针对不确定性进行高精度的规划,而无需承担运行数千次模拟的沉重代价。

作者承认,这种特定的数学技巧在某些情况下(例如当机器人的世界可以用平滑曲线和云团来描述时)效果最好。他们指出,如果世界变得过于复杂或维度过高,数学计算可能会再次变得繁重。然而,对于许多连续控制任务——如驾驶汽车、驾驶无人机或平衡机器人——这种方法提供了一种既聪明又安全的方式,而无需依靠超级计算机来运行无止尽的模拟。它证明了我们可以教会机器理解未来的“迷雾”,而不至于在其中迷失方向。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →