← 最新论文
🤖 machine learning

Stochastic Decision Horizons for Constrained Reinforcement Learning

本文介绍了随机决策视界(SDH),这是一个具有理论基础的框架,通过将违规建模为有效视界缩短,确保约束强化学习中的每一步都满足约束,从而催生了如 VT-MPO 等新颖的离线策略算法,这些算法在奖励与违规的权衡以及训练稳定性方面均优于最先进的方法。

原作者: Nikola Milosevic, Leonard Franz, Daniel Haeufle, Georg Martius, Nico Scherf, Pavel Kolev

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Nikola Milosevic, Leonard Franz, Daniel Haeufle, Georg Martius, Nico Scherf, Pavel Kolev

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人走路。在旧的方法(称为约束马尔可夫决策过程或 CMDPs)中,你给机器人一个可犯错的“预算”。这就像一张信用卡:“在惹上麻烦之前,你可以踩草地 10 次。”机器人可能会小心翼翼地走一会儿,然后冒巨大的风险,连续踩草地 9 次,仍然处于“安全”状态,因为它尚未触及上限。这种方法适用于燃料消耗等场景,但对于机器人摔倒或患者心率飙升等情况则非常危险,因为一次错误的步伐就会导致灾难性的后果。

本文提出了一种名为**随机决策视界(Stochastic Decision Horizons, SDH)**的新方法来教导机器人。与信用卡预算不同,SDH 将每一步都视为一次“生存检查”。

核心理念:“易碎玻璃”类比

想象机器人正在一块由易碎玻璃制成的地板上行走。

  • 旧方法(预算): 地板上有一个计数器。如果机器人踩得太重,计数器就会增加。只要计数器低于 10,机器人就是安全的。它可能会学会疯狂地跳跃,希望不要触及上限。
  • 新方法(SDH): 每次机器人迈出一步,玻璃都有破裂的可能。如果步伐安全,玻璃保持坚固。如果步伐危险(即“违规”),玻璃会变得稍微更脆弱。如果机器人迈出非常糟糕的一步,玻璃可能会完全粉碎,该特定训练运行中机器人的“生命”将立即结束。

在 SDH 中,违规不仅仅是给分数加一点;它会缩短机器人的未来。如果机器人知道糟糕的一步可能会立即终结它的“生命”,它就会学会每一次都小心翼翼,而不仅仅是在接近预算上限时才小心。

处理“玻璃破裂”的两种方式

本文探讨了玻璃破裂(即发生违规)后的两种不同理念:

  1. “吸收态”(AS-SAC): 想象玻璃粉碎,机器人掉入黑洞。它完全停止做出决策。对于该次尝试而言,游戏结束。机器人明白,如果它搞砸了,就会失去所有未来的奖励。这就像是一个“硬性停止”。
  2. “虚拟终止”(VT-MPO): 想象玻璃破裂,机器人仍然站立,但它现在变成了“幽灵”。它仍然可以移动双腿并做出决策,但无法再因其行动获得任何分数(奖励)。这就像在玩电子游戏,虽然你还活着,但你的分数被冻结在零。机器人继续移动,但它明白糟糕的举动会让其未来变得毫无价值。

研究发现,第二种方法(VT-MPO)通常更稳定且更易于训练,尤其适用于复杂任务。

重大突破:逼真的行走

作者在一个人形逼真、拥有90 块肌肉(称为 H2190)的复杂机器人上测试了这种方法。教导该机器人自然行走而不摔倒或受伤是一项巨大的挑战。

  • 问题: 以前的方法试图通过不断改变规则来平衡“走得快”与“少耗能”(就像老师大喊“走快点!”然后“慢点!”)。这导致机器人的训练不稳定且耗时漫长。
  • 结果: 使用 SDH(具体为 VT-MPO 方法),机器人学会了与以往最佳方法一样逼真的行走,但训练速度快了 4 倍,且更加稳定。它不需要不断的规则变更;它只是明白了糟糕的步伐会缩短其未来,因此自然地找到了一种安全、高效的行走方式。

何时有效?(“单一尺度”规则)

本文还解释了该方法在何时效果最佳。

  • 效果极佳的情况是危险具有一致性。例如,如果机器人每次踩得太重,都是一种会稍微缩短其生命的“中等”风险。这就像走在地板上,每一块松动的瓷砖都具有同等的危险性。
  • 效果不佳的情况是危险混杂。想象一块地板,99% 的情况下踩到瓷砖无事发生,但 1% 的情况下踩到瓷砖会炸毁整栋大楼。“生存”方法可能无法捕捉到这种罕见但巨大的爆炸,因为它习惯于小而频繁的裂缝。在这些情况下,可能仍然需要旧的“预算”方法。

总结

本文介绍了一种更智能的机器人安全训练方法。它不是给机器人一个犯错“预算”,而是教导它们每一次错误都会缩短其未来。这迫使它们在每一步都保持安全,从而在诸如逼真人类行走等复杂任务中实现更快、更稳定的学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →