想象一下,你正在教一个机器人走路。在旧的方法(称为约束马尔可夫决策过程或 CMDPs)中,你给机器人一个可犯错的“预算”。这就像一张信用卡:“在惹上麻烦之前,你可以踩草地 10 次。”机器人可能会小心翼翼地走一会儿,然后冒巨大的风险,连续踩草地 9 次,仍然处于“安全”状态,因为它尚未触及上限。这种方法适用于燃料消耗等场景,但对于机器人摔倒或患者心率飙升等情况则非常危险,因为一次错误的步伐就会导致灾难性的后果。
本文提出了一种名为**随机决策视界(Stochastic Decision Horizons, SDH)**的新方法来教导机器人。与信用卡预算不同,SDH 将每一步都视为一次“生存检查”。
核心理念:“易碎玻璃”类比
想象机器人正在一块由易碎玻璃制成的地板上行走。
- 旧方法(预算): 地板上有一个计数器。如果机器人踩得太重,计数器就会增加。只要计数器低于 10,机器人就是安全的。它可能会学会疯狂地跳跃,希望不要触及上限。
- 新方法(SDH): 每次机器人迈出一步,玻璃都有破裂的可能。如果步伐安全,玻璃保持坚固。如果步伐危险(即“违规”),玻璃会变得稍微更脆弱。如果机器人迈出非常糟糕的一步,玻璃可能会完全粉碎,该特定训练运行中机器人的“生命”将立即结束。
在 SDH 中,违规不仅仅是给分数加一点;它会缩短机器人的未来。如果机器人知道糟糕的一步可能会立即终结它的“生命”,它就会学会每一次都小心翼翼,而不仅仅是在接近预算上限时才小心。
处理“玻璃破裂”的两种方式
本文探讨了玻璃破裂(即发生违规)后的两种不同理念:
- “吸收态”(AS-SAC): 想象玻璃粉碎,机器人掉入黑洞。它完全停止做出决策。对于该次尝试而言,游戏结束。机器人明白,如果它搞砸了,就会失去所有未来的奖励。这就像是一个“硬性停止”。
- “虚拟终止”(VT-MPO): 想象玻璃破裂,机器人仍然站立,但它现在变成了“幽灵”。它仍然可以移动双腿并做出决策,但无法再因其行动获得任何分数(奖励)。这就像在玩电子游戏,虽然你还活着,但你的分数被冻结在零。机器人继续移动,但它明白糟糕的举动会让其未来变得毫无价值。
研究发现,第二种方法(VT-MPO)通常更稳定且更易于训练,尤其适用于复杂任务。
重大突破:逼真的行走
作者在一个人形逼真、拥有90 块肌肉(称为 H2190)的复杂机器人上测试了这种方法。教导该机器人自然行走而不摔倒或受伤是一项巨大的挑战。
- 问题: 以前的方法试图通过不断改变规则来平衡“走得快”与“少耗能”(就像老师大喊“走快点!”然后“慢点!”)。这导致机器人的训练不稳定且耗时漫长。
- 结果: 使用 SDH(具体为 VT-MPO 方法),机器人学会了与以往最佳方法一样逼真的行走,但训练速度快了 4 倍,且更加稳定。它不需要不断的规则变更;它只是明白了糟糕的步伐会缩短其未来,因此自然地找到了一种安全、高效的行走方式。
何时有效?(“单一尺度”规则)
本文还解释了该方法在何时效果最佳。
- 效果极佳的情况是危险具有一致性。例如,如果机器人每次踩得太重,都是一种会稍微缩短其生命的“中等”风险。这就像走在地板上,每一块松动的瓷砖都具有同等的危险性。
- 效果不佳的情况是危险混杂。想象一块地板,99% 的情况下踩到瓷砖无事发生,但 1% 的情况下踩到瓷砖会炸毁整栋大楼。“生存”方法可能无法捕捉到这种罕见但巨大的爆炸,因为它习惯于小而频繁的裂缝。在这些情况下,可能仍然需要旧的“预算”方法。
总结
本文介绍了一种更智能的机器人安全训练方法。它不是给机器人一个犯错“预算”,而是教导它们每一次错误都会缩短其未来。这迫使它们在每一步都保持安全,从而在诸如逼真人类行走等复杂任务中实现更快、更稳定的学习。
技术摘要:约束强化学习中的随机决策视界
问题陈述
现实世界控制系统(如机器人、生物力学、医疗过程)的强化学习(RL)通常需要在每个时间步满足瞬时约束。单次深度违规可能导致硬件损坏、患者伤害或控制器失稳。约束强化学习的标准框架是约束马尔可夫决策过程(CMDP),其优化目标是累积成本预算。虽然 CMDP 对全局预算(如总燃料消耗)有效,但在处理瞬时可行性方面却显得力不从心。将每步限制编码为累积预算会迫使预算变得极小,而在该区间内,现有的 CMDP 算法往往难以收敛或有效学习。
本文提出了随机决策视界(SDH)作为一种具有理论依据的替代方案。SDH 不将约束违规视为消耗预算,而是将其视为瞬时(不可)行性信号,该信号以概率方式缩短有效规划视界。
方法论
1. 随机决策视界(SDH)
SDH 将约束问题重构为生存概率问题。
- 机制:引入状态 - 动作延续概率 α(s,a)∈[0,1]。若发生约束违规,α 下降,从而降低轨迹继续的概率。
- 目标:智能体最大化在随机几何终止时间 Tγ 处的期望奖励,条件是该轨迹存活至该点。
- 贝尔曼公式:这导出了一个带有整形奖励和状态 - 动作依赖折扣的修正贝尔曼方程:
- r~(s,a)=α(s,a)r(s,a)
- γ~(s,a)=γα(s,a)
- 对偶变量:拉格朗日对偶变量 η 充当生存奖励并加到奖励上(r+η),而非作为成本惩罚。这鼓励那些能维持高生存概率的策略。
2. 控制即推理(CaI)与正则化
为了推导离线策略(off-policy)的正则化算法,作者采用了控制即推理方法。他们识别出约束违规后发生的两种不同语义解释,从而导出了两种不同的正则化项:
- 吸收态(AS)语义:决策过程在违规发生时立即终止。只有存活的决策才贡献信息成本(KL 散度/熵)。
- 算法:AS-SAC(吸收态软演员 - 评论家)。
- 正则化项:最大熵,但仅由存活的决策质量加权。这产生了一个可变折扣的软贝尔曼递归。
- 虚拟终止(VT)语义:决策过程继续,但奖励信用停止累积。智能体继续在底层 MDP 上行动,但未来奖励受生存状态门控。
- 算法:VT-MPO(虚拟终止最大后验策略优化)。
- 正则化项:在普通折扣视界上进行 KL 正则化策略改进,并配合生存整形的评论家。
3. 与 CMDP 的理论联系
本文引入了违规深度分布来刻画 SDH 与加性预算 CMDP 之间的关系。
- 单尺度区间:如果违规发生在单一特征尺度上(例如频繁发生的浅层违规,或遵循特定分布的罕见深层违规),SDH 能有效求解匹配的加性预算 CMDP。
- 多尺度区间:如果违规分布混合了多个尺度(例如频繁发生的浅层违规与罕见的深层违规并存),SDH 与 CMDP 的目标将产生分歧。若不将历史状态扩充到状态空间中,SDH 无法复现精确的预算感知可行性规则。
主要贡献
- SDH 的形式化:作者将通用延续模型 α(s,a) 形式化为与贝尔曼一致的生存占用分布。他们证明了 SDH 是随机生存概率问题的固定对偶拉格朗日形式。
- 正则化离线策略算法:他们推导出了首个针对瞬时约束的离线策略正则化算法:AS-SAC(最大熵)和VT-MPO(KL 正则化)。两者均兼容经验回放。
- 理论范围分析:通过违规深度分布,他们精确 delineated 了 SDH 何时能求解加性预算 CMDP(单尺度违规)以及何时不能(多尺度违规)。
- 最先进的生物力学控制:他们将 VT-MPO 应用于高保真肌肉骨骼模型,将长期存在的努力 - 速度步态权衡问题作为固定瞬时约束问题加以解决。
实验结果
1. Hyfydy(肌肉骨骼控制)
- 设置:在三个具有多达 90 块肌肉的人形模型(H0918, H1622, H2190)上进行训练。
- 对比:与**努力权重自适应(EWA)**进行比较,后者是利用自适应奖励重加权的领域特定最先进方法。
- 结果:
- 稳定性:VT-MPO 收敛至稳定的行走状态,其振荡显著少于 EWA,后者受非平稳奖励信号影响较大。
- 样本效率:VT-MPO 以4 倍更少的环境步数实现了最先进水平的步态逼真度(例如,在 H2190 上达到峰值性能仅需 2100 万步,而 EWA 需要 9000 万步)。
- 逼真度:两种方法实现了相似的步态匹配百分比(约 63-76%),但 VT-MPO 更快地达到这些峰值,并具有更严格的约束满足度(速度、地面反作用力、关节力矩)。
2. Safety Gymnasium(范围测试)
- 设置:在具有标准化成本信号的移动和导航任务上进行评估。
- 发现:
- 单尺度任务(如 AntVelocity):SDH(VT-MPO 和 AS-SAC)实现了强大的奖励 - 成本权衡,优于无约束基线,并以更高的样本效率匹配了有约束基线。
- 多尺度任务(如 PointGoal, CarButton):理论正确预测了失效模式。在需要智能体牺牲部分约束满足度以实现目标的任务中(多尺度违规分布),SDH 要么无法满足约束,要么遭受灾难性的奖励退化。这证实了理论局限性,即 SDH 并非任意加性预算 CMDP 的通用求解器。
意义与主张
本文主张随机决策视界为约束强化学习提供了一个互补的设计维度:塑造视界而非调整预算。
- 实际影响:SDH 提供了一种原则性的方法来处理瞬时约束,其中单次违规是灾难性的,从而避免了自适应奖励重加权(如 EWA)的不稳定性以及在 CMDP 中设置微小预算的困难。
- 理论洞察:该工作阐明了瞬时约束与累积预算是截然不同的目标,仅在特定的几何条件下(单尺度违规分布)才会重合。
- 算法进步:它提供了首个专门针对瞬时约束设计的正则化离线策略算法(AS-SAC, VT-MPO),使得在 90 块肌肉的人形等高分辨率、复杂系统上进行稳定训练成为可能。
作者强调,虽然 SDH 并非 CMDP 的通用替代品,但它是生存概率问题的精确解,并在以每步可行性为主要关注点的区间内,提供了更优越的稳定性和样本效率。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。