Bridging Reinforcement Learning and Optimal Control via Feasible Action Mapping
本文介绍了可行动作最优控制(Feasible Action for Optimal Control, FAOC),这是一种通过采用一种计算高效的映射算法将抽象的强化学习动作转化为与状态相关的可行参数,从而在无需专家设计的动作空间的情况下,确保严格的安全约束并在实时机器人运动规划中实现卓越性能的新型框架,该框架架起了强化学习与最优控制之间的桥梁。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:可行动作优化控制 (FAOC)
问题陈述
操作受限动力系统需要能够解决复杂任务,同时严格执行递归可行性和安全约束的控制器。虽然强化学习 (RL) 已展示出在各种领域解决复杂控制问题的能力,但它存在样本效率低以及无法严格保证约束满足性的固有缺陷。相反,最优控制 (OC),特别是模型预测控制 (MPC),通过显式的约束执行提供了严谨的安全保证,但在处理非凸、长时界问题时面临计算可行性挑战,且通常需要对动作空间进行大量的调优。
现有的结合 RL 和 OC 的混合方法通常面临一个关键的权衡:
- 可行性问题: 当 RL 智能体直接选择最优控制问题 (OCP) 的参数时,其输出的动作可能会导致 OCP 不可行,从而需要引入松弛变量或启发式惩罚,这会降低性能。
- 动作空间设计: 为了确保可行性,以往的工作通常采用静态的、启发式的动作空间(例如有界的超立方体),这些空间并未考虑到底层 OCP 可行参数集的态相关性。这导致了包含不可行或冗余动作的情况,迫使 RL 策略必须隐式地学习复杂的边界,从而阻碍了学习效率和最终性能。
方法论:可行动作优化控制 (FAOC)
作者提出了可行动作优化控制 (FAOC),这是一个通过计算高效的、基于优化的映射算法来连接 RL 和 OC 的分层框架。其核心创新在于一种双射映射,该映射将 RL 智能体的输出从一个静态的、几何简单的抽象动作集转换为 OCP 的态相关可行参数集。
框架架构
- 高层 RL 策略: RL 智能体在一个静态、紧凑、实心且凸的抽象动作空间 (例如超矩形)内运行。它输出一个原始动作,该动作随后被转化为抽象动作 。
- 映射算法 (): 一种新型算法将 映射到属于 OCP 的态相关可行集 的参数 。该映射保证 对于当前系统状态 始终是可行的,从而确保 OCP 保持可解性。
- 底层 OCP: 映射后的参数 (例如终端状态目标)被输入到一个参数化 OCP 中。该 OCP 在物理约束条件下求解最优控制轨迹,从而保证安全性与递归可行性。
关键算法组件
论文开发了一系列映射算法,以处理抽象集合 与态相关集合 之间的几何变换:
- 拓扑特征描述: 作者建立了温和的几何条件(引理 1),确保通用 OCP 的可行参数集 是紧凑、实心且凸的。这在带有终端约束的线性 MPC 中得到了明确证明(推论 1)。
- 可逆径向映射: 核心映射(算法 1)是一种径向缩放算法,它将点从 双射地变换到 。它确保了可逆性,允许任何可行参数被投影回抽象动作空间,从而防止了“动作混叠”。
- 几何畸变缓解:
- 2D 面积匹配: 对于 2D 空间,推导了一种方向变换来匹配集合面积的边缘角分布,以防止点在目标集的狭窄区域过度聚集(命题 2 & 3)。
- 线性变换(任意维度): 对于更高维度,作者建议使用仿射代理(具体为最大体积内切椭球)来近似几何畸变。这使得可以使用可扩展的线性变换来保持分布密度,而无需显式表示 的几何形状(命题 4)。
- 隐式集合处理: 一个重要的贡献是能够在不使用 显式几何表示的情况下执行这些映射。通过利用 OCP 约束的结构,作者推导出了鲁棒的公式,直接从优化约束中计算内点和形状矩阵(命题 6–8),从而实现实时执行。
核心贡献
本文概述了五项主要贡献:
- 拓扑特征描述: 确定了确保通用 OCP 的态相关参数集是紧凑、实心且凸的几何条件。
- 可逆可行动作映射: 一种计算高效的径向算法,能将抽象 RL 动作双射地映射到保证可行的 OCP 参数。
- 几何畸变缓解: 开发了面积匹配(2D)和线性变换(任意维度)技术,以防止点聚集并加速学习。
- 针对隐式集合的可处理性: 推导了鲁棒的公式,直接从 OCP 约束中计算必要的映射组件(内点、形状矩阵),避免了高昂的显式几何表示计算开销。
- 实验验证: 应用于 8 自由度机器人乒乓球系统的实时运动规划,展示了专业级的性能。
实验结果
FAOC 框架在一个真实的 8 自由度机器人手臂上进行了评估,该任务要求高速决策并严格遵守运动学约束。
- 设置: RL 智能体(使用 Soft Actor-Critic)为每个关节选择 2D 路标点(位置和速度)。FAOC 映射器将这些路标点转化为参数化 OCP 的可行终端约束。
- 基准测试: FAOC 与以下模型进行了对比:
- 1D 变体: 智能体仅选择位置、速度或加速度的控制器(受控能力有限)。
- 2Dsoft: 使用静态、态无关动作空间并配合软终端代价来处理不可行目标的控制器。
- 性能表现:
- 样本效率: FAOC 在所有实验中实现了最高的样本效率和最终性能,优于 1D 和 2Dsoft 基准。
- 可控性: FAOC 展示了卓越的可控性,特别是在降低 RL 决策频率(模拟高延迟)时。当其他控制器因频率降低而性能显著下降时,FAOC 由于采用了确保轨迹段可行的态相关动作空间,依然保持了高性能。
- 现实世界成功: 该框架使机器人能够在正式的 ITTF 比赛中与专业级人类选手竞技并获胜。
意义与主张
论文声称 FAOC 解决了结合 RL 和 OC 时持久存在的可行性和探索挑战。通过将 RL 智能体与物理约束解耦,该框架允许策略专注于战略决策,而由 OCP 处理局部运动学约束。
作者强调,与以往工作不同,FAOC 不需要专家设计的动作空间,也不会通过不可行动作来损害 OCP 的公式。该框架有效地结合了 OC 的可预测安全性与 RL 的灵活性。在高速、竞争性环境下的真实机器人部署,证明了该方法可以处理非凸战略问题(由 RL 处理),同时保持严格的局部可行性(由 OC 处理)。其映射算法和 OCP 实现已开源,以促进进一步研究。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。