想象一下,你正在教机器人驾驶汽车。你希望机器人能提升驾驶水平(更快、更平稳、更高效),但有一条不可协商的规则:它绝不能发生碰撞或驶离道路。
问题在于,机器人是通过试错来学习的。如果你只是让它尝试新事物,它可能会意外学会一条直接通向树木的“捷径”。
本文介绍了一种名为SCPO(基于采样的约束策略优化)的方法。可以将 SCPO 想象成一位严格且注重安全的教练,在每一次练习中都站在机器人身旁。以下是其工作原理,分解为几个简单概念:
1. “安全基座”(备用驾驶员)
作者并非让机器人从零开始,而是从一个“备用驾驶员”起步。这是一个简单、枯燥但绝对安全的控制器(类似于永不加速的定速巡航)。
- 类比:想象机器人是一名学员飞行员。“备用驾驶员”就是坐在副驾驶位上、随时准备在出问题时接管控制的教官。
- 技巧:机器人的大脑被设计为:在初始阶段,它完全照搬教官的操作。它通过添加一个“残差”层来学习——这是一个小型神经网络,试图对教官的操作进行微调,使其更优。
2. “安全网”(教练的规则手册)
机器人想要学习,但教练(SCPO)有一条规则:“你只能做出那些我们此刻能证明是安全的改变。”
通常,检查改变是否安全非常困难,因为你必须模拟机器人驾驶数小时以观察是否会撞车。这太耗时了。
- 创新点:SCPO 使用了一种“采样”技巧。它不是模拟整个未来,而是对机器人大脑进行微小的随机调整,执行几次快速的“试驾”(rollouts)。
- 隐喻:想象你在冰面上行走。你不想一次性测试整个冰面。相反,你只在正前方的几个位置戳一下冰层。如果这些点能承受,你就假设眼前的区域可以安全踏入。SCPO 在数学上就是这样做的:它用微小的改变去“戳”安全约束的“冰层”,看它们是否稳固。
3. “投影”(守门员)
每当机器人学到新东西(即一次“梯度更新”)时,它可能会试图向更快的驾驶风格迈出一大步。
- 问题:这一步可能不安全。
- 解决方案(投影):SCPO 就像俱乐部的守门员。当机器人带着新想法试图进入时,守门员会将其与“安全区”(即我们测试中冰层稳固的区域)进行比对。
- 如果想法是安全的,机器人就被允许进入。
- 如果想法不安全,守门员会对其进行投影。这意味着他们会对机器人的想法进行数学上的“压缩”,直到它落入安全区内。机器人仍然在学习,但它是在一个被保证不会违反安全规则的方向上学习。
4. “归纳”保证(安全链条)
本文证明了一个强有力的概念,称为“归纳安全”。
- 逻辑:
- 我们从安全的机器人(教官)开始。
- 我们只允许通过安全检查的改变。
- 因此,机器人的下一个版本也是安全的。
- 因为下一个版本是安全的,我们可以无限重复这个过程。
- 结果:只要数学成立,机器人就可以无限学习和改进,而永远不会迈出违反安全规则的一步。这就像连锁反应,每一个环节都是由安全的金属锻造而成。
5. 测试内容
作者在两种场景下测试了该方法:
- “坏老师”测试:他们尝试教机器人模仿一位“恶意专家”(一位提供糟糕、危险建议的老师)。机器人试图向这位坏老师学习,但 SCPO 充当过滤器,拒绝了危险的建议,同时允许机器人学习有用且安全的改进。
- “双重积分器”测试:这是一个经典的物理问题(类似于轨道上的小车)。他们证明,即使机器人被推向不稳定状态,投影方法也能使其保持稳定并留在轨道上。
总结
SCPO 是一种让 AI 在提升任务表现的同时,永不违反安全规则的方法。它通过以下方式实现:
- 从已知的安全基线开始。
- 测试微小改变以确认其安全性。
- 强制任何“学习”都保持在安全区内,即使原始想法是危险的。
这就像训练赛车手:你让他们将车推向极限,但你有一个安全笼,无论他们多么努力地试图那样转向,都能物理上防止他们撞墙。
技术摘要:基于采样权重空间投影的约束策略优化(SCPO)
1. 问题陈述
本文解决了安全关键型学习的挑战,具体而言,即如何在违反安全约束或脱离已知安全运行区域的前提下提升基于学习的控制器的性能。作者关注以下设定:
- 基于轨迹展开的安全约束:安全由轨迹级指标(例如状态约束、稳定裕度)定义,这些指标可通过仿真(轨迹展开)进行评估,但相对于策略参数不可解析求导。
- 黑盒约束:约束函数 g(θ) 缺乏闭式雅可比矩阵,使得标准约束优化方法(如那些需要显式约束梯度的方法)无法适用。
- 目标:执行约束策略优化,确保递归可行性(在每一步训练中都保持安全)和任务目标的单调改进,且从经过认证的安全初始化开始。
2. 方法论:SCPO
作者提出了SCPO(基于采样的约束策略优化),该方法直接在策略网络的权重空间中强制执行安全。
2.1 架构与初始化
受低秩自适应(LoRA)的启发,策略 πθ 被构建为经认证的基础控制器(πsafe)与残差神经网络(ϕθ)的组合:
πθ(x)={πsafe(x)+ϕθ(x)πsafe(x)x∈/Xfx∈Xf
- πsafe:一个非参数化的稳定控制器(例如带截断的 LQR),保证在区域 Ω 内的安全性和稳定性。
- ϕθ:一个初始化为输出零的神经网络(ϕθ0≡0)。这确保了初始策略与基础安全控制器完全相同。
- 学习目标:训练过程被视为在 πsafe 邻域内的“安全自适应”,其中 ϕθ 学习提升性能,而投影机制确保组合策略保持稳定性。
2.2 局部安全区域构建
由于 g(θ) 不可微,SCPO 利用以下方法在权重空间中构建局部安全集:
- 逐点评估:在一组有限的候选权重更新(轨迹展开)上评估安全指标。
- 平滑性界限:该方法假设安全约束具有局部利普希茨连续性。它使用二次上界来近似约束曲面:
gi(θt+Δθ)≤gi(θt)+∇gi(θt)⊤Δθ+2Li∥Δθ∥2
其中 Li 是从采样的更新中估计的曲率常数。
2.3 基于采样的投影
SCPO 不直接求解高维约束优化问题,而是将更新限制在采样候选更新的张成空间(D)内。
- 候选库:缓冲区 D 存储最近的更新及其对应的安全评估 G。
- 低维投影:更新被参数化为 Δθ=Dc,其中 c∈Rm 是系数向量。
- 凸优化:问题被简化为低维空间 c 中的二阶锥规划(SOCP)(或二次约束二次规划):
cmin∥c−em∥S2s.t.(1−1⊤c)g(θt)+Gc+21(c⊤Sc+∣c∣⊤diag(S))L≤0
这将原始梯度更新投影到一个保守的局部安全集上,保证新权重满足安全约束。
2.4 理论保证
- 归纳安全:从安全初始化(g(θ0)≤0)开始,只要投影可行,投影机制就能保证对所有后续步骤 g(θt+1)≤0。
- 稳定性:对于线性动力系统,该方法保持了李雅普诺夫裕度,确保闭环系统保持局部渐近稳定,且安全区域 Ω 是前向不变的。
- 单调改进:使用 Armijo 风格的回溯线搜索,算法保证任务损失 L(θ) 的降低,同时不违反约束。
3. 主要贡献
- 权重空间投影:一种新颖的基于采样的方法,直接在参数空间中执行安全投影,无需约束函数的梯度。
- 归纳安全机制:一种学习框架,从任何安全初始化开始,保证递归可行性和目标函数的单调改进。
- 控制理论分析:形式化证明 SCPO 通过保持李雅普诺夫裕度来维持线性系统的闭环稳定性。
- 实证验证:在约束回归和模仿学习任务中展示了其对有害监督的鲁棒性以及安全探索能力。
4. 实验结果
作者在两个任务上评估了 SCPO:
4.1 约束回归
- 设置:一个一维回归问题,其中目标函数在某些区域违反了硬约束(∣y∣≤1.4)。
- 结果:SCPO 成功在安全区域内拟合目标函数,并在约束边界处平滑饱和。与软约束基线(需要可微约束和超参数调整)不同,SCPO 严格强制执行硬约束且无违反。
4.2 双积分器模仿学习
- 设置:一个控制任务,神经网络试图模仿“恶意专家”(一种使系统不稳定的激进策略),同时从安全的 LQR 基础控制器开始。
- 结果:
- 拒绝有害更新:SCPO 拒绝会导致不稳定的更新,防止策略模仿专家的 destabilizing 行为。
- 稳定性保持:学习到的策略保持了原始安全控制器的稳定区域,而恶意专家在状态空间的大部分区域无法使系统稳定。
- 性能:该策略在模仿目标上实现了有意义的改进,同时保持在安全运行区域内。
5. 意义与局限性
意义:
本文声称 SCPO 提供了一种实用的、数据驱动的安全学习方法,不依赖于显式的约束成本或可微的安全过滤器。通过将经认证的备份控制器视为冻结基础并在权重空间中投影更新,它实现了超越保守基线的安全自适应。这对于自动驾驶和机器人等领域尤为相关,因为在这些领域中推导形式化保证很困难,但安全是不可妥协的。
局限性:
作者承认该方法具有保守性。投影步骤不生成新的改进方向;它仅从现有的采样候选中选择最佳的安全方向。作者指出,未来的工作旨在整合其他技术以修改目标,从而改进安全探索,解决这一保守性问题。
结论:
SCPO 提供了一个严格的约束策略优化框架,弥合了高性能学习与严格安全要求之间的差距,确保基于学习的控制器在整个训练过程中保持安全和稳定。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。