✨ 要点🔬 技术摘要
想象一下,你拥有一支由不同船只组成的船队。有些船像快艇一样小巧灵活,而另一些则像驳船一样沉重迟钝。它们都有不同的引擎,并且对水的反应也各不相同。
通常情况下,如果你想让一艘船遵循特定的路径(比如地图上画的一条线),你必须为每艘船构建一个定制的“大脑”。你必须研究它的具体重量、它在水中的阻力以及它的引擎如何推动它。如果你更换了船只,旧的大脑就无法工作,你必须从头开始。
问题所在: 苏黎世联邦理工学院(ETH Zurich)的研究人员希望创造一个“通用的脑”,它可以被直接安装到这支船队中的任何 一艘船上,并立即知道如何驾驶它,而无需事先研究这艘新船。这被称为“零样本”(zero-shot)部署——意味着它能立即投入使用,无需任何练习。
解决方案:“老师”与“学生” 该团队采用了一种受人类学习方式启发的巧妙两步训练法,即使用“老师”和“学生”的方法。
老师(全知的导师): 首先,他们在计算机模拟中创建了一个“老师”AI。这个老师在“作弊”:它拥有一份秘密的小抄。它知道它所控制的船只的精确物理特性(例如它的重量、转向速度等)。因为掌握了这些秘密,它学会了如何完美地驾驶任何船只。
学生(侦探): 接下来,他们创建了一个“学生”AI。这个学生不被允许 看到那份小抄。它必须在盲操的情况下驾驶船只,就像在现实世界中驾驶真实的船只一样。 这里的魔力在于:学生被训练去观察历史记录 中发生的事情。它会观察:“我让引擎向左转,但船只只转动了一点点。然后我让它向右转,结果它转得太快了。”通过分析这些过去的交互,学生学会了如何实时推测船只的“个性”(隐藏的物理特性)。它本质上是在驾驶过程中构建了一个关于船只的心理模型。
类比:学习驾驶不同的汽车 把这想象成学习开车。
老师 就像一位驾驶教练,他知道世界上每辆车的精确马力和刹车灵敏度。由于了解这些参数,他们可以完美地驾驶法拉利或卡车。
学生 是一位坐在从未见过的车里的新手司机。他不知道车辆的参数。但在驾驶了几秒钟后,他能感觉到方向盘的反应以及刹车的感觉。他会根据这种“感觉”立即调整自己的驾驶风格。
结果: 学生学会在驾驶新车时,表现得像老师一样出色,尽管他从未看过这辆车的说明书。
他们在现实世界中所做的工作 研究人员在两艘截然不同的真实船只(平台 A 和平台 B)上测试了这一技术。
他们使用了一个非常简单、快速的计算机模型(而不是超级复杂、缓慢的物理模拟器)来训练 AI。
然后,他们将这个 AI 直接应用到真实的船只上,没有进行任何额外的调优。
结果: 这个“学生”AI 的表现几乎接近于为该船只专门定制的控制器。事实上,在其中一艘船上,与不具备这种“侦探”能力的标准 AI 相比,它将误差(即船只偏离路径的程度)降低了 58% 。
为什么这很重要 这意味着我们不需要为建造的每一艘新船都花费数周时间来设计新的控制器。我们可以训练一个智能系统,使其能够适应它所搭载的任何船只,从而更轻松地部署用于监测水质、搜寻幸存者或仅仅是为了娱乐的各类自主航行船队。
局限性 论文指出,这种方法在船只以正常速度行驶时效果最好。对于“滑行”(在高速下掠过水面)的船只或应对极端波浪的情况,它可能会遇到困难,因为用于训练的简单模型并未涵盖这些极端的物理现象。但对于标准作业而言,这是一种控制水上机器人的强大新方法。
技术摘要:基于自适应强化学习的跨平台自主水面航行器控制
1. 问题陈述
自主水面航行器(ASV)在流体动力学和执行机构特性方面表现出显著的多样性。当前的控制策略面临部署瓶颈:
基于模型的控制器 (如 MPC)需要精确的系统辨识和针对特定平台的调优,这对于异构舰队而言属于劳动密集型工作。
**标准强化学习(RL)**方法通常针对单一、固定的平台或必须能够精确捕捉目标特性的模拟器进行训练。将这些策略部署到新船只时,通常需要重新进行系统辨识和重新训练。
核心挑战在于开发一种单一的通用控制器 ,能够在无需预知部署平台动力学特性或进行单平台微调的情况下,实现对同类不同 ASV 平台的零样本(zero-shot)部署。这被框架化为一个部分可观测问题 ,其中真实的系统动力学参数 (θ \theta θ ) 在部署时是未知的,这使得尽管底层物理过程具有马尔可夫性质,但系统仍表现为部分可观测状态。
2. 方法论
作者提出了一种利用教师-学生架构(Teacher–Student architecture)通过交互历史推断潜在动力学的 自适应强化学习框架 。
A. 系统动力学与公式化
模型: 系统使用基于 Fossen 公式简化的 3 自由度(纵摇、横摇、偏航)水平面模型。动力学由七个物理参数 (θ \theta θ ) 参数化,包括质量、附加质量系数、线性阻尼和惯性。
MDP 公式化: 轨迹跟踪被表述为部分可观测马尔可夫决策过程(POMDP)。状态 s t s_t s t 是可观测的,但动力学参数 θ \theta θ 是不可观测的。策略通过以交互历史为条件来恢复近似的马尔可夫性。
动作空间: 策略输出归一化 的机体坐标系力与力矩指令 (τ ˉ ∈ [ − 1 , 1 ] 3 \bar{\tau} \in [-1, 1]^3 τ ˉ ∈ [ − 1 , 1 ] 3 )。这些指令在部署时会根据特定平台的执行器限制进行缩放,从而使策略与绝对力的大小解耦。
B. 教师-学生架构
该方法采用了一种受特权学习(privileged learning)启发的两阶段训练流水线:
第一阶段:教师训练(特权学习)
“教师”策略在模拟器中进行训练,可以访问一个特权向量 e ∈ R 9 e \in \mathbb{R}^9 e ∈ R 9 。该向量编码了源自 3-DoF 运动方程的归一化动力学参数(峰值加速度、阻尼率和科里奥利耦合系数)。
教师学习系统动力学的潜在表示 z = μ ( e ) z = \mu(e) z = μ ( e ) 。
训练利用近端策略优化(PPO),并在广泛的动力学参数范围内进行领域随机化(domain randomization)。
第二阶段:学生训练(自适应)
特权向量 e e e 被移除。编码器 μ \mu μ 被一个**适配器(Adapter)**模块 ϕ \phi ϕ 取代。
适配器由门控循环单元(GRU)和多层感知机(MLP)组成,它仅根据交互历史 h t h_t h t (最近的状态变化、速度和归一化动作)来估计潜在表示 z ^ \hat{z} z ^ 。
学生策略(冻结的教师执行器)以适配器的估计值 z ^ \hat{z} z ^ 为条件进行运行。
适配器通过监督学习进行训练,以最小化重建误差 ∥ z ^ − z ∥ 2 \|\hat{z} - z\|^2 ∥ z ^ − z ∥ 2 ,其中 z z z 是第一阶段中的地面真值潜在变量。
C. 训练设置
模拟: 训练依赖于轻量级的解析动力学模型,而非高保真流体动力学模拟器。
课程学习: 采用渐进式课程,通过扩大随机化动力学参数的范围和轨迹复杂度(从直线到急转弯)来增加难度。
扰动: 环境扰动(电流、风、浪)被建模为 Ornstein–Uhlenbeck 过程。执行器延迟也被随机化。
奖励: 复合奖励函数包含位置、航向和速度跟踪项,以及辅助的前进运动奖励和对侧滑、过度偏航以及动作幅度和光滑度的惩罚。
3. 核心贡献
零样本跨平台策略: 首次展示了单一 RL 策略在无需重新训练或系统辨识的情况下,零样本部署于多个不同的 ASV 平台(同类但动力学不同)。
教师-学生自适应: 将足式机器人(legged locomotion)的教师-学生框架应用于海洋机器人领域,实现了仅通过交互历史推断潜在动力学。
简化的训练流水线: 该方法仅使用简单的 3-DoF 解析模型即可实现高性能,避免了高保真流体动力学模拟的计算成本和复杂性。
可解释性: 学习到的潜在空间有效地捕捉了相关的动力学特征,主成分分析(PCA)显示 9 维潜在空间占据了一个低维子空间。
4. 实验结果
A. 现实世界实验
实验在两个不同的物理平台(平台 A 和平台 B)上进行,两者具有不同的质量、惯性和执行机构限制。
性能: 自适应学生策略在两个平台上均达到了 4.0 cm 的位置平均绝对误差(MAE) 。
对比:
比非自适应的通用 PPO 基准提升了高达 58% (平台 B:4.0 cm 对比 9.5 cm)。
优于针对特定平台的 PPO 基准(仅在单一平台上训练)。
接近经过平台特定调优的模型预测控制(MPC)的跟踪精度(学生:4.0 cm 对比 MPC:4.1–4.6 cm)。
航向: 学生策略实现了与非自适应基准相当或更好的航向精度。
B. 模拟实验
在理想条件下,在五个平台(包括 Roboat 变体)上的模拟实验证实了现实世界的发现:
与非自适应通用 PPO 相比,学生策略减少了 44% 的位置误差 和 55% 的航向误差 。
学生策略的表现与“教师”(先知)策略几乎一致,验证了适配器成功恢复了必要的潜在信息。
消融研究表明,若将适配器的输出替换为静态平均潜在变量(“Student avg. z”),跟踪误差会增加一倍以上,证实了在线自适应的必要性。
5. 意义与声明
本文声称这项工作为通用型 ASV 控制 提供了一个实用的方案。通过以交互历史为条件,单一策略可以在无需每平台调优或辨识的工程开销下,实现对异构舰队的泛化。
效率: 整个训练流水线(教师和学生阶段)在单个消费级 GPU(NVIDIA RTX 4090)上仅需约 30 分钟 即可完成。
可扩展性: 该方法消除了“单平台瓶颈”,允许使用统一的控制策略部署异构舰队。
对局限性的审慎说明: 作者承认目前的 3-DoF 线性阻尼模型适用于低速排水型状态。适配器通过在随机化范围内重新估计有效阻尼,来处理速度相关效应(如二次阻尼)。该方法目前尚未涵盖高速滑行或强烈的垂荡/纵摇/横摇耦合。未来的工作建议进行在线持续自适应,并与基于模型的控制目标进行更紧密的集成。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。