← 最新论文
🤖 machine learning

Cross-Platform Control for Autonomous Surface Vehicles via Adaptive Reinforcement Learning

本文提出了一种自适应强化学习框架,该框架通过使用教师-学生架构从交互历史中推断潜在的平台动力学特性,实现了自主水面航行器在零样本跨平台轨迹跟踪方面的性能,尽管依赖于简化的仿真模型,但在真实船舶上仍实现了卓越的表现且无需微调。

原作者: Ruiheng Jiang, Thomas Bi, Raffaello D'Andrea, Aswin Ramachandran

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruiheng Jiang, Thomas Bi, Raffaello D'Andrea, Aswin Ramachandran

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一支由不同船只组成的船队。有些船像快艇一样小巧灵活,而另一些则像驳船一样沉重迟钝。它们都有不同的引擎,并且对水的反应也各不相同。

通常情况下,如果你想让一艘船遵循特定的路径(比如地图上画的一条线),你必须为每艘船构建一个定制的“大脑”。你必须研究它的具体重量、它在水中的阻力以及它的引擎如何推动它。如果你更换了船只,旧的大脑就无法工作,你必须从头开始。

问题所在:
苏黎世联邦理工学院(ETH Zurich)的研究人员希望创造一个“通用的脑”,它可以被直接安装到这支船队中的任何一艘船上,并立即知道如何驾驶它,而无需事先研究这艘新船。这被称为“零样本”(zero-shot)部署——意味着它能立即投入使用,无需任何练习。

解决方案:“老师”与“学生”
该团队采用了一种受人类学习方式启发的巧妙两步训练法,即使用“老师”和“学生”的方法。

  1. 老师(全知的导师):
    首先,他们在计算机模拟中创建了一个“老师”AI。这个老师在“作弊”:它拥有一份秘密的小抄。它知道它所控制的船只的精确物理特性(例如它的重量、转向速度等)。因为掌握了这些秘密,它学会了如何完美地驾驶任何船只。

  2. 学生(侦探):
    接下来,他们创建了一个“学生”AI。这个学生不被允许看到那份小抄。它必须在盲操的情况下驾驶船只,就像在现实世界中驾驶真实的船只一样。
    这里的魔力在于:学生被训练去观察历史记录中发生的事情。它会观察:“我让引擎向左转,但船只只转动了一点点。然后我让它向右转,结果它转得太快了。”通过分析这些过去的交互,学生学会了如何实时推测船只的“个性”(隐藏的物理特性)。它本质上是在驾驶过程中构建了一个关于船只的心理模型。

类比:学习驾驶不同的汽车
把这想象成学习开车。

  • 老师 就像一位驾驶教练,他知道世界上每辆车的精确马力和刹车灵敏度。由于了解这些参数,他们可以完美地驾驶法拉利或卡车。
  • 学生 是一位坐在从未见过的车里的新手司机。他不知道车辆的参数。但在驾驶了几秒钟后,他能感觉到方向盘的反应以及刹车的感觉。他会根据这种“感觉”立即调整自己的驾驶风格。
  • 结果: 学生学会在驾驶新车时,表现得像老师一样出色,尽管他从未看过这辆车的说明书。

他们在现实世界中所做的工作
研究人员在两艘截然不同的真实船只(平台 A 和平台 B)上测试了这一技术。

  • 他们使用了一个非常简单、快速的计算机模型(而不是超级复杂、缓慢的物理模拟器)来训练 AI。
  • 然后,他们将这个 AI 直接应用到真实的船只上,没有进行任何额外的调优。
  • 结果: 这个“学生”AI 的表现几乎接近于为该船只专门定制的控制器。事实上,在其中一艘船上,与不具备这种“侦探”能力的标准 AI 相比,它将误差(即船只偏离路径的程度)降低了 58%

为什么这很重要
这意味着我们不需要为建造的每一艘新船都花费数周时间来设计新的控制器。我们可以训练一个智能系统,使其能够适应它所搭载的任何船只,从而更轻松地部署用于监测水质、搜寻幸存者或仅仅是为了娱乐的各类自主航行船队。

局限性
论文指出,这种方法在船只以正常速度行驶时效果最好。对于“滑行”(在高速下掠过水面)的船只或应对极端波浪的情况,它可能会遇到困难,因为用于训练的简单模型并未涵盖这些极端的物理现象。但对于标准作业而言,这是一种控制水上机器人的强大新方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →