Fleet-To-Lab: A Transfer Learning Framework For Lunar Rover Slippage Estimation Via Model Fusion
本文介绍了“从车队到实验室”(Fleet-to-Lab)这一迁移学习框架,该框架利用一种名为 AcoMerge 的新型混合群智算法,将基于有限月球数据训练的异构专家模型进行融合,从而通过有效弥合地球与月球之间的领域差异,为未来的月球漫游车实现精确的轮滑估计。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在月球上驾驶机器人是一场以“英寸”为单位的博弈。在地球上,探测器的车轮能以可预测的确定性抓紧地面,但在月球表面,规则发生了变化。月球的引力仅为地球的六分之一,而其土壤(被称为月壤)在压力下表现得像一种流体。当车轮转动时,它可能会下陷、打滑,或者在车辆并未前进的情况下徒劳地空转。这种被称为“打滑”的现象,是月球任务中无声的杀手。过度的打滑会破坏机器人的定位感,在最糟糕的情况下,它会将车辆困在深坑中无法脱身。为了安全导航,探测器需要实时精确地知道其车轮打滑的具体程度。
几十年来,工程师们一直试图教会机器人仅利用来自机器人自身的数据(例如车轮转动的速度和车辆的倾斜度)来感知这种打滑。他们构建了复杂的计算机程序或模型来做出这些预测。然而,这些程序面临着一个巨大的障碍:它们通常是在地球上训练的。一个在模拟月球环境且处于地球引力下的机器人学习驾驶,学到的往往是错误的经验。物理特性实在太不一样了。土壤的反应不同,车轮下陷的方式在地球实验室中从未发生过。由于来自月球的真实数据极其稀缺——只有极少数探测器曾造访过月球,且它们很少携带测量直接打滑所需的特定传感器——科学家们一直难以构建出适用于未来任务的系统。
卢森堡大学的一个研究小组提出了一种解决这一问题的新方法,将过去任务的历史转化为未来的指南。他们并没有尝试在地球上从零开始教一个新的机器人,而是开发了一种借鉴旧有、已部署月球探测器经验的方法。他们称之为“舰队到实验室”(Fleet-to-Lab)的方法,将以往任务的数据视为一座智慧图书馆。通过结合这些不同机器人的知识,他们可以为一台甚至从未离开过地面的未来探测器创建一个更聪明的模型。
他们工作的核心是一个被命名为 AcoMerge 的新算法。想象一下一支专家团队,每位专家都有不同的训练方式:一位专家在地球上学习,另一位学习自在月球行驶的探测器,第三位则学习自另一种类型的月球探测器。通常,当你试图结合这些专家的意见时,你只是简单地取其平均值,但这往往会导致一个什么都做不好的混乱结果。AcoMerge 的做法更为精准。它扮演着“首席编辑”的角色,观察计算机模型的每一个部分,并决定哪位专家的版本是最优的。它在成千上万种可能的组合中进行搜索,以找到知识的最佳混合比例。为此,它使用了一种模仿蚁群觅食和鲸鱼捕猎的混合方法,在不需要从头开始重新训练整个系统的情况下寻找最优解。
研究人员在一个高度详细的计算机模拟中测试了这个想法,该模拟模拟了月球的引力和土壤。他们创建了一个场景:一个仅在地球上接受过训练的目标探测器,需要学习如何在月球上驾驶。他们向其输入了来自两个已经在模拟月球地形中训练过的“舰队”探测器的数据。随后,团队利用极少量的真实世界数据——即新探测器着陆后仅几分钟的行驶数据——来微调最终的模型。这种少量的数据是符合实际情况的,因为未来的任务在着陆后可能只有一个很短的窗口期来进行系统校准。
结果非常显著,尽管根据所用模型的复杂程度存在重要的细微差别。在模拟中,这种新方法在较小、较简单的计算机模型上表现异常出色,优于那些仅仅试图在所有数据上同时训练机器人的标准技术。对于这些资源受限的网络,AcoMerge 成功融合了分离的专家模型,从而实现了对打滑预测更高的准确性,特别是在探测器即将陷入困境的最危险情况下。然而,在更大、更复杂的模型上,该方法表现得与传统的联合训练方法持平,在达到高准确度的同时,无需经历合并所有数据集进行单次训练运行的复杂流程。该方法在较小、较简单的计算机模型上效果更好,这至关重要,因为未来的探测器计算能力有限,无法携带庞大且沉重的软件系统。
研究还揭示了哪些方法是行不通的。简单地将模型平均化(这是领域内的一种常用技术)无法弥合地球与月球物理特性之间的鸿沟。同样,即便稍后加入一点月球数据,仅靠地球数据来教导机器人也无法克服引力和土壤带来的根本差异。研究人员发现,关键不在于拥有更多的数据,而在于拥有“正确”的数据:即那些已经面对过月球环境的机器人的具体操作经验。
这项工作为太空探索指明了一条新路径。它意味着我们不需要等待一份完美的月球数据集来制造更好的机器人。相反,我们可以利用过去任务的档案,即使那些没有完美传感器的任务,来训练下一代机器人。通过融合一群过去探索者的学习行为,我们可以让新的探测器获得领先优势,使其能够以一种此前无法想象的信心,在险象环生的月球表面进行导航。研究人员计划在物理机器人和真实的过往任务历史数据上测试这些想法,但他们的模拟实验表明,这一概念是可靠的。在月球探索这种失之毫厘谬以千里的高风险领域,拥有一台懂得如何“阅读”脚下地面的机器人,可能就是任务成功与车辆搁浅之间的分水岭。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。