软体机器人是工程学的一个独特分支,它用灵活的、类橡胶的材料取代了刚性的金属和塑料。与依靠精确、固定关节运动的传统机器不同,这些机器人像生物组织一样弯曲和扭转,使其能够挤过狭窄的空间、处理脆弱的物体,或在不造成损坏的情况下在崎岖地形中穿行。由于它们的身体是由柔软、富有弹性的组件构成的,因此它们没有单一的固定形状;相反,它们的整个形态可以持续变化。这种灵活性使它们在医疗手术或搜救任务等受限环境中极其有用,但也使得它们的控制变得异常困难。传统的计算机模型难以精确预测软体机器人的运动方式,因为材料的弯曲方式复杂且难以预测。为了解决这个问题,研究人员转向了基于视觉的控制技术,即通过摄像头观察机器人并实时调整其动作,就像人类观察自己的手来引导动作一样。然而,一个主要的障碍仍然存在:大多数此类视觉控制系统都是为特定尺寸的机器人构建的。如果一个机器人由五个相连的段组成,那么该控制软件通常无法直接用于由三段或七段组成的机器人,而无需进行完全重写和重新训练。
一个研究小组开发了一种新方法,允许单一控制系统管理不同长度的软体机器人,而无需为每种尺寸准备新的训练数据。他们专注于一种通过将相同的充气段线性连接起来构建的机器人。在实验中,他们构建了从仅有一个段到五个段首尾相连的机器人。他们发现的核心技术是将机器人的整个身体图像分解成小的、独立的个体,将每个段视为一个独立的实体。系统不再试图将五段机器人作为一个巨大的、复杂的整体来学习其运动方式,而是学习单个段如何运动,并将同样的知识应用于它所看到的每一个段,无论这些段有多少个邻居。这意味着,一旦研究人员教会了计算机如何控制单个段,同一个“大脑”就可以立即被重复使用,去控制一个由一个、三个或五个段组成的机器人。
为了实现这一点,研究人员必须克服这样一个事实:一个段在序列中所处的位置不同,其外观也会有所不同。位于五段机器人底部的段在摄像头的视野中以及呈现的角度,与单独放在桌上的单个段是不同的。为了教会计算机忽略这些视觉差异,他们在训练阶段使用了一种称为几何数据增强的技术。这包括通过人工旋转和移动单段图像的数千种方式,有效地向计算机展示了同一块橡胶可以出现在许多位置和方向。通过在这些多样化的视图上进行训练,计算机学会了识别段的核心形状,而不是它在图片中的特定位置。当系统部署在多段机器人上时,它使用一种专门的工具在相机画面中定位每个段,将其裁剪出来,并将其输入到同一个控制模块中。随后,该模块计算出该特定段所需的空气压力调整,以匹配目标形状。
研究人员在实验室中悬挂物理机器人,并使用标准的网络摄像头进行观察,对该系统进行了测试。他们编程让机器人弯曲成特定的形状,例如扭转或向前弯曲,并测量实际机器人与目标图像的匹配程度。结果显示,该系统成功引导了一到五段机器人趋向其目标形状。虽然段数较多的机器人需要更长的时间才能稳定下来,并且表现出略高的误差,但该控制系统在所有配置下都能有效工作,无需额外的训练。该系统还表现出了对环境变化的鲁棒性;即使在房间光照变化、背景中有物体放置,或者机器人的顶端挂有重物时,它仍能保持控制。在一次测试中,一个500克的质量块被附着在一个五段机器人的末端,模拟了现实世界机器人可能携带的额外负载,而系统仍然能够引导机器人达到正确的姿态。
该系统可靠性的一个关键部分在于其处理缺失信息的能力。在现实场景中,机器人的某些部分可能会被自身的身体、人的手或其他物体遮挡,导致摄像头丢失对某个特定肌肉或段的追踪。研究人员构建了一个轻量级网络,可以根据周围的部分来推测缺失的视觉数据。当一部分机器人形状被遮挡时,该网络会重建缺失的图像,从而使控制系统能够平稳运行。如果没有这种重建,机器人将会难以移动或无法达到目标。这项研究表明,通过将复杂的全身问题分解为简单的局部任务,单一控制模型可以扩展到处理更大、更复杂的机器。这一发现表明,未来的软体机器人可以根据不同的部件数量进行组装和拆解,并且相同的控制软件可以立即投入使用,从而消除了每次机器人配置改变时都需要收集新数据或重新训练系统的需求。
技术摘要:面向串联模块化软机器人的模块数量自适应视觉形状控制
1. 问题陈述
软体机器人,特别是那些由模块化气动驱动器构建的机器人,在受限和非结构化环境中具有巨大的应用潜力。然而,由于其高自由度、材料非线性、滞后性和制造变异性,控制这类机器人的全身形状具有挑战性。虽然数据驱动的控制方法已经出现,旨在绕过复杂的解析建模,但现有的方法通常依赖于为固定机器人结构训练控制器。
当前基于图像的全身形状控制的一个关键局限性在于缺乏可扩展性。当串联软机器人的模块数量发生变化时,相机视野内的模块空间分布也会随之偏移。因此,针对特定配置(例如单个模块)训练的控制器无法直接复用于具有不同模块数量的配置,而无需收集新的训练数据并重新训练模型。本文旨在解决一种能够利用仅从单模块配置中学习到的控制知识来适应不同模块数量的控制框架的需求。
2. 方法论
所提出的框架通过将全局控制问题分解为局部模块级任务,实现了可扩展的全身控制。该系统由三个主要部分组成:模块提取器 (Module Extractor)、模块控制器 (Module Controller) 和 掩膜重建网络 (Mask Reconstruction Network)。
A. 系统架构
模块提取器:
- 利用模块分割器 (Module Segmenter, MS) —— 一个基于 Detectron2 的实例分割模型 —— 来识别全身图像中的每个模块的边界框。
- 提取出的模块按其垂直位置(从上到下)进行排序,以建立当前图像与目标图像之间的一致对应关系。
- 将全身图像裁剪成与每个模块对应的局部补丁(patches)。对补丁边界进行插值处理,以减少背景噪声。
- 通过在一个包含所有测试配置(1 到 5 个模块)图像的组合数据集上对单个 MS 进行微调,使其能够不受总数限制地定位模块。
模块控制器:
- 基于闭环方式运行,根据当前状态与目标状态之间的差异迭代更新驱动电压。
- 输入处理: 对于每个模块补丁,驱动器分割器 (Actuator Segmenter, AS) 会识别出三个气动人工肌肉(左、中、右)。掩膜根据其质心 x 坐标进行重排序,以确保一致的空间通道顺序(左-中-右)。
- 状态表示: 控制器的输入张量是一个由以下内容组成的 9 通道拼接:
- 当前二值掩膜 (Mt,n)。
- 目标二值掩膜 (Mtarg,n)。
- 从当前指令电压广播而来的归一化电压图 (Qt,n)。
- 预测模型: 基于 CNN 的电压预测模型 (Iθ) 估计期望的电压向量。最终指令使用一阶增益 (K=0.5) 对预测电压与当前电压之差进行更新,随后将其裁剪至有效电压范围。
- 训练策略: 控制器仅在单模块视觉和驱动数据上进行训练。为了便于向更长链条中的下游模块迁移,在训练期间应用了几何数据增强(随机旋转和平移)。这模拟了下游模块在多模块设置中可能表现出的位置和方向变化。
掩膜重建网络:
- 解决由遮挡、重叠或光照变化引起的视觉信息缺失问题。
- 一个轻量级的基于 U-Net 的网络 (Rϕ) 用于重建缺失的驱动器掩膜通道。
- 机制: 如果某个特定通道(例如左侧掩膜)缺失或不可靠,网络将剩余的两个掩膜通道和当前电压向量作为输入,来预测缺失的通道。这确保了控制器即使在部分遮挡的情况下也能接收到一致的 9 通道输入张量。
3. 核心贡献
本文概述了三个主要贡献:
- 组合式视觉控制框架: 一种能够复用仅在单模块数据上训练的控制器的的方法,该方法可用于具有不同模块数量(1 到 5 个)的机器人,而无需收集特定配置的控制数据或重新训练控制器。
- 通过增强实现的可扩展迁移: 证明了在单模块训练期间应用的几何数据增强(旋转和平移)能有效减少视觉分布偏移,从而使控制器能够泛化到更长串联链条中的下游模块。
- 鲁棒性验证: 通过实验验证了控制器在物理机器人上,在不同模块数量、环境干扰(光照、背景)、仿射变换(平移和旋转)以及负载加载情况下的性能。
4. 实验结果
实验是在一个物理模块化软体气动机器人(最多 5 个模块,总长度 875 mm)上进行的,使用的是单个 RGB 相机。
- 可扩展性(1 到 5 个模块): 仅在单模块数据上训练的控制器成功驱动了具有 1 到 5 个模块的机器人,使其趋向于目标姿态(扭转、前倾、后仰等)。虽然均方误差 (MSE) 及其标准差随着模块数量的增加而略有上升(表明存在误差累积),但图像误差随时间持续下降,并在约 20 秒内收敛。
- 数据增强的影响: 对比有/无几何增强训练的实验表明,增强显著抑制了随模块数量增加而产生的误差上升,证实了其在泛化控制策略方面的作用。
- 环境鲁棒性: 系统在改变照明、背景障碍物以及反馈图像的合成仿射变换(平移和旋转)下仍能保持性能。
- 负载加载: 当在 5 模块机器人的末端连接 500g 负载时,控制器成功收敛至目标形状,尽管不同姿态下的误差方差有所增加。
- 掩膜重建: 在实验性地移除一个驱动器掩膜通道的情况下,重建网络成功恢复了缺失的视觉特征,使机器人能够恢复运动。若没有重建功能,机器人将无法有效运动。
5. 重要性与局限性
本文声称这项工作实现了面向串联模块化软机器人的可扩展、无标记全身形状控制。其核心意义在于能够将训练于极简单模块数据集的控制模型,部署到复杂的、变长的结构中,而无需重新训练。这降低了数据采集的负担,并促进了模块化机器人在动态环境中的重新配置。
作者也坦诚地指出了局限性:
- 误差累积: 稳态误差随模块数量增加,这归因于负载分布(重力矩)的变化以及单目视觉固有的深度信息缺失。
- 数据增强的局限: 当前的 2D 旋转和位移增强无法完全模拟由深度运动(3D 变化)引起的表观尺度变化。
- 目标生成: 研究假设提供了一个物理上可行的目标图像;并未涉及如何从高级规划器或草图生成此类目标。
结果表明,虽然单模块学习可以组合进全身控制,但较长链条中的物理耦合和深度歧义限制了精度的实际上限,未来的工作可能会通过负载补偿或具备 3D 感知的增强技术来解决这些问题。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。