想象一下一种像植物藤蔓一样生长,通过将自身皮肤翻转过来向外扩张来向前推进的机器人。这是一种“藤蔓机器人”(vine robot)。它是柔软且灵活的,非常适合挤进管道或坍塌隧道等狭窄、杂乱的空间,而刚性机器人则会卡在那里。
然而,控制这种机器人简直是一场噩梦。因为它是由软性材料制成的,它会以不可预测的方式扭动、折叠和弯曲。如果你告诉它“直走”,它可能会意外地卷成一个结,或者撞到墙上,因为材料的反应每次都不同。这就像是在尝试用遥控器去驾驶一根湿润的面条;你不能仅仅靠猜测路径,因为面条在移动时形状一直在变。
解决方案:让机器人的全身都长出“眼睛”
斯坦福大学的研究人员开发了一个名为 PanoVine 的系统,他们意识到要控制这种扭动的机器人,你不能只盯着顶端看,你需要观察它的全身。
- 装置设置: 他们制造了一个长达 6 米(约 20 英尺)的软体机器人,并在其身体各处安装了 19 个摄像头。
- 类比: 想象一条蛇穿着一件每一片鳞片上都装有摄像头的套装。随着机器人的生长和伸展,这些摄像头会逐渐显露出来,为机器人提供 360 度、多角度的视角,观察自身及周围的世界。
- 结果: 机器人不再是靠猜测,而是可以“看到”自己是如何弯曲的,在哪里碰到了墙壁,以及前方有哪些障碍物。
大脑:通过观察进行学习
由于机器人的运动很难用数学方程来预测,研究人员并没有尝试编写规则。相反,他们使用了模仿学习(Imitation Learning)。
- 工作原理: 一名人类操作员使用摇杆驱动机器人通过困难的课程(如爬坡、穿过树枝和躲避障碍物),同时 19 个摄像头记录下这一切。
- AI: 计算机观看这些视频,并学习一种“策略”(一套规则),将摄像头所看到的画面与机器人下一步应该做什么联系起来。这就像一名学生看着大师级厨师烹饪,然后尝试复制那道菜,只不过在这种情况下,这个学生是一个正在学习如何驾驶巨型、扭动藤蔓的 AI。
结果:它能做什么?
团队在现实世界中用两个主要挑战测试了这个系统:
障碍赛: 机器人必须导航通过一条复杂的 6 米路径,其中包括急转弯、爬上 45 度斜坡、跨越无支撑的间隙以及挤过树枝。
- 结果: AI 控制的机器人成功率达到了 80%。
- 对比: 当他们尝试在不让 AI 观察摄像头的情况下,仅仅重放人类的摇杆动作(开环控制)时,机器人 100% 失败了。这证明了机器人需要实时观察情况来纠正错误。
目标练习: 机器人必须向外生长,发现一个特定物体,并将顶端精准地转向该物体进行触碰。
- 结果: AI 成功率达到了 85%。
- 对比: 如果他们只使用第一个摄像头(位于底部的那个)而忽略其余摄像头,机器人则 100% 失败了。这表明拥有遍布全身的眼睛至关重要,因为物体可能会被底部的摄像头遮挡,但会被藤蔓更高处的摄像头看到。
为什么这很重要
这是首次有藤蔓机器人能够仅依靠其自带的传感器实现自主驾驶。通过赋予机器人“全身视觉”系统,并教它通过人类演示进行学习,研究人员解决了这种机器人难以预测、扭动特性带来的问题。
目前还做不到的事情(局限性)
论文指出,该系统目前仅使用标准摄像头,还没有感知触觉或压力的传感器。此外,它是针对特定的机器人设计进行训练的;它需要更多的数据才能变得更加可靠。但就目前而言,这是在教导软体、生长型机器人如何自主导航复杂现实世界方面迈出的重要一步。
技术摘要:PanoVine —— 用于软体生长型藤本机器人(Vine Robot)的全身视觉运动控制
问题陈述
藤本机器人是一类气动软体生长连续体机器人,由于其具有柔顺的本体和自支撑的生长机制,在导航受限、复杂且非结构化环境(如管道、地下基础设施)方面具有独特优势。然而,控制这类机器人进行自主导航和操作仍面临重大挑战,主要源于以下两个因素:
- 不可预测的动力学特性: 机器人的行为受材料顺应性、滞后现象、失稳屈曲、本体与环境交互以及未翻转尾部张力的影响。这些因素使得系统难以进行物理建模。因此,开环重放动作轨迹往往会导致不同实验中出现截然不同的机器人构型。
- 车载传感能力有限: 机器人在大型工作空间内经历复杂的全身变形。传统的有限传感模态(例如单个摄像头或 IMU)不足以捕捉可靠闭环控制所需的必要状态信息,特别是在顶端传感器增加机械复杂性,或机器人本体遮挡自身视野时。
现有的基于模型的方案依赖于运动学假设(如分段恒定曲率)或障碍物几何先验,这些假设在充满障碍且未知的环境中会失效。类似地,先前的基于学习的方法大多局限于模拟环境或较短的非生长型软体臂,无法扩展到具有高自由度且持续生长的长型藤本机器人。
方法论
作者提出了 PanoVine,这是首个能够仅依靠车载传感实现闭环控制的自主藤本机器人系统。该方法集成了一个定制的硬件平台与一个数据驱动的视觉运动控制框架。
1. 系统硬件:分布式全身视觉
PanoVine 平台拥有一个长 6 米、直径 0.16 米的软体生长本体,具备七个可控自由度(一个伸展维度,六个旋转弯曲关节)。
- 传感器套件: 系统配备了 19 个 RGB 摄像头,分布在机器人的整个本体上。
- 布置策略: 摄像头安装在机器人各段的 TPU 涂层侧面,相对于本体轴线呈 60 度角。它们分别面向远端或近端。随着机器人通过翻转(eversion)生长,摄像头会被逐渐显露出来,从而提供关于机器人变形和周围环境的多视角反馈。
- 驱动方式: 机器人通过操纵杆界面进行控制,该界面用于指挥关节空间的转向和轴向生长,并可通过压力调节进行刚度控制。
2. 控制框架:全身视觉运动策略
系统的核心是通过模仿学习从遥操作演示中训练出的端到端视觉运动策略。
- 输入: 策略接收观测历史 o=(I,q),其中 I 代表所有 19 个摄像头的 RGB 流,q 代表本体感知(关节角度和基座长度)。
- 架构: 系统采用 扩散 Transformer(Diffusion Transformer) 作为骨干网络。
- 视觉编码: 图像被调整为 224×224×3 大小,并通过预训练的 CLIP Vision Transformer 进行处理。每个摄像头视图的类别标记(class token)作为紧凑的嵌入向量。
- 交叉注意力(Cross-Attention): 交叉注意力机制使策略能够学习隐式的多视图对应关系,以及分布式视觉输入、本体感知与动作之间的特定任务语义关系,从而绕过了对显式外参标定的需求。
- 动作输出: 策略预测一个动作块 a∈Rτ×d(其中 τ=8),指定未来时间步的基座长度和关节角度。
- 提升鲁棒性的关键设计选择:
- 相对表示: 本体感知和动作都是相对于最新的观测帧来表达的,以确保平滑过渡,并提高对滞后现象和驱动不确定性的鲁棒性。
- 数据重平衡: 为了解决遥操作数据中转向动作稀疏的问题(此类数据主要由纯生长动作主导),训练数据集经过了重平衡处理,以确保策略学习到关键的反应性转向行为(如转向、攀爬),而不是过度拟合于生长过程。
核心贡献
- 硬件平台: 一个具有分布式全身视觉(19 个摄像头)的藤本机器人系统,在整个生长过程中提供关于机器人状态和环境的全方位、多视角反馈。
- 控制框架: 一种专为长型变形机器人设计的学习型视觉运动策略。它能有效聚合分布式传感信息,保持对不可靠状态估计的鲁棒性,并处理具有稀疏转向动作的长程行为。
- 自主演示: 首次展示了藤本机器人在无需外部传感(如 GPS、运动捕捉)或基于模型的规划的情况下,在复杂现实场景中实现自主闭环控制。
实验结果
系统在两个具有挑战性的现实任务上进行了评估:
1. 复杂路径导航
- 任务: 导航一条 6 米长的路径,涉及分支选择、45° 斜坡攀爬、穿越无支撑间隙、避障以及急转弯。
- 表现: PanoVine 策略实现了 80% 的成功率。
- 基准测试:
- 轨迹重放(开环): 成功率为 0%。失败原因包括与障碍物碰撞,以及由于屈曲导致的长度偏差导致无法到达目标。
- 未进行重平衡: 成功率为 10%。策略在分支点未能进行充分转向,凸显了数据重平衡策略的必要性。
2. 物体触达
- 任务: 向前延伸 2 米,并精确转向以触碰并撞倒放置在未知位置和方向的物体。
- 表现: 该策略实现了 85% 的成功率,证明了通过将转向指令建立在多视图视觉反馈之上,系统可以对未见过的物体和位置进行泛化。
- 基准测试:
- 单摄像头策略: 成功率为 0%。单摄像头在延伸或转向过程中无法维持对物体的观察,导致目标丢失。
意义与主张
论文声称,PanoVine 代表了软体机器人领域的重要进展,证明了仅依靠车载传感即可实现藤本机器人的自主闭环控制。
作者强调,他们的方法绕过了传统基于模型的流水线的局限性,这些模型在处理藤本机器人固有的非线性、滞后性和不连续变形时表现困难。通过学习基于分布式全身视觉的端到端视觉运动策略,系统可以直接观察接触、变形和周围几何形状,从而补偿机器人状态和动力学的不确定性。这项工作为未来研究在复杂、非结构化环境中运行的软体机器人的学习控制奠定了基础。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。