✨ 要点🔬 技术摘要
人类之手是工程学上的奇迹,它能够握住一支笔,在手臂完全不动的情况下描绘出复杂的字母。这种被称为“手内操纵”(in-hand manipulation)的能力,依赖于手指与物体之间持续且微妙的博弈。然而,对于机器人而言,这仍然是一个极其困难的挑战。虽然机器可以轻松拿起杯子或按下按钮,但要让一个机械手仅靠手指驱动机械手拿着笔在纸上书写,长期以来似乎一直难以实现。问题在于,手与物体之间的接触点在不断变化,产生了一个极其复杂的力场网络,这使得使用标准的计算机模型进行预测变得异常困难。为了教会机器人这项技能,研究人员传统上依赖于两种“笨重”的方法:要么构建庞大且精细的模拟系统,试图模拟每一次物理交互;要么收集大量的人类视频数据,向机器人展示如何运动。这两种方法都需要巨大的计算能力和时间,而且都没有完全解决让机械手在纸上自由书写的问题。
苏黎世联邦理工学院(ETH Zurich)的一个研究小组现在展示了一条不同的路径,这条路径避开了对复杂模型或海量数据集的需求。他们通过让机器人实时学习自身运动与笔的位置之间的关系,教会了机械手书写。该系统并非试图预先计算抓握的物理过程,而是简单地观察当手指移动时会发生什么,并即时调整其理解。使用一台标准的笔记本电脑处理器和一个简单的摄像头,系统从一段短暂的探索期开始,通过一系列动作移动手指以感知笔的感觉。在大约十八秒内,机器人就收集到了足够的信息来开始书写。随后,它在书写过程中不断优化自己的动作,无需预设关于手部运作方式的程序图谱,即可即时纠正错误。
研究中使用的机器人是 ORCA 手,这是一个拥有十七个运动关节的逼真设备,由微小的缆绳驱动,类似于人类手部的肌腱。研究人员将一支笔放入手中,并用软套固定,以使抓握更加稳定,同时放置了一个摄像头来观察笔尖。当机器人移动时,摄像头会追踪笔在纸上的位置。该系统的核心是一个观察与调整的连续循环。当机器人指令手指移动时,它会观察笔实际移动到了哪里。然后,它会更新一个内部估计值,即手指的运动如何转化为笔的运动,从而有效地在运动过程中学习抓握的“规则”。这使得机器人能够追踪预期的路径,例如一个字母或一个形状,并保持极高的精度。在测试中,机器人写出了整个字母表并绘制了各种形状,无论是在空中还是在纸上,都能将笔的路径保持在预期线条不到一毫米的范围内。
这种方法的独特之处在于其简洁性与速度。该系统不依赖于手部结构的数学模型或接触点的物理特性,也不需要通过虚拟世界进行训练或观看人类演示。它纯粹通过交互进行学习。研究人员发现,如果他们在初始设置后停止学习过程并尝试使用一组固定的规则,机器人很快就会迷失方向,经常掉落笔或偏离线条。然而,通过保持学习处于活跃状态,机器人可以适应微小的滑动或抓握变化,在长达三十多分钟的书写过程中保持其准确性。该系统也在计算机模拟中针对两种不同类型的机械手进行了测试,并且表现良好,这表明该方法不受特定机械手设计的影响。
结果表明,机器人无需被教导关于手部运作的所有细节,也能实现类人的灵巧度。目前的书写速度较慢,且机器人仍需要一个独立的机械臂在字母之间移动手部以变换起始位置,但仅靠手指运动就能书写任意形状和字母的能力,是向前迈出的重要一步。研究人员指出,该系统足够鲁棒,能够在受到突然震动或滑动时进行恢复而无需重启,这对于实际应用至关重要。通过证明机器人可以通过直接的实时观察来学习书写,这项工作表明,复杂的操纵任务并不总是需要海量数据或强大的超级计算机。相反,一种轻量级的、能够从即时环境中学习的自适应方法,可能是解锁机械手全部潜力的关键。
技术摘要:通过实时雅可比估计实现灵巧手内笔书写快速学习
问题陈述
灵巧的手内操纵(dexterous in-hand manipulation)——即仅通过手指运动来重新定位或操纵抓取的物体——是机器人领域的一项重大挑战。目前的基于学习的方法面临着明显的瓶颈:
强化学习 (RL): 虽然在仿真环境中非常有效,但 RL 依赖于大量的领域随机化(domain randomization)来弥补从仿真到现实(sim-to-real)的差距,由于接触交互具有复杂且动态的特性,这变得非常困难。
模仿学习 (IL): 这种方法需要大量的演示数据。然而,获取高质量的手内演示数据非常困难,因为手指会遮挡物体及彼此,导致纯视觉记录(即使是第一视角视图)也无法捕捉所有的接触点。此外,将人类数据重定向(retargeting)到运动学不同的机器人上也具有挑战性。
两种方法通常都需要大规模的模型构建、仿真或数据收集工作才能实现灵巧性。作者提出了一种替代方案:一种轻量级、数据高效的方法,该方法直接在物理机器人上学习手指驱动与物体运动之间的关系,而无需预先收集的数据或解析接触模型。
方法论
所提出的系统利用**在线任务雅可比估计(online task-Jacobian estimation)**方法,控制一个 17 自由度的人形机器人手(ORCA 手)进行手内笔书写。该系统无需解析的手物运动学模型、仿真训练或先验演示。
1. 系统架构与感知
硬件: 一个腱驱动的 ORCA 手抓取一支装在定制软 TPU 套筒中的笔(增加了直径以确保抓握稳固)。腕部、环指和中指固定;控制仅限于拇指、食指和中指的 10 个关节。
感知: 使用标准网络摄像头追踪笔上的 ArUco 标记以及桌面上的标记,以定义纸张坐标系。笔尖位置通过固定偏移量恢复,并使用带有离群值剔除功能的卡尔曼滤波器进行平滑处理。
控制循环: 系统以约 15 Hz 的感知受限速率运行。它在一个“感知–估计–执行”的循环中运行:将笔尖轨迹与参考轨迹进行比较,并基于估计的雅可比矩阵生成关节指令。
2. 在线雅可比估计 该方法的核心是一个递归最小二乘(RLS)估计器,用于学习命令空间任务雅可比矩阵 (J J J ),该矩阵将关节速度 (q ˙ \dot{q} q ˙ ) 映射到笔尖速度 (x ˙ \dot{x} x ˙ )。
更新机制: 估计器使用指令关节增量 (Δ q c m d \Delta q_{cmd} Δ q c m d ) 而非测量的速度来更新 J J J ,因为“指令到运动”的映射在操作上更具相关性且噪声更小。
自适应性: 遗忘因子 (λ \lambda λ ) 使估计器能够追踪缓慢变化的动力学特性(例如抓握滑动)。协方差矩阵被对角化以降低计算负载。
激励阶段: 为了引导估计过程,系统执行了一个 18 秒的初始化阶段,期间手部在六个预定义的抓握姿态中进行扫掠。这确保了估计器在开始追踪之前观察到一组配置良好的 ( q ˙ , x ˙ ) (\dot{q}, \dot{x}) ( q ˙ , x ˙ ) 数据对。
3. 控制律 控制器使用估计的雅可比矩阵的阻尼右伪逆 (J + J^+ J + ) 来计算关节指令:Δ q = ( J + v c m d + k p b N ⊥ ( q 0 − q ) ) Δ t \Delta q = (J^+ v_{cmd} + k_{pb} N^\perp (q_0 - q)) \Delta t Δ q = ( J + v c m d + k p b N ⊥ ( q 0 − q )) Δ t
任务追踪: 第一项 (J + v c m d J^+ v_{cmd} J + v c m d ) 利用带有前馈的 PID 控制器驱动笔尖沿期望轨迹运动。
抓握稳定: 第二项通过雅可比矩阵的近似零空间 (N ⊥ N^\perp N ⊥ ) 投影一个姿态稳定力。它将手部拉回初始的稳定抓握姿态 (q 0 q_0 q 0 ),而不会干扰主要的书写任务,从而防止抓握失稳。
核心贡献
具身手内书写: 首次展示了通过纯粹的手内手指运动,使类人手能够在纸上书写任意单笔画轨迹(字母和形状),并实现了亚毫米级的精度。
轻量级、无模型控制: 一种不需要解析接触模型、仿真训练或预先收集演示数据的控制架构。它完全依赖于实时交互和在线估计。
泛化性: 同一套估计器/控制器公式已成功应用于三种不同的机器人手系统(一个物理 ORCA 手和两个仿真手:Shadow Hand 和 Wuji Hand 2),证明了其与具身形态无关的特性。
开源: 代码和仿真实现均已开源。
结果
追踪精度: 在 38 次运行(22 次在空中,16 次在纸上)中,系统实现了 0.64 ± 0.10 mm 的平均平面内追踪误差。表现最好的运行达到了 ~0.39 mm(空中)和 ~0.57 mm(纸上)。第 95 百分位误差约为 1.4 mm。
鲁棒性: 系统能够在长时程内(例如连续 31 分钟完成整个字母表的书写)保持精度而不会出现性能下降。它可以从较大的瞬态误差(例如 ~20 mm 的突跳)中恢复,而无需重新初始化。
消融实验:
雅可比冻结: 在初始化后冻结雅可比估计会导致精度迅速下降或发散。持续的在线更新对于应对诸如抓握滑动之类的扰动至关重要。
抓握正则化: 禁用零空间姿态稳定项会导致抓握不稳定,并在 60% 的运行中导致失败,证明了其对于维持稳固抓握的必要性。
速度: 书写速度被刻意保持在较低的 8 × 10 − 4 8 \times 10^{-4} 8 × 1 0 − 4 m/s (0.8 mm/s) 。将速度提高到 2 倍、3 倍或 4 倍会非线性地降低精度和鲁棒性,表明吞吐量与稳定性之间存在权衡。
仿真: 该方法被移植到 MuJoCo 中用于 Shadow Hand 和 Wuji Hand 2。尽管控制的是 3D 坐标(不同于物理控制中的 2D)且缺乏柔性套筒,Shadow Hand 仍实现了 0.17 mm 的 RMSE,Wuji Hand 2 实现了 1.48 mm 的 RMSE,证实了该方法在不同运动学下的适用性。
意义与主张
作者声称这项工作证明了在线、实时学习是实现灵巧手内操纵的一条可行路径 ,特别是在需要轻量级、自适应控制器的场景下。
作为重型方法的替代方案: 本文将此方法定位为 RL 和 IL 的一种计算简单且数据高效的替代方案,后者通常需要大规模的模型构建或数据收集工作。
无需精确模型: 结果表明,缺乏精确的解析模型或大型数据集并不是实现高度灵巧性的根本障碍;相反,快速的具身学习即可足够。
实用性: 该系统可以在标准笔记本电脑 CPU 上运行,仅需一个普通网络摄像头,这使得它在计算资源有限的应用场景(如车载假肢控制)中具有应用前景。
作者承认的局限性:
系统目前仅控制 2D 平面内运动;垂直方向(z 轴)的漂移不受控制,由柔性纸架吸收。它目前还无法在刚性表面上书写,也无法在没有手臂辅助的情况下执行多笔画任务(如字母 'i' 上的点)。
它无法处理接触不连续的任务(例如重新抓握笔)。
书写速度目前比人类书写慢,且精度受限于视觉系统的抖动。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。