想象一下,你正试图用一个机械手去捡起一块脆弱且富有弹性的饼干。如果机器人只是单纯地将手指移动到“正确”的形状,它可能会压碎饼干,或者在饼干滑落时直接掉落。为了出色地完成这项任务,机器人需要感知自己挤压得“有多用力”,而不仅仅是知道手指在哪里。
这篇论文介绍了一种新的方法,旨在教导不同类型的机械手如何去“感知”和“抓握”物体,即使这些机械手的外观完全不同。以下是使用简单类比进行的详细解读:
1. 问题所在:不同的手,不同的“语言”
把机械手想象成不同的乐器。一个可能是钢琴(有很多琴键),另一个可能是吉他(弦较少),第三个可能是架子鼓。
- 旧方法: 以前的方法试图教这些乐器演奏相同的“音符”(手指位置)。但如果钢琴演奏者按得太重,声音会很大;如果吉他手按得太重,琴弦就会断。旧方法只翻译了“位置”(手指在哪里),而没有翻译“力量”(按得有多重)。
- 结果: 一个在钢琴上训练出的机器人手无法轻易切换到吉他,因为它不知道如何针对新乐器调整其“触感”。
2. 解决方案:通用的“力觉转换器”
作者创建了一个通用力/位接口(Universal Force-Position Interface)。你可以把它想象成一个能同时说两种语言的翻译官:
- “在哪里”的语言(运动): 他们使用了一个基于人类手型的共享“潜在编码”(一种压缩的数字蓝图)。无论机械手的大小或形状如何,它都能告诉每只机械手应该“移动到哪里”。
- “有多重”的语言(力): 这是核心创新点。他们将每只特定机械手的原始、混乱信号(例如“电机出力”)转化为物理扭矩(牛顿·米)。
- 类比: 想象每只机械手都有不同类型的速度计。作者构建了一个转换器,将每个速度计的读数都转换为“英里/小时”。现在,拥有“巨大”速度计的机器人和拥有“微型”速度计的机器人,都能准确理解自己的行驶速度。
- 他们还创建了一个“负载描述符”(Load Descriptor),这就像一张地图,展示了物体在手指上的确切接触位置以及重量是如何分布的。
3. 大脑:MARC(“蒙眼”的学习者)
他们训练了一种新的 AI 策略,称为 MARC(掩码感知反应式顺应控制,Mask-Aware Reactive Compliant)。
- 训练技巧: 在训练期间,他们有时会在机器人的摄像头上盖上一层“遮挡物”(视觉掩码)。这迫使机器人停止依赖视觉,转而学习利用其“触觉”(经过校准的力学数据)来判断该做什么。
- 结果: 机器人学会了,如果它看不清物体(因为自己的手挡住了视线),它应该信任手指上的压力传感器,以此来判断自己抓得是否足够紧,或者是否快要掉落物体。
4. 执行:一个混合团队
该系统并不只用一个大脑处理所有事情。它采用的是团队协作模式:
- 学习者 (MARC): 处理最棘手的部分:伸手并抓取物体。它通过“蒙眼”训练来确保动作既安全又温柔。
- 肌肉 (基于模型的控制器): 一旦抓住了物体,一个更简单的、基于数学的控制器就会接管,负责稳稳地握住物体并进行移动。如果机器人撞到了东西,这个控制器会自动稍微放松握力以防止损坏,然后再次收紧。
- 交接: 当把物体交给人类时,系统会利用力传感器精确判断何时放手,而不是仅仅靠定时器来打开手掌。
5. 结果:一个大脑,多种手
团队在三只非常不同的机械手上测试了该系统(有些有 5 根手指,有些指头较少,有些关节结构也不同)。
- 神奇之处: 他们在一组机械手上训练了系统,然后在另一组从未见过的全新机械手配置上进行了测试。
- 成果: 系统表现得惊人地好。通过将“力”转化为一种通用语言,机器人可以将其技能从 20 关节的手转移到 15 关节的手上,而无需从头开始重新学习。
- 成功率: 在处理困难任务(如捡起光滑的鸡蛋或一叠杯子)时,当使用这种带有“力觉转换器”的新方法(而非仅观察手指位置的旧方法)时,成功率从约 44% 大幅提升至 71%。
总结
简而言之,这篇论文的核心观点是:“不要只教机器人移动到哪里;要教它们挤压得有多重,并将这种感觉转化为一种通用的语言,以便任何机械手都能理解它。” 这使得机器人能够安全地处理脆弱、光滑或富有弹性的物体,即使它们使用的机械手与训练时的类型完全不同。
技术摘要:传输接触,而非仅仅是运动
问题陈述
灵巧操纵不仅需要预测手指运动,更需要主动调节接触力,以处理打滑、形变和自遮挡问题。现有的跨具身策略通过重定向姿态或潜空间动作实现了运动意图的统一,但它们无法传输接触反馈。力反馈目前仍与特定手的传感和驱动(例如原始驱动信号或触觉代理)紧密绑定,导致无法在异构机器人手之间比较负载情况。因此,在视觉线索被遮挡或需要精确力调节时,在一个手上训练的策略无法泛化到另一个手上。
方法论
1. 统一力-位接口
核心贡献是一个可传输的接口,它将运动意图与接触负载解耦,并以物理上可比较的单位来表达两者。
- 共享运动意图: 手部姿态由共享的 MANO-pose 潜变量 (ψ∈R15) 表示。该低维向量从人类手套数据中学习得到,并通过特定的手部重定向映射 (Rh) 映射到任何特定手的关节配置 (q(h)),该映射旨在优化指尖位置和手指形状。
- 校准接触通道: 系统并非使用原始驱动信号,而是通过系统辨识将特定手的驱动代理映射为物理关节扭矩 (τ(h),单位为 N·m)。从这些扭矩中,系统推导出:
- 指尖力 (ft): 通过平移雅可比矩阵的最小二乘逆运算计算得出。
- 空间扭矩描述符 (γt): 一组包含三个标量 (c,ρ,ℓ) 的紧凑集合,编码了沿手指的接触位置、跨关节的负载分布以及力的横向分量。
这使得策略能够在一个统一的坐标系中观察“手应该如何移动”以及“物体是如何被加载的”,无论具体的机器人手形态如何。
2. MARC:掩码感知反应式顺应策略
作者引入了 MARC,一种基于扩散 Transformer (DiT) 架构的流匹配(flow-matching)策略。
- 输入: 策略受统一状态元组 st 条件约束,该元组包含末端执行器姿态、指尖位置、校准后的力 (ft)、空间扭矩描述符 (γt) 以及共享姿态潜变量 (ψt)。
- 结构化视觉掩码: 在训练期间,视觉标记(图像块或整个摄像机流)会被随机替换为学习到的掩码嵌入。这迫使策略在视觉证据缺失或不可靠(例如自遮挡期间)时,依赖于力和本体感受,而不是学习去忽略力数据。
- 训练目标: 策略预测速度向量,将高斯噪声源传输到目标动作块,从而最小化流匹配损失。
3. 混合执行流水线
系统并不依赖单一的端到端策略来完成长程任务。相反,它将学习到的原语与基于模型的控制器相结合:
- 到达与提起 (Reach-and-Lift): 由 MARC 执行,处理抓取和初始提升阶段的接触敏感环节。
- 运输 (Transport): 由一个稳态抓握调节器管理,该调节器使用混合力-位置控制器。它维持一个最小的稳定抓握,并根据校准后的扭矩反馈在运输过程中自动加紧。
- 交接 (Handover): 由末端执行器导纳控制器控制,该控制器会根据外部外力矩(wrenches)按比例让出手臂并张开手部。
- 控制器逻辑: 低层控制器追踪指令姿态,但应用基于校准扭矩的“单侧撤回”修正。如果接触扭矩超过目标值,控制器会张开关节;否则,它会遵循姿态指令。这确保了顺应性,同时避免了手部过度压入物体。
核心贡献
- 可传输的接触表示: 一种将特定手的驱动信号转换为校准后的关节扭矩、指尖力和紧凑负载描述符的方法,使得接触反馈在不同灵巧手之间具有物理可比性。
- 统一力-位接口: 一个结合了共享手部姿态意图与校准接触反馈的框架,实现了跨异构具身的顺应控制传输。
- MARC 策略与流水线: 一种基于视觉、本体感受和校准接触的掩码感知流匹配策略,通过与基于模型的原语集成,实现长程操纵(到达、运输、交接)而无需针对特定任务进行重新训练。
实验结果
系统在配备了三种结构不同的手(Wuji, Wuji12, 和 Inspire)的 Unitree G1 人形机器人上进行了评估,涉及涉及刚性和柔性/可变形物体(如鸡蛋、布里欧修面包、堆叠的杯子)的十项任务。
- 性能增益: 在所有手部和任务中,MARC 将平均“到达并提起”成功率从 0.44(基准 sDiT)提高到了 0.71。
- 具体改进:
- Inspire: 0.54 → 0.84
- Wuji: 0.48 → 0.79
- Wuji12: 0.29 → 0.51
- 关键案例: 在“标记物”(易滑、有遮挡)任务中观察到了最显著的提升,其中 Inspire 和 Wuji 的成功率分别从 0.2/0.1 跳升至 1.0/0.9。
- 消融实验: 移除校准接触通道会导致刚性物体的性能退回到基准水平(0.48),证实了增益是由力通道驱动的,而非仅仅是架构或掩码的作用。
- 零样本泛化: 策略成功迁移到了未见过的 Wuji15 配置(15自由度)而无需重新训练,其成功率与分布内 Wuji 结果的差距在 0.1 以内。
意义与主张
论文声称,当接触以物理单位(扭矩和力)而非特定手的代理形式表达时,接触本身是可传输的。通过将运动意图和接触负载统一到共享接口中,该系统实现了灵巧操纵技能在结构不同的手之间的传输。作者强调,这种方法允许在长程任务中进行稳定的、顺应性的交互,特别是在视觉反馈因遮挡或物体形变而不足的情况下。这项工作证明,通过在校准接触上训练,单个策略可以驱动异构硬件,而无需进行针对每种手的模型训练或特定任务的微调。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。