这篇论文介绍了一种名为 DiSPo 的新机器人学习技术。为了让你轻松理解,我们可以把机器人学习动作的过程想象成**“学习画画”或者“指挥交通”**。
🎨 核心问题:机器人太“笨”了,只会看大轮廓
想象一下,你想教一个机器人(比如机械臂)去穿过一个狭窄的管道,或者轻轻按下一个按钮。
- 传统方法:就像你只给机器人看几张模糊的、间隔很远的草图(比如每 1 秒钟画一个点)。机器人学会了大概的路线,但到了需要转弯或精细操作的地方,它要么撞墙,要么动作太粗糙,根本过不去。
- 以前的解决方案:要么让人类画超级精细的草图(每 0.1 秒画一个点),但这太费时间、太费数据;要么让机器人自己“脑补”中间的细节(插值),但机器人经常脑补错,导致动作僵硬。
🚀 DiSPo 的解决方案:像“变焦镜头”一样灵活
DiSPo 的核心思想是:“从粗到细”(Coarse-to-Fine)。它不仅能看懂模糊的草图,还能自动把草图“高清化”,并且能根据情况决定哪里需要“高清”,哪里只需要“模糊”。
我们可以用三个生动的比喻来理解它的三大创新:
1. 混合了“天气预报”和“智能导航”的大脑
DiSPo 结合了两种强大的技术:
- 扩散模型(Diffusion):就像**“去噪”**。想象你在一张满是杂点的照片上,一步步把杂点擦掉,直到照片变清晰。机器人也是通过一步步“擦除”错误的动作,最终生成完美的动作。
- SSM (Mamba):就像**“智能导航”**。它能记住很长的历史路径,而且非常省内存。
- DiSPo 的魔法:它把这两者结合了。它不仅能像扩散模型一样“擦除”错误,还能像导航一样,灵活地调整“时间步长”。
2. “变焦镜头”:哪里需要细,哪里需要粗
这是 DiSPo 最厉害的地方。
- 普通机器人:要么全程慢动作(太慢),要么全程快动作(太糙)。
- DiSPo:它手里有一个**“变焦镜头”**(论文里叫 Step-scale factor)。
- 当机器人在空旷的地方移动时,它说:“这里很简单,我大步走(粗粒度),省点力气。”
- 当机器人快到狭窄的管道口或按钮前时,它说:“这里危险,我要慢动作、微操(细粒度),一步步挪过去。”
- 比喻:就像开车,在高速公路上你可以踩油门(粗动作),但到了复杂的立交桥或停车场,你会自动切换到“蠕行模式”(细动作)。DiSPo 能自动判断什么时候该切换。
3. “作弊小抄”:用粗糙的图练出精细的手艺
通常,要练好精细动作,需要大量的精细数据。但 DiSPo 很聪明,它发明了一种**“伪演示生成”**的方法:
- 它先拿粗糙的草图(低频数据)训练。
- 然后,它自己给自己“出题”:把粗糙的图放大,中间的空缺自己填上,生成一张**“伪精细图”**。
- 它反复练习这张“伪精细图”,就像学生拿着模糊的地图,自己脑补出细节,然后反复练习,最后真的能画出高清地图。
- 结果:不需要人类再花大量时间去录制精细动作,机器人自己就能学会。
🏆 实际效果:真的好用吗?
论文在两个真实场景和三个模拟场景中测试了 DiSPo:
- 穿管任务:让机械臂穿过一个细管子。
- 结果:其他机器人经常撞管子,DiSPo 却能像穿针引线一样丝滑通过。
- 按按钮任务:让机械臂轻轻按下一个按钮,不能按歪。
- 结果:DiSPo 成功率高达 93%,比其他最好的方法高出很多。
💡 总结
DiSPo 就像是一个拥有“超级直觉”的机器人学徒:
- 它不需要你手把手教它每一个微小的动作(省数据)。
- 它看一眼大概的路线(粗演示),就能自己脑补出细节。
- 它知道什么时候该“大步流星”,什么时候该“小心翼翼”(自适应粒度)。
- 最终,它用更少的训练时间,做出了更精准、更流畅的动作。
这项技术让机器人变得更聪明、更灵活,未来在工厂组装精密零件、或者在家里帮忙做家务时,它们将不再是个“笨手笨脚”的大家伙,而是一个能灵活应对各种复杂情况的“巧手工匠”。
1. 研究背景与问题定义 (Problem)
核心问题:
在机器人模仿学习(Imitation Learning, IL)中,如何从多粒度(Multi-granularity)的演示数据中学习,并生成符合用户意图的多尺度动作(从粗略定位到精细操作)。
现有挑战:
- 数据依赖与效率: 传统方法通常依赖大量高频(精细)演示数据,或者需要复杂的插值技术和动力学模型来从低频数据生成高频动作,这导致了存储和计算开销巨大。
- 粒度适应性差: 现有的主流方法(如基于 Transformer 的 BeT 或基于扩散的策略)通常针对特定频率的轨迹进行训练。它们难以理解演示数据中的时间结构,无法灵活地在推理阶段根据用户需求调整动作的离散化粒度(即动作生成的频率/精细度)。
- 粗粒度到精细度的转换困难: 当仅使用低频(粗略)演示数据训练时,现有模型难以生成高精度的局部操作(如拧螺丝、插孔),往往导致任务失败。
目标:
提出一种能够同时学习粗略和精细演示,并能在线生成任意粒度动作的策略,实现**从粗到细(Coarse-to-Fine)**的动作生成。
2. 方法论 (Methodology)
作者提出了 DiSPo (Diffusion-SSM based Policy),这是一种结合了**扩散模型(Diffusion Models)的表征能力和状态空间模型(SSM,特别是 Mamba)**的灵活离散化能力的新型策略。
核心架构:DiSPo
- 基础模型: 基于 Mamba(一种高效的 SSM)构建的扩散去噪网络。
- 输入条件:
- 扩散步数 k。
- 观测序列 o(图像 + 本体感知)。
- 含噪动作序列 a(k)。
- 关键创新: 步长缩放因子(Step-scale factors, rt)。这是一个用户定义或预测的向量,用于控制离散 SSM 的时间粒度。
关键技术创新
步长缩放机制 (Step-scaling Mechanism):
- 传统的 Mamba 使用固定的步长参数。DiSPo 将步长参数 Δ 设计为输入和步长缩放因子 rt 的函数:
Δt(i)=rt⋅SoftPlus(fΔ(…))
- 通过调整 rt,模型可以动态改变 SSM 的离散化程度。rt<1 生成更精细(高频)的动作,rt>1 生成更粗略(低频)的动作。这使得模型能够直接从低频数据中学习,并在推理时生成高频动作。
多粒度学习方案 (Multi-granularity Learning Scheme):
为了在没有高频数据的情况下生成高频动作,作者设计了两阶段训练策略:
- 阶段一:预训练(样本率增强): 对原始数据集进行随机步长缩放增强,让模型学习不同频率下的动作分布。
- 阶段二:微调(伪演示生成):
- 利用预训练好的 DiSPo,从噪声开始生成高频动作序列。
- 混合策略: 在去噪过程中,将生成序列中对应原始低频频率的部分替换为带有噪声的真实演示数据(Pseudo Demonstration),保留高频部分由模型生成。
- 通过这种“伪演示”进行微调,使模型能够利用低频数据推断出缺失的高频细节,而无需额外收集高频数据。
自适应粒度预测器:
引入一个 MLP 预测器 ϕr,根据当前观测序列自动预测所需的步长缩放因子 rt,实现根据任务区域(如自由空间 vs. 关键接触区)动态调整动作粒度。
3. 主要贡献 (Key Contributions)
- 首个基于 Mamba 的细粒度操作策略: 首次尝试调制 Mamba 的离散模型以用于机器人精细操作,利用 SSM 的内存效率和长序列建模能力。
- 创新的步长缩放机制: 提出了一种无需重新训练即可在推理阶段灵活调整动作离散化粒度的方法,实现了真正的“多粒度学习”。
- 高效的数据利用策略: 通过“伪演示生成”和“步长缩放”,实现了仅从低频(粗略)演示数据中学习并生成高频(精细)动作的能力,显著降低了数据收集成本。
- 统一的粗到细框架: 提供了一个统一的策略,既能生成粗略运动(节省推理开销),又能生成精细运动(保证任务成功率)。
4. 实验结果 (Results)
实验在三个仿真基准(夹钳传递、通道穿越、按钮触摸)和两个真实世界任务(UR5e 机械臂的夹钳传递和按钮触摸)上进行。
仿真基准表现:
- 成功率: 在从 2.5Hz 到 20Hz 的演示数据训练下,DiSPo 在目标 20Hz 推理时的成功率最高,平均超过 81%。
- 对比基线: 相比 DiffusionPolicy (DP-C/DP-T)、Mamba-based (D-Ma) 和 VQ-BeT 等 SOTA 方法,DiSPo 在低频演示(2.5Hz, 5Hz)下的表现显著更优。基线方法在低频训练下往往无法处理急转弯或精细插入,成功率大幅下降。
- 混合频率训练: 在混合频率(2.5Hz + 5Hz)数据训练下,DiSPo 在“按钮触摸”任务中达到了 93% 的成功率,远超其他基线(最高 83%)。
推理效率与粒度控制:
- 使用自适应预测器 ϕr 时,DiSPo 在“按钮触摸”任务中减少了 32% 的所需动作步数(在自由空间使用粗略动作),同时仅轻微降低了任务成功率,显著提高了推理效率。
真实世界实验:
- 在 UR5e 机械臂上,DiSPo 成功完成了具有 2.5mm 径向间隙的夹钳插入和精确按钮触摸任务。
- 相比之下,基线模型 D-Ma 虽然能捕捉粗略运动,但常导致管道刮擦或在按钮附近停止,无法完成精细操作。
5. 意义与影响 (Significance)
- 打破数据频率限制: 证明了机器人策略可以从低成本、低频的演示数据中学习,并生成高质量的高频控制信号,极大地降低了机器人示教的数据门槛。
- 计算与存储优化: 通过动态调整动作粒度,模型可以在非关键区域生成粗略动作以减少计算量,在关键区域生成精细动作,实现了推理效率与任务精度的最佳平衡。
- 推动模仿学习发展: 为多粒度模仿学习提供了新的范式,展示了 SSM(Mamba)与扩散模型结合在机器人控制领域的巨大潜力,特别是在处理长序列和复杂时间结构任务方面。
总结: DiSPo 通过引入步长缩放机制和伪演示微调策略,成功解决了从粗略演示学习精细技能的难题,在保持高成功率的同时显著提升了推理效率,是机器人模仿学习领域的一项重要进展。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。