✨ 要点🔬 技术摘要
想象一下你正在教一个机器人完成一项任务,比如拿起一个玩具并把它放进盒子里。通常,为了教好一个机器人,你需要从许多不同的角度和位置向它展示许多示例。如果你只展示它如何在桌子的左侧完成这项任务,那么当要求它在右侧执行时,机器人往往会感到困惑。收集所有这些不同的示例既缓慢、昂贵又乏味。
MirrorDuo 是一种新方法,它通过一个简单的技巧解决了这个问题:“收集一个,免费获得一个。”
它是如何工作的,这里使用了一些日常类比:
1. 魔法镜子戏法
把机器人的训练数据想象成一本相册。如果你拍了一张机器人手臂在桌子左侧 移动杯子的照片,MirrorDuo 就像一面魔法镜子。它能瞬间创造出一张完美的“镜像照片”,展示机器人手臂在桌子右侧 进行完全相同的动作。
问题所在: 在现实世界中,如果你只是水平翻转一张照片,机器人的手臂看起来可能会很奇怪(就像一个左撇子突然变成了右撇子)。
解决方法: MirrorDuo 非常聪明。它不仅仅是翻转图片;它还会同时翻转机器人的“肌肉记忆”(即关于其手臂位置和运动方式的内部数学逻辑)。它确保翻转后的图像与翻转后的动作完美匹配,从而凭空创造出一个全新的、有效的训练示例。
2. 使用该技巧的两种方式
论文提出了两种使用这种“免费”数据的主要方式:
“数据助推器” (MirrorAug): 想象你正在为考试复习。你有 10 道练习题。MirrorDuo 将这 10 道题进行翻转,并给了你另外 10 道略有不同但教授相同概念的练习题。现在你有了 20 道题目可以学习,这让你准备得更充分,而无需做任何额外的工作。
“内置对称性” (MirrorDiffusion): 想象建造一座房子。与其只是堆砌砖块,不如设计一座即使你穿过镜子,结构依然合理的房子。MirrorDuo 可以直接构建在机器人的大脑(其神经网络)中。这迫使机器人理解“左”和“右”只是同一枚硬币的两面,因此它能自然地泛化到新的空间。
3. 为什么这意义重大
研究人员在计算机模拟和真实的机器人手臂上测试了这种方法。以下是他们的发现:
从零到英雄: 如果他们只向机器人展示了 5 个在左侧完成任务的示例,然后要求它在右侧完成任务,普通的机器人几乎 100% 会失败。但使用 MirrorDuo,机器人在几乎没有额外训练的情况下,成功率达到了 70–80% 。这就像机器人仅仅通过观察左侧,就突然“领悟”了右侧的操作。
应对杂乱的房间: 现实中的房间并不完美对称。一侧可能是木头桌子,另一侧可能是白色的。从宽视角看,机器人的手臂可能看起来有所不同。论文表明,即使存在这些“视觉偏差”,MirrorDro 仍然表现出色,尤其是结合了一些额外的视觉技巧(例如在训练期间随机改变背景颜色)来增强机器人的鲁棒性。
甜点区(最佳应用场景): 该方法在数据量较少时效果最好。如果你拥有数千个示例,其收益会略微缩小(因为机器人已经学到了它需要的一切),但在那些收集数据既昂贵又困难的场景下,它是一个游戏规则改变者。
总结
MirrorDuo 是一种聪明的办法,可以在不雇佣更多人录制视频的情况下,让你的训练数据翻倍。通过将反射(左与右)视为一种自然的对称性,它允许机器人以极少的示例更快地学习技能,并将其应用到新的镜像环境中。它将一次性的“单面”课程转化为了“双面”的精通。
技术摘要:MirrorDuo
问题陈述
基于图像的行为克隆(Behavior Cloning, BC)为机器人技能获取提供了一条可扩展的路径,但面临着显著的数据效率约束,特别是在跨越工作空间布局的空间变化或非对称场景配置进行泛化时。虽然利用 3D 输入(如点云)的方法可以利用 SE(3) 刚性变换等变性来合成变换后的演示,但将此类变换应用于 2D RGB 图像往往会导致结果不一致。现有的试图在 2D 中近似对称性的方法(例如第三人称图像的 SO(2) 旋转)局限于领域内设置,无法支持更广泛的泛化。此外,反射对称性——许多操作任务(例如左-右抓取与放置变体)的自然属性——由于在保持镜像图像与 6 自由度末端执行器动作之间的语义一致性方面存在挑战(例如存在视觉伪影,如机器人手腕的不对称、背景纹理),在基于图像的策略中仍未得到充分探索。
方法论:MirrorDuo
作者提出了 MirrorDuo ,一种将反射对称性纳入视觉运动学习的通用公式。其核心创新是一种基于反射的变换,该变换能够对 RGB 观测(包括手眼相机和第三人称视角)、本体感受状态以及完整的 6 自由度末端执行器动作进行联合操作,从而为每一个原始演示生成一个语义和物理一致的镜像对应物。
关键技术组件
位姿空间镜像化 (Pose Space Mirroring):
为了确保与图像镜像(水平翻转)的一致性,作者定义了位姿空间中的镜像操作。对于相机坐标系下的末端执行器位姿 X H X_H X H ,镜像位姿 X H ∗ X^*_H X H ∗ 通过 X H ∗ = X C E X C − 1 X H E X^*_H = X_C E X^{-1}_C X_H E X H ∗ = X C E X C − 1 X H E 推导得出,其中 E = diag ( [ − 1 , 1 , 1 , 1 ] ) E = \text{diag}([-1, 1, 1, 1]) E = diag ([ − 1 , 1 , 1 , 1 ]) 。
相机外参无关性: 为了避免依赖于通常不可用的相机外参 (X C X_C X C ),该方法将位姿重新参数化为局部坐标系(增量位姿 Δ X H \Delta X_H Δ X H 或相对位姿 δ X H \delta X_H δ X H )。这使得镜像操作可以表示为 Δ X H ∗ = E Δ X H E \Delta X^*_H = E \Delta X_H E Δ X H ∗ = E Δ X H E ,使该方法具有数据集无关性。
SO(3) 不连续性处理: SO(3) 中的反射可能会导致旋转的突变。为了确保机器人从近乎相同的配置开始镜像技能,该方法强制执行一个恒定的对齐旋转 Q Q Q ,将初始位姿的平均工具轴映射到世界 X 轴,从而减轻不连续性。
统一镜像算子 (M M M ):
该方法定义了一个统一算子 M M M ,它对图像应用水平翻转 (M I M_I M I ),并对向量化的位姿和动作进行元素级乘法(乘以符号模式向量 ρ \rho ρ )。这创建了一组由原始和镜像元组 ( o t , a t ) (o_t, a_t) ( o t , a t ) 与 ( M ( o t ) , M ( a t ) ) (M(o_t), M(a_t)) ( M ( o t ) , M ( a t )) 组成的配对数据集。
两种互补的应用:
MirrorAug (数据增强): 一种策略,在批次采样期间,将部分训练数据替换为其镜像对应物。这在不修改网络架构的情况下,扩展了训练分布以包含镜像配置。
MirrorDiffusion (结构先验): 一种反射等变的扩散策略,其中镜像变换作为归纳偏置嵌入到潜扩散过程中。策略网络利用 E(n)-等变的可操纵 CNN (Steerable CNNs) 来强制噪声预测函数与反射变换对易(即 π ( M ( o ) ) = M ( π ( o ) ) \pi(M(o)) = M(\pi(o)) π ( M ( o )) = M ( π ( o )) )。
处理视觉不对称:
作者承认镜像会引入视觉分布外 (OOD) 伪影(例如,右手型机器人看起来像左手型机器人,或者不对称的桌面纹理)。
为了缓解这一问题,该方法将 MirrorDuo 与 随机叠加 (Random Overlay) (增强背景)以及 预训练视觉骨干网络 (基于 ImageNet 的 ResNet-18)相结合,以增强对任务无关变化的鲁棒性。
核心贡献
反射一致性公式化: 一种生成与 2D 图像、3D 本体感受和 6 自由度动作保持一致的镜像演示对的新方法,有效地实现了“采集一个,免费获得一个”。
双重效用: 该框架既可以作为数据增强策略 (MirrorAug),也可以作为等变策略学习的结构先验 (MirrorDiffusion),适用于包括行为克隆 (BC) 和扩散策略 (Diffusion Policies) 在内的标准流水线。
对未知镜像的泛化: 该方法使得在目标布置中仅需零个或五个演示即可实现高效的技能迁移。
对不对称性的鲁棒性: 论文证明,当结合轻量级视觉泛化技术时,即使在存在显著视觉不对称(机器人设计、背景纹理)的情况下,也可以利用反射对称性。
实验结果
作者在 MimicGen 数据集(仿真)和真实的 Franka Emika 设置上评估了 MirrorDuo,涉及两个任务:毛绒玩具抓取与放置(单侧)和方块堆叠(双侧)。
单侧迁移 (仿真与真实):
在演示仅限于工作空间一侧的设置中,使用原始数据训练的标准策略无法泛化到镜像侧(某些基准测试的成功率接近 0%)。
MirrorAug 结合视觉泛化(随机叠加 + 预训练权重)使得策略即使在仅有 5 个额外的对侧演示的情况下,也能在镜像侧达到接近领域内的性能。
MirrorDiffusion (等变型)由于噪声注入在反向扩散过程中破坏了全局对称性,在零样本迁移时失败,但在拥有极少量对侧数据后恢复了性能。
双侧数据效率:
当演示分布在两侧时,MirrorDuo 显著提高了数据效率。
在低至中等数据量级(50–200 个演示)下,MirrorAug 和 MirrorDiffusion 产生了持续的性能提升(例如,在 Square D0 上比基准测试提升了 31%)。
在高数据量级下,性能增益趋于平缓,并且在某些复杂的长程任务中观察到了轻微的性能下降,这归因于由来自近乎相同任务的冲突观测分布导致的决策边界破碎。
真实世界验证:
在真实的毛绒玩具任务中,Diffusion Policy (M, O, P) (MirrorAug + Overlay + Pretrained)在仅有 5 个镜像演示的情况下,在镜像设置中实现了 83.3% 的成功率,达到了其领域内性能。
使用单侧数据训练的标准 Diffusion Policy 在镜像设置上的成功率仅为 3.3%。
作者指出,虽然 MirrorDiffusion 在理论上很优雅,但配合 MirrorAug 和视觉泛化技术使用的标准 Diffusion Policy 在面临挑战性视觉条件时表现得更为实用,并提供了更快的训练收敛速度。
重要性与主张
论文声称 MirrorDuo 确立了反射对称性作为一个强大且被低估的归纳偏置,用于可扩展、可泛化的机器人学习。通过利用原始域和镜像域之间的重叠,该方法允许机器人在极少额外数据的情况下,泛化到未见的观察空间配置。
作者强调,虽然将 3D 反射投影到 2D 视觉观测中会引入复杂性(视觉不对称),但这些挑战可以被有效管理。这项工作证明,反射一致性学习与基于图像的流水线高度兼容,为解决收集多样化机器人演示的高昂成本提供了实用的解决方案。论文结论指出,结合反射对称性与轻量级视觉泛化技术,可以使策略容忍来自机器人和环境的视觉不对称,从而促进在多变现实环境中的稳健部署。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。