想象一下,你正在教一个机器人完成一项复杂的家务,比如折叠一条短裤或擦拭一块白板。这些不仅仅是单一步骤的动作,而是由一系列细小的移动组成的长时间序列。
这篇论文介绍了一种名为 SARM2 的新系统和一个名为 SPIRAL 的学习框架,旨在帮助机器人比以往更快、更好地学习这些任务。以下是其工作原理的简单解释:
问题所在:盲目的机器人
目前,教机器人通常涉及“行为克隆”(Behavior Cloning)。这就像是给机器人看一段人类做任务的视频,然后告诉它:“完全模仿你看到的一切。”
- 缺陷: 如果机器人在早期犯了一个微小的错误,它就会迷失方向。因为它只是在盲目模仿,所以它不知道自己为什么失败,也不知道如何修复错误。
- 奖励问题: 要通过“强化学习”来教机器人进行自我改进,你需要一个“计分卡”(奖励模型),在每一个步骤都告诉它做得有多好。
- 旧的计分卡太模糊(比如只在最后才说“做得好!”)。
- 其他计分卡又太具体(你必须为每一个全新的任务从头开始构建一个新的计分卡)。
解决方案:SARM2(智能计分卡)
作者构建了一种新型计分卡,称为 SARM2。你可以把它想象成一个通用的机器人任务 GPS。
“动作原语”词典:
与其试图一次性理解整个复杂的任务,SARM2 将一切分解为微小的、基础的构建模块,称为“原语”(primitives)。
- 类比: 想象一种语言。你不需要为读过的每一本书都准备一本新词典;你只需要字母表和常用词即可。SARM2 拥有大约 22 种基础动作的词汇量(如“拿起”、“推动”、“旋转”、“夹紧”)。
- 无论机器人是在折叠一件衬衫还是擦拭一块白板,它都只是以不同的顺序组合这些相同的 22 个基础动作。
“阶段估计器”(GPS):
SARM2 观察机器人当前正在做什么,并询问:“我们正在做这 22 种基础动作中的哪一个?”
- 如果机器人当前正在“旋转”一件衬衫,SARM2 就确切知道对于“旋转”而言,什么是“好”的。
- 如果它切换到“折叠”,SARM2 会立即切换焦点,关注于“折叠”而言什么是“好”的。
“多门控专家”系统:
这是 SARM2 的大脑。想象一家拥有许多专科医生的医院。
- 如果病人腿骨折了,你会把他送到骨科医生那里。如果他头痛,你会把他送到神经科医生那里。
- SARM2 的工作原理也是如此。当它识别出当前的“动作”(例如“抬起”)时,它会为最擅长判断“抬起”动作的特定“专家”AI 打开大门。它不会尝试用一个通用的脑子处理所有事情,而是会在合适的时刻使用合适的专家。
结果: SARM2 为机器人提供了一个非常精确、循序渐进的分数(一种“稠密奖励”),无论任务是什么,都能准确告诉它距离完成任务还有多远。
学习环路:SPIRAL(自我进化的健身房)
一旦机器人拥有了这个完美的计分卡(SARM2),作者就创建了一个名为 SPIRAL 的系统,让机器人可以进行自主练习。
他们证明了什么?
团队在真实机器人上测试了这两个特定任务:
- 折叠短裤: 一项涉及柔软、易变形织物的复杂任务。
- 清洁白板: 一项需要一边稳住白板一边擦拭的任务。
结果:
- 准确度: 在判断进度方面,SARM2 比以往的方法准确率高出 80%。
- 成功率:
- 对于折叠短裤,使用该系统的机器人从失败一半的频率提升到了 100% 的成功率。
- 对于清洁白板,成功率从 50% 提升到了 90%。
简而言之
这篇论文认为,要让机器人真正变得聪明,我们不能仅仅向它们展示视频。我们需要教会它们识别任务中的微小“步骤”,并为每一步提供完美的实时评分。通过将通用的“步骤词典”与专业的“评审团队”相结合,并让机器人在一个自我修正的环路中进行练习,他们创造了一个让机器人能够自主、快速且可靠地学习复杂家务的系统。
技术摘要:SARM2 —— 用于机器人自我改进的多任务阶段感知奖励建模
1. 问题陈述
视觉-语言-动作(VLA)模型已确立了端到端策略学习作为机器人操控领域的主流范式。然而,这些模型在缺乏领域内大量微调的情况下,通常难以处理长程任务。监督微调(SFT)依赖于高成本、高质量的人类演示,并且容易出现分布外(OOD)失败。虽然强化学习(RL)提供了一条自我改进的路径,但它面临两个关键瓶颈:
- 稀疏奖励: 现有的在线 RL 方法通常依赖于稀疏的终端奖励,这无法为长程、富接触类任务提供必要的密集、步级监督。
- 奖励模型局限性: 当前的奖励建模方法分为两类次优方案:
- 任务特定模型: 准确但需要针对每个新任务进行标注和重训(如 SARM),限制了可扩展性。
- 通用 VLM 模型: 适用范围广,但在步级表现粗糙且存在噪声,不适合作为精细化操控进度的高密度监督信号。
本文认为,扩展 VLA-RL 需要一种既是密集型(逐步)、又具备准确性(忠实于任务进度)且具有通用性(无需重训即可应用于多样化任务)的奖励模型。
2. 方法论
作者提出了 SARM2(多任务阶段感知奖励模型)和 SPIRAL(通过奖励对齐学习实现的自我策略改进)。
3.1 SARM2:多任务阶段感知奖励模型
SARM2 通过结合任务无关的阶段估计器与专门的价值头,解决了泛化性与准确性之间的权衡问题。
动作原语阶段估计器:
- 该模型不使用任务特定的阶段标注,而是使用共享的动作原语(如“拾取”、“放置”、“旋转”、“擦除”)作为中间表示。
- 基于对 10,000+ 小时操控数据的分析,作者确定了 K=21 个动作原语,涵盖了超过 90% 的任务时长,并包含一个用于处理不确定性的“空(null)”类别。
- 该估计器是一个 4 层因果 Transformer,输入为多视图图像(手腕左侧、手腕右侧、俯视)和本体感受状态。它将当前片段分类为 K+1=22 个原语类别之一。
- 该估计器在涵盖 100 个任务、共 66 小时片段的平衡数据集上进行训练,使其能够跨领域泛化。
多门控混合专家(MMoE)价值头:
- 为了产生密集的价值估计(具体为归一化的剩余完成步数),SARM2 采用了 MMoE 解码器。
- 架构: 价值模型使用独立的 6 层因果 Transformer 骨干网络。它接收与阶段估计器相同的视觉/本体感受输入,以及任务嵌入和来自阶段估计器的预测原语嵌入。
- 路由机制: 预测的原语会选择 MMoE 中的特定门控。每个门控将 Token 路由到共享的专家池(3 层 MLP)。这种设计使模型能够专注于特定原语组的视觉动力学和进度特征,同时在任务间共享容量。
- 目标: 模型预测一个代表剩余进度的密集奖励 rt∈[−1,0]。损失函数结合了目标距离的均方误差(MSE)以及用于防止路由器崩溃的门控平衡和熵的辅助损失。
3.2 SPIRAL:自我策略改进框架
SPIRAL 是一个基于奖励的在线强化学习框架,旨在利用 SARM2 的密集奖励创建一个“机器人数据飞轮”。
- 残差 RL 基质: SPIRAL 基于 DICE-RL 框架构建,采用残差学习方法,即由残差策略对基础 VLA 策略的输出进行修正。
- 混合目标:
- 密集组件: 使用带有 SARM2 提供的密集逐步奖励的 TD3。
- 稀疏组件: 将其与由稀疏回合级奖励驱动的蒙特卡洛(MC)目标相结合,以确保与最终任务目标对齐。
- 自主循环: 该框架以闭环方式运行:
- 初始化: 通过行为克隆(BC)微调基础 VLA 策略。
- 一次性适配: 通过一小组人类标注的展开过程(rollouts)来使奖励模型适配策略的展开分布。
- 自我改进: 系统自主收集展开过程,使用适配后的 SARM2 进行重新标注,并通过残差 RL 更新策略。此循环不断重复,无需进一步的人类干预。
3. 核心贡献
- SARM2: 一种多任务阶段感知奖励模型,它将通用的基于原语的阶段估计器与多门控 MMoE 价值头相结合。这种架构可以在单个模型中产生跨多种长程任务的准确、密集奖励,消除了对每任务重训的需求。
- SPIRAL: 一个奖励对齐的在线残差 RL 框架,利用 SARM2 的密集奖励实现从廉价的自主展开过程中进行持续策略优化,从而闭合了自主机器人数据飞轮。
- 经验验证: 证明了高质量密集奖励对于稳定的自我改进至关重要,在真实任务上相对于稀疏奖励和基于 VLM 的基准模型取得了显著提升。
4. 实验结果
作者在 10 个任务的基准测试以及两个特定的现实世界长程任务(折叠短裤和擦拭白板)上评估了 SARM2 和 SPIRAL。
奖励模型性能
- 准确性: 与最强的基准模型(ReWiND, TOPReward, Robometer)相比,SARM2 将留出集演示数据的均方误差(MSE)降低了 80%。
- 泛化性: 在“擦拭白板”任务(T2)中,SARM2 实现了 0.667 的展开分类相关系数 (ρ),显著优于通用 VLM 模型(后者往往因过度乐观而产生负相关)。
- 消融实验: 去除阶段估计器会导致演示损失增加约 70%;去除多门控设计会导致损失增加约 30%。这证实了阶段感知和 MMoE 路由具有协同作用。
- 路由器健康度: MMoE 路由保持平衡(密度得分 ~0.10),而单门控变体则会出现路由器崩溃(密度 > 0.80)。
策略学习性能 (SPIRAL)
- 折叠短裤:
- 平整状态(Flat): 成功率从 58%(初始 BC/RL-Dense)在经过 3 轮 SPIRAL 迭代后提升至 100%。
- 褶皱状态(Crumpled,更难): 成功率从 33% 提升至 67%。值得注意的是,稀疏奖励基准在此任务上的表现有所下降(降至 17%),凸显了密集奖励的必要性。
- 擦拭白板:
- 成功率从 50% 提升至 90%。
- 平均进度得分从 0.813 增加到 0.975。
- 对比: SPIRAL 配合 SARM2 始终优于所有基准模型,包括 LoRA 微调的 VLM 奖励模型(Robometer-FT)和稀疏奖励 RL。结果表明,虽然密度是必要的,但奖励的质量和阶段感知能力才是有效自我改进的瓶颈。
5. 重要性与主张
本文声称 SARM2 和 SPIRAL 证明了高质量密集奖励是实现可持续机器人数据飞轮的“承重因素”。这项工作挑战了“通用 VLM 足以胜任精细化机器人控制”的观点,转而表明基于结构化原语的方法对于准确的进度估计是必需的。
作者强调,通过将阶段估计(通用的原语)与价值估计(专门的专家)解耦,他们实现了一个既能跨任务扩展又足够精确以引导在线 RL 的模型,从而在初始适配阶段后实现对长程任务的持续策略优化,且人为干预极少。
作者承认的局限性:
- 具身范围: 动作原语词汇量源自双臂桌面数据;若要扩展到移动操作,需要重建原语集。
- 残差 RL 上限: 该框架通过残差学习而非更新 VLA 权重来优化策略,这意味着它无法纠正意图或高层任务分解层面的错误。
- 样本效率: 虽然是自主进行的,但在线展开过程仍需要人类操作员在每个回合之间进行常规重置。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。