想象一下,你正在教一个机器人做晚饭。过去,要教这个机器人,你必须充当一位严厉的裁判,监视它每一个动作的每一秒,并为其切洋葱的表现赋予精确的分数(例如“10 分中的 7.5 分”)。如果机器人掉了刀,你就必须确切地判断分数是在何时下降的,以及下降了多少。这极其困难,尤其是在机器人失败时,这意味着你无法利用机器人在现实世界中成千上万次“失败”的尝试,因为它们太混乱而无法评分。
ROBOMETER 是一个新系统,它通过采用更智能、更像人类的评分方式,改变了我们教机器人的方法。
核心理念:比较而非评分
ROBOMETER 不再试图为每一个瞬间给出完美分数,而是通过比较同一任务的两次不同尝试来学习。
这就像选秀节目的评委。评委不再给参赛者打出 8.2 分(满分 10 分),而是直接观察两场表演,然后说:“表演 A 明显优于表演 B。”
- 旧方法:你必须看着机器人把杯子放到桌子上的失败过程,并试图计算出这次失败究竟有多“糟糕”。
- ROBOMETER 方法:你向机器人展示一段人类完美完成该动作的视频,以及一段机器人打翻杯子的视频。系统会学习:“人类视频更好。”它不需要知道为什么,也不需要给出具体数字;它只需学习“好”与“坏”的顺序。
“错误巨库”(RBM-1M)
为了训练这个系统,研究人员建立了一个名为RBM-1M的巨大图书馆。
- 旧问题:大多数机器人训练库只包含“完美”的视频。如果机器人打翻了杯子,那段视频就会被扔进垃圾桶,因为它难以评分。
- 新方案:这个图书馆包含来自 21 种不同类型机器人(从单臂到人形手)的100 万段视频。关键在于,它充满了错误、失败和笨拙的尝试。因为 ROBOMETER 是通过比较来学习的(例如“这次失败的尝试比那次成功的尝试更差”),它实际上可以从这些被丢弃的失败视频堆中学习。它将失败视为关于不该做什么的宝贵教训。
工作原理(两步舞)
ROBOMETER 同时使用两种特定技巧进行学习:
- “进度”检查:它观看单段视频,并尝试猜测:“这个任务进行到哪个阶段了?”(0% 到 100%)。这为机器人对时间和进度的理解提供了锚点。
- “偏好”检查:它并排观看两段视频,并决定:“哪一段更好地完成了任务?”这教会机器人理解动作的质量,即使该动作是完全失败的。
通过结合这两者,机器人学会了一种对成功的“感觉”,即使面对它从未见过的机器人,或在它从未进入过的房间,这种感觉依然有效。
实际成效(已验证的结果)
该论文表明,该系统在四个具体的现实场景中比之前的方法表现更好:
- 自动在线学习:当机器人在实时学习任务(如将碗放在桌子上)时,ROBOMETER 充当教练,立即告诉机器人“你做错了”,并引导其修正错误。在杂乱的厨房环境中,它帮助机器人将成功率从20% 提升至 85%,而旧方法则停滞在 55%。
- 从混乱数据中学习(离线强化学习):如果你拥有一组混合了完美视频和混乱失败视频的数据,ROBOMETER 可以从中筛选出内容来训练新机器人。与最佳先前的工具相比,它将成功率提高了2.4 倍。
- 发现优质内容(数据过滤):想象你有一大堆视频片段,需要找出其中最好的 10 个来教机器人如何“搅拌锅”。与其他搜索工具相比,ROBOMETER 能更好地找到相关且成功的片段,并忽略失败片段。这使得机器人学习该任务的能力提高了4.5 倍。
- 识别失败:如果机器人陷入停滞、振荡(来回晃动却未移动)或掉落物体,ROBOMETER 可以立即检测到这种失败,而无需被告知失败长什么样。它在**81%**的案例中正确识别了失败,优于其他系统。
总结
ROBOMETER 是一个“通用奖励模型”,它不再需要人类为机器人工作的每一秒进行评分。通过利用包含成功与失败的大规模图书馆来学习比较“更好”与“更差”,它帮助机器人学得更快、更好地处理错误,并能适应新任务和新机器人本体,而无需从头开始重新训练。
技术摘要:ROBOMETER
问题陈述
当前通用机器人奖励模型面临显著的扩展性和泛化挑战。现有方法完全依赖于源自专家演示的绝对进度标签(例如,将进度从 0 到 1 进行线性插值)。虽然这种方法对成功轨迹有效,但该范式因两个主要原因无法扩展到大型异构数据集:
- 失败轨迹的歧义性:在真实世界数据收集中大量存在的次优或失败尝试,缺乏定义明确的绝对进度标签。在这些情况下,进度往往波动或倒退,使得逐点监督成本高昂且定义不清。
- 有限的泛化能力:仅基于轨迹局部进度监督训练的模型,难以在不同机器人形态、场景和不同轨迹质量之间进行泛化。当绝对分数存在歧义时,它们通常无法区分成功行为与次优行为。
本文提出,人类认知依赖于比较判断而非孤立的绝对标度来内化校准后的进度。因此,机器人奖励模型需要一种利用跨多样化轨迹的相对排序的监督信号,以学习稳健且可泛化的奖励函数。
方法论
1. ROBOMETER 框架
ROBOMETER 是一个可扩展的奖励建模框架,结合了轨迹内进度监督与轨迹间偏好监督。它采用双目标训练配方:
- 帧级进度损失:通过预测密集的逐帧进度(在 [0, 1] 范围内离散化为 10 个区间)和二元成功标签,将奖励幅度锚定在专家数据上。这确保模型学习任务完成的时间结构。
- 轨迹比较偏好损失:通过预测两条轨迹中哪一条更好地满足语言指令,施加全局排序约束。这使得模型能够从相对比较中学习,而无需为失败轨迹提供绝对分数。
2. 架构
ROBOMETER 建立在预训练的视觉 - 语言模型(VLM)骨干网络之上,具体为 Qwen3-VL-4B-Instruct。
- 分词:模型处理交错排列的文本和视觉标记。为了在不破坏预训练表示的情况下实现密集奖励估计,它在第一条轨迹的每一帧后插入可学习的进度标记(
<|prog token|>),并在提示末尾插入单个偏好标记(<|pref token|>)。
- 因果掩码:架构使用因果掩码,确保进度标记仅关注第一条轨迹的当前及先前帧(支持在线推理),而偏好标记则关注两条轨迹以做出相对判断。
- 输出头:轻量级 MLP 头连接至进度标记的隐藏状态(用于进度和成功预测)以及偏好标记的隐藏状态(用于二元偏好分类)。
3. RBM-1M 数据集
为了在大规模上支持这种双目标训练,作者构建了 RBM-1M,这是一个包含超过 100 万条轨迹的数据集,涵盖 21 种机器人形态(包括单臂、双臂和移动操作器)及多样化场景。
- 构成:该数据集聚合了专家演示(如 Open-X、AGIBotWorld)、人类视频(Epic-Kitchens)、仿真数据(LIBERO),以及至关重要的、来自自动滚动和失败检测数据集的未标记失败和次优轨迹。
- 增强策略:为了在不进行额外人工标注的情况下构建偏好对,作者采用了三种策略:
- 基于进度的比较:将专家演示与未标记的失败或次优轨迹进行对比。
- 指令负样本:将轨迹与不同的语言指令配对,确保奖励基于指令。
- 视频回退:通过反转成功轨迹的片段来生成合成失败,以模拟“撤销”进度的过程。
主要贡献
- 双目标训练配方:本文提出了一种方法,利用绝对进度标签(针对成功数据)和成对偏好标签(针对所有数据,包括失败数据)来训练奖励模型。这使得有效利用此前无法使用的次优数据成为可能。
- RBM-1M 数据集:发布了一个大规模、多形态的数据集,包含大量的失败数据,专门用于训练全局一致的偏好关系。
- 可扩展的泛化能力:该框架证明,偏好监督充当了正则化器,诱导了更具结构化的内部奖励表示,从而提高了模型区分成功轨迹与次优轨迹的能力,即使是在仅使用有限专家数据训练的情况下。
实验结果
奖励评估
ROBOMETER 在 RBM-EVAL-OOD 上进行了评估,该数据集包含来自 3 个机构和 6 种形态(其中 3 种在训练期间未见)的 976 条轨迹。
- 奖励对齐:ROBOMETER 在 OOD 数据上实现了 0.94 的价值顺序相关性(VOC),优于最先进基线(例如 RoboReward-8B 为 0.88,VLAC-8B 为 0.38)。
- 轨迹排序:在区分成功与失败轨迹方面,ROBOMETER 在 OOD 数据上实现了 0.64 的 Kendall-τa,显著优于 RoboReward-8B(0.47)和 ReWiND(0.01)。
- 失败检测:在零样本失败检测任务中,ROBOMETER 实现了最高的平均 F1 分数(0.81),有效平衡了真阳性和真阴性率,而 VLAC 等基线受困于高假阳性,基于标记不确定性的基线则受困于高假阴性。
下游策略学习
本文证明,ROBOMETER 提供的密集且校准良好的奖励改善了四种设置下的下游机器人学习:
- 自动在线强化学习:在单阶段任务中使用 DSRL 结合 ROBOMETER,成功率从 20% 提升至 85%;在多阶段任务中从 20% 提升至 70%,性能超过 RoboReward 2.5 倍。
- 离线强化学习:在混合专业知识设置(专家数据 + 噪声数据)中,ROBOMETER 使 IQL 策略的成功率比最佳基线提高了 2.4 倍。
- 数据过滤与检索:当用于检索模仿学习任务相关的子轨迹时,经 ROBOMETER 过滤的数据产生的成功率比 STRAP 和 SigLIP 等基线高出 4.5 倍。
- 基于模型的强化学习:将 ROBOMETER 集成到 DreamZero 中,在杂乱环境下的成功率从 20% 提升至 70%。
消融研究
- 偏好监督:在仅进度训练的基础上添加偏好损失,一致地提升了排序指标(Kendall-τ)和成功 - 失败分离度。
- 失败数据:将未标记的失败轨迹纳入偏好训练,为奖励区分能力带来了最大的提升。
- 骨干网络:用较小的非预训练架构(ReWiND 变体)替换预训练的 VLM 骨干网络,导致性能严重下降,证实了大规模多模态预训练的必要性。
意义与主张
本文主张,ROBOMETER 代表了从绝对进度监督向比较偏好监督的转变,作为扩展奖励学习的一种机制。通过利用相对比较,该框架能够有效利用真实世界机器人中普遍存在但此前被丢弃的大量次优和失败数据。
作者强调,这种方法实现了:
- 可扩展性:从包含数百万条轨迹的数据集中进行学习,无需对每一帧进行密集的绝对标注。
- 泛化能力:在未见的机器人形态、场景和相机视角下表现稳健。
- 实用价值:可立即应用于在线强化学习、离线强化学习、模仿学习数据策展以及自动化失败检测。
该研究得出结论:虽然当前模型难以应对失败的歧义性,但一种以专家进度为锚点、由全局偏好引导的双目标方法,使奖励模型能够内化校准后的任务进度标度,从而加速机器人在复杂真实世界环境中的学习。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。