想象一下,你正在教一个机器人完成一项精细的任务,比如把杯子叠放在积木上,或者捡起一块乐高零件。你有一个“基础机器人”(即策略),它通过观看许多人类完成该任务的视频来进行学习。它试图模仿他们。但问题在于:这个基础机器人有点笨拙。它可能会做到非常接近正确的姿势,但仅仅因为差了1毫米,就导致杯子翻倒。它并不知道自己为什么失败了,因为它在训练视频中看到的永远都是“圆满结局”。
这篇论文介绍了一种解决方案:机器人评论家(Robot Critic)。你可以把这个评论家想象成一位站在机器人身边、观察入微、甚至有些强迫症的教练,实时盯着它的每一个动作。
以下是该系统的运作方式,分为简单的几个步骤:
1. “如果……会怎样”模拟器(水晶球)
在机器人实际移动手臂之前,系统会询问一个“水晶球”(一种AI视频生成器),让它想象一下如果机器人尝试不同的动作会发生什么。
- 机器人会思考 5 或 10 种不同的抓取物体的方式。
- 水晶球会快速生成短视频,展示这 5 或 10 次尝试中的每一个“未来”。
- 现在,机器人不再只是凭直觉猜测,而是可以并排看到 5 个不同的潜在未来。
2. 评论家的职责(“注重细节”的教练)
这是该论文核心创新的所在。研究人员训练他们的评论家变得极其挑剔。
- 旧的评论家: 以前的 AI 教练能分辨出“机器人拿着杯子”和“机器人完美地拿着杯子”的区别。但它们无法分辨“机器人完美地拿着杯子”与“机器人几乎完美地拿着杯子(但即将掉落)”之间的区别。
- 新的评论家: 这个评论家是在一种特殊的“数据食谱”下训练出来的。它不仅观看成功的视频,还观看失败的视频。它看到了机器人掉落杯子、错过乐高或撞倒物品的视频。
- 训练过程: 研究人员向评论家展示成对的图像:“看这个成功的瞬间”对比“看这个在同一时刻发生的失败瞬间”。评论家学会了识别那些会导致灾难的、微小的 1 毫米偏差。
3. 选择过程(挑选赢家)
一旦水晶球展示了 5 个潜在的未来,评论家就会审视所有这些未来。它会对它们进行两两比较(就像锦标赛的淘汰赛一样)。
- “未来 A 看起来将会成功。”
- “未来 B 看上去夹具有点歪;那是失败。”
- 评论家投票选出看起来最成功的那个未来,并告诉机器人:“做这一个。”
为什么这很重要
研究人员在实验室的真实机器人和计算机模拟环境中测试了这项技术。
- 结果: 通过使用这个“强迫症”式的评论家在实际行动前选择最佳动作,机器人的任务完成率显著提高。
- 数据: 在现实世界中,如果没有评论家,机器人的成功率会降低,而有了它,成功率提升了 11%。在模拟环境中,性能提升了 5.9%。
- 核心洞察: 论文发现,如果你只用成功案例来训练评论家,它就无法识别微妙的错误。它必须看到失败,才能学会如何避免。这就像一个只看过完美驾驶课程的司机;在他们学会如何纠正侧滑之前,他们并不知道侧滑是什么样子的。
总结类比
想象你在玩电子游戏。
- 基础机器人是一个记住了获胜招式但卡在困难关卡的玩家,因为他们会犯一些微小的错误。
- 水晶球是一个“存档读档(Save Scumming)”功能,让你可以预演 5 条不同的前进路径。
- 评论家是一位超级专家级的向导,他玩过成千上万次游戏,包括所有的“游戏结束(Game Over)”画面。他看着你的 5 条预演路径并说:“别往左走,那看起来是个陷阱。往右走,那条路径的对齐非常完美。”
通过添加这位深谙失败本质的专家向导,机器人不再犯下那些微小且致命的错误,从而能够更加可靠地完成任务。
技术摘要:关注细节的机器人评论家(Robot Critics that Sweat the Small Stuff)
问题陈述
大型视觉语言模型(VLMs)拥有广泛的物理世界先验知识,使其成为在推理过程中引导机器人策略的极具前景的“评论家”候选者。然而,在细粒度视觉推理方面存在一个关键差距。虽然现成的 VLM 和现有的进度检测方法可以区分初始状态与最终任务状态,或识别高层级的子任务,但它们难以辨别区分成功与失败的细微视觉差异。
例如,1 毫米的夹持器对准偏差在视觉上可能与成功的抓取非常相似,但会导致任务失败。现有方法在时间间隔极短的“细粒度场景”中表现不佳。在实验中,基线模型(如 Gemini 3)在区分成功与失败时的准确率仅为 54.7%,而专门的进度检测方法(如 ROVER、ProgressLM)分别达到了 72.1% 和 61.0%,在这些微妙场景下仅略高于随机猜测(50%)。这种局限性阻碍了 VLM 在闭环执行中有效地引导随机机器人策略远离失败模式。
方法论
作者提出了一个框架,通过微调 VLM 来专门进行成对的进度与失败辨别,并通过一个动作条件视频模型将其集成到闭环机器人策略中。
1. 训练 VLM 评论家
其核心创新在于构建了一个源自机器人展开轨迹的成对进度监督数据集。
- 数据构建: 系统从相同的初始条件生成成对的轨迹:一条成功的轨迹(Ss)和一条失败的轨迹(Sf)。
- 成功-成功对: 将来自成功轨迹的连续帧进行配对,以教会模型渐进式的向前进展(将较晚的帧标记为具有更多进度)。
- 成功-失败对: 将失败轨迹中的帧与处于相同时间步的成功轨迹中的帧进行配对。成功的帧被标记为具有更多进度。这对于教会评论家识别特定策略的失败模式(例如,给定当前策略时机器人失败的具体方式)至关重要,而不仅仅是通用的任务失败。
- 微调: 对 VLM(具体为 Qwen2.5-VL-7B)进行监督微调,使其预测离散决策 c(vi,vj)∈{+1,−1},指示哪一帧显示出更大的向目标迈进的进度,并最小化交叉熵损失。
2. 环路内策略引导
微调后的评论家被集成到机器人的执行循环中,以提高测试时的性能:
- 采样: 给定观测值 xt,基础随机策略(如 Diffusion Policy 或 GR00T N1.5)采样 N 个候选动作序列。
- 多样性剪枝: 使用贪婪的最远点采样(FPS)策略选择一个包含 K 个候选者的多样化子集。
- 未来合成: 一个动作条件视频模型(HunyuanVideo 1.5,一种 Diffusion Transformer)为每个候选动作序列合成终端视觉状态 xt+H。
- 评论家选择: 评论家对生成的 K 个终端状态进行所有成对比较。累积了最多“选票”(表示具有更大进度)的候选动作序列将被选中执行。
- 重规划: 执行选定的动作,并重复该过程直到任务完成。
核心贡献
- 细粒度评论家训练: 一种使用成对成功与失败展开轨迹来微调 VLM 的方法,使其能够检测标准 VLM 会忽略的细微视觉差异(例如毫米级的对准偏差)。
- 特定策略的失败学习: 证明了针对部署策略的失败数据进行训练是必不可少的。仅在成功演示上训练的评论家无法识别该策略特定的失败模式,导致在区分成功与失败时准确率大幅下降。
- 闭环集成: 一个结合了随机策略采样、生成式视频预测以及基于 VLM 的成对比较来实时引导机器人动作的完整流水线。
- 泛化能力: 该方法可推广到分布外(OOD)物体和未见过的任务,表明了一种可行的未来任务学习预训练策略。
实验结果
作者在真实硬件和仿真环境中对该方法进行了评估。
准确率基准
- RoboCasa(仿真): 微调后的评论家在分布内任务上的平均准确率达到 93.6%,在分布外任务上达到 91.4%,显著优于 Gemini 3 (54.7%) 和 ROVER (72.1%) 等基线。
- LBM(真实世界): 在 LBM 数据集上,该方法达到了 90.0% 的平均准确率,而 ROVER 为 62.9%,Gemini 3 为 55.4%。
- 细粒度场景: 随着比较帧之间的时序间隔减小(使视觉差异变得更细微),基线性能从 73% 下降到 56%。而所提方法仅下降了 2%,保持了高性能,展示了在细粒度辨别方面的鲁棒性。
策略性能提升
- 真实世界任务: 使用“评论家在环”(critic-in-the-loop)使基础 Diffusion Policy 的成功率平均提升了 +11%。具体的增益包括“堆叠”(Stacking)任务提升了 18%,以及“推碗”(Push-Bowl)任务的平均交并比(mIoU)提升了 2.3 倍。
- 仿真任务(RoboCasa365): 该方法将 GR00T N1.5 策略的成功率从 43.6% 提高到 49.5%,平均增益为 +5.9%。在需要精确操作按钮、门和杠杆的任务中观察到了显著改进。
重要性与主张
本文主张,虽然 VLM 提供了有价值的语义先验,但由于它们无法对细粒度的视觉进度和特定策略的失败进行推理,其在机器人领域的效用受到了限制。通过在成功与失败轨迹的细微差别上显式训练评论家,作者证明了 VLF 可以被转化为有效的“细节关注者”(sweaters of the small stuff)。
其重要性在于能够在无需重新训练策略的情况下,在测试时改进随机策略。该方法充当了一个过滤器,从可能的动作分布中筛选出最有希望的候选动作。作者强调,识别失败与识别进度同样重要;如果没有失败数据,评论家就无法有效地引导策略远离那些隐藏在众多失败模式中的成功“针尖”。这种方法弥合了基础模型的高层推理能力与成功机器人操控所需的低层精度之间的鸿沟。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。