想象一下你正在教一个机器人做饭。传统上,如果你想让机器人学习一项新技能,比如“做三明治”,你必须站在那里,握着它的手,引导它完成每一个步骤:拿起面包、抹上黄油、加上奶酪等等。这既缓慢又昂贵,而且如果你稍后想教它“煮汤”,你又得把整个过程重新来一遍。
INSIGHT 论文提出了一种更聪明的机器人教学方式,这种方式更接近人类学习新技能的方式。机器人不再是死记硬背整个食谱,而是学习单个动作(如“拿起”、“抬起”、“旋转”或“倾倒”),然后由它自己去思考如何组合这些动作。
以下是该系统的运作方式,分为几个简单的步骤:
1. “乐高积木”法
把机器人的技能想象成不是一个巨大的、不可分割的整体,而是一盒乐高积木。
- 问题所在: 如今大多数机器人都是针对整个任务进行训练的。如果你教它们“拿起杯子”,它们会学习那一段特定的序列。如果此时你要求它们“倒水”,它们可能会失败,因为它们从未见过“倾倒”这个积木。
- INSIGHT 的解决方案: 该系统通过人类演示(例如一段有人拿起杯子的视频)并自动将其拆解成微小的、带有标签的“积木”,即原语(primitives)。
- 例子: 机器人看到的不再是“拿起杯子”,而是:“手移动到杯子处” + “手指闭合” + “向上抬起”。
- 机器人能如此出色地掌握这些单个动作,以至于它可以根据指令被“操控”去执行其中某一个动作。
2. “智能助手”(VLM)
机器人内置了一个“智能助手”(视觉语言模型,简称 VLM),充当项目经理的角色。
- 场景: 假设机器人知道如何“拿起瓶子”和“放下瓶子”,但你要求它**“把瓶子里的液体倒入碗中”**。
- 差距: 智能助手观察计划后会说:“嘿,我们有‘拿起’积木和‘放下’积木,但我们缺少了**‘倾斜并倾倒’**这个积木!”
- 补救措施: 智能助手不会要求人类演示如何倾倒,而是通过计算该动作的物理特性(例如:“将瓶子向前倾斜 45 度”),并告诉机器人尝试执行它。
3. “练习循环”
这就是见证奇迹的时刻。机器人会尝试自主完成那个缺失的动作。
- 试错: 机器人尝试执行“倾斜”动作。如果洒了一地,它会尝试以略微不同的角度再次尝试。
- “先知”检查: 在机器人尝试之后,智能助手会观察结果(就像老师批改试卷一样)。“水进到碗里了吗?进了?很好!没进?再试一次。”
- 学习: 一旦机器人成功完成了倾倒动作,系统就会将这个特定的“倾斜”动作作为一个新的乐高积木保存到它的库中。随后,它会重新训练自己,以便永久记住这个新的积木。
4. 从零开始构建新技能
一旦机器人学会了“倾倒”积木,它就不再需要人类来教它了。
- 结果: 如果稍后你要求机器人“拧开盖子然后倾倒”,它现在可以结合它之前可能已经学会的“拧”积木和新的“倾倒”积木。
- 类比: 这就像一位音乐家已经学会了弹奏 C 大调和弦以及 F 大调和弦。如果他们想演奏一首新歌,不需要老师来教他们整首歌,他们只需要组合已经掌握的那些和弦即可。
他们究竟证明了什么?
研究人员在计算机模拟和真实机器人(使用机械臂)上都测试了这一点。他们展示了:
- 无需人类额外协助: 他们教会了机器人完成复杂任务,如翻转方块、关闭抽屉、拧开瓶盖和倾倒豆子,而从未向其展示过有人做这些动作的视频。
- 效率极高: 机器人学习这些新技能的速度比传统方法(如强化学习,类似于机器人通过盲目的试错进行数千次尝试)要快得多。
- 不会遗忘: 当机器人学习新的“倾倒”技能时,它并不会忘记如何“拿起”瓶子。它在增加新技能的同时,保留了所有旧有的技能。
- 现实世界中的成功: 在真实机器人上,它实现了极高的成功率(倾倒任务高达 96%),并且甚至可以组合技能来完成一个它从未见过的长达 14 个步骤的任务(拧开盖子,然后倾倒)。
核心结论
INSIGHT 是一个让机器人将复杂任务分解为小型、可重用动作的框架。当遇到新工作时,它们利用“智能助手”来确定缺少哪些动作,自主练习这些动作,并将它们保存起来以备后用。这使得机器人能够持续学习新技能,而无需每次都由人类全程指导。
技术摘要:INSIGHT —— 通过可控 VLA 实现自主技能获取
问题陈述
视觉-语言-动作(VLA)模型虽然推动了通用机器人操控技术的发展,但其本质上仍受限于其训练数据中所包含的技能。获取新的操控技能通常需要昂贵的人类演示和针对每个新任务的微调。虽然强化学习(RL)提供了另一种选择,但它往往面临着极高的样本复杂度以及现实世界中的安全约束问题。此外,现有的利用视觉-语言模型(VLM)或大语言模型(LLM)作为规划器或编码代理的方法,通常仅在测试阶段运行;它们通过组合预定义的技能或生成轨迹,而不会更新底层的学习策略。因此,机器人无法在没有人工干预的情况下,自主扩展其能力集以处理新颖场景(例如,一个仅受过“舀取岩石”训练的火星探测器需要学会“清扫碎屑”)。
方法论:INSIGHT 框架
INSIGHT 通过在原始动作层面使 VLA 具有“可控性(steerable)”,从而实现通过两阶段流水线进行自主技能获取,解决了上述局限性。
第一阶段:自动原始动作分割与可控 VLA 训练
第一阶段通过无需手动标注的方式,将标准的遥操作演示转化为可控的 VLA 策略。
- 原始动作定义(Primitive Definition): 原始动作被定义为一个可重用的动作段,其特征是单一的主导运动模式(例如,沿轴向平移、旋转或夹爪状态切换)以及自然语言标签(例如,“向上提升”、“闭合夹爪”)。
- 自动分割: 利用 VLM 提供任务描述和示例原始动作,生成预期原始动作的有序序列。这些由 VLM 生成的计划通过夹爪状态切换(开/关)、末端执行器运动幅度以及主导轴标签,与人类演示数据进行对齐。
- 微调: 使用分割并标记的轨迹通过 LoRA 对预训练的 VLA 进行微调。每个原始动作段成为一个基于其语言标签的独立训练回合。在动作空间中添加了一个学习到的进度通道,以提供单个原始动作的终止信号。
- 结果: 最终得到的 VLA 可以通过语言进行引导,从而执行特定的原始动作,而非仅仅是执行完整的任务指令。
第二阶段:VLM 引导的技能获取循环
给定一个拥有已知原始动作词汇表 (V) 的可控 VLA,INSIGHT 可以自主获取针对新任务缺失的技能。
- 原始动作差距识别: 对于一项新任务,VLM 规划器将其分解为一系列原始动作。计划中任何不在当前词汇表 V 中的原始动作 pi 都将被标记为“原始动作差距(primitive gap)”。
- 参数化与执行: 对于每个差距,VLM 会提出低层控制参数,具体包括运动轴(平移 {dx,dy,dz} 或旋转 {drx,dry,drz})和有符号幅值。机器人执行该计划:已知的原始动作由可控 VLA 处理,而差距部分则由使用 VLM 提议参数的低层控制器执行。
- 成功评估与集成: VLM 先知(oracle)通过分析执行前后的场景来验证任务是否成功。成功执行的新原始动作会被自动标记、存储并添加到训练数据集中。
- 重训练: 在结合了原始数据和新获取的原始动作的数据集上对 VLA 进行重训练。这扩展了词汇表 V,使得机器人在未来的迭代中能够自主执行完整的组合任务。
核心贡献
- 自动原始动作分割流水线: 一种利用 VLM 计划分解和运动学线索将遥操作演示分解为带标签原始动作的方法,消除了对手动标注的需求,并实现了原始动作层面的可控性。
- VLM 引导的数据飞轮: 一个闭环系统,其中 VLM 识别新任务中缺失的原始动作,通过低层控制自主生成成功的演示,并重训练 VLA 以集成这些新能力,无需进一步的人类演示。
- 组合式技能获取: 证明了所获取的原始动作可以被组合起来解决复杂的长程任务,有效地实现了持续性的终身学习。
实验结果
该框架在仿真环境(LIBEE 库中的 Franka Panda 机器人)和真实硬件(UFactory xArm)上的五个任务中进行了评估。
- 仿真(翻转方块): 仅从“拾取并放置”的演示开始,INSIGHT 获取了“旋转方块”的原始动作。在经过 246 次获取的原始动作执行后,它在方块翻转任务上达到了 75% 的成功率。相比之下,在相同的计算预算下,使用软行为者-评论家算法(SAC)强化学习基准模型的成功率为 0%。
- 仿真(关闭抽屉): 仅在“打开抽屉”的演示上进行训练后,INSIGHT 从分布外(OOD)的初始状态(抽屉已处于打开状态)获取了“推回抽屉”的原始动作。它在关闭抽屉的任务上达到了 100% 的成功率,同时保留了打开抽屉的能力。
- 真实世界(扭转与倾倒):
- 扭转: INSIGHT 在打开瓶盖任务上实现了 92% 的端到端成功率,而 Code-as-Policies (CaP-X) 基准模型为 32%,标准微调 VLA (π0.5) 为 0%。
- 倾倒: INSIGHT 在倾倒豆子的任务中达到了 96% 的成功率,而 CaP-X 为 16%。
- 组合: 对于一个复杂的 14 步“先扭转后倾倒”任务,INSIGHT 实现了 80% 的端到端成功率,显著优于 CaP-X(4%)。
- 效率: INSIGHT 执行每次尝试所需的实际时间远低于 CaP-X(例如,扭转任务为 13.6 秒对比 41.5 秒),因为它执行的是学习到的原始动作,而不是在测试时进行推理。
- 真实世界(清扫): 仅从“舀取”演示开始,INSIGHT 获取了侧向推挤的原始动作以清扫碎屑,并在 5/5 次评估试验中取得成功。
- 技能保留: 在所有实验中,统一的 VLA 在获取新原始动作后,对其原有的基础技能保持了 100% 的性能。
意义与主张
论文主张,原始动作的可控性为 VLA 策略的持续技能获取提供了实用的基础。 通过将技能分解为可组合、可控的原始动作,INSIGHT 使机器人能够:
- 精确识别完成新任务时缺失的具体能力。
- 自主练习并获取这些特定的缺失技能。
- 将新技能集成到统一的策略中,且不会对先前的技能产生灾难性遗忘。
作者认为,这标志着一种转变:即不再仅仅将 VLM 视为测试时的规划器,而是将其作为主动代理,参与到持续扩展机器人技能集的动态数据获取循环中。这种方法为机器人提供了一条适应新环境(如前文提到的火星探测器案例)的路径,而无需为每种新行为支付高昂的人类演示成本。
作者注明的局限性:
- 目前原始动作的获取仅限于单轴运动。
- 系统目前仅筛选成功的执行过程;引入失败分析可能会提高样本效率。
- 在执行过程中仍需人工干预进行环境重置。
- 该方法尚未在具有高自由度(high-DOF)的具身智能体(如人形机器人或移动操作臂)上进行测试。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。