想象一下,你想要教一个机器人一个新动作,比如折叠一种特定类型的衬衫,或者画一个特定的形状。通常情况下,这就像是在训练一只听从指令的狗:你必须花费数小时从头开始反复训练,直到它掌握为止。如果你稍后想教它另一个不同的动作,你往往必须重新开始整个训练过程。
这篇论文介绍了一种教机器人新方法,叫做**“行为提示”(Behavior Prompting)**。与其说它更像正式的训练,不如说它更像是给朋友看一段手机短视频并说:“像这样去做。”
以下是它的工作原理,使用简单的类比进行说明:
1. 核心理念:“视频食谱”
与其给机器人文字指令(“折叠衬衫”)或最终成品的图片(“衬衫折叠后的样子”),你直接给它一段人类完成该任务的单段演示视频。
- 类比: 想象你在尝试烤蛋糕。
- 旧方法: 你得到的是一份书面食谱(语言)或一张成品蛋糕的照片(目标图像)。你必须靠猜测来完成步骤。
- 行为提示: 你拿到的是一段有人正在烤这款特定蛋糕的视频。你可以清楚地看到他们是如何打鸡蛋、搅拌了多少次以及移动的速度。机器人观看这个“视频食谱”(行为提示),并尝试模仿其中的动作,而不仅仅是结果。
2. 大脑:“智能翻译官”(BPP)
论文引入了一个新的机器人大脑,称为行为提示策略(Behavior Prompting Policy, BPP)。
- 工作原理: 当机器人被要求执行一项任务时,它会同时观察两件事:
- 它现在看到的景象(当前的房间、桌上的衬衫)。
- “视频食谱”(人类的演示)。
- 神奇之处: 机器人并不仅仅是死记硬背这段视频。它的行为就像一个智能翻译官。它观察视频并思考:“好吧,在视频中,那个人在这里拿着衬衫。而在我现在的视角里,衬衫在那里。所以,我需要移动我的手来匹配那个位置。”它通过不断将视频与现实进行对比,来确定下一步该怎么做。
3. 训练:多样性是关键
研究人员发现,为了让这种方法奏效,机器人在初始训练阶段需要看到大量不同类型的任务,但并不需要看到每个特定任务的许多示例。
- 类比: 想象一位厨师学习烹饪。
- 如果你训练他们只做 1,000 份仅限意面的料理,他们会非常擅长做意面,但做沙拉会很糟糕。
- 如果你给他们 1,000 种不同菜肴(汤、沙拉、牛排、蛋糕)各 1 个示例,他们就会学会通用的“烹饪技能”。
- 论文发现,给机器人一个包含许多不同任务的“菜单”(即使每个任务只有少量示例),会让它在日后快速学习新事物时表现得更好。
4. 工具:“神奇遥控器”(iPhUMI)
为了收集所有这些不同的示例,团队制造了一个名为 iPhUMI 的特殊手持设备。
- 它是什么: 它是一个连接着 iPhone 的机械抓手。
- 它如何起作用: 人类只需拿起这个设备并物理移动它,以此向机器人展示该做什么。因为它带有 iPhone,所以它能立即知道自己在房间里的位置(无需花费数小时先对房间进行建模)。
- 优势: 在测试阶段(即机器人实际工作时),人类可以拿起这个设备,做一次任务来向机器人演示,机器人便能立即学会如何做。这就像是一个用于即时教授新技能的“遥控器”。
5. 结果:他们测试了什么?
团队在两个方面测试了这项技术:
- 绘画: 他们让机器人画形状。即使机器人从未见过那个特定的形状,只要人类在平板电脑上画一次(作为提示),机器人就能模仿其运动轨迹,在另一个不同的板子上画出来。
- 桌面任务: 他们测试了诸如拿起碗并移动碗之类的任务。他们发现,如果机器人看到一段人类移动碗的视频,即使它从未见过这种特定的组合,它也能学会如何移动一个不同的碗到不同的位置。
总结
该论文声称,行为提示允许机器人通过观看单次人类演示来即时学习新技能,而无需昂贵的重新训练。
- 秘诀所在: 当机器人之前见过各种各样的任务时,这种方法效果最好。
- 优势: 与使用文字指令或仅仅展示最终目标相比,它更快速、更灵活。它通过使用人类真实的动作作为引导,填补了“做什么”与“怎么做”之间的鸿沟。
重要提示: 该论文侧重于这些特定的能力(绘画和桌面操作)。它并未声称这项技术已经准备好用于复杂的医疗手术或工业组装线,也并未声称机器人仅凭看一眼就能学会任何可能的任务;它在经过广泛训练的任务类型范围内表现最佳。
技术摘要:行为提示策略 (Behavior Prompting Policy, BPP)
问题陈述
传统上,教机器人学习新技能需要针对每个特定任务进行详尽的重新训练或微调,这不仅效率低下,而且限制了快速部署。虽然大型语言模型在上下文学习(在测试时通过少样本示例适应新任务)方面取得了成功,但机器人技术在实现类似的操作能力方面仍相对滞后。现有的方法通常依赖于语言描述或目标图像,这些方式对于任务所需的具体空间和时间执行细节提供的信息可能并不完整。此外,机器人领域许多少样本学习方法依赖于带有梯度更新的元学习或显式的空间变换,这些方法在面对高多样性的任务分布时可能难以扩展。
作者提出了行为提示(Behavior Prompting),这是一种新的范式:在推理阶段,给定一个单个人类演示(即“行为提示”),机器人即可执行新任务。该提示由机器人在感觉运动空间中的观测、本体感受和动作组成,同时定义了任务并为如何执行任务提供了具体的示例。
方法论
1. 行为提示策略 (BPP)
其核心算法贡献是行为提示策略 (BPP),一种上下文视觉运动架构,旨在将行为提示和当前观测转化为机器人的动作。该架构包含三个主要组件:
- 提示分块与嵌入 (Prompt Chunking & Embedding): 为了提高效率,行为提示(观测、本体感受和动作的序列)会被进行时间下采样(通常为 1Hz)。该序列被划分为若干“块 (chunks)”,每个块包含一个时刻的观测 (o) 和本体感受 (q),以及通向下一个块的动作序列 (a)。注意力池化 (Attention Pooling) 机制将 {o,q,a} 合并为一个单一的块嵌入 (pi)。
- 提示编码器 (Prompt Encoder): 这是一个 Transformer 解码器,用于根据当前观测从提示序列 (P=[p0,…,pn]) 中提取相关信息。当前观测经过标记化处理,并通过交叉注意力 (cross-attention) 与提示块嵌入进行处理。这使得模型能够识别提示演示与当前环境之间的时空对应关系和空间差异。
- 动作解码器 (Action Decoder): 提取出的提示信息与当前观测及扩散时间步(diffusion timestep)拼接后,被输入到一个扩散模型(具体为基于 CNN 的架构,带有 FiLM 条件化)中。解码器通过迭代去噪来生成闭环动作。
训练策略: BPP 使用标准的多任务模仿学习数据集进行行为克隆训练。在每个训练步骤中,采样一个演示作为提示,并从相同任务的其他演示中采样一批后退时界(receding horizon)的观测和未来动作。至关重要的是,模型并未在提示与训练批次之间强制执行显式的空间或时间对应关系;模型通过端到端学习来利用提示。
2. iPhUMI 接口
为了解决行为提示对数据的需求,作者引入了 iPhUMI,一种手持式操作接口。它改编自 UMI 夹持器,将 GoPro 替换为 iPhone 15 Pro。其关键特性包括:
- 即时定位 (Instant Localization): 利用设备端的 ARKit 实现实时 SLAM,消除了繁琐的环境建图过程。
- 无线提示 (Wireless Prompting): 允许人类操作者将行为提示无线传输至工作站,从而在测试时为新任务实现即时的策略调节。
评估与基准测试
作者引入了两个新的基准测试来评估测试时适应能力,重点在于高任务多样性而非单一任务的复杂度:
- DrawAnything: 一个绘图环境(模拟与现实世界),需要连续且精细的动作适应。
- 模拟环境 (Sim): 在 2,000 个程序化生成的任务上进行训练;在 50 个未见的真人绘画任务上进行测试。
- 现实环境 (Real): 使用带有 iPhone 腕部摄像头的 ARX 机械臂。在 1,000 个任务上进行训练;在 10 个未见任务上进行测试。
- LIBERO-Gen: LIBERO 操作基准的扩展版本,具有显著更多的任务。
- 组合任务 (Combination): 将 10 个任务扩展到 174 个,测试从两个相同的碗中挑选一个并将其放入九个位置之一的能力。
- 链式任务 (Chain): 将 10 个任务扩展到 321 个,测试连续的两步交互(例如,先打开抽屉,然后放置物体)。
关键结果
- 卓越的适应能力: 在未见的绘图任务(DrawAnything-Sim)中,BPP 相比目标图像(Goal-Image)基准实现了 80.7% 的误差削减,相比 ICRT(之前的行为提示模型)实现了 33.3% 的误差削减。
- 对复杂性的鲁棒性: 在 LIBERO-Gen 基准测试中,BPP 优于基准模型(目标图像、语言和 ICRT),并能与 π0.5(一个经过 100K 步 LoRA 微调的视觉-语言-动作基础模型)相媲美,尽管 BPP 并没有进行基础预训练。
- 注意力机制: 对提示编码器注意力的可视化(图 5)表明,BPP 能有效地追踪任务进度。对于连续性任务(绘图),注意力紧随提示;对于离散任务(LIBERO),注意力则追踪“里程碑”(例如,下一个要交互的物体)。
- 数据需求: 系统性的消融实验表明,任务多样性是驱动提示能力的 primary 因素。在大量不同任务中为每个任务收集较少的演示,比在少数任务中收集大量演示能带来更好的测试时适应效果。
意义与主张
本文声称,行为提示提供了一种灵活且可扩展的方式,无需昂贵的微调即可教机器人学习新技能。通过利用单个人类演示作为提示,用户可以即时指定任务或定义新的机器人能力。
作者强调:
- 感觉运动提示 (Sensorimotor prompts) 比语言或目标图像更具表达力,尤其适用于需要特定低层行为或空间-时间策略的任务。
- 训练数据中的任务多样性对于实现对未见任务的零样本适应至关重要。
- iPhUMI 不仅是一个用于收集多样化训练数据的实用接口,也是在测试时指定行为提示的工具,弥合了人类意图与机器人执行之间的鸿沟。
这项工作将行为提示定位为实现机器人适应新环境(例如特定的家庭环境)迈出的一步,通过单次演示即可将预训练知识迁移至新环境,从而通过提供关于目标环境和所需操作策略的丰富信息,简化了适应问题。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。