← 最新论文
💻 computer science

Behavior Prompting Policy: Demonstrations as Prompts for Manipulation

本文介绍了行为提示策略(Behavior Prompting Policy, BPP),这是一种上下文视觉运动架构,它使机器人能够在推理阶段通过单次人类演示学习新的操纵任务,并由通过 iPhUMI 界面收集的多样化训练数据集提供支持,且通过新颖的评估基准进行了验证。

原作者: Austin Patel, Ben Pekarek, Joel Enrique Castro Hernandez, Shuran Song

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Austin Patel, Ben Pekarek, Joel Enrique Castro Hernandez, Shuran Song

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想要教一个机器人一个新动作,比如折叠一种特定类型的衬衫,或者画一个特定的形状。通常情况下,这就像是在训练一只听从指令的狗:你必须花费数小时从头开始反复训练,直到它掌握为止。如果你稍后想教它另一个不同的动作,你往往必须重新开始整个训练过程。

这篇论文介绍了一种教机器人新方法,叫做**“行为提示”(Behavior Prompting)**。与其说它更像正式的训练,不如说它更像是给朋友看一段手机短视频并说:“像这样去做。”

以下是它的工作原理,使用简单的类比进行说明:

1. 核心理念:“视频食谱”

与其给机器人文字指令(“折叠衬衫”)或最终成品的图片(“衬衫折叠后的样子”),你直接给它一段人类完成该任务的单段演示视频。

  • 类比: 想象你在尝试烤蛋糕。
    • 旧方法: 你得到的是一份书面食谱(语言)或一张成品蛋糕的照片(目标图像)。你必须靠猜测来完成步骤。
    • 行为提示: 你拿到的是一段有人正在烤这款特定蛋糕的视频。你可以清楚地看到他们是如何打鸡蛋、搅拌了多少次以及移动的速度。机器人观看这个“视频食谱”(行为提示),并尝试模仿其中的动作,而不仅仅是结果。

2. 大脑:“智能翻译官”(BPP)

论文引入了一个新的机器人大脑,称为行为提示策略(Behavior Prompting Policy, BPP)。

  • 工作原理: 当机器人被要求执行一项任务时,它会同时观察两件事:
    1. 它现在看到的景象(当前的房间、桌上的衬衫)。
    2. “视频食谱”(人类的演示)。
  • 神奇之处: 机器人并不仅仅是死记硬背这段视频。它的行为就像一个智能翻译官。它观察视频并思考:“好吧,在视频中,那个人在这里拿着衬衫。而在我现在的视角里,衬衫在那里。所以,我需要移动我的手来匹配那个位置。”它通过不断将视频与现实进行对比,来确定下一步该怎么做。

3. 训练:多样性是关键

研究人员发现,为了让这种方法奏效,机器人在初始训练阶段需要看到大量不同类型的任务,但并不需要看到每个特定任务的许多示例。

  • 类比: 想象一位厨师学习烹饪。
    • 如果你训练他们只做 1,000 份仅限意面的料理,他们会非常擅长做意面,但做沙拉会很糟糕。
    • 如果你给他们 1,000 种不同菜肴(汤、沙拉、牛排、蛋糕)各 1 个示例,他们就会学会通用的“烹饪技能”。
    • 论文发现,给机器人一个包含许多不同任务的“菜单”(即使每个任务只有少量示例),会让它在日后快速学习新事物时表现得更好。

4. 工具:“神奇遥控器”(iPhUMI)

为了收集所有这些不同的示例,团队制造了一个名为 iPhUMI 的特殊手持设备。

  • 它是什么: 它是一个连接着 iPhone 的机械抓手。
  • 它如何起作用: 人类只需拿起这个设备并物理移动它,以此向机器人展示该做什么。因为它带有 iPhone,所以它能立即知道自己在房间里的位置(无需花费数小时先对房间进行建模)。
  • 优势: 在测试阶段(即机器人实际工作时),人类可以拿起这个设备,做一次任务来向机器人演示,机器人便能立即学会如何做。这就像是一个用于即时教授新技能的“遥控器”。

5. 结果:他们测试了什么?

团队在两个方面测试了这项技术:

  1. 绘画: 他们让机器人画形状。即使机器人从未见过那个特定的形状,只要人类在平板电脑上画一次(作为提示),机器人就能模仿其运动轨迹,在另一个不同的板子上画出来。
  2. 桌面任务: 他们测试了诸如拿起碗并移动碗之类的任务。他们发现,如果机器人看到一段人类移动碗的视频,即使它从未见过这种特定的组合,它也能学会如何移动一个不同的碗到不同的位置。

总结

该论文声称,行为提示允许机器人通过观看单次人类演示来即时学习新技能,而无需昂贵的重新训练。

  • 秘诀所在: 当机器人之前见过各种各样的任务时,这种方法效果最好。
  • 优势: 与使用文字指令或仅仅展示最终目标相比,它更快速、更灵活。它通过使用人类真实的动作作为引导,填补了“做什么”与“怎么做”之间的鸿沟。

重要提示: 该论文侧重于这些特定的能力(绘画和桌面操作)。它并未声称这项技术已经准备好用于复杂的医疗手术或工业组装线,也并未声称机器人仅凭看一眼就能学会任何可能的任务;它在经过广泛训练的任务类型范围内表现最佳。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →