← 最新论文
🤖 machine learning

InSight: Self-Guided Skill Acquisition via Steerable VLAs

InSight 是一个使视觉-语言-动作(VLA)模型能够通过将演示分解为可控的基元动作,并利用由视觉语言模型(VLM)引导的数据飞轮来生成、标注并集成针对新颖长程任务的缺失基元,从而自主获取新操纵技能的框架。

原作者: Maggie Wang, Lars Osterberg, Stephen Tian, Ola Shorinwa, Jiajun Wu, Mac Schwager

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Maggie Wang, Lars Osterberg, Stephen Tian, Ola Shorinwa, Jiajun Wu, Mac Schwager

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人做饭。传统上,如果你想让机器人学习一项新技能,比如“做三明治”,你必须站在那里,握着它的手,引导它完成每一个步骤:拿起面包、抹上黄油、加上奶酪等等。这既缓慢又昂贵,而且如果你稍后想教它“煮汤”,你又得把整个过程重新来一遍。

INSIGHT 论文提出了一种更聪明的机器人教学方式,这种方式更接近人类学习新技能的方式。机器人不再是死记硬背整个食谱,而是学习单个动作(如“拿起”、“抬起”、“旋转”或“倾倒”),然后由它自己去思考如何组合这些动作。

以下是该系统的运作方式,分为几个简单的步骤:

1. “乐高积木”法

把机器人的技能想象成不是一个巨大的、不可分割的整体,而是一盒乐高积木

  • 问题所在: 如今大多数机器人都是针对整个任务进行训练的。如果你教它们“拿起杯子”,它们会学习那一段特定的序列。如果此时你要求它们“倒水”,它们可能会失败,因为它们从未见过“倾倒”这个积木。
  • INSIGHT 的解决方案: 该系统通过人类演示(例如一段有人拿起杯子的视频)并自动将其拆解成微小的、带有标签的“积木”,即原语(primitives)
    • 例子: 机器人看到的不再是“拿起杯子”,而是:“手移动到杯子处” + “手指闭合” + “向上抬起”。
    • 机器人能如此出色地掌握这些单个动作,以至于它可以根据指令被“操控”去执行其中某一个动作。

2. “智能助手”(VLM)

机器人内置了一个“智能助手”(视觉语言模型,简称 VLM),充当项目经理的角色。

  • 场景: 假设机器人知道如何“拿起瓶子”和“放下瓶子”,但你要求它**“把瓶子里的液体倒入碗中”**。
  • 差距: 智能助手观察计划后会说:“嘿,我们有‘拿起’积木和‘放下’积木,但我们缺少了**‘倾斜并倾倒’**这个积木!”
  • 补救措施: 智能助手不会要求人类演示如何倾倒,而是通过计算该动作的物理特性(例如:“将瓶子向前倾斜 45 度”),并告诉机器人尝试执行它。

3. “练习循环”

这就是见证奇迹的时刻。机器人会尝试自主完成那个缺失的动作。

  • 试错: 机器人尝试执行“倾斜”动作。如果洒了一地,它会尝试以略微不同的角度再次尝试。
  • “先知”检查: 在机器人尝试之后,智能助手会观察结果(就像老师批改试卷一样)。“水进到碗里了吗?进了?很好!没进?再试一次。”
  • 学习: 一旦机器人成功完成了倾倒动作,系统就会将这个特定的“倾斜”动作作为一个新的乐高积木保存到它的库中。随后,它会重新训练自己,以便永久记住这个新的积木。

4. 从零开始构建新技能

一旦机器人学会了“倾倒”积木,它就不再需要人类来教它了。

  • 结果: 如果稍后你要求机器人“拧开盖子然后倾倒”,它现在可以结合它之前可能已经学会的“拧”积木和新的“倾倒”积木。
  • 类比: 这就像一位音乐家已经学会了弹奏 C 大调和弦以及 F 大调和弦。如果他们想演奏一首新歌,不需要老师来教他们整首歌,他们只需要组合已经掌握的那些和弦即可。

他们究竟证明了什么?

研究人员在计算机模拟和真实机器人(使用机械臂)上都测试了这一点。他们展示了:

  • 无需人类额外协助: 他们教会了机器人完成复杂任务,如翻转方块关闭抽屉拧开瓶盖倾倒豆子,而从未向其展示过有人做这些动作的视频。
  • 效率极高: 机器人学习这些新技能的速度比传统方法(如强化学习,类似于机器人通过盲目的试错进行数千次尝试)要快得多。
  • 不会遗忘: 当机器人学习新的“倾倒”技能时,它并不会忘记如何“拿起”瓶子。它在增加新技能的同时,保留了所有旧有的技能。
  • 现实世界中的成功: 在真实机器人上,它实现了极高的成功率(倾倒任务高达 96%),并且甚至可以组合技能来完成一个它从未见过的长达 14 个步骤的任务(拧开盖子,然后倾倒)。

核心结论

INSIGHT 是一个让机器人将复杂任务分解为小型、可重用动作的框架。当遇到新工作时,它们利用“智能助手”来确定缺少哪些动作,自主练习这些动作,并将它们保存起来以备后用。这使得机器人能够持续学习新技能,而无需每次都由人类全程指导。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →