ICI-VLA: In-Context Imitation with Spatiotemporally Aligned Demonstrations for Vision-Language-Action Models
ICI-VLA 是一种训练与检索框架,它通过将动作生成以时空对齐且带有语义标签的微演示(micro-demonstrations)为条件,使固定的视觉-语言-动作模型能够实现快速、少样本的测试时自适应,从而在无需额外梯度更新的情况下,在多个机器人操纵基准测试中显著优于基准模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
长期以来,机器人一直在努力快速学习新任务。传统方法通常要求机器人在面对每一项新工作时都要从头开始重新训练,这个过程需要大量的训练数据和计算能力。这使得机器人在必须即时适应变化的动态环境中部署变得十分困难。一种被称为“上下文学习”(in-context learning)的新型方法提供了一条不同的路径。这种方法不需要重新训练机器人的“大脑”,而是允许系统通过观察几个已完成任务的示例,并利用这些信息来判断下一步该做什么,而无需改变其内部设置。虽然这项技术彻底改变了计算机理解语言和图像的方式,但将其应用于物理机器人要复杂得多。机器人不仅要理解视觉场景和语音指令,还必须实时协调自身的身体动作,因为在时间或位置上的微小偏差都可能导致失败。
武汉大学的研究人员开发了一种名为 ICI-VLA 的新框架,成功地将这种“从示例中学习”的能力带到了机械臂领域。他们的系统允许机器人观看几个简短的任务执行视频片段,然后立即将所学知识应用于新的、类似的场景。这项创新的关键在于系统处理示例的方式。研究人员并没有向机器人输入完整的、长篇的任务视频,而是将这些演示分解为微小的、带有标签的片段,使其与机器人当前工作的特定时刻相匹配。随后,他们训练了一个专门的搜索工具,用于寻找与机器人当前所见景象精确对齐的片段,从而确保机器人能在正确的时间模仿正确的动作。为了防止机器人仅仅是死记硬背示例视频中的数值,系统在训练时被要求忽略示例的结尾,转而关注当前的视角,从而迫使机器人去理解动作本身,而非仅仅是重复动作。
在实验中,团队在两个不同的模拟环境以及一个配备双臂的真实物理机器人上测试了这种方法。在第一个涉及移动物体和打开抽屉等各种任务的模拟环境中,该系统的成功率达到了 97.7%。在第二个涉及双臂协作、难度更高的模拟环境中,它达到了 60.4%,较以往的方法有了显著提升。当他们将该系统转移到配备物理摄像头和机械臂的真实场景中时,它完成排序物体和将物品放入抽屉等任务的成功率达到了 83.2%。这些结果表明,如果能给机器人提供正确且高度匹配的即时示例,它就不需要为每一项新工作都进行重新训练。
成功的核心在于系统如何管理信息流。当机器人接收到一个长指令(例如“打开抽屉并将碗放进去”)时,系统会将其分解为较小的步骤。然后,它会在经验库中搜索短片,以找到与当前步骤相匹配的内容。例如,如果机器人当前正在尝试推上抽屉,系统会寻找一段关于“推上抽屉”的短片,而不是展示一段“打开抽屉”的视频。这确保了机器人正在查看相关的信息。研究人员还引入了一种训练技术,在学习阶段隐藏示例动作的部分内容。这迫使机器人依赖于它当前所见的景象和任务的整体语境,而不是盲目地复制示例视频中的数值。这可以防止机器人因为起始位置与示例略有不同而产生困惑。
研究强调,示例的质量比数量更重要。通过仔细选择并将这些短演示与机器人当前的运动阶段对齐,系统可以实现瞬时适应。研究人员发现,仅使用三个示例就足以达到巅峰性能;增加更多示例并无帮助,有时甚至会降低系统的有效性。这表明,机器人受益于少量、高度相关的线索,而非海量的信息。该系统通过保持机器人的主要控制软件固定且不变,仅根据检索到的示例来调整其行为。这意味着机器人可以在无需昂贵且耗时的重新训练环节的情况下,部署到新的场景中。
尽管研究结果令人鼓舞,但研究人员指出,该系统仍然依赖于拥有一个高质量的过往演示库。如果机器人遇到与其库中完全不符的情况,它可能会难以找到有用的示例。此外,构建该库和训练搜索工具在机器人投入使用前需要大量的离线工作。然而,这些发现展示了一条让机器人变得更加灵活的清晰路径。通过将过去的经验视为参考指南而非僵化的剧本,机器人可以学会应对新的挑战,并展现出以往难以企及的适应能力。这项工作表明,未来机器人控制的核心或许不在于从零开始构建更聪明的“大脑”,而在于教会它们如何在正确的时间从正确的示例中学习。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。