← 最新论文
🤖 machine learning

BooST: Bridging Semantics and Motions for Efficient Skill Transfer

BooST 是一个两阶段框架,它通过跨模态 VQ-VAE 在高层语义意图与底层运动动力学之间架起桥梁,以构建统一的技能表示,从而实现高效的小样本适应、跨领域迁移以及面向现实世界机器人部署的鲁棒性。

原作者: Jusuk Lee, Daesol Cho, Jonghun Shin, Seungyeon Yoo, Jonghae Park, Taekbeom Lee, H. Jin Kim

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Jusuk Lee, Daesol Cho, Jonghun Shin, Seungyeon Yoo, Jonghae Park, Taekbeom Lee, H. Jin Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人做家务。你可能会尝试向它展示每一项任务中每一个极其微小的动作——就像在教一个孩子系鞋带时,去描述每一秒钟每一根手指的角度。这不仅耗时漫长,而且效果很差,因为如果鞋子的颜色变了或者房间变乱了,这种方法就失效了。这就是**机器人学习(robot learning)**中的一个巨大难题:我们如何教会机器变得聪明且灵活,而不需要进行数百万小时的练习?

科学家们一直试图通过教授机器人“技能”来解决这个问题。把技能想象成一个预先做好的食谱或一个舞蹈动作。机器人不是从零开始学习每一步如何走路,而是学习一种可以重复使用的“走路技能”。但问题在于,有些方法教会了机器人“如何移动”(肌肉记忆),但它们并不理解“要做什么”(目标)。另一些方法完美地理解了目标,却不知道如何实际驱动身体去实现它。这就像是一个厨师非常清楚蛋糕应该是什么味道,却完全不知道如何搅拌食材;或者一个面包师可以搅拌任何东西,却不知道一个蛋糕最终应该长什么样。为了让机器人在混乱、不可预测的现实世界中真正发挥作用,我们需要一种方法,能同时教会它们“做什么”和“怎么做”,这样它们才能快速学习新任务,并忽略像猫跳上柜台之类的干扰。

这正是名为 BooST(Bridging Semantics and Motions for Efficient Skill Transfer,即:通过桥接语义与运动实现高效技能迁移)的新型框架所发挥作用的地方。BooST 的研究人员意识到,要让机器人变得高效,他们需要停止将“做什么”和“怎么做”视为两个独立的问题。他们构建了一个两阶段训练系统,就像一位大师级厨师在教徒弟。

在第一阶段,称为统一技能预训练(Unified Skill Pretraining),BooST 从一个庞大的机器人视频库(确切说是 76,000 个片段)中学习。它使用一个特殊的“翻译器”,同时观察两件事:视觉场景和语言指令(例如“拿起苹果”)以理解“意图”,以及实际的机器人运动以理解“动力学”。想象一下,机器人正在观看一段有人拿起杯子的视频。BooST 不仅仅看到手在移动;它还理解其目标是拿起杯子,并且它学会了忽略背景中奔跑的狗或光照的变化。它将所有这些信息压缩成一个紧凑的“技能代码”——一种捕捉了动作本质的数字简写。

在第二阶段,下游适配(Downstream Adaptation),这种沉重且智能的知识被提炼成一个轻量化、快速的策略。这就像是将一位大师级厨师多年的经验转化为一张简单易懂、新手也能立即使用的食谱卡。当机器人面对一个全新的任务且仅有极少示例(在现实测试中仅为 5 次演示)时,它不需要重新学习一切。它只需查看自己的“技能代码本”,挑选出正确的动作,并迅速完成适配。

论文显示,这种方法的效果极其出色。在计算机模拟中,BooST 的表现优于其他方法,尤其是在数据匮乏的情况下。例如,在仅给定 10 次任务演示的情况下,BooST 在适应新场景方面的表现比排名第二的方法高出 140%。更令人印象深刻的是,研究人员在一个真实的机械臂(UR3)上测试了该方法,而这个机械臂与用于收集训练数据的机械臂(Franka Emika Panda)在型号上并不相同。尽管身体构造和运动风格存在差异,BooST 仍成功实现了技能迁移,在每个任务仅需 5 次演示的情况下就达到了很高的成功率。

研究人员还测试了机器人处理混乱情况的能力。他们在训练视频中加入了移动的、具有干扰性的物体(比如走来走去的真人身影)。当其他方法被这些噪声干扰而无法学习正确动作时,BooST 依然能够保持专注,证明了它能够忽略无关的视觉干扰。这项研究表明,通过弥合理解目标与掌握运动之间的鸿沟,机器人可以变得更加适应环境、更具鲁棒性,并为现实世界做好准备,同时比以前使用更少的计算能力和数据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →