← 最新论文
🤖 machine learning

REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs

REFACTOR-VLA 是一个通过行为等价核与潜在世界模型对动作片段进行聚类,从而学习可重用的、带类型的运动程序的“唤醒/睡眠”框架,通过一个库约束解码器以及一个优先考虑聚类质量而非模型容量的训练目标,在长时程 LIBERO 任务上实现了最先进的性能。

原作者: Riyaaz Shaik, Chandru Venkataraman

发布于 2026-09-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Riyaaz Shaik, Chandru Venkataraman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

机器人正在变得越来越擅长观察世界并穿行其中,但它们在处理人类能轻松应对的那种复杂的、多步骤的任务时仍然感到吃力。当一个人制作三明治时,他们并不会去思考抓取面包、涂抹黄油或切开西红柿时所需的每一次肌肉抽动。相反,他们依赖于一个熟悉的动作库——抓取、涂抹、切割——并将这些动作以不同的顺序串联起来。目前的机器人人工智能模型往往缺乏这种组织行为的能力。它们倾向于生成原始的、瞬时的指令,而没有将其分组为可重用的、定义明确的技能。这使得它们很难为长期任务进行规划,也难以解释它们所学到的内容。研究人员现在正尝试教机器构建自己的内部技能库,让它们能够将复杂的工作分解成更小的、易于管理的片段,从而实现重用和组合。

苹果公司的一个研究小组开发了一种名为 REFACTOR-VLA 的新系统,试图通过教机器人自主发现其技能来解决这个问题,而无需人类进行标注。该系统通过两个交替进行的阶段运行,就像人类练习一个新动作后休息以让大脑组织记忆一样。在第一阶段,机器人学习预测如果执行特定的动作序列会发生什么。它构建了一个关于世界的心理模型,理解其动作如何改变环境。在第二阶段,系统查看收集到的海量运动数据,并尝试寻找模式。它提出了一个简单但困难的问题:两种不同的动作序列是否产生了相同的结果?如果机器人的手臂画圈来拿起杯子,或者走直线来完成同样的操作,系统需要识别出这两条路径都达到了相同的目标。

为了回答这个问题,研究人员创建了一个特殊的工具,该工具衡量的是动作的结果,而非仅仅是外观。系统不是观察机器人运动的原始视频,而是在其学习到的心理模型中模拟该动作,以观察机器人的最终位置以及获得了什么奖励。如果两条不同的运动路径导向相同的最终状态和相同的奖励,系统就会将它们视为等效的。随后,它将这些相似的路径组合在一起,形成一个单一的、可重用的技能。一旦形成一个组,系统就会尝试编写一个简单的、结构化的程序来描述该技能的共同模式。这个程序随后会被添加到库中。机器人稍后可以使用这个库来规划新任务,调用这些预包装好的技能,而不是从头开始计算每一个微小的动作。

研究人员在模拟环境中的一系列标准机器人任务上测试了这种方法。他们发现了一个关于这些系统如何学习的令人惊讶的事实。在人工智能领域有一个普遍观点,即让模型变得更大、更复杂总是会导致更好的性能。然而,当研究人员将世界模型的规模从大约 1.88 亿个参数增加到 4.3 亿个参数时,系统的表现实际上在所有测试套件上都变差了。较大的模型无法正确组织技能,这表明仅仅增加计算能力并不是解决方案。

相反,成功的关键在于模型的训练方式。研究人员发现,在初始训练阶段加入一种特定类型的学习目标,可以显著提高结果。这种目标有助于系统更清晰地区分不同的任务,使其能够更有效地将相似的动作分组在一起。通过这一改进,该系统的表现超过了现有的最强方法,在所有四个主要测试套件上都取得了显著的平均分提升。该系统成功地为特定任务构建了一个包含三种不同、可重用技能的库,并且使用该库的机器人能够使用这些新技能重写它所见过的每一个演示过程。

这项研究还表明,系统寻找这些技能的能力在很大程度上取决于它分析的数据类型。虽然系统成功创建了基于语言指令的库(例如“拿起物体并将其放入篮子中”),但它未能从原始电机指令本身中发现可重用的模式。这表明,系统更擅长理解任务的高层目标,而非移动方式的底层物理细节。研究人员测量了多次不同训练运行中结果的一致性,发现系统能够可靠地发现相似的技能分组,且不同版本的模型之间具有高度的一致性。

这项工作证明,机器人如何组织其经验比其“大脑”的规模更为重要。通过关注动作的结果并使用结构化的方法对其进行分组,该系统可以构建一个技能库,帮助它应对复杂的长期任务。研究结果挑战了“越大越好”的观念,并指向了一个未来,即机器人可以像人类一样,学会以可重用动作的形式进行思考。研究人员已经公开了他们的代码和数据,允许他人验证这些结果并基于这种新的机器人学习方法进行开发。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →