Fine-Tuning VLAs with Self-Demonstrated Generative Control for Multi-Task Manipulation
本文提出了一种自监督微调方法,该方法利用来自零样本视觉-语言-动作(VLA)模型的在线交互展开(rollouts),使新的机器人实体能够在学习新技能的同时,保留其原有的指令遵循能力和先验任务知识。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
长期以来,机器人一直难以理解指令与现实之间的区别。几十年来,工程师可以编写程序让机器极其精确地移动机械臂,但那台机器无法理解像“拿起红色的杯子”这样简单的句子。近年来,一种新型的人工智能应运而生,旨在弥合这一差距。这些被称为“视觉-语言-动作模型”(vision-language-action models)的系统,通过海量数据进行训练,以理解语言、图像和物理运动是如何相互关联的。它们能够观察场景、阅读请求并决定如何行动,这让我们窥见了这样一个未来:机器人可以通过英语进行交流,而不是依靠编码指令。然而,一个顽固的问题依然存在:这些模型通常是在受控环境下针对某一种特定的机器人进行训练的,当研究人员尝试将它们用于另一台机器(哪怕只是略有不同的机器)时,机器人往往会失败。它可能完美理解了词义,但在执行抓取物体的物理动作时却手忙脚乱;或者更糟的是,在被迫学习新任务时,它会完全忘记如何遵循指令。
伊利诺伊大学厄巴纳-香槟分校的一个研究小组发现了一种修复方法,无需收集数千小时的新人类演示数据。他们发现,当机器人无法完成一项任务时,其失败的尝试中仍然包含着有价值的信息。通过让机器人尝试自主行动并从这些尝试中学习,他们可以教机器人掌握新技能,同时保持其对语言理解的能力。他们的方法包含一个两步走的流程。首先,他们获取一个预训练好的“机器人大脑”,并向其展示少量的专家数据——仅需十四分钟由人类引导机器人完成特定任务(例如拿起一个立方体)的过程。这教会了机器人完成该特定机器所需精细的运动技能。但如果只停留在这一步,机器人会忘掉它之前知道的一切,比如如何将物体放在别处或如何处理不同类型的物品。为了解决这个问题,研究人员让机器人利用它已经理解的指令进行自我练习。他们要求机器人尝试它以前见过的各种任务,记录它的行为,并将这些录像作为额外的训练数据。这种方法被称为“自监督学习”(self-supervised learning),它让机器人在学习新技能的同时,通过“复习”旧技能来有效地防止遗忘。
实验结果非常惊人。当研究团队将这种方法应用于一台拥有双臂的真实机器人时,机器人学会了拿起物体并将其放入篮子中,即使是对于那些从未被人类明确教授过的任务,也表现出了极高的成功率。在一组测试中,仅通过人类演示学习“拿起物体”技能的机器人,完全忘记了如何“放置”物体,在将物体移动到容器的任务中失败率达到了100%。而当研究人员将机器人生成的自我练习数据加入训练后,机器人放置物体的成功率跃升至55%,且其遵循指令的能力也得到了显著提升。机器人不仅学会了抓取,还学会了理解完整的句子,知道何时在拿起物体后停止,以及何时移动到第二个位置进行放置。即便面对全新的物体或房间内物品布局的变化,这一表现依然成立。
研究人员还在模拟环境(一个机器人可以在不损坏硬件风险的情况下快速学习的数字世界)中测试了这个想法。在这些模拟中,他们发现,仅使用人类数据来训练新任务会导致机器人丧失执行旧任务的能力,成功率从90%以上跌至不足17%。通过混入机器人生成的自我练习数据,他们恢复了机器人执行旧任务的能力,使成功率回升至70%以上,同时也提升了新任务的表现。这表明,机器人的自主尝试——即使是失败的尝试——也携带了一种关于物理世界的记忆,有助于保持其灵活性。团队指出,这种方法特别有用,因为它不需要访问最初用于训练机器人的那些庞大数据集,因为那些数据集通常由创建公司的商业机密所掌控。相反,机器人可以直接在工厂车间或家庭环境中生成自己的学习材料。
最令人惊讶的发现之一是,该方法在处理从未经过训练的任务时表现出的适应性。研究人员测试了一项名为“推”的技能,这项技能既不在人类演示的数据集中,也不在自我生成的练习数据中。仅接受过“拿起并放置”物体人类演示训练的机器人,往往会忽略“推”的指令,转而尝试去拿起物体,从而导致任务失败。然而,接受了自监督学习训练的机器人却能正确理解“推”的指令,并能有70%的概率执行该动作。这表明,自监督方法有助于机器人保持其更广泛的运动理解力,而不是被一套狭隘的习惯所覆盖。研究人员观察到,机器人甚至可以处理复杂的情况,例如在物体不在视线范围内时转身向后看,而仅靠人类数据训练的机器人则无法表现出这种行为。
这项研究凸显了机器人适应新环境方式的根本性转变。研究人员并没有将机器人的失败视为无用的噪音,而是将其视为一种资源。通过将机器人的自身行为作为一种“复习”,他们创建了一个既具适应性又具鲁棒性的系统。团队证明,只需极少量的引导,结合机器人的自我练习,单一策略即可在新的机器上学习执行多种任务。这种方法解决了“灾难性遗忘”(catastrophic forgetting)问题,即学习新事物会导致系统丢失原有知识的问题。研究人员发现,该方法不仅适用于堆叠积木等简单任务,也适用于复杂的、涉及大量接触的任务,例如将齿轮插入移动的板中,在这种情况下,成功率从30%提升到了90%。
尽管该方法功能强大,但研究人员承认它并非完美。机器人有时会继承来自其自我生成数据的微小缺陷,例如陷入“拿起并放下”某个物体的循环,或者在试图将衣物放入篮子时拖拽篮子的边缘。这些问题源于机器人正在从自己不完美的尝试中学习。为了防止不安全行为,研究人员在将数据用于训练前,手动过滤掉了最差的例子,但他们也指出,实现这一过程的自动化是规模化应用该技术的一项必要步骤。尽管存在这些局限性,这项工作仍为使机器人更加实用和易于部署提供了一条充满希望的路径。它表明,打造全能机器人的关键不仅在于收集更多的真人数据,还在于教会机器从自身的经验中学习,使其在不同任务之间转换时能够带着已有的知识不断前行。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。