MINERVA: How Small Can a Manipulation Policy Be and Still Solve LIBERO?
该论文介绍了 MINERVA,这是一个参数量仅为 0.54M 的高度紧凑的视觉-语言-动作策略,它在 LIBERO 基准测试上实现了接近最先进水平的性能,揭示了该任务的能力底线出人意料地低,同时也暴露了指令调节鲁棒性的关键局限性以及缺乏流匹配带来的收益。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
机器人正在学习以曾经看似不可能的灵巧度进行移动,能够拿起物体、堆叠积木并遵循简单的口头指令。这一进展是由一种新型人工智能驱动的,它将视觉、语言和行动整合进一个单一的系统中。这些系统通常被称为视觉-语言-行动模型(vision-language-action models),它们充当机器人的大脑,观察场景,理解像“拿起红色的积木”这样的请求,然后计算出完成任务所需的精确动作。为了训练这些大脑,研究人员使用了一套被称为基准测试(benchmarks)的标准挑战集,这作为衡量机器人表现的标尺。多年来,机器人操控领域最受欢迎的基准测试是一个包含四十种不同任务的集合,涉及在模拟环境中移动物体。该领域普遍认为,要出色地完成这些任务,机器人需要一个巨大的大脑——一个拥有数十亿参数(即内部设置)的数字模型,这需要运行强大的、昂贵的计算机硬件。
然而,来自东京大学的一个研究小组提出了一个更简单、更实际的问题:大脑究竟需要多大?如果一个机器人被部署到工厂或家庭中执行特定的工作,它并不需要具备理解世界上每种语言或识别从未见过的每种物体的能力。它只需要解决受雇执行的特定任务即可。研究人员想要寻找能够完美解决这套标准四十项任务的最小版本的机器人大脑。他们正在寻找完成工作所需的最小计算量,这个阈值将决定机器人是可以在小型、廉其廉价的芯片上运行,还是始终需要一个庞大的服务器。
为了找到这个极限,该团队构建了一系列机器人策略(policies),即告诉机器人如何移动的程序,并有系统地缩小它们。他们从一个拥有近千万个内部设置的模型开始,逐步缩小规模,观察机器人在何时开始失败。他们剥离了大型模型中常见的复杂功能,例如阅读自然语言句子或使用预训练视觉系统的能力。相反,他们给了机器人一个由数字表示的四十个任务名称的简单列表,以及一个从零开始学习观察的摄像头。随后,他们在标准的四十项任务上训练这些模型,并进行了两千多次测试,以观察它们的成功率。
结果揭示了一个令人惊讶的底线。研究人员发现,一个仅有 0.54 百万参数的模型就能以 95.1% 的成功率完成任务。这个微小的模型表现得几乎与该领域最著名、规模最大的模型不相上下,后者的参数量高达数十亿,且体积大出数千倍。一旦模型规模达到约一百万参数,机器人的性能就不再显著提升;超过此点增加计算能力会产生收益递减。反之,当模型缩小到二十五万参数以下时,机器人的解决能力就会崩溃,尤其是在处理复杂的长时程任务时。这表明,对于这组特定的挑战,机器人不需要一个巨大的大脑,它只需要一个小型且高效的大脑。
这项研究还揭示了机器人大脑中哪些部分真正起作用。研究人员测试了组织模型的不同方式,发现最关键的资源是处理视觉信息的部件——机器人的“眼睛”。如果他们从视觉系统中夺走过多的容量,无论为规划动作的部分留有多少动力,机器人都会失败。他们还发现,通常用于生成平滑、流利动作的复杂数学方法对于达到这种水平的表现并非必要。一种更简单、更快速的动作计算方法同样有效,并能让机器人实现极速决策。
或许最令人震惊的发现是机器人如何理解指令。在较大的模型中,机器人读取像“拿起杯子”这样的句子并试图理解词语的含义。而在这种微型模型中,研究人员用一个简单的数字代码取代了语言。当他们打乱这些代码,给机器人提供错误的任务编号时,机器人的成功率降至接近于零。这证明,在这个特定的基准测试上,机器人并非在真正“理解”通用的语言,而仅仅是在记忆哪种视觉模式对应哪个数字代码。指令只是解锁特定记忆行为的一把钥匙。
这种区别具有深远的意义。研究人员表明,大型模型在该基准测试上报告的高成功率,很大程度上是衡量机器人对特定任务的记忆程度,而非其对新情况的泛化能力。当他们测试这些微型模型面对任务的变化(如改变光照、背景或物体形状)时,成功率大幅下降,这表明这些模型并未学习到世界的底层物理规律,而只是记住了训练任务的具体样貌。然而,对于每天执行相同四十项任务的机器人来说,这种记忆正是所需要的。
这项研究的实际成果是一个极其高效的机器人策略。这个 0.54 百万参数的模型可以在标准的笔记本电脑上运行,无需任何专门的显卡,且决策时间不到十毫秒。这比目前最先进的模型快了数百倍,后者通常需要数秒才能规划一次移动。通过证明微型专业化模型可以解决标准基准测试,研究人员表明,通往实用、廉价机器人的道路并不一定需要构建越来越大的大脑。相反,它需要寻找最适合特定工作的最小、最高效的大脑,这一发现可能使机器人得以部署在空间、电力和成本受限的家庭及工厂中。该研究并不声称这些小型模型可以取代进行开放式探索所需的大型通用系统,但它明确指出,对于固定的任务集,所需的容量远比此前认为的要小得多。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。