CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model
CoTinyVLA 是一个参数量在十亿以下级的视觉-语言-动作模型,它通过利用结构化监督技术——包括双视图时序输入、层级式思维链蒸馏以及改写增强——而非增加模型规模,从而在 LIBERO-Plus 基准测试上实现了最先进的鲁棒性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个机器人不再仅仅是遵循僵化代码的盲目机器,而是能够理解我们的语言并能自主规划手臂动作来完成任务的得力伙伴的世界。这就是“具身智能”(Embodied AI)的梦想——在这个领域,计算机学习通过摄像头观察世界,理解人类语言,并将这两者转化为物理动作。长期以来,最聪明的机器人需要巨大的“大脑”——拥有数十亿个“神经元”的计算机模型——来处理这些任务。这些庞大的模型就像超级计算机,需要巨大的、昂贵的服务器来运行,这使得它们无法装进一个可以在家里走动或在厨房里帮忙的小型机器人中。研究人员一直思考的一个大问题是:我们能否制造出一个既聪明又可靠,但体积小到可以装进背包里的机器人?
这篇论文介绍了一个新的机器人大脑,叫做 CoTinyVLA。你可以把它想象成一个微型且超高效的机器人大脑,它在仅使用极小内存的情况下,性能竟然超越了目前处于领先地位的那些庞大、沉重的模型。研究人员不仅缩小了大脑的体积,还教会了它一种更好的思考方式。他们没有让机器人试图死记硬背每一种可能出现的情况,而是给了它一份“作弊条”来进行推理。他们教会机器人将一个大任务分解为一个简单的计划(就像一份待办事项清单),然后在执行每一步动作之前先进行思考。他们还给了它一双特殊的眼睛——一只从远处观察以看清整个房间,另一只安装在手腕上以观察手部正在触摸的具体物体——并教会它观看过去几秒钟的短视频以理解运动。结果是,这个拥有 0.9 亿参数的模型(相比于 70 亿参数的巨型模型非常小巧),在处理复杂的现实世界情况时,表现优于规模是其八倍的模型。
问题所在:大脑袋,小机器人
多年来,用于执行指令的最佳机器人就像巨大的、沉重的坦克。为了理解像“拿起蓝色杯子并把它放在桌子上”这样的指令,这些机器人使用拥有 30 亿到 70 亿参数的庞大计算机模型。虽然这些模型非常聪明,但它们也非常庞大。运行它们大约需要 20 GiB 的计算机内存。这就像是试图把一整座图书馆塞进一个背包里;这根本无法装进移动机器人或辅助设备中配备的小型、电池驱动的计算机里。
研究人员想知道:我们真的需要如此巨大的大脑才能变得聪明吗?或者,我们能否构建一个微小、高效,且在处理现实世界的混乱情况时同样出色的机器人?
解决方案:拥有大策略的微型大脑
团队构建了 CoTinyVLA,这是一个只有 0.9 亿参数的机器人大脑。为了让这个微型模型像巨头一样强大,他们不仅是喂给它更多的数据,还改变了它的“学习方式”以及它关注的对象。他们使用了三种主要的技巧,称之为“结构化监督”,来教会机器人更好地思考。
1. “双眼”时光机
想象一下你在尝试接住一个球。如果你只看到一张球的照片,你不知道球是在向你飞来还是在远离你。你需要看到一段短视频才能理解运动。
CoTinyVLA 被教会在同一时间通过两只不同的“眼睛”观察世界:
- 第三人称之眼: 一个观察整个房间以了解所有物体位置的摄像头。
- 手腕之眼: 一个位于机器人手部的摄像头,用以观察抓取器正在触摸的具体物体。
机器人不仅仅是观察当前的一瞬间,它还会观看过去 16 帧的短“电影”(每只眼睛各 8 帧)。这给了它一种时间感和运动感,帮助它理解物体移动的速度以及运动的方向。
2. “计划与思考”作弊条
这是最重要的技巧。在机器人移动之前,它被教导要写下一个故事。
- 计划(The Plan): 在任务开始时,机器人会写下一个高层级的“待办事项清单”(例如:“第一,抓住杯子。第二,举起它。第三,把它放在桌子上”)。这个计划在整个任务过程中保持不变。
- 思考(The Think): 在每一次细小的动作之前,机器人会写下一段关于它正在做什么的简短笔记(例如,“我正在闭合我的抓取器”或“我正在举起杯子”)。
机器人通过观察一个更强大、更聪明的机器人(一个拥有 350 亿参数的“老师”)解决相同任务的过程来学习这一过程。这个微型机器人模仿了老师的思考过程。这有助于微型机器人理解它为什么要这样做,而不仅仅是做什么。
3. “释义”游戏
如果人们用不同的方式表达同一个意思,机器人往往会感到困惑。如果机器人只接受过“拿起杯子”这种表达方式的训练,当你说“抓起马克杯”时,它可能会卡壳。
为了解决这个问题,研究人员利用 40 条基本指令对机器人进行了训练,并将其扩展成了 800 个不同的版本。他们更换了词汇(比如将“拿起”改为“抓取”或“举起”),改变了物体的描述(比如将“黑色碗”改为“深色碗”),甚至加入了礼貌用语(如“请问能不能把……”)。这教会了机器人理解指令的“含义”,而不仅仅是特定的单词。
结果:以小博大
研究人员在 LIBERO-Plus 上测试了 CoTinyVLA,这是一个旨在测试机器人如何应对世界变化的严苛测试套件。该测试包含超过 10,000 个不同的场景,其中各种情况都发生了变化:机器人的起始位置很奇怪、光照发生了变化、背景不同,或者指令的措辞很奇怪。
结果令人惊讶。拥有仅 0.9 亿参数的 CoTinyVLA,在所有四个主要测试类别中都击败了最强大的 70 亿参数模型:
- 空间(Spatial): 成功率 90.8%(超过大模型 4.7 个百分点)。
- 物体(Object): 成功率 87.3%(超过大模型 2.8 个百分点)。
- 目标(Goal): 成功率 86.6%(大幅超过大模型 15.9 个百分点)。
- 长程(Long): 成功率 80.7%(超过大模型 3.0 个百分点)。
最大的胜利出现在“目标”类别中,微型机器人的表现比最好的巨型机器人高出了近 16 个百分点。考虑到这款微型机器人运行在仅使用 2.25 GiB 内存的计算机上,这一点尤其令人印象深刻,因为这个容量足以适配许多现实世界的机器人。
为什么这很重要
这篇论文表明,你并不需要一个庞大的大脑才能让机器人变得聪明。通过教会一个小机器人以结构化的方式进行“思考”(制定计划并检查步骤),并给予它正确的视觉和语言训练,它处理复杂、不可预测的现实世界的能力可以比更大的模型更强。
研究人员还发现,“计划”这一思考过程至关重要。如果拿掉机器人编写计划的能力,它的成功率会下降 40 到 45 个百分点。这证明了机器人不仅仅是在瞎猜,它实际上是在利用计划来引导它的行动。
简而言之,CoTinyVLA 证明了通过正确的教学方法,一个小型、高效的机器人可以像巨型超级计算机一样强大,这让我们离在家庭和工作场所拥有得力、智能的机器人又近了一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。