Finetuning Vision-Language-Action Models Requires Fewer Layers Than You Think
本文介绍了一种无需训练的结构压缩流水线,该流水线能够识别并移除视觉-语言-动作模型中的冗余层,在保持或提升多种机器人任务性能的同时,实现了高达 50% 的深度缩减以及训练和推理速度的显著提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个巨大的、超智能的机器人大脑。这个大脑是一个“视觉-语言-动作”(VLA)模型。它能看见世界,理解你的口头指令,并能弄清楚如何精确移动它的手臂去完成像折叠衣服或拿起杯子这样的任务。
问题在于,这些大脑极其庞大。它们如此之大,以至于训练它们需要超级计算机运行数天;而在实时运行它们时,就像是在拥挤的集市里驾驶一辆法拉利——既缓慢、昂贵,又需要消耗大量的燃料(计算能力)。
这篇论文的作者提出了一个简单的问题:“我们真的需要那么大的大脑吗?”
重大发现:“回声室”效应
研究人员观察了这些巨大的机器人大脑,并发现了一些令人惊讶的现象。他们发现这些大脑充满了冗余。
把大脑想象成一条拥有 50 名工人(层)的长长的流水线:
- 工人 1 观察物体。
- 工人 2 再次观察,并说:“没错,这是一个杯子。”
- 工人 3 观察它并说:“仍然是一个杯子。”
- 工人 4 说:“确定是一个杯子。”
研究人员发现,在漫长的流水线过程中,这些工人只是在重复前一个人的话。他们并没有增加任何新信息;他们只是在回声式地重复相同的信息。用技术术语来说,他们发现连续的层产生了近乎相同的“想法”(表征)。
解决方案:“CKA”剪刀
与其保留所有 50 名工人,团队发明了一种称为 CLP(基于 CKA 指导的层剪枝)的方法。
想象你有一把聪明的剪刀,可以倾听流水线上的声音。这把剪刀使用一种叫做**中心化核对齐(Centered Kernel Alignment, CKA)**的工具来衡量两个工人说话的内容有多相似。
- 如果工人 5 和工人 6 说的话完全一样,剪刀就会将他们剪掉。
- 流水线重新连接,让工人 4 直接将信息传递给工人 7。
至关重要的是,这并不需要从头开始重新训练整个大脑。这是一种在机器人学习新特定任务之前进行的单次“修剪”。
结果:更小、更快、更聪明
在剔除多余的部分后,结果令人印象深刻:
- 大脑变小了: 他们移除了高达 50% 的层。这就像把一座 50 层高的摩天大楼变成一座 25 层高的建筑,但建筑依然稳固如初。
- 训练变快了: 因为模型变小了,教它一项新任务所需的时间减少了 40–50%。如果以前学习一项任务需要 20 小时,现在只需要大约 10 小时。
- 实时速度: 机器人在现实生活中思考和移动的速度提高了约 30%。
- 在某些情况下表现更好: 出人意料的是,在机器人学习数据较少(例如只看到该任务 100 次)的情况下,较小的脑力实际上比巨大的脑力表现得更好。
- 类比: 想象你在为考试复习。如果你有一本庞大且混乱的教科书(大模型),你可能会感到不知所措并记错内容(过拟合)。如果你有一份简洁明了的总结(剪枝后的模型),你会专注于最重要的事实,并且表现得更好。
他们在哪里进行了测试
他们不仅仅是在计算机模拟中进行测试。他们在:
- 虚拟机器人: 像 LIBERO 和 RoboCasa 这样的游戏世界中。
- 真实机器人: 实验室里的实际物理机械臂(如 UR10 和 ALOHA 机器人),执行诸如折叠短裤、递餐巾纸和堆叠积木等任务。
核心结论
这篇论文证明了这些先进的机器人大脑是“过度设计”的。它们拥有的层数远比完成工作所需的要多。通过使用一种简单的、无需训练的方法来剪掉重复的层,我们可以制造出训练成本更低、运行速度更快、且同样出色(甚至更好)的机器人。
简而言之: 你不需要一个 50 层的脑子来折叠一件衬衫;一个精简的 25 层脑子完全可以胜任,而且做得更快。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。