Offline Semantic Guidance for Efficient Vision-Language-Action Policy Distillation
本文介绍了 VLA-AD,这是一种蒸馏框架,它利用视觉 - 语言模型提供的离线语义指导来训练轻量级、高速的学生策略,这些策略在推理阶段无需教师模型即可达到或超越大型视觉 - 语言 - 动作教师模型的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位才华横溢、世界级的厨师(教师),能够以完美的精准度烹饪复杂的菜肴。这位厨师拥有庞大的知识库,可以遵循任何食谱,但他们的速度却极其缓慢。如果你让他们切洋葱,他们可能会花整整一分钟思考最佳角度、质地以及洋葱的历史,然后才下第一刀。在机器人领域,这种“思考时间”太长了;机器人需要在毫秒级内做出反应,以避免掉落物品或撞上墙壁。
问题在于,如果你试图仅通过观察厨师的手部动作来教导一个微小、快速的学徒机器人(学生),学徒往往会感到困惑。如果厨师不小心手部抽搐了一下,或者在瞬间改变了主意,学徒就会复制这个错误。随着时间的推移,这些微小的错误会累积,导致学徒机器人崩溃。
解决方案:VLA-AD
本文的作者创造了一种名为VLA-AD的新训练方法。你可以将其想象为在练习期间聘请一位叙述者(视觉 - 语言模型)站在厨师身旁。
以下是训练过程的简单类比:
1. 设置:厨师、学徒和叙述者
- 厨师(教师): 一个巨大、缓慢、拥有 70 亿参数的机器人大脑。它确切知道该做什么,但对于实时应用来说太慢了。
- 学徒(学生): 一个微小、快速、拥有 1.58 亿参数的机器人大脑。它需要足够快,以便在标准计算机(如游戏电脑)上实时运行。
- 叙述者(VLM): 一位聪明的观察者,它不移动机器人的手臂,而是观察场景并用通俗的英语描述正在发生什么。
2. 训练过程:“什么”与“如何”
通常,你只会向学徒展示厨师的手部动作(“如何”)。但 VLA-AD 增加了来自叙述者的第二层指令(“什么”)。
- 阶段锚点: 叙述者不断标记任务的当前阶段。学徒听到的不仅仅是手部在移动,而是:“我们正处于运输阶段。”这为学徒提供了稳定的上下文。即使厨师的手部抖动,叙述者也会说:“不,我们仍然只是在运输”,帮助学徒忽略抖动。
- 多帧方向: 有时,单张图片令人困惑。想象一个半开的抽屉。机器人是在把它拉开,还是在把它关上?单张照片无法说明。叙述者观察一段短视频(5 帧)并说:“我们正在将抽屉向外拉。”这消除了关于方向的困惑。
3. 魔法技巧:叙述者离开
这是最重要的一点:叙述者只存在于练习期间。
一旦学徒机器人训练完成,叙述者就会被解雇。学徒不再需要叙述者来运行。它已经学会了内化阶段和方向的“感觉”。
- 训练期间: 学徒从厨师的手部动作以及叙述者的描述中学习。
- 实际工作期间: 学徒独自运行,速度极快,仅使用自己的眼睛和大脑。
4. 结果:快速、强大且智能
本文在名为LIBERO的一组机器人任务上测试了这种方法(这就像机器人的标准化障碍赛)。
- 速度: 巨大的厨师(教师)每秒只能移动约3.8 次。经过训练后,微小的学徒每秒可以移动12.5 次。这快了3 倍多。
- 大小: 厨师的大脑巨大(70 亿参数)。学徒的大脑微小(1.58 亿参数)。学徒的大小和重量是厨师的1/44。
- 性能: 尽管微小且快速,学徒的表现几乎与巨大的厨师完全一样。事实上,由于叙述者帮助学徒忽略了厨师意外的手部抽搐(噪声),学徒实际上比厨师本身更稳定,更少犯愚蠢的错误。
为什么这很重要
这篇论文表明,如果你以正确的方式教导机器人,就不需要一台巨大、缓慢的计算机来控制它。通过在训练期间使用聪明的“叙述者”来解释任务的故事(阶段和方向),你可以将超级智能但缓慢的机器人压缩成一个微小、快速的机器人,它可以在日常硬件上运行而不丧失其智能。
这就像教导赛车手,不仅仅是展示他们如何转动方向盘,还要解释赛道的逻辑。一旦他们理解了逻辑,他们就能完美地驾驶赛车,而不再需要教练在耳边大喊指令。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。