ExToken: Structured Exploration for Efficient Vision-Language-Action Reinforcement Fine-tuning
本文介绍了 ExToken,这是一个通过将策略建立在用于结构化探索的离散行为先验之上,并利用状态条件化标记选择器来弥合训练多样性与确定性部署之间的鸿沟,从而增强视觉-语言-动作模型(Vision-Language-Action models)的样本效率和收敛性的强化学习框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人折叠衣服或擦桌子。你希望它通过实践来学习,尝试各种方法,并观察哪些行之有效。这被称为强化学习(Reinforcement Learning, RL)。但问题在于,机器人非常昂贵,而且现实世界是混乱多变的。如果你让机器人只是随机地“尝试一切”,它可能会在重复同一个愚蠢错误上浪费数小时。它会陷入循环,就像一只在滚轮上原地踏步、永远无法跑向远方的仓鼠。
这篇论文的作者们发现,“ExToken”注意到这种“卡住”的行为是一个巨大的问题。他们发现,在目前的机器人训练中,机器人的动作很快就会变得极其单调。他们称之为“动作模式坍缩”(action mode collapse)。这就像一个学生在一次数学考试失败后,决定在未来的每一次考试中都重复抄写同一个错误答案,因为这样感觉比较“安全”。机器人因此停止了探索解决问题的其他新方法。
重大发现:多样性胜过数量
研究人员提出了一个简单的问题:是拥有一百万次完全相同的尝试更好,还是拥有几百次各不相同的尝试更好?
为了找出答案,他们进行了一项模拟实验。他们对比了三组机器人:
- 一组使用标准的随机探索,进行了 1,024 次尝试。
- 一组仅进行了 512 次尝试(只有一半的次数)。
- 一组进行了 1,024 次尝试,但丢弃了那些无聊、重复的尝试,只保留了 512 个最具有差异性和独特性的尝试。
结果令人惊讶。那组仅保留了 512 次独特且多样化尝试的机器人,表现得与进行了 1,024 次尝试的组别一样出色。事实上,它们比使用标准、单调方法的 512 次尝试组表现得要好得多。论文指出,尝试的多样性远比尝试的绝对数量更为重要。 如果你只是不断重复同样的事情,你并不是在学习,你只是在练习如何“卡住”。
解决方案:ExToken(“行为菜单”)
那么,如何阻止机器人陷入循环呢?作者引入了一个聪明的技巧,叫做 ExToken。
想象一下,你正在给机器人提供一份不同“人格”或“风格”的菜单供其尝试。你不再只是说“去试着折叠这件衣服”,而是给机器人一个特殊的“标记”(一个小的数字标签),上面写着:“今天,尝试像专业厨师那样折叠”;或者“今天,尝试像匆忙的青少年那样折叠”;或者“今天,尝试温柔地折叠”。
以下是他们构建这个菜单的方法:
- 图书馆(The Library): 他们观察了大量人类执行任务(如折叠衣物)的视频。
- 分类(The Sort): 他们利用计算机大脑,根据人类动作的特征将这些视频进行聚类。也许一组是“缓慢而谨慎”,另一组是“快速而直接”。
- 标记(The Tokens): 每个组都被分配了一个标记。这些标记代表了完成工作的不同方式。
- 训练(The Training): 当机器人进行练习时,计算机会从菜单中随机挑选一个标记,并告诉机器人:“今天使用这种风格!”这迫使机器人去探索不同的运动方式,确保它不会陷入单调的循环。
神奇开关:标记选择器(The Token Selector)
这种“菜单式”方法存在一个问题:在实际工作期间(比如在真实的厨房里),你不能只是随机挑选一种风格。你需要知道哪种特定的风格最适合处理当前这张特定的衬衫和当前这张特定的桌子。
为了解决这个问题,ExToken 加入了一个“标记选择器”。你可以把它想象成一个聪明的管理者,它观察场景(衬衫、桌子、光照情况),然后瞬间选出菜单中完美的那个标记。
- 在训练期间: 管理者尝试不同的标记,以观察哪些有效。
- 在实际工作中: 管理者观察现状,并自信地宣布:“好了,针对这个特定的混乱情况,我们使用‘细心的厨师’标记。”
这使得机器人在学习过程中可以进行狂野且富有创造性的探索,但在实际执行任务时,又能表现出完美的、确定性的精准度。
数据说明了什么
论文通过两种方式测试了这个想法:在计算机模拟中以及在真实机器人身上。
在模拟中: 他们使用了名为 LIBERO 的基准测试,包含四种不同类型的任务(空间、物体、目标和长程任务)。
- 标准机器人(RLinf-GRPO)的平均成功率为 96.8%。
- ExToken 机器人达到了 98.2%。
- 在最难的任务(LIBERO-Long)中,标准机器人为 95.2%,而 ExToken 跳升至 97.8%。
- 至关重要的是,他们是在严格限制条件下完成的:机器人的每步尝试次数被限制在 512 次以内。即便在如此紧凑的预算下,ExToken 依然胜出。
在现实世界中: 他们在四个真实任务上进行了测试:折叠衣服、擦桌子、倒水和把笔放入笔筒。
- 在“折叠衣服”任务中,标准方法成功率为 90%,而 ExToken 为 95%。
- 当改变环境(例如使用不同的衬衫或不同的桌面背景)时,标准方法的性能下降了 10% 到 20%。Ex-Token 的性能仅下降了 5% 到 10%,显示出它具有更强的鲁棒性(稳健性)。
他们尚未掌握的部分(未知领域)
论文谨慎地指出,这并非解决所有问题的万灵药。
- 粒度(Granularity): 他们测试了使用 3、6 或 10 个不同标记的情况。在 3 到 6 个标记之间,结果非常稳定;但在 10 个标记时,性能略有下降。他们认为,拥有过多的微小类别可能会让机器人难以学习。
- 极端限制: 如果将预算削减到仅 128 次尝试,系统就会开始变得不稳定。作者怀疑这是因为没有足够的起始点来支撑如此广泛的标记多样性。
- 人类可解释性(Human Interpretability): 他们发现,有些机器人学到的“风格”并没有明确的人类名称(比如“奇怪的扭曲折叠”)。但这并不重要!只要这些标记能创造出不同的物理运动,它们就能帮助机器人学习。
核心结论
论文表明,如果你想高效地训练机器人,不要只是向它们投喂更多的数据。相反,你应该专注于确保数据的多样性。通过使用 ExToken 在练习过程中强迫机器人尝试不同的“人格”,你可以更快地教会它,用更少的尝试次数,并让它在应对现实世界的变化时表现得更好。重要的不是你尝试了多少次,而是你尝试了多少种不同的方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。