Hybrid Training for Vision-Language-Action Models
本文介绍了混合训练(HyT),这是一种面向视觉 - 语言 - 动作模型的框架,其在训练阶段利用思维链推理以提升性能,同时允许模型在推理阶段跳过思维生成,从而降低延迟并增强现实世界的可用性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人做家务,比如拿起一个红色积木并把它放进杯子里。
旧方法:“思考者”与“执行者”
最近,研究人员尝试教机器人在行动之前“大声思考”。这就像要求学生解方程前先写下解题步骤。这种“思维链”(Chain-of-Thought, CoT)方法帮助机器人变得更聪明,能解决更难的问题。然而,有一个大缺点:它太慢了。
就像一个学生在回答简单问题前要花 10 分钟写下每一个想法一样,这些机器人在现实生活中太慢了。如果机器人必须在每个动作之前停下来“思考”几秒钟,那么对于需要快速反应的任务(比如接住掉落的物体或在传送带上平稳移动),它就变得毫无用处。
新方案:混合训练(HyT)
这篇论文的作者提出了一个简单的问题:机器人真的需要在工作中“大声思考”,还是它们只需要在训练期间学会如何思考?
他们开发了一种名为**混合训练(HyT)**的方法。其工作原理可以用一个简单的类比来说明:
想象一所烹饪学校。
- 旧方法(ECoT): 厨师(机器人)被强迫在烹饪的同时,为每一次切菜和搅拌写下详细的食谱并解释其推理。这使他们成为优秀的厨师,但烹饪速度非常慢。
- 混合方法(HyT): 厨师接受了一种特殊的训练方式。
- 有时,他们练习写食谱并解释自己的想法(学习“为什么”)。
- 有时,他们练习遵循他人编写的食谱。
- 最重要的是,他们在已经内化了所有推理知识的情况下,练习仅仅烹饪(执行动作)。
结果:“熟练的直觉”
该论文声称,通过在训练阶段让机器人“思考”,机器人发展出了一种熟练的直觉。这就像一位大厨不再需要阅读食谱或自言自语;他们仅仅知道该做什么,因为他们已经无数次练习过思考过程。
当机器人真正开始工作(推理阶段)时:
- 它跳过“思考”步骤。 它直接进入行动。
- 它很快。 它的移动速度与标准机器人相同(比“思考者”机器人快约 3 倍)。
- 它很聪明。 因为它从“思考”练习中学习,所以即使在工作时不“大声思考”,它的表现也优于从未被教导过思考的机器人。
机器人的“三种模式”
混合训练的有趣之处在于机器人的灵活性。你可以通过给它一个特定的指令令牌(一个小关键词)来告诉它使用哪种“模式”:
- “行动”模式: 机器人快速完成工作。(现实世界使用的默认模式)。
- “思考”模式: 机器人停下来并大声解释它的计划。(如果人类想看机器人在想什么,这就很有用)。
- “跟随”模式: 机器人忽略自己的想法,严格遵循人类的详细指令。
实验结果
团队在计算机模拟和真实机械臂(UFactory xArm 6)上测试了这种方法。
- 在模拟中: 混合训练的机器人在复杂的堆叠和放置任务上比标准机器人表现更好,并且比“思考者”机器人快得多。
- 在现实世界中: 在摆有真实物体(如香蕉、立方体和马克杯)的真实桌面上,混合机器人的成功率达到63%,而标准机器人仅为41%。它尤其擅长处理以前从未见过的、棘手的新情况。
结论
该论文总结道,“思考”是学习的有力工具,但不必成为执行的工具。通过混合训练,我们可以教会机器人内化复杂的推理,使它们能够快速高效地行动,从而让我们兼得两者之长:思考者的智慧和执行者的速度。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。