: Training Robots to Reason in Natural Language via Reinforcement Learning
本文介绍了 ,这是一个后训练框架,它通过将现成的视觉-语言模型增强为能够为低层操纵策略生成自由形式自然语言引导的机器人推理器,从而通过在专家轨迹上的中段训练(mid-training)和基于准则的强化学习相结合,显著提升了在长程任务中的探索与泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
长期以来,机器人一直是重复动作的大师,能够以完美的精度执行成千上万次相同的动作。然而,当面对新情况或错误时,它们往往会陷入困境,缺乏停下来思考哪里出错的能力。这种局限性源于“看到世界”与“理解世界”之间的差距。现代人工智能在视觉和语言方面已取得了长足进步,使机器能够识别物体并遵循口头指令。然而,如何将这些能力与物理动作联系起来,从而实现灵活的问题解决,仍然是一个重大挑战。驱动近期研究的核心问题是:赋予机器人通过文字进行“思考”的能力,是否能帮助它应对需要规划、追踪进度和从错误中恢复的复杂长期任务。
卡内基梅隆大学的一个研究小组开发了一种新方法来教机器人进行这种思考。他们创建了一个系统,训练一个高层人工智能生成自然语言推理——本质上是在向实际移动机器人手臂的低层控制器发出指令之前,生成一段关于机器人下一步该做什么的实时评论。研究人员发现,通过训练系统产生这些想法,机器人变得显著更擅长解决困难的操作任务,例如将积木排列成特定形状或将杂货装进袋子。关键的发现是,实时生成这些想法的行为(而非仅仅将其作为一种训练工具)起到了某种形式的心理计算作用,有助于机器人更有效地引导其动作。
研究人员通过将机器人的大脑视为一个两部分组成的系统来解决这个问题。一部分是“推理者”,即一个大型语言模型,它观察场景并了解目标;另一部分是“执行者”,即一个经过预训练的策略,负责执行物理动作。在实验中,推理者的任务是观察世界的当前状态、迄今为止发生的历史记录以及最终目标,然后在向执行者发出具体指令之前,写下一段简短的计划说明。例如,如果目标是将积木排成一列,推理者可能会首先注意到一个绿色的积块已经到位,观察到一颗星形块位置不对,然后决定移动这颗星形块以完成队列。这种编写推理的过程在机器人每走一步时都会发生。
为了教导该系统,研究人员使用了两阶段训练过程。首先,他们向系统展示了专家在解决任务时同时进行言语化思考过程的示例。这一步被称为“中期训练”(mid-training),帮助模型学习用于此类物理任务的推理风格,例如追踪部分进度或察觉计划出错。然而,仅仅模仿这些示例是不够的。研究人员随后使用了第二阶段,即涉及强化学习的方法,这是一种系统根据反馈通过试错来学习的方法。在这个阶段,机器人被赋予一项任务,并被要求生成自己的推理和指令。它获得的奖励不仅取决于最终结果,还取决于其生成的指令是否符合专家指令的意图。这使得系统能够利用大量仅已知最终指令的数据来精炼其推理技能,而无需为每一次动作都收集昂贵的专家思考示例。
实验结果在两个不同的环境中进行了测量。第一个是充满彩色积木的模拟桌面,机器人必须将它们排列成线型或V型等形状。第二个是更复杂的双臂机器人装杂货进袋子的模拟环境。在这两种情况下,使用这种名为R3的推理方法进行训练的系统,其表现都优于仅训练跟随指令而不生成想法的系统。在积木排列任务中,具备推理能力的机器人表现出了显著的泛化能力,能够应对未见过的形状,并在其他方法失败的地方取得了成功。在杂货装袋模拟中,能够对动作进行推理的机器人,在处理困难且未见过的任务时,成功率接近47.9%,而仅靠跟随指令而不思考的系统成功率约为38.0%。
至关重要的是,研究人员调查了这种提升究竟是来自于机器人训练期间学习到了更好的视觉模式,还是来自于思考行为本身。他们发现,虽然训练确实提高了机器人理解场景的能力,但真正的益处来自于决策时刻的推理过程。当他们强制机器人停止生成想法而直接行动时,其性能显著下降。相反,当他们允许机器人花费更多时间生成更长、更详细的想法时,其成功率有所提高,尤其是在处理较难的任务时。这表明,语言推理充当了一种机制,让机器人能够在面对难题时投入额外的心理努力,就像人类在动手解复杂谜题前可能会停下来思考一样。
这项研究还揭示了推理系统学会采用的特定行为。机器人开始在选择动作之前对比不同的可能选项,在对物体位置不确定时重新检查场景,并在意识到之前的步骤失败时调整计划。它学会了追踪其交互的历史记录,记住自己已经做了什么,以避免重复错误。这些行为并非显式编程,而是随着系统学习使用语言来引导其动作而自然涌现的。研究人员指出,即使在第二阶段训练中没有给出明确的专家思考示例,该方法依然有效,因为它依赖于系统仅从最终指令中推断出正确推理的能力。
尽管实验是在模拟环境中进行的,但研究结果为如何让机器人变得更具适应性提供了清晰的路径。研究人员建议,这种方法可以应用于现实世界的机器人,以帮助它们处理物理任务中的不可预测性,例如应对噪声传感器或从碰撞中恢复。他们还指出,未来的工作可以探索如何将推理部分和动作部分结合在一起进行训练,而不是保持分离,从而创造出更加协调的行为。目前来看,这项工作证明了赋予机器人与其自身对话的能力不仅仅是一种理论练习,更是一种提高其解决复杂长期问题能力的实用方法。系统不需要完美才能发挥作用;它只需要能够思考每一步,通过这种方式,它会比仅仅做出反应的机器强大得多。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。