RoMAN-Flow: Taming Autoregressive Normalizing Flows for Offline Reinforcement Learning in Robotic Manipulation
RoMAN-Flow 是一个离线强化学习框架,它通过采用无采样优化目标并将生成的策略蒸馏为低延迟的一步生成器以实现高效部署,使得自回归归一化流在机器人操控任务中的实际应用成为可能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
让机器人具备类人般的灵巧操作能力一直是人工智能领域的一个长期目标,但如何让它们在无需人类持续指导的情况下实现这一目标,仍然是一个棘手的挑战。传统上,工程师们依赖强化学习,这是一种通过与环境交互、通过成功获得奖励和失败受到惩罚来进行试错的学习过程。虽然这种方法功能强大,但在错误可能导致昂贵设备损坏的现实环境中,往往显得缓慢且不切实际。一种更高效的替代方案已经出现:离线强化学习。机器人不再通过“边做边学”来学习,而是通过研究大量预先记录的人类演示库来进行学习。它通过分析这些过去的动作来弄清楚哪些做法效果最好,从而在无需再次接触物理世界的情况下精炼其行为。然而,一个显著的障碍依然存在:目前用于生成这些复杂动作的最成功模型(依赖于扩散或流匹配技术)就像是“黑盒”。它们可以产生优秀的动作,但无法轻松计算出任何特定动作的具体概率,这使得很难利用离线库中的奖励数据对其进行数学上的优化。
中国科学技术大学与香港中文大学的研究团队开发了一种名为 RoMAN-Flow 的新框架,旨在解决这一特定的瓶颈问题。他们的研究方法核心是一种被称为自回归归一化流(autoregressive normalizing flow)的 AI 模型。与“黑盒”模型不同,这种架构允许系统计算其生成的任何动作的确切可能性,这对于离线学习中所需的数学优化至关重要。研究人员面临着一个独特的问题:虽然这种模型非常擅长计算概率,但由于它必须像人写句子一样逐字逐句地构建动作,因此生成新动作的速度极其缓慢。这种顺序处理过程产生的延迟对于机器人的实时反应来说太长了。为了克服这一点,团队设计了一个两部分组成的策略。首先,他们创建了一种训练方法,通过分析离线数据中的奖励来改进机器人的策略,而无需要求这个缓慢的模型去生成新动作。其次,一旦模型完成优化,他们便使用一种称为“蒸馏”的技术,将复杂的、缓慢的“教师模型”压缩成一个更快的、单步执行的“学生模型”,后者可以瞬间预测出整个动作序列。
研究人员在多种模拟环境以及配备了七关节机械臂和十二指灵巧手的真实机器人平台上测试了该框架。在模拟实验中(任务包括将物体移动到特定位置以及解决复杂谜题),该系统展示了其能够从静态数据中进行有效学习的能力。在包含五十种不同操作任务的基准测试集中,该方法在离线训练阶段后显著提高了机器人的成功率,平均成功率达到了 80% 以上。与其它领先模型相比,该方法表现出了极强的竞争力,经常优于那些计算成本更高、规模更大的系统。至关重要的是,蒸馏过程并未以牺牲性能为代价来换取速度。最终的蒸馏模型保留了原始缓慢版本几乎所有的技能,同时将生成动作序列的时间缩短了八倍以上。这意味着机器人现在大约可以在 80 毫秒内规划好下一步动作,这一速度足以满足实际的实时控制需求。
团队还在真实的实验室环境下,通过要求机器人执行一些精细任务(如拿起烧杯、将其放置在天平秤上以及操纵圆柱体)验证了这些发现。在这些现实世界的试验中,离线训练被证明在精炼机器人行为方面非常有效。该系统在这些物理任务上的平均成功率从大约 57% 提升到了 80% 以上。在需要精确放置的任务中,改进最为显著,成功率提升了超过 60 个百分点。这表明,通过计算确切概率的能力,使机器人能够更好地理解哪些特定动作最有可能成功,即使面对现实世界中不可预测的噪声和变化。蒸馏后的模型保持了这种高水平的性能,证明了提速并未以牺牲可靠性为代价。
这项工作表明,通往更强大机器人的路径并不一定需要更大、更复杂且难以训练或难以使用的模型。通过将一种可以进行数学优化的模型与一种使其变快的方法相结合,研究人员展示了创造既高技能又具响应性的机器人策略是可能的。结果表明,曾经被认为在实际部署中过于缓慢的自回归归一化流,现在可以使之在现实世界机器人领域变得可行。该框架成功地弥合了基于似然学习的理论优势与机器人控制的实际需求之间的鸿沟,为教导机器以更高的精度和自主性操纵环境提供了新的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。