Flowing With Purpose: Latent Action Guided Flow Matching Policies For Robotic Manipulation
本文介绍了潜在动作引导流匹配(Latent Action Guided Flow Matching, LAFM),这是一种新型机器人操控框架,它通过由潜在动作模型支撑的自适应学习分布库来取代固定的高斯先验,以解决动作空间中的结构性失配问题,从而在训练效率和任务成功率方面显著优于标准的流匹配和大型预训练模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机械臂执行复杂的任务,比如堆叠碗或者打开抽屉。为了做到这一点,机器人需要学习一种“策略”——即一套规则,告诉机械臂如何从当前位置移动到目标位置。
近年来,教机器人完成这些任务的最佳方法叫做流匹配(Flow Matching)。把流匹配想象成一个 GPS 导航系统。机器人从一个“噪声”位置(一个随机、混乱的潜在运动集合)出发,需要驶向一个“目标”位置(完成任务所需的完美、平滑的运动)。AI 学习的是连接噪声与目标的“道路”(向量场)。
问题所在:并非所有情况都适用同一种方案
目前的标准 GPS(标准流匹配)有一个主要缺陷:它假设每一次行程都必须从完全相同的随机地点出发。
想象你是一名出租车司机。有时你需要开车去一个安静的图书馆(一个非常具体、精准的动作)。其他时候,你可能要去参加一个混乱的音乐节(一个广泛、多变的动作)。
- 旧方法: GPS 强迫你无论去图书馆还是音乐节,都必须从沙漠中心完全相同的随机停车场出发。你必须横穿整个沙漠才能到达属于你特定行程的起点。这使得机器人的“道路”(AI 的学习路径)变得极其纠缠、混乱且低效。
- 现实情况: 机器人的任务是“异方差性”的(heteroscedastic)。这是一个高级词汇,意思是有些任务非常可预测(低方差),而另一些任务则非常狂野多变(高方差)。单一的起点无法同时处理好这两者。
解决方案:LAFM(潜动作引导流匹配)
该论文的作者引入了 LAFM,它就像是你出租车车队的智能调度员。
LAFM 不再让每次行程都从同一个随机沙漠点出发,而是使用了一个潜动作模型(Latent Action Model, LAM)。你可以把 LAM 想象成一位“运动图书管理员”。
- 图书管理员: 在机器人开始移动之前,LAM 会观察当前的场景并询问:“这是一种什么样的运动?”是精细的“拿起”动作?还是“推”的动作?或者是“堆叠”动作?
- 图书馆: LAM 拥有一个由不同“起始区域”(先验分布)组成的图书馆。每个区域都针对特定类型的运动进行了专业化设计。
- 匹配: 如果机器人需要做一个精细的“拿起”动作,LAM 会把它送到紧邻图书馆的起始区域。如果它需要跳一段狂野的“舞蹈”,LAM 则会把它送到靠近音乐节的起始区域。
通过让机器人的旅程从一个与任务相匹配的“智能”起点出发,机器人就不必横穿沙漠。路径变得更短、更直,也更少纠缠。
他们如何证明其有效性
研究人员通过两种方式测试了这个全新的“智能调度员”系统:
真实世界机器人: 他们使用了一个真实的机械臂(Franka Emika Panda)来完成四项任务:将盘子放入沥水架、用螺丝刀打开抽屉、扔掉罐头以及堆叠碗。
- 结果: 新方法(LAFM)比旧的标准方法成功率高出 23.4%。尽管 LAFM 的规模要小得多,但它的表现甚至优于一个拥有 30 倍参数量(内存)的庞大预训练 AI 模型 。
模拟基准测试 (LIBERO): 他们在一个包含 90 个不同任务的复杂视频游戏模拟器中测试了机器人。
- 结果: LAFM 比标准方法实现了 10.4% 的更高成功率。它击败了几乎所有顶尖的机器人 AI,包括那些在海量数据集上进行预训练的模型。
核心要点
该论文声称,通过仅仅改变机器人开始学习旅程的位置(从单一的随机点变为一个智能起始点库),你可以让机器人学习得更快、移动得更平滑,并能更频繁地成功完成任务。
他们不仅仅是增加了一点额外的训练;他们从根本上改变了学习过程的几何结构。机器人不再需要解开一个混乱的可能性的结;它被赋予了一条与特定工作相匹配的、预先分类好的路径。
简而言之: LAFM 停止了机器人盲目猜测起点的行为。它根据机器人所见到的场景,给了机器人一个“领先优势”,使得整个学习如何移动的过程变得更加高效且成功。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。