APEX: Adaptive Policy Execution for Precise Manipulation
本文介绍了 APEX,这是一个即插即用的框架,通过在测试时重构动态可行参考轨迹并适应状态反馈,弥合了高层模仿学习策略与底层控制器之间的执行差距,从而在无需修改原始策略或控制器的前提下,显著降低了跟踪误差并提高了操作成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在教一个机器人如何穿针引线或堆叠积木。你有一个“大脑”(AI 策略),它非常清楚该做什么;同时你还有“肌肉”(底层控制器),它们负责实际移动机器人的手臂。
问题在于,根据这篇论文的说法,大脑和肌肉之间并不能完美地使用同一种语言。
问题所在:“翻译鸿沟”
AI 大脑擅长规划。它会说:“将手臂移动到这个精确的位置,以这个精确的速度。”然而,机器人的肌肉(控制器)通常是僵硬或不完美的。它们可能反应有点慢,或者无法理解大脑给出的那些微妙的“加速度”指令。
这就像一位指挥家(大脑)挥动指挥棒来告诉管弦乐队(肌肉)何时演奏一个音符。指挥家的挥动非常完美,但小提琴手(控制器)却稍微跑了调,或者反应迟钝了一秒钟。结果?音乐(机器人的动作)变得有些走调。在简单的游戏中,这没关系。但如果机器人正试图穿过一个仅有 3 毫米孔径的针眼,哪怕只差了一点点,任务就会失败。
作者们称之为**“执行差距”(Execution Gap)**。
旧有的解决方案(为什么它们很麻烦)
以前,为了解决这个问题,人们尝试过两种方法:
- 重写大脑: 修改 AI 的代码让它变得更谨慎。但如果这个 AI 是一个你无法触碰的、庞大的预训练模型呢?
- 重写肌肉: 修改机器人的内部控制器。但如果这个机器人是一个商业产品(比如 UR5 手臂),而你无法接触到它的内部代码呢?
这两种方法都需要对那些你无权触碰的系统进行“侵入性手术”。
解决方案:APEX(“智能翻译官”)
作者提出了 APEX(自适应策略执行)。你可以把 APEX 想象成一个超级智能的翻译官,或者一位指挥家的助手,它站在大脑和肌肉之间。
它既不改变大脑,也不改变肌肉。它只是坐在中间,实时向肌肉低声传递修正指令。
它是这样工作的,这里使用了生物学类比:
- “大脑皮层”(大脑): AI 发出一个指令:“移动到位置 X。”
- “小脑”(APEX): 在人类身上,小脑是处理精细运动控制和平衡的部分。它不会重新规划整个行走路径,它只是进行微小的、即时的调整,以防止你绊倒。
- 第一步(平滑处理): APEX 接收 AI 的指令,并对其进行平滑处理,添加肌肉运动所需的缺失的“速度”和“加速度”细节。
- 第二步(自适应): 在机器人移动的过程中,APEX 会观察肌肉。如果肌肉滞后或过度冲过了头,APEX 会立即计算出一个微小的修正量,并将其添加到指令中。这就像一辆自动驾驶汽车,即使路面颠簸,也会不断地微调方向盘,以保持在车道内行驶。
他们的发现
研究人员在一些棘手的任务上测试了该技术,例如推动方块、拿起物体以及将插销插入孔中。
- “回放”测试: 他们提取了完美的专家演示(比如一段人类完美完成任务的视频),并要求机器人仅仅是模仿它。即使有了完美的指令,机器人也经常失败,因为它的肌肉不够精准。APEX 解决了这个问题,将误差减少了 41%,并显著提高了机器人的成功率。
- “真实 AI”测试: 他们将 APEX 与四种不同类型的 AI 大脑(包括一些非常先进的模型)配对。在每种情况下,APEX 都帮助机器人做得更好。
- 对于最难的任务(将插销插入微小的孔中),APEX 帮助一个 AI 将成功率从 20% 提升到了 35%。对于机器人来说,这是一个巨大的飞跃!
底层逻辑
你不需要重建 AI 或机器人就能让它们更好地协作。你只需要一个轻量级的“中间人”(APEX),它倾听 AI 的指令,观察机器人的状态,并进行微小的、即时的调整,以确保机器人真正完成了它被告知要做的事情。
这就像是给一位笨拙的舞者配备了一位教练,这位教练不会改变其舞蹈动作,但会通过轻轻拍打其肩膀来提醒他保持节奏。结果就是:一场更精彩的表演。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。