ASPIRE: Agentic /Skills Discovery for Robotics
ASPIRE 是一个持续学习系统,它通过执行、故障诊断和进化搜索的迭代循环,自主编写并优化机器人控制程序,从而生成一个可重用的技能库,该库在受扰动、双臂协作及长程任务中的表现显著优于以往的方法,同时实现了零样本泛化和从仿真到现实的迁移。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是关于 ASPIRE 论文的解释,已将其翻译为通俗易懂的语言,并保留了创意类比。
核心理念:教机器人像人类一样“从错误中学习”
想象一下,你正在教一个非常聪明但非常“死脑筋”的机器人如何做晚饭。
- 旧方法: 你写下一份严格的食谱(代码)。如果机器人掉落了一个勺子,它就会停下来,你必须手动重写食谱,然后再次尝试。如果勺子很滑,你必须为未来每一次使用勺子的场景都重写一遍食谱。任务一旦结束,机器人就会忘掉一切。
- ASPIRE 的方式: 机器人尝试做饭。当它掉落勺子时,它不仅仅是停下来。它会观察自己究竟为什么会掉落(是手柄太滑了?还是抓得太用力了?)。它会立即修复食谱。然后,它会在一本共享笔记本上写下一条“专业提示”:“当握住光滑的勺子时,要抓紧并缓慢抬起。” 下次做饭时,甚至当另一个机器人尝试做饭时,它都会先查看这本笔记本。
ASPIRE(通过迭代机器人探索实现的智能技能编程)是一个让机器人能够编写自己的代码、调试自己的失败,并建立一个永久性的“技巧库”的系统,这让它们每天都变得更加聪明。
它是如何工作的:三大神奇工具
论文将 ASPIRE 描述为一个由三个工作人员组成的团队,他们在循环中协同工作:
1. “超级调试器”(机器人执行引擎)
大多数机器人只会告诉你:“我失败了。” 但它们不会告诉你为什么。
ASPIRE 的引擎就像一个高科技监控摄像头,记录机器人做的每一个微小动作。
- 类比: 想象你正在尝试把车停进一个狭窄的车位。普通的机器人只会说:“撞车了!”而 ASPIRE 的引擎会向你展示视频:“你转弯太早了,导致后保险杠撞到了墙。”
- 作用: 它为机器人提供一个“追踪记录”(详细日志),展示感知在哪里失效、计划在哪里出错,或者机械臂在哪里卡住。这使得机器人能够自我诊断问题,而不是靠猜。
2. “共享笔记本”(技能库)
在过去,如果机器人学会了如何打开某个特定的抽屉,这种知识在任务结束后就消失了。
ASPIRE 维护着一个不断增长的“技能库”。
- 类比: 这就像一本**“生活妙招”食谱**。
- 条目 1: “如果机器人因为桌子挡路而无法触及物体,尝试从侧面接近,而不是正面直冲。”
- 条目 2: “如果机器人看到两个碗,先看左边的那个。”
- 作用: 当机器人修复一个错误(Bug)时,它不仅保存这个修复方案,还保存这个模式。如果它以后遇到类似的问题(即使是使用不同的机器人或不同的物体),它会立即从笔记本中提取这个“生活妙招”并使用它。这就是它如何随着时间的推移变得更快、更好的。
3. “头脑风暴会议”(进化搜索)
有时,机器人会陷入死循环,一遍又一遍地尝试同一个错误的方案。
ASPIRE 使用一种称为“进化搜索”的方法。
- 类比: 想象你在修理一个漏水的管道。你不是只拧紧一次螺栓,而是同时尝试 10 种不同的扳手、5 个不同的角度和 3 种不同类型的胶带。你观察哪一个效果最好,保留那个最好的,然后尝试改进它。
- 作用: 该系统会同时生成许多个不同版本的机器人代码。它测试所有版本,保留胜出者,丢弃失败者。这有助于机器人跳出“局部循环”,找到人类可能想不到的创造性解决方案。
他们实际取得了什么成果(实验结果)
论文在三种类型的挑战上测试了这个系统,结果令人印象深刻:
“凌乱厨房”测试 (LIBERO-Pro):
- 场景: 机器人需要移动物体,但物体被随机移动到了不同的位置,或者指令发生了细微变化(例如,“拿起红杯子”变为“拿起蓝杯子”)。
- 结果: ASPIRE 的成功率比以往的方法高出 77%。它不仅仅是记住了位置,它学会了无论物体在哪里都能找到并抓取的“技能”。
“双臂交接” (Robosuite):
- 场景: 一个拥有双臂的机器人需要将物体从一只手传递到另一只手。由于涉及复杂的时机和物理特性,这非常困难。
- 结果: 以前的方法成功率仅为 20%。ASPIRE 跳升到了 92%。它通过试错法学会了传递物体的“舞蹈步法”。
“漫长的居家一天” (BEHAVIOR-1K):
- 场景: 机器人需要完成一系列长链条任务,比如“去厨房,找到苏打水,打开冰箱,把它放进去”。
- 结果: ASPIRE 比次优方法好 32%。因为它拥有技能库,它不需要每次都重新学习如何“打开冰箱”;它只需查阅“打开冰箱”的技能即可。
“神奇的迁移”:从模拟到现实
论文中最酷的部分之一是 Sim-to-Real Transfer(从模拟到现实的迁移)。
- 设置: 机器人在视频游戏(模拟环境)中学习了所有的技能。然后,他们将它放在一个看起来不同、传感器也不同的真实物理机器人上。
- 结果: 尽管真实的机器人有所不同,但模拟环境中的“生活妙招”仍然有效。
- 例子: 机器人在游戏中学会了“如果你尝试正面推抽屉,它会卡住”。它将同样的逻辑应用到了真实的抽屉上。
- 影响: 这使得在某些任务中,真实机器人所需的“思考量”(计算机处理量)减少了近 10 倍。它证明了在虚拟世界学到的技能可以帮助现实世界的机器人。
总结
ASPIRE 是一个让机器人停止成为“只会重复的笨蛋”,并将其转变为“持续学习者”的系统。
- 它给了它们眼睛,去观察失败的具体原因(执行引擎)。
- 它给了它们记忆,去保存修复方案以备后用(技能库)。
- 它给了它们大脑,去同时尝试多种解决方案(进化搜索)。
论文声称,通过这样做,机器人可以比以前更快地解决复杂且混乱的任务,并且它们在一种情况下获得的知识可以帮助它们在完全新的情况下取得成功。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。