Towards the Harness of Embodied Agents
本文介绍了 Thea,这是一个为具身智能体设计的框架,它通过集成一个用于状态感知的持久性符号场景图和一个用于动作反馈的评估机制,将编码智能体范式适配到物理世界中,从而通过闭环智能体回路实现长程任务的成功执行。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个机器人做你的家务。长期以来,科学家们一直认为,智能机器人的秘诀在于构建一个足够聪明、能够自主思考的“大脑”。但问题在于:现实世界是混乱且不可预测的,它不像电子游戏那样拥有“存档”功能。如果机器人摔碎了一个杯子,杯子就碎了。如果它撞到了墙,它就会被卡住。这就是**具身智能(Embodied AI)**的领域——即生活在物理身体中并与现实世界进行交互的智能。
为了理解这一挑战,请思考一下你如何使用计算机。当你编写代码时,如果出错,计算机会立即提示“错误:第5行”。它给出了一个清晰的信号,告诉你哪里出了问题,然后你可以进行修复。这被称为闭环(Closed Loop):你采取行动,获得反馈,然后进行调整。在数字世界里,这种反馈是免费且即时的。但在物理世界中,机器人不会得到一个像“抓取失败”这样的小弹窗。它只会闭合手掌,然后可能杯子掉落了,或者它根本没抓稳。机器人必须去猜测发生了什么。这篇论文提出了一个大问题:我们能否构建一个像计算机程序员那样,即使在世界没有给出简单答案的情况下,也能从错误中学习的机器人?
机器人的“马具”:将大脑转化为身体
见见 Thea。本文作者们不仅仅是在构建一个更聪明的机器人大脑;他们是在构建一个“马具”。把马具想象成马鞍和缰绳:马(机器人的身体)很强壮,骑手(AI 大脑)很聪明,但如果没有马具,骑手无法有效地引导马匹。Thea 就是那个马具。它将一个强大的 AI 模型连接到机器人身体上,并以一种让机器人能够学习、从错误中恢复并完成复杂长任务的方式进行连接。
论文指出,秘诀不仅仅是在真空中让 AI 变得更“聪明”。相反,关键在于围绕它构建正确的架构。作者展示了通过将机器人的能力(如移动、抓取或观察)封装成 AI 可以调用的简单“工具”,并通过创建一个不断检查这些工具是否奏效的系统,机器人可以处理以前无法完成的任务。
两个大问题:阅读世界与知晓何时获胜
论文指出了数字世界(编程代理生存的地方)与物理世界(机器人生存的地方)之间的两个巨大鸿沟。
1. 世界难以阅读(“场景图”解决方案)
在计算机程序中,计算机确切知道每个文件的位置。它可以一次性读取整个“代码库”。但机器人只能通过摄像头看到世界的一小部分,就像通过吸管看东西一样。它可能看到一个杯子一秒钟,然后转身看到了桌子。除非它建立起记忆,否则它不知道杯子刚才在哪里。
- 解决方法: Thea 构建了一个场景图(Scene Graph)。想象一下,这是机器人随身携带的一个持久的、神奇的笔记本。每当机器人看到某样东西,它就会把它记在笔记本上:“杯子在桌子上,靠近台灯。”即使机器人转过头去,笔记本也会记住。这把混乱、模糊的世界变成了一张清晰、可读的地图,让 AI 能够理解,就像程序员阅读代码一样。
2. 世界不提供“退出码”(“评估器”解决方案)
当一个计算机程序运行时,它会结束并显示“成功”或“错误”。如果机器人尝试拿起一个瓶子,它不会得到一个表示“成功”的信号。它只是继续移动。它如何知道自己是真的抓住了瓶子,还是仅仅挤压了空气?
- 解决方法: Thea 引入了一个评估器(Evaluator)。这就像一个站在机器人旁边的严格裁判。在机器人尝试抓取某物后,评估器会观察结果并说:“你没抓到”、“你抓到了,但滑落了”或者“做得好!”它充当了物理世界所缺失的“退出码”。如果机器人失败了,评估器不仅会说“不”,还会解释为什么(例如,“你离得太远了”),以便机器人能带着更好的计划重试。
它是如何运作的:学习循环
奇迹发生在循环之中。AI 查看它的“笔记本”(场景图),决定要做什么,并选择一个工具(如“抓取杯子”)。机器人尝试执行。然后,评估器检查结果。
- 如果成功: 机器人更新其笔记本,并进入下一步。
- 如果失败: 评估器给出一个原因。AI 阅读该原因,更新其计划,并再次尝试。
这听起来可能很简单,但它改变了一切。论文显示,如果没有这个循环,如果机器人必须完成 10 个步骤才能完成一项任务,且每一步成功的概率是 85%,那么完成整个任务的概率是非常微小的(不到 20%)。但有了这个“马具”,如果机器人在某一步失败了,它会不断重试直到成功。突然间,完成整个任务的概率跳升到了 90% 以上。
研究发现(以及未发现的部分)
研究人员在三种不同的机器人上测试了 Thea:一种轮式类人机器人(Astribot S1)、一种移动机械臂(AgileX Cobot Magic)以及一种带有灵巧手的较小机器人(Unitree G1)。他们给出的任务范围从拿起单个物体到穿越房间、在杂乱的柜子里寻找特定物品,并将物品送到另一张桌子上。
- 结果: Thea 在所有测试中都是最成功的系统。当任务变得更难、更长时,其他系统(那些没有这种带有评估器的“马具”的系统)开始失效且无法恢复。然而,Thea 却能不断尝试、调整位置,并在被困住时寻求帮助。
- “主动感知”: 在一个演示中,机器人被要求寻找一个充电宝。它不在桌子上。机器人并没有放弃,而是利用它的“笔记本”意识到它还没有检查过抽屉。它走向柜子,打开抽屉,找到了物品。它不仅仅是在遵循脚本;它意识到自己需要去新的地方寻找。
- “退出码”的准确性: 评估器在判断成功或失败方面表现出色,准确率约为 93%。论文指出,这种高准确性至关重要;如果裁判经常出错,机器人就会感到困惑。
这为什么重要
论文表明,我们不需要等待一个永远不会犯错的“超智能”机器人大脑。相反,我们可以构建一个能够犯错、学习并从中恢复的系统。“马具”是关键。它允许不同的机器人身体使用同一个聪明的脑,也让同一个大脑可以在不同的机器人身上工作。
作者谨慎地指出,这并不是一个完美、最终完成的产品。“笔记本”(场景图)目前还不完美;有时它会对物体的位置产生困惑。“裁判”(评估器)也并非 100% 准确。而且由于机器人每一步动作都需要通过语言模型进行思考,它的速度仍然有点慢。但方向是明确的:通过在 AI 周围构建正确的架构,我们可以将笨拙的机器人转变为可靠的助手,让它们能够应对我们混乱的现实家庭环境。机器人技术的未来不仅仅在于更好的大脑,更在于更好的马具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。