ALRM: Agentic LLM for Robotic Manipulation
本文介绍了 ALRM,这是一个代理式大语言模型(LLM)框架,它通过一个支持“代码即策略”(Code-as-Policy)和“工具即策略”(Tool-as-Policy)执行模式的模块化 ReAct 式循环,将自然语言推理与机器人操控连接起来,并通过一个包含 56 个语言多样化任务的新基准测试进行了验证。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明、博学多才的机器人助手。你想让它收拾你的厨房,但你不是给它一个僵化的、预先写好的脚本,比如“拿起勺子,移动到水槽”,你只是说:“嘿,能不能请你把这些脏盘子清理一下?”
长期以来,机器人一直很难处理这种情况。它们就像是背诵了剧本但如果剧本中改动了一个词就会卡壳的演员。如果你说“把盘子扔掉”而不是“移动盘子”,机器人可能会陷入停滞。
这篇论文介绍了一个名为 ALRM(用于机器人操控的代理式大语言模型)的新系统,它教会机器人如何像人类一样思考、规划并进行实时适应。
机器人“思考”的两种方式
研究人员发现,机器人可以通过两种不同的方式来处理你的请求,就像两种不同的工作风格:
“代码编写者”(Code-as-Policy,代码即策略):
想象机器人是一个程序员。当你给它一个任务时,它会立即编写一段短小的计算机程序(脚本)来解决问题,然后点击“运行”。它既快速又高效,就像一位熟记食谱的厨师,一口气就能完成整顿饭。然而,如果它在食谱中出了一个小小的拼写错误,整道菜可能就会烧焦,它必须从头开始。“工具使用者”(Tool-as-Policy,工具即策略):
想象机器人是一个侦探。它不会编写整个脚本,而是将工作分解成微小的步骤。它会说:“首先,我要寻找盘子。好了,我找到了。现在,我要抓起它。噢,等等,我的手滑了。让我再试一次。”它使用一种“工具”来完成一件小事,检查结果,然后决定下一步该做什么。这种方式比较慢,因为需要花时间思考,但它在实时修复错误方面表现得更好。
操作的“大脑”
该系统使用一个特殊的“大脑”(大语言模型,简称 LLM)来充当项目经理。
- 规划器(The Planner): 这部分负责倾听你的请求(“清理桌子”)并将它分解成逻辑严密的微小步骤(“找到杯子”、“拿起杯子”、“把杯子放入水槽”)。
- 执行器(The Executor): 这部分负责实际操作,要么运行规划器编写的代码,要么通过“工具”逐步执行。
- 循环(The Loop): 如果机器人掉落了杯子,执行器会告诉规划器:“我把它弄掉了。”规划器会说:“好吧,让我们尝试再次拿起它。”这个循环会一直持续,直到任务完成。
他们给机器人的“考试”
为了测试这个系统是否真的有效,研究人员不仅仅是在简单的指令上进行测试。他们创建了一个复杂的“考试”,包含三个不同虚拟房间(厨房、箱子存储区和水果碗)中的 56 个不同任务。
他们用以下类型的指令测试了机器人:
- 简单型: “拿起柠檬。”
- 复杂型: “抓取酸味水果和大型水果。”(机器人必须在没有被告知名称的情况下,自行判断哪种水果是酸的,哪种是大的)。
- 话痨型: “嘿,这些水果都烂了!把柠檬和桃子扔进垃圾桶!”(机器人必须忽略多余的闲聊,专注于动作本身)。
他们测试了 10 个不同的“大脑”(AI 模型),范围从庞大、强大的模型(如 Claude-4.1-Opus)到可以在单台计算机上运行的较小、较轻量级的模型(如 Falcon-H1-7B)。
结果:谁赢了?
- 性能王者: 最大、最昂贵的 AI 模型(Claude-4.1-Opus)在“工具使用者”方法中表现最佳。它解决了几乎 94% 的任务,甚至是那些复杂的任务,但因为它考虑得非常周全,所以需要更长的时间来思考。
- 速度达人: 较小的开源模型(Falcon-H1-7B)成为了一个惊喜之星。当使用“代码编写者”方法时,它完成了 84% 的任务,并且比大型模型快得多。它几乎可以媲美那些巨型模型,而且不需要超级计算机来运行。
- 挣扎者: 较小的模型在“工具使用者”方法中表现得很吃力。当它们需要每做一个微小步骤就停下来思考时,它们会感到困惑,往往无法完成任务。
核心结论
这篇论文表明,我们不再需要强迫机器人遵循僵化的脚本。通过赋予它们一个能够规划、使用工具并编写代码的“代理式”大脑,机器人可以理解自然语言,处理错误,并解决像清理凌乱桌面这样的复杂多步谜题。
研究得出结论,为了获得最佳效果,你可以使用强大的云端 AI 进行复杂推理,或者使用较小的本地 AI,如果你追求速度且可以接受稍微简单一点的任务。这是迈向能真正理解我们“意图”而非仅仅理解我们“言语”的机器人的重要一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。