想象一下,你正试图教一个机器人如何在你的厨房里帮忙。如果你只是对它说,“给我做一个水果碗,”一个标准的机器人可能会感到困惑。它知道什么是“水果”,但它不知道水果在哪里,不知道如何抓取而不把水果捏扁,也不知道要把水果放在碗边的确切位置。
这篇论文介绍了一种使用“双脑”系统与机器人交流的新方法。与其让一个超级聪明的计算机同时处理所有事情,研究人员将这项工作分给了两个专门的、类似于高级AI聊天机器人的大语言模型(LLMs)。
以下是该系统的运作方式,我们使用简单的类比来解释:
双脑系统
1. “总经理”(高层智能体/High-Level Agent)
把这个AI想象成一名项目经理。你给它一个自然的指令,比如,“清理桌子上的所有水果。”
- 它的职责: 它将宏大的目标分解为一份待办事项清单。它会决定:“首先,我需要找到苹果。然后,我需要拿起它们。接着,我要把它们放进垃圾桶里。”
- 它的思考方式: 它使用一种叫做“ReAct”(推理+行动)的方法。它会想:“我需要一个苹果”,然后它会要求机器人的眼睛去寻找一个,看到苹果后,它会说:“好了,把它抓起来。”它还会记录下已完成的操作日志,这样就不会忘记进度。
- 局限性: 虽然这位经理擅长逻辑,但它非常不擅长数学。如果你告诉它“把杯子放在盘子的左边”,它可能理解这些词汇,但它并不知道移动机器人手臂所需的精确3D坐标。它可能会进行猜测,而这种猜测在物理上可能是无法实现的。
2. “空间建筑师”(底层子模块/Low-Level Sub-Module)
这是一个处理几何结构的专业工程师。总经理并不直接与机器人手臂对话,而是与这位“建筑师”对话。
- 它的职责: 当经理说“把马克杯放在盘子旁边”时,建筑师便接管了工作。它观察马克杯和盘子的3D形状(使用名为YOLOX-GDRNet的视觉系统),并计算出精确的数学关系:“盘子的坐标是X, Y, Z。为了实现‘在旁边’,马克杯需要位于X + 5cm处。”
- 为什么要分离? 如果让总经理在进行规划的同时还要处理数学问题,它会因为负担过重而出错(比如尝试把杯子放进实心的桌子里面)。通过将“做什么”与“具体放在哪”分开,系统变得更加可靠。
他们是如何测试的
研究人员在模拟环境和真实机器人(PAL Robotics Tiago机械臂)上对该系统进行了24项不同的测试。
- 结果: 该系统在任务中的成功率达到了 86%。
- 简单 vs 困难: 它在处理简单指令(如“拿起香蕉”)时表现出色,甚至在识别不可能的任务(如“把香蕉放进实心的桌子里”)方面表现得更好。在这些不可能的情况下,机器人100%地正确回答了“我做不到”。
- 人类反馈: 当人类观察最终结果时,给出了大约6.9分(满分10分)的评分。他们喜欢机器人执行明确任务的表现(如堆叠盘子),但在面对模糊指令(如“做个咸味零食”)时则不太确定,因为“咸味零食”存在多种解读方式。
现实世界测试
他们还在真实的房间里,在真实的机器人手臂上进行了测试。
- 成功之处: 即使在桌面很乱的情况下,机器人也能很好地找到物体(如芥末瓶或苹果)。它完美地制定了计划。
- 失败之处: 在极少数失败的情况下,并不是因为AI对“计划”产生了困惑,而是由于物理硬件问题,例如摄像头轻微偏移或机器人手臂碰撞到了物体。此时,“大脑”是在正常工作的,只是“身体”出现了小故障。
核心结论
这篇论文表明,通过将工作分配给负责逻辑与对话的**“经理”和负责3D数学与定位的“建筑师”**,机器人可以更好地理解人类的指令。
然而,作者也坦诚地指出了局限性:虽然机器人在理解语言和空间方面变得越来越聪明,但它仍然难以应对物理世界的复杂多变。这是让机器人能够真正协助我们在家中生活的一大进步,而无需我们必须使用“机器人代码”来进行沟通。
技术摘要:用于机器人任务与运动规划的双 LLM 模块分层提示策略
问题陈述
将服务机器人集成到家庭环境中,需要能够理解模糊、不完整或依赖上下文的自然语言指令的系统。虽然传统的任务与运动规划(TAMP)系统依赖于人工定义的符号规则(例如 PDDL),但它们在处理人类环境的开放词汇特性方面表现乏力。相反,尽管大语言模型(LLM)展示了涌现的推理能力以进行任务分解,但在直接应用于机器人领域时面临显著局限性:
- 缺乏物理接地(Physical Grounding): 标准 LLM 本身并不具备物理定律的接地能力,经常生成在运动学或几何学上不可行的“幻觉”计划。
- 单体提示问题: 当前的提示策略往往强迫单个模型实例同时处理抽象逻辑(例如,“什么是水果?”)和精确的空间数学(例如,“相对于盘子的坐标在哪里?”)。这会导致“Token 耗尽”或推理混乱,使模型在任务逻辑与空间精度之间产生优先级冲突。
- 感知-动作鸿沟: 高层语义规划与底层几何执行之间存在脱节,特别是在物体几何形状和工作空间约束各异的非结构化环境中。
方法论
作者提出了一个层次化的、语言驱动的框架,通过双模块提示架构将高层任务规划与底层空间推理解耦。该系统在一个桌面环境中运行,并集成了以下组件:
1. 视觉模块
系统利用 YOLOX-GDRNet 流水线进行物体感知:
- 检测: YOLOX 检测输入图像中的物体,提供 2D 边界框和类别标签。
- 位姿估计: 感兴趣区域(ROI)由 GDR-Net 神经网络处理,以预测相对于相机坐标系的 6D 位姿(3D 平移向量和四元数朝向)。
- 几何数据: 系统可以访问预计算的物体 3D 模型和直径,以为空间推理提供信息。
2. 高层 LLM 智能体(任务规划器)
- 架构: 使用 Python LangChain 实现,采用 Llama3.2:70B 模型。
- 提示策略: 该智能体通过 ReAct 式循环(思考、行动、观察)运行。它维护交互历史记忆以支持迭代推理。
- 工具: 智能体可以使用检索物体列表、抓取物体、放置物体和释放物体的工具。它负责整体的任务逻辑和序列,但将精确的坐标计算委托出去。
3. 低层 LLM 子模块(放置推理器)
- 架构: 一个独立的、专门的子模块,同样由 Llama3.2:70B 提供动力。
- 功能: 该模块处理 3D 空间约束和几何可行性。它不了解高层智能体的内部逻辑,从而确保了模块化。
- 提示策略: 它利用包含物体名称、位姿和几何属性(如直径)的结构化输入的少样本提示(few-shot prompting)。
- 目标: 将空间语言(例如,“在……左侧”)映射到一致的几何变换,并确定物体放置的具体 3D 坐标,从而防止高层规划器因处理低层坐标数学而过载。
核心贡献
论文概述了三个主要贡献:
- 双模块架构: 一种新颖的框架,通过将高层任务规划与低层空间推理解耦,提高了生成的机器人计划的可靠性。
- 专门的空间子模块: 一个旨在处理 3D 空间约束和几何可行性的专用组件,直接解决了标准 LLM 缺乏物理接地的问题。
- 实证验证: 在 24 个真实世界和模拟场景中演示了该框架的有效性,展示了在非结构化环境中执行复杂人类指令方面的显著改进。
评估与结果
系统在 24 个测试场景中进行了评估,包括简单的空间命令、高层指令以及不可行的请求。
定量结果
- 总体成功率: 系统实现了 86% 的总体任务成功率。
- 场景细分:
- 简单命令(16 个场景): 成功率为 87.5%,平均每个任务 4 个步骤。
- 高层命令(5 个场景): 成功率为 80.0%,平均每个任务 6 个步骤。
- 不可行场景(3 个场景): 在正确识别不可行性方面达到了 100% 的成功率,平均用 5 个步骤判定不可行。
- 规划时长: 平均规划时长为每个任务 5 步。
定性与空间分析
- 人类评估: 三名独立评估员根据初始命令与最终场景之间的对齐程度进行 1-10 分的评分。平均评分为 6.86,对于具有清晰空间关系的任务(例如,“做一碗水果”得分为 9.67)得分较高,对于模糊任务(例如,“做一份咸味零食”得分为 3.00)得分较低。
- 空间推理精度: 放置推理器在“在……之上”和“在……旁边”的关系中表现出最高的精度(坐标方差最低)。对于基于深度的关系(如“在……前面”和“在……后面”),性能表现不够稳定,显示出较高的方差。
- 物理机器人实验: 在 PAL Robotics Tiago 操作臂上的实验证实,该系统能够可靠地识别目标物体并在杂乱环境中推断用户意图。观察到的失败局限于底层执行(运动规划和标定误差),而非语义或任务级推理。
意义与主张
作者声称,他们的层次化方法有效地桥接了自然语言与 3D 几何关系之间的鸿沟,展现出适用于零样本放置的鲁棒“空间语法”。论文断言:
- 模块化是关键: 将空间几何推理隔离到专门的子模块中,可以防止高层规划器因坐标数学的复杂性而失败。
- 可行性优于表达力: 该框架优先考虑在真实机器人上的执行可靠性,通过牺牲广泛的动作表达力来换取物理可行性。
- 未来方向: 尽管该系统展现了前景,但作者指出,其实际应用仍受限于物理可行性和环境泛化能力。他们建议,未来的工作应整合几何先验和物理模拟器,以优化动态具身环境中的预测。
论文总结道,将 LLM 的符号灵活性与落地的空间感知相结合,为实现直观且通用的机器人-人类协作提供了一条充满希望的路径。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。