想象一下,你正在试图教一个机器人如何拿起杯子并把它放在桌子上。
旧方法:即时编程者 (The "On-the-Fly" Programmer)
以前,实现这一目标的最佳方式是让一个超级智能的 AI(大语言模型)充当一名手忙脚乱的程序员。每当机器人掉落杯子或没碰到桌子时,AI 就会停下来,思考,编写新的代码来修复错误,然后再次尝试。这就像一位厨师品尝了汤,意识到需要加盐,于是停止烹饪,写了一份新食谱,然后重新开始。这种方法可行,但既慢又乱,而且机器人无法移动得足够快以投入实际应用,因为它一直在不断地重写自己的指令。
新方法:RHO(“赛前”教练)
这项研究引入了 RHO(机器人护栏优化,Robotics Harness Optimization)。RHO 不再让 AI 在机器人运动时编写代码,而是在训练阶段扮演一名严厉且具有反思能力的教练。
以下是 RHO 的工作原理,使用一个简单的类比:
1. “仓库”(是整个工具箱,而不只是一个便签)
大多数 AI 系统试图通过微调一个句子或一个小的函数来修复机器人(比如改变食谱中的一种配料)。RHO 则不同。它将机器人的大脑视为一个完整的代码文件库(一个“仓库”/ Repository)。
- 类比: 想象机器人的大脑不仅仅是一张写着指令的便签;它是一个完整的车间,拥有手册、一套工具、一份安全检查清单和一张导航地图。RHO 不仅仅是修改那张便签,它会同时重新组织整个车间,更换工具,并重写所有的手册。
2. “具备工具能力的智能体”(能够真正动手建造的学徒)
RHO 使用了一种特殊的 AI 智能体,它不仅仅是一个文本生成器。它是一个拥有“双手”的编程智能体。
- 类比: 这个智能体不仅仅是谈论如何修复机器人,它被允许打开机器人的代码文件,运行测试,查看机器人的“视频监控画面”以观察哪里出了错,检查错误日志,然后真正地重写代码。这就像一个既能读懂手册,又能拿起扳手修理引擎,还能顺便完成试驾的学徒。
3. “进化搜索”(适者生存)
RHO 不仅仅尝试一种修复方案。它运行了一个进化过程。
- 类比: 想象一场锦标赛。AI 创建了 100 个不同版本的机器人“大脑”(不同的代码仓库)。它将它们全部送入模拟器中尝试执行任务。
- 有些失败得很惨烈。
- 有些表现尚可。
- 有些表现非常出色。
- AI 会提取这些“获胜者”,将它们最好的特征融合在一起,创造出新一代的 100 个机器人。它重复这个过程数百次。
- 至关重要的是,它保持了一个“帕累托前沿”(Pareto Frontier)。这意味着它并不只是保留那个在所有方面都表现最好的机器人,而是保留那个在这项特定任务上表现最好的机器人,即使它在其他任务上表现不佳。这确保了最终的机器人是一个专家,而不是一个在特定工作上表现平庸的通才。
4. 结果:“即插即用”的机器人
通过训练,RHO 产生了一个单一且完美的“仓库”(一套完整的代码文件)。
- 神奇之处: 当这个机器人在现实世界中部署时,它不再需要 AI 来思考了。它不需要停下来编写代码。它只需运行预先写好的、经过高度优化的代码。
- 类比: 这就像是一个在考试时必须查阅每个数学公式的学生,与一个已经背下了公式并练习了数千道题目的学生之间的区别。RHO 机器人就是那个已经在“家庭作业”(训练)阶段完成了艰苦工作,并准备好立即通过“考试”(部署)的学生。
他们究竟取得了什么成就?
论文声称,这种方法显著优于目前的尖端技术:
- 速度与可靠性: 在标准机器人基准测试(如堆叠积木或移动物体)中,RHO 仅通过一次快速执行就达到了 70% 的成功率。之前的最佳方法(需要 AI 不断停顿并重写代码)仅达到 68%,且速度慢得多。
- 应对混乱: 当研究人员改变规则(例如移动物体的位置或改变任务描述)时,其他 AI 模型(如 OpenVLA)完全失败(成功率为 0%)。而 RHO 仍能维持 45% 的成功率。
- 效率: 在一个更复杂的现实模拟中,RHO 将机器人“思考”的时间减少了 20%,并将它调用的工具数量减少了 27%,同时使成功率翻倍。
核心结论
RHO 通过将繁重的计算任务从部署阶段(机器人工作时)转移到训练阶段(机器人学习时)改变了游戏规则。它利用一个聪明的、具备工具调用能力的 AI,演化出一个完整的、多文件的代码库,这个库既稳健又具有可解释性(人类可以阅读代码),并且可以立即运行,无需在执行过程中依靠超级计算机来实时重写指令。
技术摘要:机器人夹具优化 (Robotics Harness Optimization, RHO)
问题陈述
代码即策略 (Code-as-Policies, CaP) 已证明大语言模型 (LLMs) 可以编写可执行代码,以组合感知、规划和控制原语。然而,目前的 CaP 系统过度依赖于测试时的多轮代码生成循环来处理执行反馈、视觉差异和错误纠正。由于延迟以及扩展推理调用所需的计算成本,这种方法在实时机器人控制中往往是不可行的。
相反,视觉-语言-动作 (Vision-Language-Action, VLA) 模型通过将像素和语言直接映射到动作,但在泛化方面表现挣扎。当面对扰动环境(例如改变物体位置或任务描述)时,像 OpenVLA 和 π0.5 这样的 VLA 模型会遭遇灾难性的性能下降(在 LIBERO-PRO 扰动下,成功率分别为 0.0% 和 12.83%)。
核心挑战在于开发一种机器人控制范式,能够:
- 避免在部署时进行迭代式 LLM 推理(实现实时控制)。
- 在 VLA 失效的分布偏移和扰动情况下实现鲁棒泛化。
- 生成可解释、可调试的策略,而非黑盒神经网络。
方法论:机器人夹具优化 (RHO)
作者引入了机器人夹具优化 (RHO),这一范式将计算负担从测试时生成转向训练时的进化搜索。RHO 不是优化单个提示词或函数,而是进化多文件神经符号策略仓库 (Repositories-as-Policies)。
核心组件
HELIX (通过 LLM 启发式探索的层次化进化):
- 一种反思式进化优化器,将搜索空间从单一构件提升到整个多文件仓库。
- 变异算子 (Mutator): 一个具备工具能力的编码智能体(例如 Codex, Claude Code),充当变异操作符。在单个生成步骤内,该智能体可以:
- 编辑仓库中的多个文件。
- 编写并执行临时测试。
- 通过白名单接口在机器人环境中运行候选策略。
- 读取回溯信息 (tracebacks) 和标准错误输出 (stderr)。
- 调用视觉差异模块 (VDM) 来比较场景状态。
- 反思 (Reflection): 智能体会接收一份总结了前一代失败与成功的反思提示词,以指导下一步的变异。
策略即仓库 (Repositories-as-Policies):
- 候选构件是一个可部署的软件系统,包含任务路由、控制例程、感知封装、抓取辅助工具,以及(如果适用)LLM 夹具。
- 这些是神经符号 (neurosymbolic) 的:符号化代码将学习到的神经感知/抓取服务与运动原语进行组合。
机器人环境即服务 (REaaS) 与隔离机制:
- REaaS: 为编码智能体提供隔离的、受白名单限制的机器人环境(模拟器)访问权限,用于执行候选策略并收集反馈。
- 隔离机制: 为了防止奖励黑客行为(例如,智能体硬编码解决方案或读取评估器内部信息),RHO 强制执行严格的边界。变异工作区是一个侧边代理 (sidecar proxy),排除了评估器源代码、基准测试拆分和裁判提示词。
优化循环:
- 选择 (Selection): 候选者在训练小批量数据上进行评估。如果子代严格改进了总体的塑造奖励 (shaped reward)(或达到放宽的 ≥ 阈值),则接受该子代。
- 帕累托前沿 (Pareto Frontier): RHO 不维护单一的改进链,而是维护一个基于覆盖支配 (coverage dominance) 的候选者帕累托前沿。如果一个仓库在至少一个验证实例上表现最佳且未被其他存活的仓库所支配,则将其保留。这确保了多样性并防止过早收敛。
- 部署 (Deployment): 最终部署的策略是来自终端前沿中具有最高平均验证奖励的仓库。至关重要的是,部署时不会发生 LLM 代码生成;该仓库作为静态 Python 控制器(或用于 LLM 在环系统的固定夹具)进行执行。
核心贡献
- 机器人夹具优化 (RHO): 一种全新的范式,它进化可解释的、神经符号的多文件仓库,而非单一提示词或函数,通过将优化转移到训练时间来消除测试时的推理循环。
- 工具赋能的反思式变异: 首个变异算子为工具赋能的编码智能体的进化优化器,该智能体能够在单次变异步骤内与环境交互、读取回溯信息并编辑多个文件。
- 鲁棒、泛化的策略: 证明了 RHO 产生的策略在单轮评估中优于多轮智能体系统和 VLA 基准模型,特别是在分布偏移的情况下。
实验结果
作者在三个基准测试上评估了 RHO:CaP-Bench Robosuite、LIBERO-PRO 和 Robotec's RAI O3DE。
1. CaP-Bench Robosuite (操纵任务)
- 设置: 单轮执行 (S4),部署时无 LLM 代码生成调用。
- 性能: RHO 实现了 70.0% 的成功率 (490/700 次试验)。
- 对比: 这超过了最强的已发表多轮记录 (CaP-Agent0 的 68.29%,该模型每次试验最多需要 66 次 LLM 调用)。当 CaP-Agent0 被限制在单轮执行时,其性能降至 24.0%。
- 效率: RHO 在控制循环部署期间实现了零 LLM 调用。
2. LIBERO-PRO (扰动下的泛化)
- 设置: 扰动的拾取与放置任务(物体/目标/空间交换以及任务描述变更),此类任务通常会导致 VLA 失效。
- 性能: 在未扰动数据上经过 63 代训练后,RHO 实现了 45.0% 的成功率 (1351/3000 次试验)。
- 对比:
- 比之前的多轮 CaP SOTA (CaP-Agent0 为 18.17%) 高出 2.5 倍。
- 比 π0.5 (12.83%) 高出 3.5 倍。
- 显著优于 OpenVLA (0.0%)。
- 意义: RHO 能够泛化到 VLA 会崩溃的扰动场景,且无需针对扰动任务进行演示。
3. RAI O3DE (LLM 在环部署)
- 设置: 一个控制循环包含 LLM 的 ROS 2 操纵基准测试。
- 性能: RHO 进化出了包含提示词、工具和控制代码的多文件仓库,将留出成功率从 23.5% 提高到 44.3%。
- 效率: 与基准相比,实现了 20% 更少的墙钟时间 和 27% 更少的工具调用。
- 消融实验: 单文件消融实验 (GEPA 式) 导致工具调用增加了 16%,墙钟时间增加了 34%,证明了多文件仓库结构的优越性。
结构先验分析
对比多文件仓库与单文件存根或僵化结构先验(行为树、有限状态机)的实验表明:
- 多文件仓库 (70.0%) 显著优于单文件存根 (63.86%)。
- 僵化先验(行为树: 33.86%, FSMs: 18.14%)表现崩溃,这表明仓库结构提供了合适的脚手架,在引导智能体实现模块化的同时,不会过度约束解空间。
重要性与主张
论文声称 RHO 代表了机器人策略发现方式的根本转变:
- 从测试时转向训练时: 通过将搜索和精炼前置到训练阶段,RHO 消除了实时控制中迭代式 LLM 推理带来的延迟和不稳定性。
- 可解释性与可调试性: 不同于端到端的 VLA,RHO 产生的神经符号代码中,高级启发式算法(例如,分位数鲁棒几何、IK 可行性预门控、双重感知交叉验证)是被显式发现并编码的。这些机制是人类可读且可验证的。
- 泛化能力: RHO 证明了对多文件仓库进行进化搜索可以发现鲁棒的策略,这些策略能够泛化到新的物体排列和任务描述,超越了当前的智能体堆栈和 VLA 模型。
- 可扩展性: 该框架扩展了智能体收集的“经验”。CaP-Agent0 在部署时的每一轮进行反馈,而 RHO 在进化搜索期间收集一次此类经验,并将其编译为静态、高效的仓库。
作者总结道,虽然 RHO 继承了底层 LLM 的空间推理限制,但它成功恢复了任务与运动规划所需的模块化结构,为鲁棒、可解释且可部署的机器人控制提供了一条路径。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。