← 最新论文
💻 computer science

RHO: Your Coding Agent is Secretly a Roboticist

本文介绍了机器人控制力优化(Robotics Harness Optimization, RHO),这是一种全新的训练范式,其中具备工具调用能力的编码智能体通过环境反馈来搜索可解释的多文件神经符号策略库,从而在实时机器人任务中实现了最先进的性能,并且其效率优于现有的多轮对话智能体系统。

原作者: Karim Elmaaroufi, Justin Svegliato, Sarunas Kalade, Graham Schelle, Sanjit A. Seshia, Matei Zaharia

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Karim Elmaaroufi, Justin Svegliato, Sarunas Kalade, Graham Schelle, Sanjit A. Seshia, Matei Zaharia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人如何拿起杯子并把它放在桌子上。

旧方法:即时编程者 (The "On-the-Fly" Programmer)
以前,实现这一目标的最佳方式是让一个超级智能的 AI(大语言模型)充当一名手忙脚乱的程序员。每当机器人掉落杯子或没碰到桌子时,AI 就会停下来,思考,编写新的代码来修复错误,然后再次尝试。这就像一位厨师品尝了汤,意识到需要加盐,于是停止烹饪,写了一份新食谱,然后重新开始。这种方法可行,但既慢又乱,而且机器人无法移动得足够快以投入实际应用,因为它一直在不断地重写自己的指令。

新方法:RHO(“赛前”教练)
这项研究引入了 RHO(机器人护栏优化,Robotics Harness Optimization)。RHO 不再让 AI 在机器人运动时编写代码,而是在训练阶段扮演一名严厉且具有反思能力的教练。

以下是 RHO 的工作原理,使用一个简单的类比:

1. “仓库”(是整个工具箱,而不只是一个便签)

大多数 AI 系统试图通过微调一个句子或一个小的函数来修复机器人(比如改变食谱中的一种配料)。RHO 则不同。它将机器人的大脑视为一个完整的代码文件库(一个“仓库”/ Repository)。

  • 类比: 想象机器人的大脑不仅仅是一张写着指令的便签;它是一个完整的车间,拥有手册、一套工具、一份安全检查清单和一张导航地图。RHO 不仅仅是修改那张便签,它会同时重新组织整个车间,更换工具,并重写所有的手册。

2. “具备工具能力的智能体”(能够真正动手建造的学徒)

RHO 使用了一种特殊的 AI 智能体,它不仅仅是一个文本生成器。它是一个拥有“双手”的编程智能体。

  • 类比: 这个智能体不仅仅是谈论如何修复机器人,它被允许打开机器人的代码文件,运行测试,查看机器人的“视频监控画面”以观察哪里出了错,检查错误日志,然后真正地重写代码。这就像一个既能读懂手册,又能拿起扳手修理引擎,还能顺便完成试驾的学徒。

3. “进化搜索”(适者生存)

RHO 不仅仅尝试一种修复方案。它运行了一个进化过程。

  • 类比: 想象一场锦标赛。AI 创建了 100 个不同版本的机器人“大脑”(不同的代码仓库)。它将它们全部送入模拟器中尝试执行任务。
    • 有些失败得很惨烈。
    • 有些表现尚可。
    • 有些表现非常出色。
    • AI 会提取这些“获胜者”,将它们最好的特征融合在一起,创造出新一代的 100 个机器人。它重复这个过程数百次。
    • 至关重要的是,它保持了一个“帕累托前沿”(Pareto Frontier)。这意味着它并不只是保留那个在所有方面都表现最好的机器人,而是保留那个在这项特定任务上表现最好的机器人,即使它在其他任务上表现不佳。这确保了最终的机器人是一个专家,而不是一个在特定工作上表现平庸的通才。

4. 结果:“即插即用”的机器人

通过训练,RHO 产生了一个单一且完美的“仓库”(一套完整的代码文件)。

  • 神奇之处: 当这个机器人在现实世界中部署时,它不再需要 AI 来思考了。它不需要停下来编写代码。它只需运行预先写好的、经过高度优化的代码。
  • 类比: 这就像是一个在考试时必须查阅每个数学公式的学生,与一个已经背下了公式并练习了数千道题目的学生之间的区别。RHO 机器人就是那个已经在“家庭作业”(训练)阶段完成了艰苦工作,并准备好立即通过“考试”(部署)的学生。

他们究竟取得了什么成就?

论文声称,这种方法显著优于目前的尖端技术:

  • 速度与可靠性: 在标准机器人基准测试(如堆叠积木或移动物体)中,RHO 仅通过一次快速执行就达到了 70% 的成功率。之前的最佳方法(需要 AI 不断停顿并重写代码)仅达到 68%,且速度慢得多。
  • 应对混乱: 当研究人员改变规则(例如移动物体的位置或改变任务描述)时,其他 AI 模型(如 OpenVLA)完全失败(成功率为 0%)。而 RHO 仍能维持 45% 的成功率。
  • 效率: 在一个更复杂的现实模拟中,RHO 将机器人“思考”的时间减少了 20%,并将它调用的工具数量减少了 27%,同时使成功率翻倍。

核心结论

RHO 通过将繁重的计算任务从部署阶段(机器人工作时)转移到训练阶段(机器人学习时)改变了游戏规则。它利用一个聪明的、具备工具调用能力的 AI,演化出一个完整的、多文件的代码库,这个库既稳健又具有可解释性(人类可以阅读代码),并且可以立即运行,无需在执行过程中依靠超级计算机来实时重写指令。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →