← 最新论文
🤖 AI

ENPIRE: Agentic Robot Policy Self-Improvement in the Real World

该论文介绍了 ENPIRE,这是一个使编码智能体能够通过环境重置、并行展开和迭代代码优化构成的闭环系统,在现实世界中自主改进机器人操控策略的框架,从而在极少的人类监督下,在复杂的灵巧操作任务中实现了高成功率。

原作者: Wenli Xiao, Jia Xie, Tonghe Zhang, Haotian Lin, Letian "Max" Fu, Haoru Xue, Jalen Lu, Yi Yang, Cunxi Dai, Zi Wang, Jimmy Wu, Guanzhi Wang, S. Shankar Sastry, Ken Goldberg, Linxi "Jim" Fan, Yuke Zhu, G
发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenli Xiao, Jia Xie, Tonghe Zhang, Haotian Lin, Letian "Max" Fu, Haoru Xue, Jalen Lu, Yi Yang, Cunxi Dai, Zi Wang, Jimmy Wu, Guanzhi Wang, S. Shankar Sastry, Ken Goldberg, Linxi "Jim" Fan, Yuke Zhu, Guanya Shi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想教一个机器人完成一项棘手的任务,比如穿针引线或用剪刀剪断扎带。传统上,这就像有一个人类老师站在机器人身后盯着它看好几天,不断地说:“不对,再试一次”、“手往左移一点”、“做得好,现在试着快一点”。这种人工监督既缓慢又昂贵,而且限制了机器人的学习速度。

ENPIRE 论文提出了一种不同的方法:我们不再提供一个人类教师,而是给机器人一个 AI“研究员”团队(编码智能体),他们可以进行自我教学、修复自己的错误,并在没有人类帮助的情况下 24/7 全天候运行实验。

以下是 ENPIRE 的工作原理,通过简单的概念进行拆解:

1. 问题所在:“人类保姆”瓶颈

目前,教机器人需要人类不断地重置场景(把物体放回原位)、检查机器人是否成功以及调整代码。这就像一位厨师在喝每一口汤之后,都必须去洗碗、切菜并品尝汤的味道。机器人无法快速学习,因为人类成为了瓶颈。

2. 解决方案:自动驾驶的研究实验室

ENPIRE 是一个框架,它将机器人变成了一个自动驾驶的研究实验室。它赋予 AI 研究员一套工具,让他们能够自动完成四件事:

  • 环境(“重置按钮”): AI 编写代码来创建一个安全区域。如果机器人掉落了针或者撞到了墙,系统会自动停止、将物体重置到初始位置,并为下一次尝试做好准备。不需要人类走过去捡起那根针。
  • 眼睛(“计分员”): AI 创建一种方式来“观察”任务是否完成。例如,它可能会查看摄像机画面,看扎带是否真的被剪断了。如果没剪断,它会给机器人一个“低分”。如果剪断了,它会给一个“高分”。
  • 大脑(“策略改进器”): 这是核心部分。AI 研究员阅读书籍(科学文献),观察“低分”结果,然后重写自己的代码以尝试新的策略。他们可能会说:“好吧,这行不通。让我们尝试改变速度,”或者“让我们尝试一种不同的学习算法。”
  • 舰队(“团队协作”): 与其让一个机器人尝试一个想法,ENPIRE 可以同时运行 8 台机器人。每台机器人都被分配了一名 AI 研究员,并带着略有不同的想法。它们展开竞赛,看哪个想法效果最好。如果一台机器人找到了获胜策略,其他机器人就会效仿它。

3. 类比:“爬山”团队

把机器人的学习过程想象成一支登山队试图登上一座大雾弥漫的山顶(即“完美的机器人技能”)。

  • 传统方式: 一名登山者(机器人)迈出一步,然后停下来等待向导(人类)说:“你走错方向了,往左走。”
  • ENPIRE 方式: 你派出 8 名登山者。他们都带着对讲机。
    • 登山者 A 尝试向左走。
    • 登山者 B 尝试向右走。
    • 登山者 C 尝试跳跃。
    • 他们都会汇报情况:“我撞到悬崖了!”或者“我发现了一条路!”
    • 团队会立即分享最佳路径。如果登山者 A 发现了一条捷径,其他人会立即切换到那条路径。他们不断尝试新路线,直到到达顶峰。

4. 他们实际取得了哪些成就

论文在四个困难的现实任务上测试了这个系统:

  1. Push-T: 将 T 形块推到特定位置。
  2. 插针(Pin Insertion): 将销钉插入一个极小的孔中(仅 4 毫米宽)。
  3. GPU 插槽插入(GPU Insertion): 小心地将计算机芯片放入插槽。
  4. 剪断扎带(Zip Tie Cutting): 抓取剪刀并剪断塑料扎带。

结果:

  • AI 研究员学会了自主解决这些任务,成功率高达 99%
  • 他们完成这些任务的速度比人类专家手动操作更快。
  • 扩展性: 当他们使用更多机器人时(从 1 台到 8 台),学习所需的时间显著下降。例如,“插针”任务从使用 1 台机器人的 1.5 小时缩短到使用 8 台机器人的 40 分钟。

5. 缺陷(局限性)

论文诚实地指出了缺点:

  • 资源浪费: 有时机器人在 AI “思考”或编写代码时会处于闲置状态。
  • 成本: 随着你增加更多的机器人,其“成本”(在计算能力和数据使用方面)增长速度超过了速度带来的收益。这就像雇佣 8 个人来做一份工作:他们完成得更快,但你必须支付 8 倍的薪水,而且有时他们花在互相交流上的时间比干活的时间还多。

总结

ENPIRE 是一个让 AI “科学家”在真实机器人上运行自身实验的系统。他们建立安全规则,观察结果,修复自己的代码,并作为一个团队协作,以掌握复杂的物理任务。它让我们从“机器人需要人类照看”转向了“机器人可以自我教学”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →