← 最新论文
💻 computer science

CRAFT: Coaching Reinforcement Learning Autonomously using Foundation Models for Multi-Robot Coordination Tasks

该论文提出了 CRAFT,这是一个利用大语言模型将复杂的多机器人协作任务自主分解为子任务,并利用视觉语言模型来优化奖励函数,从而在无需人工设计奖励的情况下实现协作行为的有效学习与现实世界迁移的框架。

原作者: Seoyeon Choi, Kanghyun Ryu, Jonghoon Ock, Negar Mehr

发布于 2026-06-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Seoyeon Choi, Kanghyun Ryu, Jonghoon Ock, Negar Mehr

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教两只狗进行一场复杂的舞蹈表演,比如在不互相碰撞的情况下穿过一道窄门,或者一起抬起一个沉重的锅而不洒出汤。

如果你只是把它们扔进房间并说:“做起来!”它们很可能会感到困惑、互相绊倒,并且永远学不会。这就是加州大学伯克利分校的研究人员在面对机器人时所面临的问题。他们希望机器人能够协同工作,但标准的计算机训练方法失效了,因为任务太长、太复杂,而且机器人之间无法通过“交谈”来提前规划。

CRAFT 登场了。

把 CRAFT 想象成一个超级聪明、由 AI 驱动的教练,它不仅仅是在观察机器人,它还在积极地教它们如何学习。以下是这个“教练”的工作原理,分为简单的步骤:

1. 教练将大任务分解为小练习(课程生成)

想象一位足球教练。他们不会立刻告诉新球队:“去赢得世界杯!”相反,他们会将其拆解:“今天,我们练习传球。明天,我们练习射门。下周,我们练习防守。”

CRAFT 使用大语言模型(LLM)——一种非常擅长理解语言和逻辑的 AI 类型——来充当这个教练。当面对一个宏大且困难的任务(如“两个机器人必须穿过一道门”)时,教练会将其分解为一系列更小、更容易的步骤:

  • 第 1 步: 只学习如何在不撞到门的情况下行走。
  • 第 2 步: 学习如何走过那道门。
  • 第 3 步: 学习如何协作,让其中一个等待,另一个通过。

2. 教练编写游戏规则(奖励生成)

在机器人训练中,机器人通过通过做正确的事获得“分数”(奖励)以及因做错事而失去分数来学习。通常情况下,人类必须编写这些规则,而这非常困难。

CRAFT 的教练使用 AI 来为每个小练习编写评分规则。

  • 示例: 对于“走过门”这个练习,AI 会写下一条规则,说:“如果你靠近门,你会获得分数,但如果你撞到门,你会失去分数。”
  • AI 会将这条规则写成机器人可以理解的计算机代码。

3. 教练观察并进行点评(策略评估)

一旦机器人开始尝试练习,一个视觉语言模型(VLM)——一种能够“看到”视频并理解正在发生什么的 AI——就会观察这些机器人。它扮演着裁判的角色。

  • 它们成功了吗? 如果成功了,教练会说:“做得好!让我们进入下一个练习。”
  • 它们失败了吗? 如果它们碰撞或卡住了,裁判并不仅仅是说“失败”。它会查看视频和得分历史,以弄清楚为什么失败。也许机器人太专注于保持平衡,而忘记了向前移动。

4. 教练调整规则(奖励优化)

这是神奇之处。如果机器人失败了,教练并不会放弃。

  • “裁判 AI”会给出建议:“机器人在平衡方面得到了太多分数,而在向前移动方面得到的太少。移动的规则需要更强一些。”
  • “教练 AI”接收这个建议,并重写评分规则以解决问题。
  • 机器人再次尝试。它们不断重复这个循环(尝试 -> 观察 -> 修改规则 -> 再次尝试),直到掌握那个特定的练习。

结果:从模拟到现实

研究人员在两个主要挑战上测试了这一点:

  1. 四足机器人导航: 两台四足机器人(类似于狗)学习在不发生碰撞的情况下穿过窄门。
  2. 双臂操作: 两只机械臂学习共同抬起一个沉重的锅,同时保持水平。

发生了什么?

  • 在没有这个教练的情况下,其他方法要么失败了,要么学到了奇怪、不自然的动作(例如为了得分而以不可能的方式扭曲关节)。
  • 有了 CRAFT,机器人学会了平滑地协作。它们先学习基础知识,然后逐步过渡到高难度任务。
  • 现实世界测试: 最棒的部分是,研究人员将他们在计算机模拟中训练好的机器人,应用到了真实的物理机器人(Unitree Go1 和 Go2)上。无需任何额外调整,这些机器人在现实世界中成功地穿过了门,证明了这种训练在模拟环境之外同样有效。

总结

CRAFT 就像是一个耐心且聪明的机器人导师。它不再仅仅寄希望于机器人能自行摸索复杂的团队协作,而是:

  1. 将大任务简化为小步骤。
  2. 为每一步创建定制化的规则。
  3. 观察机器人并在出错时修正规则。
  4. 引导它们从简单的练习过渡到复杂的协作,最终使它们能够完成通过其他方式无法学会的现实任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →