← 最新论文
💻 computer science

LEACL: LLM-Enhanced Automatic Curriculum Learning for Reinforcement Learning in Long-Horizon Manipulation Tasks

本文提出了 LEACL,这是一个利用大语言模型自动分解长程操作任务并生成必要规范的框架,使强化学习智能体能够通过仅使用稀疏奖励进行自动课程学习,而无需人工设计的稠密奖励函数,从而实现卓越的性能。

原作者: Faraz Heravi, James Ouyang, Zifan Xu, Arjun Kumar, Yoonchang Sung, Peter Stone

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Faraz Heravi, James Ouyang, Zifan Xu, Arjun Kumar, Yoonchang Sung, Peter Stone

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人制作一道复杂的菜肴,比如一份高级三明治。你不能只告诉机器人“做个三明治”,然后指望它能自己搞定切西红柿、抹面包黄油以及完美堆叠各层食材的过程。如果你只在最后阶段给机器人一个“做得好”或“做得差”的信号,它可能会在原地漫无目的地徘徊多年,永远学不会具体的步骤。这就是强化学习(Reinforcement Learning, RL)的世界——在这里,软件智能体通过试错来学习。其中的难点在于“稀疏奖励(sparse reward)”问题:如果机器人只有在任务100%完成后才能获得奖励,它就无法知道自己是在接近目标还是在远离目标。为了解决这个问题,科学家们经常使用课程学习(Curriculum Learning),这是一种让机器人先练习简单版本任务(比如仅仅是拿起面包),然后再过渡到更难的任务(比如切西红柿)的方法。但问题在于,设计这些由易到难的步骤通常需要人类专家手动编写每一个规则和难度设置,这既缓慢、枯燥,又难以为每一个新任务都这样做。

于是有了 LEACL(LLM增强型自动课程学习),一种提出了非常聪明问题的全新方法:“我们能否让一个超智能的AI语言模型来帮我们完成这些枯燥的规划工作?”这项研究背后的研究人员想要测试,是否可以使用大语言模型(LLM)——即驱动聊天机器人的那种技术——来充当一名“大师级教师”。与其由人类手动编写教学计划,不如让LLM阅读一个自然语言目标(例如“打开抽屉”),并自动将其分解为一系列更小、更易于管理的步骤。更棒的是,LLM随后还能为每个步骤设计具体的“辅助轮”(即难度设置和参数),从而让机器人仅通过简单的“成功/失败”信号就能学习,而无需为每一个微小的动作编写复杂的、手写的奖励指令。

该论文在五个棘手的机器人任务上测试了这一想法,例如打开橱柜抽屉、把碗放在盘子上或打开炉灶。结果非常令人振奋。研究人员发现,当他们让LLM来设计课程时,机器人学习这些长程复杂任务的速度和成功率都比直接尝试学习整个任务要快得多。事实上,由LLM设计的系统表现得与人类专家花费数小时手动构建训练步骤和奖励规则的系统一样出色,甚至有时更胜一筹。这项研究表明,通过让AI处理“教学计划”,我们可以教会机器人完成复杂的、多步骤的工作,而无需人类在训练过程中进行每一个细节的微观管理。

机器人的上学时光:LEACL 如何运作

把机器人学习一项长程任务(“长程”任务是指需要许多步骤才能完成的工作)想象成一名学生正在准备参加期末考试。如果老师只在最后才给出成绩,学生可能会学错重点或者干脆放弃。**自动课程学习(Automatic Curriculum Learning, ACL)**就像一位导师,他会制定一份教学大纲,从简单的问题开始,然后逐渐增加难度。但通常情况下,需要由人类来编写这份大纲。

LEACL 通过引入LLM作为“首席教师”改变了游戏规则。整个过程分为三个有趣的阶段:

  1. 任务分解(Task Decomposition):
    想象你告诉机器人:“打开橱柜顶部的抽屉。”人类可能会想:“好吧,这就是一个任务。”但LLM看了一眼后会说:“没那么简单!这实际上是三个任务:第一,伸手去够抽屉;第二,抓住把手;第三,向外拉开。”LLM利用其对世界运作方式的庞大知识储备(例如知道如果不握住把手就无法拉开抽屉),将大目标拆解为逻辑连贯的一系列子任务。它会将这些步骤记录在一种特殊的“配方语言”——PDDL中,以便机器人能够理解。

  2. 教学计划(Meta-Task Generation):
    现在机器人有了步骤,但它需要知道如何练习这些步骤。它是应该从抽屉微开的状态开始练习?还是从完全关闭的状态开始?把手应该离得近一点还是远一点?这再次展现了LLM的魅力。它扮演着创意课程设计师的角色,为每个步骤生成一个“任务空间”。它编写一段Python脚本,可以生成成千上万个略有不同的“抓取把手”任务版本。有些版本非常简单(把手就在机器人面前),而有些则较难(把手稍微远了一点)。LLM还会判断哪些版本比其他版本“更难”,从而为机器人搭建一个完美的难度阶梯。

  3. 练习(Automatic Curriculum Learning):
    最后,机器人开始训练。它使用一种算法来观察机器人的表现。如果机器人在执行“简单”版本的任务时表现出色,系统会自动切换到“中等”难度的版本。如果机器人遇到了困难,系统则会退回到简单的版本。机器人通过在每个子任务结束时仅使用一个简单的“1”(成功)或“0”(失败)来进行学习。它不需要人类告诉它:“做得好,你的手臂靠近了2英寸。”LLM预设的课程承担了引导机器人的所有重任。

结果:机器人通过测试了吗?

研究人员使用名为 LIBERO 的模拟器(他们将其升级到了 LIBERO+ 以处理这类新任务)对五个不同的挑战进行了测试。任务包括:

  • 打开底部的抽屉。
  • 把白色的碗放在盘子上。
  • 拿起番茄酱并放入篮子。
  • 打开炉灶并将锅放在上面。
  • 把马克杯放入微波炉并关上门。

他们将这个LLM驱动的系统(LEACL)与几种其他方法进行了对比:

  • “无所作为”法: 让机器人直接尝试学习整个过程,仅使用稀疏奖励。(剧透:它彻底失败了,在大多数任务上的成功率为0%)。
  • “无课程”法: 将任务分解,但让机器人在没有智能难度阶梯的情况下学习每个步骤。(这也失败得很惨,成功率接近0%或非常低)。
  • “人类专家”法: 由人类手动设计步骤和奖励函数(即给予机器人靠近目标的额外分数)。这通常被视为金标准。
  • “LEAGUE”法: 一种之前的技术,它使用LLM为每个步骤编写稠密的奖励函数(即复杂的评分规则)。

结果如下:
使用LLM设计课程但仅依赖简单的“成功/失败”信号的LEACL系统,在表现上优于那些尝试在没有课程的情况下学习的系统。更令人印象深刻的是,在五个任务中的四个任务上,它的表现优于 LEAGUE 系统(后者使用了复杂的、人工调优的奖励规则)。

从原始数据来看,LEACL系统实现了如99.8%(打开抽屉)和90.7%(把碗放在盘子上)这样的成功率。这些数字非常接近、甚至在某些情况下匹配了由人类专家手动设计的“人类课程”。例如,在“打开底部抽屉”的任务中,人类设计的系统得分为 99.8 ± 0.2%,而LEACL得到了 99.8 ± 0.1%。在“把马克杯放入微波炉”的任务中,人类系统的得分为 89.0 ± 7.5%,而LEACL为 75.9 ± 3.4%。

为什么这很重要(以及它的局限性)

核心结论是,设计复杂的奖励函数既困难且往往是不必要的。论文指出,试图给机器人一个“稠密”奖励(例如“你离目标近了,所以得0.5分”)其实是一个陷阱。这可能会误导机器人,使其优先考虑错误的目标,或者养成“粗糙”的习惯——即虽然接近了目标,但始终无法真正完成任务。通过让LLM处理学习的结构(课程),并让机器人从成功或失败的简单事实中学习,机器人能学到更精确、更可靠的技能。

然而,论文也谨慎地指出了几点限制。LLM仍然需要一个关于什么是可能的“词典”(一组预定义的规则或谓词)才能工作。它无法凭空创造新的物理法则或物体;它必须在模拟环境(如LIBERO+环境)的规则内运行。此外,虽然LLM表现出色,但在五个任务中的三个任务上,人类设计的课程仍略微领先,这表明即使LLM已经变得非常优秀,人类的直觉仍然发挥着作用。

简而言之,LEACL表明,我们不再需要亲自为机器人编写详细的说明书。我们只需给机器人一个目标,让AI语言模型去构思最佳的教学方式,然后看着机器人自发地学会完成复杂的、多步骤的工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →