HERAKLES: Hierarchical Skill Compilation for Open-ended LLM Agents
HERAKLES 是一个分层智能体,它结合了用于选择可实现子目标的、高层 LLM 策略,以及将成功行为编译为可重用技能的底层控制器,从而在部分可观测且奖励稀疏的环境中实现高效的开放式探索与技能组合。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
寻找自我教学机器人的征途
想象一个这样的世界:计算机不再仅仅是遵循人类编写的严格食谱,而是学会了如何自主烹饪、建造和探索,并且每天都变得更加聪明。这就是人工智能领域中“开放式学习”(open-ended learning)的梦想。长期以来,AI 就像是一个只会死记硬背巨型教科书的学生,一旦遇到书本之外的问题就会不知所措。然而,真正的人类却不同。我们不只是记忆,我们是在构建技能库。当我们学习骑自行车时,我们不仅学会了平衡,还学会了踩踏、转向和刹车——这些都是我们可以稍后组合并用于学习驾驶摩托车的独立工具。
你即将阅读的这篇论文探讨了该领域的一个特定问题:我们如何教一个 AI 智能体在永无止境的学习过程中不陷入停滞?其核心思想是“分层学习”(hierarchical learning)。你可以把它想象成一家拥有老板和员工的公司。老板(高层大脑)并不负责繁重的体力活;相反,他们负责将宏大且艰巨的项目分解成更小、更易于管理的任务交给员工(底层大脑)。员工执行这些任务,而一旦他们精通了这些任务,这些任务就会变成老板可以用一个词语就能下达指令的“技能”。这篇论文探讨了如何构建一个能够自动实现这一过程的机器人,将混乱的新挑战转化为一个整洁、有序的能力工具箱。
HERAKLES 的故事:构建属于自己的工具箱的机器人
认识一下 HERAKLES,一种旨在成为终身学习者的全新机器人大脑。想象你是一名试图征服一片巨大且神秘森林的年轻冒险家。起初,你只知道如何一步一步地走。如果你想到达远处的山峰,你必须从头开始摸索每一步,这既累又慢。你可能会在到达第一座小山之前就感到疲惫并放弃。
HERAKLES 通过扮演一个由两个截然不同的角色组成的智能团队来解决这个问题。第一个角色是将军(高层策略),它是一个非常聪明、擅长语言处理的 AI。第二个角色是士兵(底层策略),它是一个快速、高效的机器人,负责实际移动身体和拾取物品。
以下是神奇之处是如何发生的:
1. 将军规划,士兵执行
当将军看到一个巨大的目标,如“制作石镐”时,他们不会试图一次性完成它。相反,他们会观察士兵已经掌握了哪些能力。也许士兵已经学会了“砍木头”和“放置桌子”。将军会将大目标分解为:“首先,砍木头。然后,放置桌子。最后,制作石镐。”将军向士兵下达这些较小的指令。
2. “技能编译”技巧
这是 HERAKंखला 最聪明的地方。每当士兵成功完成一项任务(如“砍木头”)时,将军并不会仅仅将其忘掉。他们会将整套动作序列“编译”成一个单一的、可重复使用的技能。这就像士兵学会了骑自行车,突然之间,将军只需要说“骑到河边”,而不需要说“踩踏、转向、平衡、踩踏、转向……”
随着机器人的学习,它的技能工具箱也会不断增长。将军开始可以使用越来越大的“选项”。与其通过 100 个微小的步骤来盖房子,将军可能只需说“造一面墙”(一个士兵已经掌握的技能)和“造一个屋顶”(另一个掌握的技能)。这使得机器人变得更快、更高效。
3. 安全过滤器
将军足够聪明,知道士兵目前不能做什么。如果士兵还没有学会“生火”,将军就不会要求他们去做,因为那只会导致失败和混乱。系统使用一种特殊的“能力检查器”,只向将军提供那些士兵有成功机会完成的目标。这保持了学习过程的平滑,并防止机器人卡在不可能完成的任务上。
研究发现
研究人员在名为 Crafter 的数字世界中测试了 HERAKLES,这是一个类似于 2D 版《我的世界》的游戏,你需要收集资源并制作物品以生存下去。目标是观察 HERAKLES 是否能在不需要人类每一步进行指导的情况下,随着时间的推移学会越来越难的任务。
他们将 HERAKLES 与其他 AI 方法进行了对比:
- “全能型”机器人: 一种每次都试图从零开始学习每一个微小步骤的机器人。这个机器人很快就陷入了停滞,因为复杂的任务学习起来耗时过长。
- “冻结大脑”机器人: 一个拥有聪明大脑但身体技能固定不变、永远无法学习新物理技巧的机器人。
- “隐藏代码”机器人: 一个尝试学习技能但使用秘密代码而非清晰语言的机器人,这使得逻辑组合技能变得困难。
结果:
HERAKLES 是长期的绝对赢家。虽然其他机器人很快就在学习了一些简单任务(如走到树旁)后就卡住了,但 HERAKLES 却在不断进步。在训练结束时(在游戏中经过 250,000 步后),HERAKLES 已经学会了制作像石镐这样复杂的物品,而其他机器人还在为基础任务苦苦挣扎。
论文指出,HERAKLES 在“样本效率”(sample efficiency)方面表现得更好,这意味着它能从更少的尝试中学习更多。它还展现出了惊人的灵活性。当研究人员要求 HERAKLES 执行它从未见过的任务时,例如“收集 4 块木头”而不是仅仅“收集木头”,或者使用同义词如“获取木头”而不是“收集木头”时,它几乎每次都能成功。它甚至可以通过意识到“木剑”与它已经学会制作的“木镐”非常相似,从而学会如何制作“木剑”。
为什么这很重要
作者认为,这种方法是创造能够真正自主成长和适应的 AI 的一大进步。通过让 AI 构建自己的技能库,并利用这些技能来应对更具挑战性的任务,HERAKLES 避免了困扰许多其他学习系统的“停滞感”。
然而,论文也承认存在局限性。目前,将军只能理解文本而不能理解图像,因此它无法直接“看到”世界。此外,系统需要一个初始的目标列表;它目前还不会自己发明目标。但这种可以让机器人将自己的经验“编译”成新的、可重复使用技能的想法是一个强大的概念。它预示着这样一个未来:AI 智能体不仅仅是记忆过去,而是积极地为无尽的学习未来奠定基础。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。