← 最新论文
🤖 machine learning

Unsupervised Hierarchical Skill Discovery

本文提出了一种基于语法的无监督方法,用于在像《我的世界》这样的高维环境中对轨迹进行分割并发现分层技能结构,结果表明所生成的具有语义意义的分层结构优于现有基线方法,并能加速下游强化学习。

原作者: Damion Harvey, Geraud Nangue Tasse, Benjamin Rosman, Branden Ingram, Steven James

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Damion Harvey, Geraud Nangue Tasse, Benjamin Rosman, Branden Ingram, Steven James

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和生动的类比对论文《无监督分层技能发现》(HiSD)的解释。

核心难题:“盲”机器人

想象一下,你正在教一个机器人玩像《我的世界》(Minecraft)这样的电子游戏。通常,要教机器人,你需要告诉它具体按哪些按钮(动作),并告知它何时表现良好(奖励)。

但如果只有一段人类玩游戏的视频呢?你能看到人类在做什么,却不知道他们具体按了哪些键,也没有记分牌告诉他们何时成功了。目前大多数人工智能方法就像是一个需要老师站在旁边、指着屏幕说“现在按'A'键!”或“刚才那步走得好!”的学生。

这篇论文的作者希望构建一种机器人,它只需观看视频就能学习,无需老师、无需按键标签,也无需记分牌。

解决方案:HiSD(“智能剪辑师”)

作者创建了一个名为HiSD(分层技能发现)的系统。把 HiSD 想象成一个智能视频剪辑师,它观看一段漫长且杂乱的游戏视频,并试图自行理清故事结构。

它主要通过两个步骤来实现:

步骤 1:将电影切割成场景(技能分割)

想象一段漫长且连续的视频,记录着某人建造房屋的过程。这只是一连串移动的像素。

  • 挑战:计算机如何知道“收集木材”何时结束,“建造墙壁”何时开始?
  • HiSD 的窍门:HiSD 寻找视觉模式。它注意到,当角色砍树时,屏幕呈现出某种样子(大量的绿色和棕色);当他们在建造时,画面则截然不同(大量的灰色和木头纹理)。
  • 类比:这就像看电影时意识到:“好了,他们从僵尸逃跑的场景结束了;现在他们躲在地下室里的场景开始了。”HiSD 自动将长视频切割成短小且有意义的“片段”或技能(如“获取木材”、“制作工作台”、“开采石头”)。

步骤 2:寻找食谱书(分层发现)

一旦 HiSD 将视频切割成片段,它就得到了一份动作清单:获取木材、获取木材、制作工作台、获取石头、获取石头、制作镐子。

  • 挑战:仅仅拥有一份片段清单是不够的。机器人需要理解“获取木材”和“制作工作台”经常一起发生,以达成一个更大的目标:“建造房屋”。
  • HiSD 的窍门:HiSD 使用一种语法(类似于语言规则)。它寻找重复的模式。如果它一遍又一遍地看到“获取木材”后跟着“制作工作台”,它就会创建一个新的高级规则,称为“准备建造”。
  • 类比:想象一位厨师在学习烹饪。
    • 第 1 层(低层):切洋葱、烧水。
    • 第 2 层(高层):“制作酱汁”。
    • 第 3 层(超高层):“制作意面菜肴”。
      HiSD 自动推断出“切洋葱” + “烧水” = “制作酱汁”,并构建一个树状结构(分层结构),展示小动作如何组合成大目标。

为什么这很特别?

大多数其他人工智能方法需要大量帮助:

  • 它们需要知道人类按下的确切按钮
  • 它们需要预先知道任务的顺序
  • 它们通常只是生成一个扁平的技能列表(A,然后 B,然后 C),而不理解 A 和 B 属于一个更大的组。

HiSD 的不同之处在于:

  1. 它是“无监督”的:它需要标签。它只需观看原始视频。
  2. 它是“分层”的:它看到的不仅仅是一个列表,而是结构。它理解某些技能是更大技能的“子程序”。
  3. 它适用于高难度游戏:作者在 Craftax 和完整未修改版的 Minecraft 上测试了这一点。这些是拥有数千种可能动作的复杂游戏。HiSD 仅通过观察屏幕就成功识别出了技能。

结果:它真的有用吗?

作者并没有止步于发现技能,他们还测试了这些技能是否实用。

  • 测试:他们拿 HiSD 发现的“食谱书”(分层结构),交给一个新的 AI 智能体去学习一项任务。
  • 结果:与试图从头学习或使用其他方法的智能体相比,使用 HiSD 发现结构的 AI 智能体学习快得多且更稳定。
  • 隐喻:想象一下学习开车。
    • 没有 HiSD:你被告知的指令是“移动脚、转动方向盘、看左边、移动脚、转动方向盘……"(原始动作)。学会它需要很长时间。
    • 有 HiSD:你被教导“开车去商店”。你已经从视频中知道了如何“转动方向盘”和“移动脚”。你只需要学习如何将它们组合起来。你只需极短的时间就能掌握这项任务。

总结

这篇论文提出了一种方法,通过观看某人执行复杂任务的视频,自动推断出:

  1. 单个“动作”是什么(技能)。
  2. 这些动作如何被分组为更大的“目标”(分层)。

它无需任何人类帮助、无需按键标签,也无需记分牌。其结果是一张任务的“心理地图”,能帮助其他 AI 智能体更快地学习相同的任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →