← 最新の論文
🤖 machine learning

HERAKLES: Hierarchical Skill Compilation for Open-ended LLM Agents

HERAKLESは、達成可能なサブゴールを選択するための高レベルLLMポリシーと、成功した振る舞いを再利用可能なスキルへとコンパイルする低レベルコントローラーを組み合わせた階層型エージェントであり、部分観測かつ報酬が疎な環境において、効率的なオープンエンドの探索とスキルの構成を可能にします。

原著者: Thomas Carta, Clément Romac, Loris Gaven, Pierre-Yves Oudeyer, Olivier Sigaud, Sylvain Lamprier

公開日 2026-07-22
📖 1 分で読めます☕ さくっと読める

原著者: Thomas Carta, Clément Romac, Loris Gaven, Pierre-Yves Oudeyer, Olivier Sigaud, Sylvain Lamprier

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

自己学習するロボットの探求

コンピュータが人間によって書かれた厳格なレシピに従うだけでなく、自ら料理を作り、構築し、探索することを学び、日々賢くなっていく世界を想像してみてください。これは、人工知能における「オープンエンド学習(開かれた学習)」という夢です。長い間、AIは巨大な教科書を暗記しているものの、本に載っていない質問をされるとフリーズしてしまう学生のような存在でした。しかし、私たち人間は異なります。私たちは単に暗記するのではなく、スキルのライブラリを構築していきます。自転車の乗り方を学ぶとき、私たちは単にバランスを取る方法を学ぶのではありません。ペダルを漕ぐ、ハンドルを切る、ブレーキをかけるといった個別のツールを学び、それらを後で組み合わせてオートバイの乗り方を学ぶための道具として活用するのです。

これからお読みいただく論文は、この分野における特定の課題に取り組んでいます。それは、「どうすればAIエージェントに、行き詰まることなく永遠に学習し続けさせる方法か?」という問題です。その鍵となるアイデアは「階層的学習」です。これは、上司と部下がいる会社のようなものだと考えてください。上司(高レベルの脳)は重労働を行うのではなく、代わりに大きな、恐ろしいプロジェクトを、部下(低レベルの脳)が対処できる小さく管理可能なタスクへと分解します。部下はそれらのタスクを実行し、一度それらに習熟すると、それらのタスクは上司がたった一言の命令で指示できる「スキル」となります。この論文では、混沌とした新しい挑戦の山を、整理された整然とした能力のツールボックスへと自動的に変えていくロボットの構築方法を探求しています。


HERAKLESの物語:自らのツールボックスを構築するロボット

自己学習を続けるために設計された、新しいタイプのロボットの脳、HERAKLESを紹介します。あなたが広大で謎めいた森を征服しようとしている若い冒険者だと想像してください。最初は、一歩ずつしか進む方法を知りません。遠くの山に到達したい場合、あらゆるステップをゼロから考え出さなければならず、それは非常に疲れ、時間がかかります。最初の丘に到達する前に、疲れ果てて諦めてしまうかもしれません。

HERAKLESは、2つの明確な役割を持つスマートなチームとして機能することで、この問題を解決します。第一の役割は、非常に賢く言語に精通したAIである将軍(高レベル・ポリシー)です。第二の役割は、実際に体を動かし、アイテムを拾い上げる、高速で効率的なロボットである兵士(低レベル・ポリシー)です。

魔法がどのように起こるのか、その仕組みを見てみましょう:

1. 将軍が計画し、兵士が実行する
将軍が「石のピッケルを作る」という大きな目標を見たとき、一度にすべてをやろうとはしません。代わりに、将兵がすでに何ができるかを確認します。おそらく兵士は「木を伐る」ことや「テーブルを置く」ことを知っています。将軍は大きな目標を次のように分解します。「まず、木を伐れ。次に、テーブルを置け。最後に、ピッケルを作れ」。将軍はこれらの小さな命令を兵士に与えます。

2. 「スキルのコンパイル」のトリック
ここがHERAKLESの非常に巧妙な点です。兵士が「木を伐る」といったタスクを完了するたびに、将軍はそれをただ忘れるわけではありません。将軍はその一連の動き全体を取り込み、一つの再利用可能なスキルへと「コンパイル(編集・集約)」します。これは、兵士が自転車の乗り方を習得すると、突然、将軍が「ペダルを漕いで、ハンドルを切って、バランスを取って、またペダルを漕いで……」と言う代わりに、「川まで走れ」と言えるようになるようなものです。

ロボットが学習を進めるにつれ、そのスキルのツールボックスは成長していきます。将軍は、より大きく、より高度な「オプション」を利用できるようになります。家を建てるために100の小さなステップを踏む代わりに、将軍は「壁を作る」(兵士がすでに習得したスキル)と言ったり、「屋根を作る」(別の習得済みスキル)と言ったりするだけで済むようになります。これにより、ロボットはより速く、より効率的になります。

3. 安全フィルター
将軍は、兵士がまだ「できない」ことを知るほど賢明です。もし兵士がまだ「火を起こす」ことを学習していなければ、将軍はそれを命じることはありません。なぜなら、それは失敗と混乱を招くだけだからです。システムは特別な「能力チェッカー」を使用し、将軍に対して、兵士が成功する可能性が高い目標のみを提示します。これにより、学習プロセスがスムーズに保たれ、ロボットが不可能なタスクで行き詰まるのを防ぎます。

研究結果

研究者たちは、デジタル世界であるCrafter(資源を集め、生き残るためにアイテムを作成する必要がある、Minecraftの2D版のような世界)でHERKALESをテストしました。目的は、HERKALESが人間の教示なしに、時間の経過とともに、より困難なタスクを実行できるようになるかどうかを確認することでした。

彼らはHERKALESを他のAI手法と比較しました:

  • 「何でもこなそうとする」ロボット: 毎回ゼロからあらゆる小さなステップを学ぼうとするロボット。このロボットは、複雑なタスクの学習に時間がかかりすぎるため、すぐに停滞してしまいました。
  • 「凍結された脳」を持つロボット: スマートな脳を持っているものの、体のスキルは固定されており、新しい物理的なコツを一切学習しないロボット。
  • 「隠されたコード」を持つロボット: スキルを学習しようとするが、論理的な組み合わせが難しい、明確な言語ではなく秘密のコードを使用するロボット。

結果:
HERKALESは、長期的な観点で明確な勝利を収めました。他のロボットが簡単なタスク(木に向かって歩くなど)を学習した後に停滞した一方で、HERKLESは向上し続けました。トレーニングの終了時(ゲーム内での25万ステップ後)、HERKLESは石のピッケルのような複雑なアイテムを作成することを学習していましたが、他のロボットはまだ基本的なタスクで苦戦していました。

論文は、HERKALESが「サンプル効率」において非常に優れていること、つまり、より少ない試行回数でより多くを学習できることを示唆しています。また、驚異的な柔軟性も見せました。研究者がHERKALESに対し、「木を1つ集める」ではなく「木を4つ集める」といった、見たことのない指示を出したり、「木を集める」の代わりに「木を獲得する」といった類義語を使ったりしても、ほぼ毎回成功しました。また、「木のピッケル」を作ることを学んでいたことから、それを応用して「木の剣」を作る方法さえも理解することができました。

なぜこれが重要なのか

著者らは、この手法が、AIが真に自律的に成長し適応するための大きな一歩であると示唆しています。AIに自身のスキルのライブラリを構築させ、そのスキルを使ってさらに困難な課題に取り組ませることで、HERKALESは多くの他の学習システムを悩ませる「停滞」という問題を回避しています。

しかし、論文は限界についても認めています。現在、将軍はテキストのみを理解し、画像は理解できないため、世界を直接見ることはできません。また、システムは開始時に目標のリストを必要とし、目標自体を自ら発明することはありません。しかし、経験を「コンパイル」して、新しく再利用可能なスキルへと変えていくロボットという概念は、非常に強力なものです。それは、AIエージェントが単に過去を暗記するのではなく、終わりのない学習の未来に向けて基礎を積極的に築いていく未来を示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →