← 最新の論文
🤖 machine learning

Goal-Conditioned Agents that Learn Everything All at Once

本論文は、すべてのゴールに対して価値と行動を同時に出力することで、ゴール条件付き強化学習における効率的かつ並列的な全ゴールオフポリシー更新を可能にし、従来のリレーベル技術に比べて大幅な性能向上と劇的な高速化を実現する「Learning Everything all at Once(LEO)」という手法を導入する。

原著者: Michael Matthews, Matthew Jackson, Michael Beukman, Thomas Foster, Alistair Letcher, Scott Fujimoto, Cédric Colas, Jakob Foerster

公開日 2026-05-25
📖 1 分で読めます☕ さくっと読める

原著者: Michael Matthews, Matthew Jackson, Michael Beukman, Thomas Foster, Alistair Letcher, Scott Fujimoto, Cédric Colas, Jakob Foerster

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大で常に変化する迷路をロボットにナビゲートさせることを想像してください。このタスクを従来の方法(ゴール条件付き強化学習と呼ばれる)で行う場合、あなたはロボットに「キッチンへ行きなさい」といった具体的な指示を与えます。ロボットはうろうろと歩き回り、壁にぶつかり、やがてもしかしたらキッチンを見つけるかもしれません。

ロボットが完了すると、教師はその歩いた経路を確認します。もしロボットにキッチンへ行くよう指示されたのに、途中で偶然図書館を通り過ぎてしまった場合、従来の方法は「その図書館の部分は間違いだ;捨ててしまえ。私たちが気にしているのはキッチンだけだ」と言います。

問題点: これは情報の無駄です!ロボットはキッチンを見つけるために図書館について多くを学んだのです。そのデータを捨ててしまうことで、もし将来ロボットに図書館へ行くよう指示した際、ロボットは図書館について再び学び直す必要があります。

従来の「修正法」(ヒンズト経験再生):
以前、研究者たちはこの問題を修正しようと、ロボットの経路を見て、「ああ、結局図書館に着いたね!では、最初から図書館へ行きたかったことにしよう」と言う試みを行いました。これは少しは役立ちますが、映画を鑑賞した後に全体を再ラベル付けしようとするようなものです。遅く、一度に扱える結末の数も限られています。

新しい解決策:「すべてを同時に学習する」(LEO)
この論文の著者たちは、より賢い方法を提案しています。ロボットに一つずつゴールを教えていく代わりに、すべての可能なゴールを同時に学習する「スーパーブレイン」を構築します。

これを、壮大な宴会の料理を作るシェフに例えてみましょう。

  • 従来の方法: シェフは一品(キッチン)を作り、味見をし、玉ねぎを切った際のメモを捨ててから、次の一品(図書館)を作るために最初からやり直します。
  • LEO の方法: シェフは一度に宴会全体を調理します。512 種類の異なるレシピ(ゴール)が書かれた巨大なボードを持っています。玉ねぎを切る瞬間、彼らは512 種類すべてのレシピに対して知識を即座に更新します。「おい、玉ねぎを切る作業はスープ、シチュー、サラダのすべてに役立つんだ!」と気づくのです。

技術的な仕組み(しかしシンプルに):
通常、コンピュータネットワークは「この特定のゴールにとって最適な動きは何だろう?」と問います。
LEO はネットワークを変更し、「今、すべてのゴールにとって最適な動きは何だろう?」と問うようにします。それは、すべての可能な目的地に対する答えを、単一のパスで巨大なリストとして出力します。これにより学習は驚くほど高速になります(従来の「再ラベル付け」方法の 250 倍以上)。なぜなら、ロボットは同じ旅を何百回も再生する必要がないからです。

欠点:「遅延融合」の問題
著者たちは小さな欠陥を発見しました。ロボットはすべてのゴールを同時に考えなければならないため、混乱することがあるのです。これは、500 種類の異なる試験を全く同じ瞬間に勉強しようとする学生のようなものです。彼らは資料の全体的な感覚を得るかもしれませんが、その一つの試験だけ勉強した学生ほど、特定の質問に鋭く答えることはできないかもしれません。

論文において、これは LEO が難しく複雑なゴールの解決には優れていましたが、焦点が「希釈」されていたため、単純なゴールにおいては時として劣ることを意味しました。

究極の修正:「デュアル LEO」(教師 - 学生システム)
これを解決するために、著者たちはチーム編成を作成しました。

  1. 教師(LEO): このネットワークは「データのスポンジ」です。多少乱雑であっても、すべてについてすべてを学習します。それは世界の概略図を提供します。
  2. 学生(標準ネットワーク): このネットワークは専門家です。現在求められている特定のゴールにのみ焦点を当てます。

教師は学生に言います。「ねえ、完璧ではないかもしれないけど、図書館への大まかな方向は知っているよ。ヒントをあげよう」。学生はそのヒントを受け取り、それを洗練させて、図書館へ到達する専門家になります。

結果
チームは、Craftax(マインクラフトに少し似た)と呼ばれる複雑なビデオゲームと、いくつかのロボット動作タスクでこれをテストしました。

  • 512 種類の異なるゴールを持つ大規模で困難なバージョンのゲームにおいて、新しいデュアル LEO法は明確な勝者となり、他のすべての方法を凌駕しました。
  • それははるかに速く学習し、他の方法が諦めていた多様なタスクを処理できました。
  • また、これはビデオゲームのステップだけでなく、ロボットアームが滑らかに動くような連続的な動作にも機能することを示しました。

まとめ
この論文は、AI が一つずつではなく、同時にすべての可能な問題を解決することを学習する方法を導入しています。それが広範になりすぎて焦点を失う場合、彼らはその広範な知識をガイドとして利用する専門家である「学生」ネットワークとペアリングします。これにより、ロボットやゲームプレイ AI は、以前よりもはるかに速く、効率的に膨大な量の情報を学習できるようになります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →