← 最新の論文
🤖 machine learning

ASH: Agents that Self-Hone via Embodied Learning

原著者: Benjamin Schneider, Xavier Schneider, Victor Zhong, Sun Sun

公開日 2026-05-15
📖 1 分で読めます☕ さくっと読める

原著者: Benjamin Schneider, Xavier Schneider, Victor Zhong, Sun Sun

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが『ポケットモンスター』や『ゼルダの伝説』のような、非常に長く複雑なビデオゲームの遊び方を学ぼうとしていると想像してください。ただし、取扱説明書も、先生も、どのボタンを押すべきかを教えてくれる人もいないとします。このように学ぼうとするほとんどのコンピュータプログラムは、数時間後に行き詰まってしまいます。なぜなら、それらは人間が慎重にラベル付けした膨大なデータや、事前に書かれたルールに依存しているからです。

この論文は、ASH(Embodied Learning による自己研鑽を行うエージェント)と呼ばれる新しいシステムを紹介しています。ASH を単にスクリプトに従うロボットとしてではなく、Google の使い方を心得た「好奇心旺盛な人間のプレイヤー」として考えてみてください。

ASH の仕組みを、簡単なステップに分解して説明します。

1. 「行き詰まる」瞬間

ASH はゲームをプレイし始めます。それは、過去 30 秒間に何があったかという短期記憶と、以前に見た重要な瞬間を覚えている長期記憶を持っています。ASH は、壁にぶつかるまでプレイを続けます。例えば、モンスターとの戦い方がわからない、あるいは迷路でどの道を進めばよいかわからないといった状況です。論文の用語では、これが「行き詰まる」状態です。

2. 「Google 検索」

ASH が行き詰まっても、諦めません。代わりに、画面で見た直後の状況を基に、インターネット(具体的には、膨大な YouTube 動画のコレクション)に出て、他の人がそのゲームをプレイしている様子を探します。ASH は、現在行き詰まっている瞬間と全く同じように見える動画を検索します。

3. 「賢いフィルター」

インターネットはノイズで溢れています。ASH は無作為な動画を視聴するのではなく、重要な瞬間を見つけるための特別なツールを使用します。例えば、誰かが 20 時間もの間ゲームをプレイしている動画を見たとしましょう。ボス戦の攻略法を学ぶために、動画全体を見る必要はありません。戦略を考え出した 30 秒間の特定の瞬間を見るだけで十分です。ASH は自動的にこれらの「ハイライト集」を見つけ出し、それを長期記憶に保存します。

4. 「逆工学」

ここが難しい部分です。ASH が見つけたインターネット上の動画は、通常、画面しか映しておらず、ボタン操作は映っていません。ASH には「翻訳機」(逆動力学モデルと呼ばれる)があり、動画を見て、「さて、この画面からあの画面へ進むには、プレイヤーは'A'ボタンを押してから'上'ボタンを押したに違いない」と推測します。これにより、無音の動画が指示のセットに変換されます。

5. 「自己改善」ループ

次に、ASH はその新しい指示を取り入れて練習します。ASH は自身の脳(方策)を更新し、次回行き詰まったときに何をすべきかを知るようにします。その後、再びゲームをプレイします。もし後で別の問題に行き詰まったら、このプロセス全体を繰り返します。行き詰まる、インターネットで検索する、コツを学ぶ、そして続ける。

結果:なぜ重要なのか

研究者たちは、ASH を非常に異なる 2 つのゲームでテストしました。

  • 『ポケットモンスター エメラルド』: 移動し、モンスターを捕まえ、戦う戦略的なゲーム。
  • 『ゼルダの伝説 神の三角神力』: 走り、飛び、パズルを解き、リアルタイムで敵と戦うアクションゲーム。

彼らは、ASH を他の AI 手法と比較しました。

  • 「教科書」学習者: これらのシステムは、事前にラベル付けされた膨大な移動データから学習しようとしました。しかし、以前に見たことのない新しい状況に対応できなかったため、早期に行き詰まりました。
  • 「天才」モデル: これらは訓練なしで答えを推測しようとする巨大な AI モデルです。これらはしばしば「幻覚」(事実を捏造すること)を起こし、壁にぶつかったり、存在しないキャラクターと話したりします。
  • ASH: ASH は絶えず向上し続けました。他のシステムが約 6 時間後に進捗を停止したのに対し、ASH は 8 時間継続し、戦闘、モンスター捕獲、パズル解決などの新しいスキルを学びました。ASH は、両方のゲームにおけるほぼすべての主要な目標を達成しました。

全体像

この論文は、ASH が、AI に長く複雑なタスクを教えるために、人間が報酬システムを作成したり、すべての動画をラベル付けしたりする必要がないことを証明していると主張しています。その代わりに、AI に行き詰まり、インターネットで助けを探し、そこから学ぶ能力を与えれば、AI は自らを教え、長く開放的な冒険を習得できるのです。

これは、マニュアルを書くことで子供に自転車に乗ることを教えるのではなく、子供に転ばせ、誰かが乗っている動画を見せ、そして再び挑戦させるようなものです。ASH は、複雑なビデオゲームにおいて、このループを自動的に成功させる最初のシステムです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →