← 最新の論文
🤖 AI

PEAM: Parametric Embodied Agent Memory through Contrastive Internalization of Experience in Minecraft

PEAM は、遅い熟考的推論と速い反射的実行という二重システム・アーキテクチャを活用して、推論時の検索からパラメータ内蔵のスキルへと記憶を変換するマインクラフトにおける具身エージェントのための新規フレームワークであり、失敗は対照学習のための重要な訓練信号として機能し、自己発動メカニズムが経験の内在化のタイミングを自律的に決定することで、破滅的忘却なしに継続的学習を可能にする。

原著者: Yuchen Guo, Junli Gong, Hongmin Cai, Yiu-ming Cheung, Weifeng Su

公開日 2026-05-28
📖 1 分で読めます☕ さくっと読める

原著者: Yuchen Guo, Junli Gong, Hongmin Cai, Yiu-ming Cheung, Weifeng Su

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに『Minecraft』をプレイさせることを想像してください。現在、ほとんどのロボットは、何も暗記しない生徒のように学習します。ゾンビと遭遇するたびに、あるいはかまどを作る必要があるたびに、彼らは立ち止まり、過去の経験が記された巨大なノートを開き、類似の事例を検索し、それを読み、次に何をすべきか考えなければなりません。これは遅く、多くの「脳のスペース」(コンピュータメモリ)を消費し、ノートが大きくなりすぎると混乱を招きます。

PEAM(Parametric Embodied Agent Memory)は、ロボットが学習する新しい方法であり、ゲームのルールを変えます。単にノートを保管する代わりに、PEAM はロボットが経験を内面化するのを助けます。「私はこれをどうやったかを覚えている」を「私はこれをどうやるかを知っている」に変えるのです。

以下に、その仕組みを簡単な概念に分解して説明します。

1. 二つの脳システム:考える者と実行する者

PEAM は、「遅い」脳と「速い」脳が連携して機能します。

  • 遅い考える者(Deliberative LLM): これは専門的なプランナーです。深く考え、コードを書き、複雑な手順を計画し、難しい問題の解決を試みます。失敗した場合は、その「理由」を特定し、再挑戦します。
  • 速い実行する者(Parametric Skills): これは反射的な筋肉記憶です。遅い考える者が問題(例えば剣の作成)を解決すると、単にその出来事を保存するのではなく、速い実行する者にそのスキルを直接教えます。次回からは、速い実行する者が遅い考える者に尋ねることなく、瞬時に実行できます。

2. 「内面化」のプロセス:ノートから筋肉記憶へ

自転車に乗ることを学習することを想像してください。最初は、バランスを取る、ペダルを漕ぐ、ハンドルを切ることを考えなければなりません(遅い考える者)。やがて、考えずにただ「行う」ようになります(速い実行する者)。PEAM はこれをロボットのために自動化します。

  • 失敗からの学習: ほとんどのロボットは間違いを無視するか、単にテキストノートとして記録します。PEAM は失敗をトレーニング信号として扱います。「失敗した試行」とそれを修正した「修正策」を照合し、ロボットに教えます。「X(失敗)をするな;Y(修正)を行え」と。これはコーチが「左に傾きすぎたから転んだ;次は右に傾け」と言うのと同じです。
  • 「価値」スコア: ロボットは「すべて」を学習するわけではありません。「パラメータ化の価値(Parameterization-Worthiness)」と呼ばれるフィルターがあり、「このスキルは暗記するほど有用か?安定しているか?頻繁に行うものか?」と問いかけます。答えが「はい」であれば、それは内面化されます。もし一時的な出来事であれば、ノートのまま残ります。

3. 「専門ジム」(分離されたアダプター)

これが「忘却」を防ぐための、この論文における最大の革新です。
クラフト室戦闘室農業室など、異なる部屋があるジムを想像してください。

  • 従来のシステムでは、戦闘を学習することが、クラフトの仕方を誤って上書きしてしまう可能性があります(まるでジムウェアを混同してしまうように)。
  • PEAM では、ロボットには物理的に隔離された部屋アダプターと呼ばれます)があります。戦闘を学習する際、それは「戦闘室」のみを更新します。「クラフト室」は手つかずのままです。これにより、ロボットは古いスキルを忘れることなく、新しいスキルを永遠に学習できます。

4. 自己起動の目覚まし時計

ロボットは、いつ練習を止め、暗記を開始すべきかを知るのでしょうか?

  • 従来の方法: 「100 回練習してから暗記する」。これは硬直的であり、早すぎたり遅すぎたりして暗記してしまう可能性があります。
  • PEAM の方法: ロボットには自己起動の目覚まし時計があります。それは自身の失敗率を観察します。特定のタスクで通常よりも頻繁に失敗し始めると、アラームが鳴ります。「おい、これで苦労しているぞ。すぐに停止して、解決策を内面化しよう」。これは、人間が特定の数を設定する必要なく、どんなタスクであっても機能します。

なぜこれが優れているのか?

この論文は『Minecraft』でこれをテストし、3 つの主な利点を発見しました。

  1. 速度: ロボットが毎回ノートを検索する必要がないため、行動が大幅に速くなります(テストでは約 40% 速い)。
  2. 効率: 古い話を再読する必要がないため、コンピュータパワーの消費が大幅に減ります(処理する「テキスト」が約 85% 少ない)。
  3. 忘却なし: 「専門の部屋」のおかげで、新しい戦闘ムーブを学習しても、家の作り方を忘れることはありません。

まとめ

PEAM は、すべての質問に対して教科書に頼る生徒を、実際にスキルを暗記した専門家へと変えるようなものです。これは、行うことで学び、間違いから学び、スキルを混同しないように分離して保持し、練習を止め記憶を開始するタイミングを正確に知ります。その結果、より速く、より賢く、学習したことを忘れないロボットが生まれます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →