Training Language Agents to Learn from Experience
本論文は、言語エージェントが過去の相互作用から得た経験を再利用可能なシステムプロンプトに蒸留し、人間の監督なしにタスク横断的な自己改善と未見の環境への一般化を実現する、文脈内学習(ICT)フレームワークおよび強化学習に基づくパイプラインを導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
非常に賢いものの、少しお人好しのロボットにビデオゲームの遊び方を教えることを想像してみてください。
問題:「一度きり」の記憶喪失
現在、これらの AI ロボット(「言語エージェント」と呼ばれる)は、間違いから学ぶ能力に長けていますが、それは非常に限定的な方法に限られます。ゲームのレベルに失敗した場合、彼らは振り返って「ああ、間違った壁にぶつかった」と言い、すぐに再挑戦できます。彼らは「その特定のレベル」において上達します。
しかし、一度そのレベルをクリアすると、彼らはすべてを忘れてしまいます。少し異なる「新しいレベル」を与えられた場合、まるでそのゲームを一度もプレイしたことがないかのように振る舞います。彼らはゼロから教訓を再学習しなければなりません。これは、数学のテストのために一生懸命勉強して A を取った学生が、翌日の物理の授業に、まるで数字を見たことがないかのように入室するのと同じです。彼らは「周囲を常に確認する」ような一般的な教訓を、再利用可能なルールブックに「蒸留」することができません。
解決策:「コーチ」と「プレイヤー」
この論文の著者たちは、文脈内トレーニング(In-context Training: ICT) と呼ばれる新しいフレームワークを導入しました。これは二人組のチームのようなものです。
- プレイヤー(アクター): これがタスクを解決しようとするロボットです。ゲームをプレイし、間違いを犯し、何が起こったかの「リプレイ」を収集します。
- コーチ(リフレクター): これがプレイヤーのリプレイを観察する 2 番目の AI です。コーチの仕事はゲームをプレイすることではなく、プレイヤーのための新しい取扱説明書(システムプロンプト)を書くことです。
ここが魔法のようです。コーチは単に「その壁にぶつかるな」とは言いません。プレイヤーが試したさまざまなレベルのバッチを見て、共通のパターンを見つけ、プレイヤーが「将来、未見のレベル」で使えるような「一般的な」ルールを書き記します。
トレーニング:コーチングを学ぶ
大きな疑問はありました。コーチにこれらのより良いマニュアルの書き方を教えることができるでしょうか?
研究者たちは、人間の教師や事前に書かれた例を使用しませんでした。代わりに、「試行錯誤」ループ(強化学習)を使用しました。
- コーチがマニュアルを書きます。
- プレイヤーがそのマニュアルを使って、新しい未見のパズルのバッチを解決しようとします。
- プレイヤーがうまくいけば、コーチは「よくやった」というシグナルを受けます。プレイヤーが失敗すれば、コーチは「もう一度試せ」というシグナルを受けます。
- コーチはこのフィードバックから学び、次回さらに良いマニュアルを書くようにします。
結果:チェスから料理まで
チームは、非常に異なる 2 つの「ビデオゲーム」(シミュレーション環境)でこれをテストしました。
- ALFWorld: テキストベースの家で、ロボットは物体を見つけ、それを掃除し、特定の場所に置く必要があります(例:「じゃがいもを冷やして冷蔵庫に入れる」など)。
- MiniHack: グリッドワールドのゲームで、ロボットは迷路を navigations したり、食べ物を食べたり、魔法の杖を使ったりする必要があります。
彼らが発見したこと:
- コーチが賢くなった: 訓練を受けたコーチは、訓練を受けていないコーチよりもはるかに優れた取扱説明書を書くことができました。彼らは、異なる種類のパズルの例を見るだけで、プレイヤーに「未見の」新しい種類のパズルを解決する方法を教えることに成功しました。
- ゲーム間マジック: 驚くべき展開として、彼らはグリッドワールドゲーム(MiniHack)のみで訓練されたコーチを、家のゲーム(ALFWorld)のプレイヤーをコーチングするよう依頼しました。ゲームが全く異なっていたにもかかわらず、コーチは、コーチングを全く受けていないロボットよりもプレイヤーのパフォーマンスを向上させるマニュアルを書くことに成功しました。それは特定のゲームのルールだけでなく、「学ぶスキル」そのものを学んだのです。
- ターン数が増えるほど結果が良くなる: コーチがマニュアルを書く練習をする回数(より多くの「メタターン」を経る)が増えるほど、プレイヤーは上達しました。これは、コーチがトレーニング中に経験した練習ラウンドの数を超えても同様でした。
ツールキット:MetaGym
最後に、著者たちはMetaGymと呼ばれる無料のソフトウェアツールを公開しました。これは研究者向けの「レゴキット」と考えてください。これにより、誰でも簡単に独自の「コーチ対プレイヤー」トレーニング環境を構築し、自分の AI が経験から学習できるかどうかをテストすることができます。
要約
この論文は、AI エージェントが「記憶喪失」を止めるように訓練できることを証明しています。プレイヤーの経験を見守り、将来のためのより良いルールを書くコーチを使用することで、AI は新しい未見の課題に適用できる一般的な教訓を学習できます。これは、1 つの地図を暗記するロボットと、あらゆる地図の読み方を学ぶロボットの違いです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。