← 最新の論文
🤖 AI

Improving Language Agents through BREW: Bootstrapping expeRientially-learned Environmental knoWledge

本論文は、新たなExpand-and-Gatherモンテカルロ木探索アルゴリズムと事後ラベル付けを用いることで、過去の相互作用の軌跡を自然言語によるレシピという構造化された検索可能な知識ベースへと蒸留することにより、LLMベースのエージェントを強化するフレームワークであるBREWを紹介しており、その結果、複数のベンチマークにおいてタスク成功率と実行効率の大幅な向上を実現している。

原著者: Shashank Kirtania, Param Biyani, Priyanshu Gupta, Yasharth Bajpai, Roshni Iyer, Sumit Gulwani, Gustavo Soares

公開日 2026-07-13
📖 1 分で読めます☕ さくっと読める

原著者: Shashank Kirtania, Param Biyani, Priyanshu Gupta, Yasharth Bajpai, Roshni Iyer, Sumit Gulwani, Gustavo Soares

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたには、ボタンをクリックしたり、ファイルを開いたり、あなたと会話したりできる、非常に賢いロボットアシスタントがいます。それは驚くほど有能なのですが、ある奇妙なメモリの不具合を抱えています。以前に行ったことがあることを頼むたびに、まるでそれが初めてであるかのように振る舞うのです。「ファイル > PDFとして書き出し」が文書を保存するための魔法の呪文であることを忘れ、「ユーザーIDを確認してから返品処理を行う」必要があることも忘れてしまいます。彼は毎回、ゼロから解決策を再発見し、昨日と同じ間違いを繰り返してしまうのです。

この論文の著者たちは、この問題を解決するために、ロボットに単なる「脳」を与えるのではなく、「レシピ本」を与えることにしました。それがBREWです。

問題点:記憶喪失のロボット

料理を学ぶ人間のことを考えてみてください。スクランブルエッグを数回作った後、あなたは調理プロセスの全秒数を暗記しているわけではありません。代わりに、あなたはレシピを内面化しています。「卵を溶き、フライパンを熱し、バターを加え、優しく混ぜる」。あなたは、いつこのレシピを使うべきか(朝食の時間)、何をすべきか、そして何に注意すべきか(バターを焦がさないこと)を知っています。

現在のロボットエージェントは、レシピを忘れてしまうシェフのようなものです。彼らは毎回、車輪の再発明をしなければなりません。一部の科学者は、ロボットの脳を「訓練」すること(内部の重みを変更すること)でこれを修正しようとしましたが、それは小麦粉の原子を並べ替えてケーキを焼こうとするようなものです。これでは、ロボットの振る舞いは、誰も検査したり簡単に修正したりできない「ブラックボックス」になってしまいます。また、ロボットに膨大な生のメモ(記憶)を与える方法を試した人もいましたが、それらのメモはあまりにも乱雑(単なるクリックのリスト)であったり、あるいはあまりにも曖昧(「注意せよ」など)であったりしました。

解決策:BREW (Bootstrapping expeRientially-learned Environmental knoWledge)

著者らは、ロボットの過去の冒険を、構造化された読みやすいレシピ本へと変えるシステム、BREWを提案しています。

その仕組みは、以下のステップで行われます:

  1. 経験 (The Experience): ロボットはタスク(ファイルの整理や航空券の予約など)を試みます。成功することもあれば、失敗することもあります。
  2. 内省 (The Reflection): 特別な「リフレクター(反射)」エージェントが、これらの試行を観察します。ロボットが失敗した場合、リフレクターは「何が間違っていたのか?」と問いかけます。成功した場合、リフレクターは「成功の秘訣は何だったのか?」と問いかけます。
  3. 「後知恵」のトリック (The "Hindsight" Trick): これが巧妙な部分です。時として、ロボットが失敗するのは、間違ったタスクを実行しようとしていたためです。システムは**「後知恵リラベル(Hindsight Relabeling)」**と呼ばれる手法を使用します。これは、失敗した試行を見て、「待てよ、もし本来の目的が『あれ』ではなく『これ』であったなら、ロボットの行動は完璧だったのではないか?」と考えるものです。失敗を、少し異なる目標に対する成功として再ラベル付けするのです。これにより、「間違い」が「新しいレシピ」へと変わり、ロボットが学習できる有用な知識の量が倍増します。
  4. レシピ本 (The Knowledge Base): システムは、これらの洞察を、構造化された読みやすい自然言語のレシピのライブラリへと整理します。各レシピには、タイトル(例:「圧縮と解凍」)、「使用場面」、そして箇条書きによる「実行方法」が含まれています。これはコードではなく、誰でも読める平易な英語の指示書です。
  5. 探索 (The Search - EG-MCTS): 完璧なレシピ本を書くことは困難です。レシピが具体的すぎると、新しいタスクには役立ちません。逆に抽象的すぎると、ロボットは混乱します。著者らは、Expand-and-Gather Monte Carlo Tree Search (EG-MCTS) と呼ばれるスマートな探索アルゴリズムを考案しました。これは、何千ものバリエーションを並列でテストし、最も優れたものを保持して残りを破棄することで、最適なレシピのバージョンを見つけ出そうとする探偵のようなものです。これにより、最終的なレシピ本が正確かつ検索しやすいものであることが保証されます。

結果:レシピ本は機能するのか?

研究者たちは、3つの現実世界の課題でBREWをテストしました:

  • OSWORLD: ロボットがコンピュータを操作するテスト(メニューのクリック、ファイルの移動など)。
  • τ2-Bench: ロボットが通信、小売、航空などのカスタマーサービスエージェントとして機能するテスト。
  • SpreadsheetBench: ロボットが複雑なExcelシートを操作するテスト。

結果は有望でした。BREWを使用したロボットは:

  • レシピ本を持たないロボットよりも、10〜20%多くのタスクを成功させました。
  • 仕事を完了するまでのステップ数が10〜15%減少しました。
  • 間違った情報を与えることで、かえってロボットの性能を低下させてしまう他のメモリシステムよりも優れた成績を収めました。

例えば、コンピュータ制御のテストでは、BREWを持つロボットは成功率が**53.30%から61.70%**に向上しました。スプレッドシートのテストでは、**44.30%から48.50%**へと跳ね上がりました。

この論文が否定していること

著者らは、何が機能しないのかについても明確に述べています。彼らは、ロボットの過去の行動の生で乱雑なログを単にメモリに流し込むことに対して異を唱えています。彼らは、「一時的な軌跡の断片(クリックごとの生のログ)」を単に保存するシステムは、ロボットを混乱させ、メモリを持たない場合よりも性能が悪化することさえあることを発見しました。また、単にロボットの脳を「ファインチューニング」すること(内部の重みを変えること)は、検査や更新が困難な「ブラックボックス」を生み出すとも指摘しています。これに対し、BREWのレシピ本は透明性が高く、編集可能です。

信頼性はどの程度か?

論文は、これらのベンチマーク上でエージェントを実行した測定された結果に基づき、これらの知見を提示しています。(10〜20%の向上といった)改善は、実験による測定された数値であり、単なる推測ではありません。著者らは、このアプローチがファインチューニングの強力な代替案であることを示唆していますが、システムの成功はトレーニングデータの質に依存することも注記しています。彼らは、これが「あらゆる場所のあらゆるロボット」のすべての問題を解決すると主張しているのではなく、これら特定の複雑なタスクにおいて、構造化された人間が読めるレシピ本を持つことが、有意で測定可能な差を生むことを示しています。

要約すると、BREWは、ロボットに「車輪の再発明」をやめさせ、彼らが実際に読み、理解できる、よく整理された人間にとって使いやすい取扱説明書を使わせるように教えているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →