← 最新の論文
💬 NLP

MemoHarness: Agent Harnesses That Learn from Experience

MemoHarnessは、制御レイヤーを6つの次元に分解し、過去の実行から得られた二層の経験バンクを用いて各ケースに合わせてハーネス構成を動的に調整することで、テスト時のラベルや追加の探索を必要とすることなく、多様なタスクにおけるLLMの性能を向上させる適応型エージェント最適化フレームワークである。

原著者: Yue Huang, Wenjie Wang, Han Bao, Yuchen Ma, Xiaonan Luo, Yi Nian, Haomin Zhuang, Zheyuan Liu, Yue Zhao, Xiangliang Zhang

公開日 2026-07-17
📖 1 分で読めます☕ さくっと読める

原著者: Yue Huang, Wenjie Wang, Han Bao, Yuchen Ma, Xiaonan Luo, Yi Nian, Haomin Zhuang, Zheyuan Liu, Yue Zhao, Xiangliang Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に優秀で極めてスマートなロボットの助手を持っていると想像してください。あなたはタスクを与え、ロボットはそれを解決しようと試みます。しかし、ここに落とし穴があります。ロボットはただ賢いだけでなく、「自分の脳をどう使うか」を知っていなければならないのです。思考をどのように整理するか、いつ情報を検索するか、どのように助けを求めるか、そして答えを出す前にどのように自分の作業を再確認するかといった指示が必要です。人工知能の世界では、この一連の指示やツールのことを「エージェント・ハーネス(agent harness)」と呼びます。これは、車のダッシュボード、ステアリングホイール、そしてGPSのようなものだと考えてください。エンジン(AIモデル)が強力であっても、もしダッシュボードが壊れていたり、GPSが古い地図で止まっていたりすれば、その車はあなたを目的地に連れて行くことはできません。長い間、科学者たちはエンジンを大きくすることでこれらのロボットをより賢くしようとしてきました。しかし、この論文は異なる問いを投げかけています。「もし、ダッシュボードを修理することに注力したらどうだろうか?」という問いです。すべての出来事に対して同じ画一的な指示を使うのではなく、ロボット自身が間違いから学び、あらゆる走行に対して自身の運転スタイルを調整できるようにしたらどうでしょうか?

これこそが、MemoHarnessの開発者たちが取り組もうとしたことです。彼らは、現在のほとんどのAIエージェントが、固定されたステアリングホイールを持つ車のようであることに気づきました。それらは、単純な右左折であっても複雑な高速道路への合流であっても、常に同じセットアップを使用します。チームは、「学習するドライバー」として機能する新しいシステムを構築しました。単に完璧な指示のセットを一生使い続けるために探すのではなく、MemoHirsnessはエージェントが過去の走行から学べるようにします。それは、何がうまくいき、何が失敗し、そして「なぜ」そうなったのかという詳細な日記を記録します。新しいタスクが発生したとき、エージェントはただ推測するのではなく、日記を読み返し、過去の似たような状況を見つけ出し、目の前の課題に合わせて自分自身の指示を即座に微調整するのです。

この論文は、「ハーネス」を、コントロールパネルのさまざまなノブを調整するように、6つの明確なパーツに分解する巧妙な方法を紹介しています。それは、エージェントがどのように情報を収集するか(コンテキスト)、どのようなツールを使うか(ツール)、どのように考え、どのように話すか(生成)、ステップの順序(オーケストレーション)、何を記憶するか(メモリ)、そしてどのように回答を仕上げるか(出力)です。これらを編集可能な独立した面として扱うことで、システムはどこで問題が発生したのかを正確に診断できます。マップを確認し忘れたのか? スピードを出しすぎたのか? あるいは重要な詳細を記憶することを忘れたのか?

実験において、チームはこのシステムを3つの全く異なるタイプのタスクでテストしました。ソフトウェアを修正するためのコンピュータ・ターミナルとして機能すること、コードを書くこと、そして複雑な金融推論のパズルを解くことです。結果は有望でした。コンピュータ・ターミナルのテストでは、MemoHarnessは成功率を0.722から0.806へと向上させ、比較対象となった最高の固定セットアップを打ち破りました。また、これらの学習された習慣が、未知の新しいタスクへと「転移」できること、さらには再学習を必要とせずに異なる種類のAIモデルでもうまく機能することを示しました。例えば、あるモデルで学習したハーネスを他の6つのモデルに適用したところ、平均成功率は**+0.098**上昇しました。

著者らは、このアプローチが、毎回新しいエンジンを構築することなく、AIをより適応させるための実用的な方法であると示唆しています。しかし、結果は強力であるものの、それらは特定のテストとシミュレーションに基づいていることには注意を払っています。彼らは、あらゆる問題を解決したとか、これが単一の現実世界のあらゆるシナリオで完璧に機能することを証明したとは主張していません。また、システムが日記を「読む」ために多くのデータを使用する一方で、そのデータの大部分はキャッシュ(素早い再利用のために保存)可能であり、コストを競争力のあるレベルに保てることも発見しました。要約すると、MemoHarnessは、AIに自身の経験を振り返り、自身のコントロールパネルを調整する能力を与えることが、真に役立つ存在にするための鍵であり、硬直した機械を柔軟な学習パートナーへと変える鍵であることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →