← 最新の論文
🤖 AI

CoEvo-Mem: Co-Evolving Retrieval Policy and Memory Bank for LLM Agents

CoEvo-Memは、交互の更新と軌跡条件付きフィードバックを通じて、検索ポリシーとメモリバンクの進化を同時に最適化することで、長期的なLLMエージェントにおけるメモリへのアクセスと洗練の間の根本的な相互依存関係に対処し、多様なベンチマークにおいて最先端の性能を達成するクローズドループ・フレームワークである。

原著者: Bowen Ye, Yongchao Xu, Zhijian Li, Xiang Yin, Junkai Ma, Wenzhao Li

公開日 2026-08-04
📖 1 分で読めます☕ さくっと読める

原著者: Bowen Ye, Yongchao Xu, Zhijian Li, Xiang Yin, Junkai Ma, Wenzhao Li

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、複雑なビデオゲームを教えられている、天才的だが忘れっぽいロボットを想像してください。そのロボットは巨大な脳(大規模言語モデル)を持っており、言葉を話し、思考することができますが、一度に保持できる「作業メモリ」は非常にわずかです。まるで、最後の3つのピースしか見えない状態でパズルを解こうとしているようなものです。長期的に上手くプレイするためには、過去の経験を検索するためのライブラリが必要です。ここで、**Retrieval-Augmented Generation(RAG:検索拡張生成)**が登場します。これは、ロボットが司書に「ねえ、以前にこのようなパズルを見たことがありますか?」と尋ねるようなものです。

しかし、ここにはトリッキーな点があります。ロボットが完璧に機能するためには、2つのことが必要です。第一に、現在の質問に対して「正しい」古いメモを見つけ出すのが非常に上手い司書(検索ポリシー)が必要です。第二に、メモを整理し、どのメモが本当に有用であるかを判断し、ゲームが難しくなるにつれてそれらを更新していくのが上手いメモ作成者(メモリバンク)が必要です。長い間、科学者たちは、司書を賢くする一方でメモ作成者を固定的なものにしようとしたり、あるいはメモ作成者を改良する一方で司書を同じままにしようとしたりしてきました。しかし、もし司書がメモの整理方法を知らなければ探し出せないのだとしたら、そしてメモ作成者が司書が何を求めているかを知らなければより良く整理できないのだとしたらどうでしょう? 彼らは互いに学び合い、ループの中で機能する必要があるのです。

これこそが、論文CoEvo-Memが探求している内容です。著者たちは、「司書」と「メモ作成者」が共に進化し、互いの仕事をより良くする方法を絶えず教え合うシステムを提案しています。彼らは、プログラミング、科学的な質問の解決、コンピュータのオペレーティングシステムの制御など、多岐にわたる7つの困難なタスクでこのアイデアをテストしました。結果は、これら2つの部分が同期して学習する場合、ロボットは単独で学習する場合よりも、長期的で複雑な問題を解決する上で著しく優れた能力を発揮することを示唆しています。

問題点:壊れたフィードバックループ

あなたが歴史の大きな試験に向けて勉強しているところを想像してください。あなたには一束のフラッシュカード(あなたのメモリ)と、学習ガイド(あなたの検索ポリシー)があります。もし学習ガイドが悪ければ、復習すべき間違ったフラッシュカードを選んでしまうかもしれません。しかし、もしフラッシュカードが乱雑で整理されていなければ、たとえ優れた学習ガイドがあったとしても、正しいものを見つけるのに苦労するでしょう。

AIエージェントの世界では、既存の手法は通常、問題の一方の側面を修正しながら、もう一方を無視しています。ある手法は、AIがメモリを「求める」方法(検索)を改善しようとし、別の手法は、AIがメモリを「保存し整理する」方法(進化)を改善しようとします。この論文の著者たちは、この分離は間違いであると主張しています。彼らは、無視されていた「根本的なフィードバックループ」を指摘しています。

  1. 検索は、何が使われるかを決定する: もしAIが間違ったメモリを選択した場合、それらのメモリには、(タスクに貢献したか、あるいは悪影響を与えたかに関わらず)何の「クレジット(評価)」も与えられません。
  2. メモリの更新は、未来を変える: もしAIが起きた出来事に基づいてメモリを更新する場合、メモリの整理方法が変わります。これは、次回、それらを見つけやすくしたり、逆に難しくしたりします。

もし、メモリの変化を考慮せずに検索方法だけを修正したり、あるいはその逆を行ったりすれば、両者が共に向上するチャンスを逃してしまいます。それは、弦の太さが常に変化している中でギターのチューニングをしようとしているようなものです。両方を同時に調整しない限り、完璧な音を出すことはできません。

解決策:CoEvo-Mem

著者たちは、CoEvo-Mem(共進化メモリ)と呼ばれるフレームワークを構築しました。これは、二人のパートナーによるダンスのようなものです。すなわち、ルーター(司書)とメモリバンク(メモ作成者)です。

このダンスの仕組みは以下の通りです:

1. 固定された脳とスマートなルーター
AIのメインの「脳」(大規模言語モデル)は凍結されたままです。つまり、新しいことを学習しません。代わりに、システムは、どのように助けを求めるかを決定するために、軽量で小さな「ルーター」を使用します。

  • 質問が入ってくると、凍結された脳は、質問を書き換えるためのいくつかの方法を提案します(あるものは「意味」に焦点を当て、別のものは特定の「キーワード」に焦点を当てます)。
  • ルーターは、AIが正解したか不正解だったかに基づいて、これらの提案を微調整することを学習します。それは、ゲームの結果に基づいて、「次はこう尋ねてみて」とささやくコーチのようなものです。

2. 生きている地図としてのメモリバンク
メモリは単なるメモのリストではありません。それは**関係グラフ(Relational Graph)**です。すべてのメモリが「都市」であり、それらの間の「道路」がどのように関連しているかを示す地図を想像してください。

  • **密な道路(Dense roads)**は、同じ意味を持つメモリ同士を繋ぎます(意味的関係)。
  • **疎な道路(Sparse roads)**は、特定の単語や名前を共有するメモリ同士を繋ぎます(語彙的関係)。
  • **時間の道路(Time roads)**は、連続したシーケンスの中で発生したメモリ同士を繋ぎます(時間的関係)。

AIがタスクを解決するとき、単に答えを保存するだけではありません。訪れた「都市」の「価値」を更新します。もしメモリがAIの勝利に貢献したなら、その都市のスコアは高くなります。もし貢献したが、わずかな程度であったなら、スコアは少しだけ上がります。決定的なのは、このクレジットは単一のメモリに留まるのではなく、隣接する都市へと伝わり、近隣の都市全体をより賢くさせるということです。

3. 交互のダンス(秘訣)
「なぜルーターとメモリを全く同時に更新しないのか?」と思うかもしれません。著者たちは、同時に行うと混乱が生じることを発見しました。両方が同時に変化すると、自転車の形が変わり続けている中で自転車に乗る練習をしているようなものです。システムは混乱し、不安定になります。

代わりに、CoEvo-Memは交互のスケジュールを使用します:

  • フェーズ1: メモリバンクが凍結(固定)されます。ルーターはこの固定されたマップを使用して、最適なメモリを見つける練習をします。
  • フェーズ2: ルーターが凍結されます。メモリバンクは、ルーターが今見つけたものに基づいて、その整理方法と価値を更新します。
  • これらを交互に繰り返します。これにより、各パートナーは、両方が同時に変化することによる混乱なしに、相手の「現在の状態」から学ぶことができます。

得られた結果

チームは、7つの非常に異なる課題に対してCoEvo-Memをテストしました:

  • オペレーティングシステムの操作: タスクを実行するためにコンピュータを制御する。
  • コード生成: 動作するコンピュータプログラムを書く。
  • マルチモーダル推論: テキストと画像の両方を含むパズルを解く。
  • 科学的な質問: 物理学、化学、生物学に関する難しい質問に答える。
  • ファンクションコーリング(関数呼び出し): AIにツールやAPIを正しく使用させる。
  • 長期的な会話: 長いチャットの詳細を記憶する。

これら7つすべてのテストにおいて、CoEvo-Memは既存の最高の手法よりも優れたパフォーマンスを示しました。

  • GPQA Diamond(高度な科学問題)では、最強のベースラインに対して7.50パーセントポイント向上しました。
  • LiveCodeBench(コーディング)では、3.81パーセントポイント向上しました。
  • **長期会話メモリ(LoCoMo)**では、81.71に達し、次に優れた手法を5ポイント近く上回りました。

著者らはまた、システムから一部を取り除いた実験(アブレーション研究)を行い、なぜそれが機能したのかを証明しました。

  • クエリの書き換え(質問の問い方を変える部分)を取り除くと、パフォーマンスが大幅に低下しました。
  • メモリの進化(グラフと価値を更新する部分)を取り除くと、特にコーディングや科学のような複雑なタスクにおいて、パフォーマンスが低下しました。
  • ルーターとメモリを同時に更新しようと試みた場合(交互ではなく)、交互の方法よりもパフォーマンスが悪化しました。

まとめ

この論文は、AIエージェントが真に長期的なタスクをマスターするためには、単に優れた検索エンジンやデータベースを作るだけでは不十分であることを示唆しています。検索エンジンとデータベースが互いに適応するように学習するシステムを構築しなければなりません。「司書」と「メモ作成者」が、一方が静止している間に交代して学習できるようにすることで、CoEvo-Memは、AIエージェントがより良く記憶し、より明晰に考え、より困難な問題を解決することを助ける、安定して向上し続けるループを作り出します。

著者らは、これら7つのベンチマークにおける結果は強力なものであるものの、これは「共進化」のための特定のフレームワークであることを注意深く述べています。彼らはこれがAIのあらゆる問題を解決すると主張しているわけではありませんが、検索とメモリをこのように結びつける方法が、エージェントが時間をかけて学習し適応していくための強力な一歩であることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →