Total Recall at What Cost? Benchmarking the Serving Cost of Agentic Memory Systems
本論文は、3つのエージェンティック・メモリ・システムと標準的な戦略と比較して、サービングコストと精度のベンチマークを実施しており、コストは会話の長さだけでなく内部システムの振る舞いによって決定されること、バックボーンやシステムによって大きく異なること、そして単一のソリューションがコストと精度の両方を最適化することはなくトレードオフが存在することを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、とても賢いけれど、少し忘れっぽいロボットの友だちと話していると想像してください。あなたたちは数週間にわたってチャットを続け、物語や計画、そして秘密を共有してきました。今、あなたは「3週間前に話したあのピザ屋さんのこと、覚えてる?」と尋ねたいと思っています。もしロボットに記憶がないとしたら、あなたは質問をするたびに、初日から今日までの友情の全ストーリーを最初から話し直さなければなりません。これは、単純な質問をするためだけに、これまでに話したすべての言葉が入った巨大で重いバックパックを運んでいるようなものです。それは機能はしますが、非常に重くなり、動作は遅くなり、すぐにコストがかさんでしまいます。
これを解決するために、エンジニアたちはこれらのロボットのために「メモリシステム(記憶システム)」を構築しました。重いバックパックを運ぶ代わりに、ロボットは特別なノートに小さなメモや事実、あるいは要約を書き留めます。あなたが質問をすると、ロボットはただ正しいページをめくって、そのメモを読むだけです。これは完璧に思えます。より軽く、速く、そして安上がりです。しかし、ここに落とし穴があります。メモを書いたり、整理したり、正しいページを見つけたりすることにも、やはり手間がかかるのです。大きな疑問は、ロボットはノートを使うことで節約できているのか、それともノートを管理するコスト自体が、重いバックパックを運ぶよりも高くついてしまうのか、ということです。この論文は、まさにその謎を解明するために、これらのメモリ技術が実際にどれほどの代償を払っているのかを測定し、本当にコストに見合うものなのかを調査しています。
メモリ・コストの大対決
この研究において、研究者たちはチャットボットの記憶を維持するために実際にどれだけのコストがかかるのかを確かめるべく、大規模なレースを設定しました。彼らは単に推測したのではなく、3つの異なる「メモリシステム」(これらをノートの整理方法だと考えてください)を用いて、制御された実験を行いました。それは、Mem0、Hidiht、そしてMastra Observational Memoryです。
テストを公平にするために、彼らはこれらのメモリシステムを、2つの極端な戦略と比較しました。
- 「ローリング・ウィンドウ(回転窓)」(安価なベースライン): これは、直近の10個の発言だけを覚えているようなものです。非常に安上がりですが、それ以外はすべて忘れてしまいます。
- 「フル・トランスクリプト(全文記録)」(高価なベースライン): これが「重いバックパック」方式です。あなたが質問をするたびに、ロボットは会話の最初の一言目から、履歴のすべてを読み直します。
彼らはこれらのシステムを最大400ターン(これは400回のやり取りを意味します)の会話を通して走らせ、ロボットが本当に正しいことを覚えているかどうかを確認するために、665個の特定の質問でテストを行いました。また、ロボットの「脳(バックボーン・モデル)」の種類によってコストが変わるかどうかを確認するために、2種類の異なる「脳」でもテストを行いました。
大きな驚き:価格設定は予測できない
最初の大きな発見は、会話の長さやメッセージの大きさを見て、コストを予測することはできないということです。研究者たちは、会話の長さとメッセージのサイズに基づいてコストを予測するシンプルな数学的公式を作ろうと試みました。
- 「フル・トランスクリプト」および「ローリング・ウィンドウ」戦略の場合、数学は完璧に機能しました。送った単語数がわかれば、コストがいくらになるかは正確にわかります。
- メモリシステムの場合、数学は無残にも失敗しました。公式による予測は、実際のコストから**18%から69%**も外れていました。
なぜでしょうか? それは、メモリシステムのコストは、単にどれだけ話したかではなく、あなたが話している間にシステムが内部で何をしているかによるからです。ある時はシステムが長い要約を書くことに決め、またある時は素早い事実だけをつかみます。時にはノート全体を再編成することもあります。これらの内部的な決定は、メッセージの長さではなく、会話の内容によって駆動されるのです。それは、ドライバーが豪華なランチを食べるのか、それともグラノーラバーをかじるだけなのかを知らずに、地図だけを見てロードトリップの費用を予測しようとするようなものです。「ランチ(内部処理)」の内容は激しく変動するため、総額は予測不可能なのです。
「損益分岐点」:いつノートは元を取れるのか?
研究者たちは、極めて重要な問いを投げかけました。「どの時点で、メモリシステムを使うことは、履歴全体を読み直すよりも安くなるのか?」
答えは、**「システムとロボットの脳の種類に完全に依存する」**です。
- Mastra Observational Memoryはスピードスターでした。いくつかのケースでは、最初のターン(ターン0)から「フル・トランスクリプト」方式よりも安価でした。
- Mem0はもう少し時間がかかり、通常はメッセージが適度に長い場合に、ターン82あたりで損益分岐点に達しました。
- Hindsightは最も遅いものでした。多くの場合、400ターン経過しても「フル・トランスクリプト」方式より安くなることはありませんでした。実際、いくつかの設定では、テスト終了時でもまだ高価なままでした。
これは、もし会話が短い場合、複雑なメモリシステムを使うことは、チャット履歴をそのまま再送するよりも、実際には多くのコストがかかる可能性があることを意味しています。メモリシステムが節約に貢献し始めるまでには、一定の時間をかけて話す必要がある(「損益分岐点」)のです。
正確性とコスト:フリーランチ(無料の昼食)はない
研究では、メモリシステムが実際に質問に答える能力があるかどうかもチェックしました。結果は幅広いパフォーマンスを示しました。
- 正確性は**21%から54%**の間で変動しました。
- Mem0は正確性の振れ幅が最も大きく、あるロボットの脳ではうまく機能し、別の脳ではうまく機能しませんでした。
- Hindsightは一般的に最も正確(しばしば50%以上)でしたが、実行コストも最も高かったです。
- Mastraは中間のパフォーマンスを示すものでしたが、正しい回答数を考慮した場合には、しばしば最もコスト効率が良いものでした。
研究者たちは、ロボットの「脳(バックボーン・モデル)」の選択が、メモリシステムの選択と同じくらい重要であることを発見しました。あるロボットの脳では安価なメモリシステムが、別の脳では高価になることもあるのです。
最終的な結論
この論文は、単一の「最高の」メモリシステムは存在しないと結論づけています。
- 特定のロボットの脳に対して、「正解あたりのコストが最も安い」選択肢を求めるなら、gpt-oss-20bという脳を用いたMastraが勝者でした(100ターン時点で、正解1つあたり約0.028ドル)。
- もし別のロボットの脳(Gemma 4 26B A4B)を使用する場合、Mem0が最も安価な選択肢になります。
- Hindsightは、正確ではありますが、会話が非常に長くならない限り、コストに見合わないことが多いです。
主な教訓は、メモリシステムを単に「かっこいいから」という理由で選んではいけないということです。自分の具体的な状況を検討しなければなりません。会話はどのくらいの長さになるのか? メッセージのサイズはどのくらいか? そして、どのロボットの脳を使用しているのか? それらを検討して初めて、メモリシステムが節約になるのか、それとも単に請求額を増やすだけなのかを知ることができるのです。「完全な想起(トータル・リコール)」を実現するメモリシステムには代償が伴い、そのコストは単にあなたが打ち込んだ単語数を数えるよりも、はるかに複雑なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。