Tessera: Lossless-First, Vendor-Free Session Compression for Long-Horizon Agent Harnesses
Tesseraは、3層のメモリシステムを採用して会話履歴を決定論的に書き換える一方で、Model Context Protocolを介して元のデータへの検証可能なアクセスを保持することで、長期的な展望を持つLLMエージェントのトークンコストとレイテンシを削減する、ベンダーフリーかつロスレスファーストなセッション圧縮プロキシです。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人工知能の世界において、「エージェント」と呼ばれる特定の種類のソフトウェアは、デジタルワーカーとして機能します。これらのエージェントは単にチャットをするだけでなく、ツールを使用し、ファイルを読み、コマンドを実行することでタスクを実行します。これを行うために、彼らは人間が使う言語を理解し生成する強力なコンピュータプログラムである「大規模言語モデル」に依存しています。しかし、これらのモデルにはメモリの制限があります。エージェントがステップを踏むたびに、これまでの会話の全履歴をモデルに送り返さなければなりません。そうしなければ、モデルがこれまでに何が起こったのかを把握できないからです。セッションが長くなり、数十のファイルや数百のコマンドが関わるようになると、この履歴は膨大なものになります。そのたびにすべてを送信することは、低速でコストがかかります。
これを解決するために、エンジニアたちは主に2つのトリックを試してきました。1つ目は、会話の最も古い部分を単純に切り捨て、最新のメッセージのみを保持することです。これはスペースを節約しますが、後で必要になるかもしれないパスワードやファイルの場所といった重要な事実を削除してしまうリスクがあります。2つ目のトリックは、古い部分をより短い物語へと要約させることです。これもまた、要約が重要な詳細を見逃したり、新しい内容を捏造したりする可能性があるため、リスクを伴います。また、その要約が正確かどうかを確認する方法もありません。どちらの方法も、コストを節約するか、真実を保持するかという選択を強いるものです。
モハマド・モサファー(Mohammad Mosafer)という研究者は、この選択を拒否する異なるアプローチを提案しました。彼は、エージェントとモデルの間のスマートな仲介役として機能する「Tessera」と呼ばれるシステムを構築しました。Tesseraは、会話を削除したり物語へと書き換えたりする代わりに、正確なコピーや類似の重複を見つけ出し、それらを除去することで会話を圧縮します。それは元のテキストを別のストレージ領域に安全に保管し、メインの会話の中にある繰り返された部分を、極めて小さく精密なポインタに置き換えます。もしエージェントが再び古いテキストを見る必要が生じた場合、システムにリクエストを送ることで、元のテキストを即座に取得できます。この方法により、エージェントは事実を失ったり特定の企業のテクノロジーに依存したりすることなく、はるかに短い会話履歴を用いて作業することができます。
問題の核心は、これらのエージェントがどのように機能するかという点にあります。エージェントがコマンドを実行すると、その結果が得られます。もし同じコマンドを再度実行した場合、しばしば全く同じ結果が得られます。長いセッションにおいて、エージェントは同じログファイルを何度も読んだり、同じステータスを繰り返し確認したりすることがあります。エージェントは毎回全履歴を送信するため、同じ大きなテキストのブロックを何度も何度も送ってしまうことになります。Tesseraはこの反復を検知します。それは会話履歴をスキャンし、あるテキストの断片が以前に送信されたものと同一であるかどうかを識別します。テキスト全体を再び送る代わりに、「これは3ステップ前のテキストと同じである」という短いマーカーを送信します。モデルはそのマーカーを読み取って文脈を理解できますが、送信されるデータ量は劇的に削減されます。
Tesseraは、単なる正確なコピーの発見にとどまりません。それは、数語だけが変わったログファイルのような、ほぼ同じテキストも探します。これらの類似の重複を見つけたとき、システムはファイル全体を送るのではなく、変更点のみを記述した小さなノートを送信します。また、長い数字のリストやコードのような大きなデータブロックについては、不要なフォーマットを削ぎ落とし、不可欠な構造のみを保持するように処理します。これらすべては、意思決定のために大規模言語モデルを使用することなく行われます。システムは単純で決定論的なルールを使用しているため、同じ入力に対して常に同じ結果を出力します。これにより、プロセスは高速かつ信頼性の高いものとなり、メッセージの送信にかかる時間にわずか数ミリ秒しか追加しません。
このシステムが実際に機能するかどうかをテストするために、研究者は制御された環境を作成しました。彼は、JSONレスポンス、サービスログ、コマンド出力などの現実的なデータを含む、偽のエージェントセッションを作成するジェネレーターを構築しました。これらのセッションの中に、ランダムなコードや特定のセッティングといった、特定かつユニークな事実をランダムな位置に植え付けました。その後、セッションをTesseraに通し、植え付けられた事実が圧縮された履歴の中にどれだけ残ったかを測定しました。彼は、古いメッセージを切り捨てる、あるいは最新のものだけを保持するという他の手法と比較しました。結果は明白でした。システムが会話を元のサイズの約29パーセントに圧縮したとき、メインの履歴には事実の61.8パーセントが保持されていました。対照的に、同じ量のスペースを保持するように強制された他の手法では、事実の保持率は約26から30パーセントにとどまりました。
このシステムには、情報が必要になった場合にそれを取り戻すための方法も含まれています。これは「リコール・ティア(想起層)」と呼ばれます。もしエージェントが会話の古い部分に関する特定の質問をした場合、システムは元のテキストの安全なストレージを検索し、正確な一節を呼び戻すことができます。この機能が使用されるとき、たとえそれらの事実がメインの圧縮された履歴の中に存在していなくても、システムは99.5パーセントの事実を回収できます。これは、エージェントが非常に効率的な短い履歴で作業しながらも、必要に応じていつでも詳細にアクセスできることを意味します。研究者たちは、この回収が、エージェントが古い出来事の文脈を覚えている場合に最も効果的であるが、曖昧な質問であっても十分に機能することを明らかにしました。
研究では、異なるタイプのエージェントがどのように振る舞うかも調査されました。ソフトウェアのバグを修正するように設計されたエージェントなどは、コマンドを繰り返し、同じ結果を頻繁に目にします。これらのエージェントに対して、システムは会話の約15パーセントが正確な重複であることを発見しました。異なるモデルを使用する他のエージェントは、ほとんど自己反復を行いませんでした。システムは両方の状況に適応し、それが特定の種類のエージェントに合わせてチューニングされている必要はないことを証明しました。それは、反復が多いか少ないかにかかわらず、そこにあるものを単に除去するのです。データの圧縮にかかる時間は無視できるほどであり、1リクエストあたり8ミリ秒未満であり、これはモデルが回答を生成する時間よりもはるかに短いです。
最も重要な発見の一つは、この方法が精度を放棄する必要はないということです。要約とは異なり、詳細を失ったり意味を変えたりする可能性がある一方で、Tesseraはすべての元のバイトを安全に保持します。もしスペースを節約するために事実がメインの表示から取り除かれたとしても、それは消えたわけではありません。それは単に、いつでも開けることができるハンドル(取っ手)の後ろに隠されているだけなのです。これにより、システムは完全に監査可能になります。エンジニアは圧縮された履歴を見て、何が削除され、どこに元のデータがあるのかを正確に知ることができます。これは、モデルに何が重要かを推測させるという、検証が困難なプロセスに依存している現在の手法からの大きな転換です。
研究者たちは、メモリ管理の他のいくつかの方法と彼らのシステムを比較テストしました。彼らは、最も新しいメッセージを保持するという一般的な慣行が、事実を保持する上で最も効果が低いことを発見しました。メッセージをランダムに保持する方法であっても、古いメッセージを切り捨てる方法よりは優れていましたが、それでもTesseraの精度には及びませんでした。Tesseraの成功の鍵は、メッセージ全体を捨てるのではなく、メッセージの内部から「余分な脂肪」を削ぎ落とし、長いテキストの頭部と尾部を残して、中間部分をポインタに置き換えることにあります。これにより、エージェントはデータの塊を削ぎ落としながら、会話の文脈を維持することができるのです。
研究ではまた、システムの構成設定に対してどの程度敏感であるかも調査されました。研究者たちは、何をもって重複とみなすか、およびいくつの最近のメッセージを圧縮から保護するかというルールを調整しました。彼らは、システムが堅牢であることを発見しました。ルールをわずかに変更しても、パフォーマンスが崩壊することはありませんでした。システムは、データの約70パーセントを一定して節約しつつ、重要な事実の大部分を保持し続けました。この安定性は、システムが絶え間ない調整を必要とすることなく、実世界のアプリケーションで使用できる可能性を示唆しています。
結局のところ、この研究は、真実を失うことなく、エージェントの会話をはるかに短縮することが可能であることを示しています。会話の履歴を、要約したり切り捨てたりしなければならない「物語」としてではなく、圧縮および検索可能な「データの集合」として扱うことで、システムは、これまでトレードオフが必要と考えられていたレベルの効率性を達成しました。エージェンドは、メモリ不足に陥ったり過剰なデータ転送費用を支払ったりすることなく、より長く複雑なタスクを実行できます。システムは特定のモデルプロバイダーに依存しないため、これらのエージェントの標準的な言語を話すあらゆるツールと共に使用できます。
研究者たちは、彼らのテストが合成データ、つまり人間の実際の使用から記録されたものではなく、コンピュータによって生成されたセッションを用いたものであることを認めています。彼らは、実世界の環境でシステムがどのように機能するかを確認するために、現実世界の実際のエージェントの軌跡を用いてテストすることを計画しています。また、現在のシステムは冗長性を除去することには非常に優れているものの、会話のより深い意味をまだ理解していないことも指摘しています。将来のバージョンでは、タスクに基づいて会話のどの部分が最も重要であるかを識別できるレイヤーが追加される可能性があります。しかし、現在のシステムは強固な基盤を提供しています。それは、注意深いエンジニアリングがあれば、データのほんの一部のみを送信しながら、エージェントの仕事の完全な記録を保持でき、事実が真に失われることは決してないということを証明しているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。