← 最新の論文
💻 computer science

Tamarin (HSQ): Reversible Hierarchical KV-Cache Compression for LLM Inference

Tamarin (HSQ) は、トークンをフォーカル・ティア(focal tier)、学習された要約ベクトル(learned summary vectors)、および CPU ベースのアーカイブへとルーティングする可逆的な 3 階層の階層的 KV キャッシュ圧縮スキームを導入することで、ベースラインに近いパープレキシティと検索精度を維持しながら、長文脈 LLM 推論における 12〜28 倍の GPU メモリ削減を実現します。

原著者: Alikhan Bazakov, Kirill Kiselev

公開日 2026-07-10
📖 1 分で読めます☕ さくっと読める

原著者: Alikhan Bazakov, Kirill Kiselev

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、小さなタブレットで32,000ページもある膨大な本を読もうとしていると想像してみてください。問題は本のテキストではなく、すでに読んだページを保持しているだけで、タブレットのメモリが瞬時に一杯になってしまうことです。AIの世界では、この「メモリ」はKVキャッシュと呼ばれます。大規模なモデルにとって、これはコンピューターの全パワーを食いつぶし、新しいページを作るために古いページを捨てざるを得ない状況を作り出します。

現在のソリューションの多くは、棚がいっぱいになったとき、ユーザーが今後必要としそうにないと判断した本を投げ捨てる司書のようなものです。彼らは最初の数ページと最後の数ページを残すかもしれませんが、もしあなたが突然、本の途中の詳細について質問した場合、そのページは永遠に失われてしまいます。論文ではこれを「エビクション(追い出し)」と呼び、ユーザーが次に何を質問するかを予測することはできないため、これは致命的な欠陥であると主張しています。

大きなアイデア:ゴミ箱ではなく、魔法のインデックスを

Siamang Labsの著者たちは、Tamarin(技術的にはHSQとして知られる)と呼ばれる異なるアプローチを提案しています。ページを捨て去る代わりに、彼らはメモリを巨大で検索可能なインデックスとして扱います。

彼らの3層構造のシステムが、図書館の比喩を用いてどのように機能するかを説明します:

  1. 「VIP」棚 (L1): タブレット(GPU)上の、高速で小さなセクションです。ここには最も重要なページと最新のページが保持されます。これらは、少し縮小されていますが(4ビット精度)、フルディテールで保持されます。
  2. 「手がかりカード」 (L2): 残りの本については、システムは8〜16ページのグループごとに、非常に小さな3ビットの「手がかりカード」を作成します。これらのカードは物語を含んでいるのではなく、単にそのページが「何について」書かれているかの要約を含んでいます。これらはあなたのタブレット上にも存在します。
  3. 「深層アーカイブ」 (L3): すべてのページのオリジナルの全文は、通りを挟んだ向かい側にある巨大な倉庫(CPU RAM)に、4ビット精度に縮小された状態で保存されています。

リアルタイムでの仕組み

AIが読んでいる最中に突然質問に答える必要が生じたとき、AIは推測しません。まず手がかりカード (L2) を見ます。賢い小さな「読者」AIが、これらのカードをスコアリングし、どのページグループが現在の質問に関連しているかを確認します。

もしカードが有望であれば、システムは即座に深層アーカイブ (L3) へ走り、オリジナルのページを掴み取り、AIが意思決定を行う直前にそれらをタブレットへと持ち帰ります。

この論文は、この「インデックス作成」のアプローチこそが鍵であることを証明しています。「アーカイブからのフェッチ(取り出し)」のステップを無効にしたテストでは、隠れた情報を見つける能力(「針に糸を通すような」検索、いわゆるneedle-in-a-haystack retrieval)が**0%**にまで低下しました。これは、手がかりカードはあくまでルーティングのためのものであり、実際のコンテンツはアーカイブにあることを裏付けています。

結果:コストをほとんどかけずに大幅な節約を実現

論文では、いくつかのモデル(具体的には0.6Bから14Bのパラメータを持つQwen3ファミリー)でこれを測定しました。判明したことは以下の通りです:

  • メモリ節約: コンテキスト長が32,000トークンのとき、TamarinはGPUメモリの使用量を12〜28倍削減します。例えば、32Kトークンのキャッシュに通常4.5 GiBのメモリを必要とするモデルは、GPU上ではわずか172 MiBしか必要としません。残りはCPU RAMに格納されます。
  • 品質: より大きなモデル(4Bおよび8Bパラメータ)では、品質は圧縮されていないバージョンとほぼ同一です。「パープレキシティ」(AIがどれほど混乱するかを示す指標)の上昇はわずか**0.1%〜0.4%です。AIは、選択する単語の96%〜97%**においてオリジナル版と一致しています。
  • 検索: テキストのさまざまな深さに隠されたコードを見つける500回の試行テストにおいて、8Bモデルは500回中500回コードを見つけ出し、統計的に非圧縮のベースラインと一致しました。

論文が否定したもの、および失敗した箇所

著者たちは、これが何ではないのか、そしてどこで苦戦するのかを明確に述べています:

  • これはスピードアップではありません: 論文では、TamarinはAIを速くするものではないと明言しています。実際、CPUアーカイブからデータをフェッチする必要があるため、32Kトークン時の速度は通常の**17〜18%**に低下します。これは、容量(より多くのテキストを詰め込むこと)と速度のトレードオフです。
  • 極小モデルでは完璧には機能しません: テストされた最小のモデル(0.6Bパラメータ)では、品質のコストが高くなります。論文では、4ビット重みを使用した際のパープレキシティが**6〜10%**上昇したと記されており、これはその特定のサイズにおいては失敗とみなされます。
  • すべてのAIファミリーに効く魔法の解決策ではありません: この手法はQwen3モデルには非常にうまく機能しますが、別のファミリー(Mistral-7B)で試したところ、結果は芳しくなく、特定の深さで精度が20パーセントポイント低下しました。著者らは、これはMistralがQwenが持つ特定の「正規化」ステップを欠いているため、手がかりカードが読み取りにくくなっているのではないかと推測しています。
  • 特定の「脆弱な」チェックポイント: 14Bモデルにおいてさえ、テキスト内の特定の2箇所で、隠された「針」を見つけるのに苦戦し、精度が**80.4%**に低下しました。論文では、これは手法自体の欠陥ではなく、そのモデルのトレーニングにおける特定の欠陥に起因するとされています。

結論

この論文は、大規模なモデル(4B以上)にとって、Tamarinは情報を永久に削除することなく、膨大な量のテキストを限られたメモリに収めるための実証された方法であることを示唆しています。それは「容量不足」という問題を、「インデックスの管理」という問題へと変えるのです。処理速度を低下させ、注意深いチューニングを必要とするものの、すべての情報を保持することが極めて重要なロングコンテキスト・タスクにおいて、メモリのボトルネックを克服することに成功しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →