← 最新の論文
🤖 AI

SplitZip: Ultra Fast Lossless KV Compression for Disaggregated LLM Serving

SplitZipは、固定長コードブックとスパースなエスケープストリームを通じて浮動小数点指数の冗長性を活用することで、分離型LLMサービングにおけるKVキャッシュ転送を加速させる、GPUフレンドリーでロスレスな圧縮器であり、既存の手法と比較して大幅に高いスループットと低減されたレイテンシを実現します。

原著者: Yipin Guo, Siddharth Joshi

公開日 2026-06-25
📖 1 分で読めます☕ さくっと読める

原著者: Yipin Guo, Siddharth Joshi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、2つの異なるチームが協力して複雑な質問に答える、巨大で高速な図書館を運営していると想像してください。

  • チームA(「プリフィル」チーム): 彼らは研究者です。非常に長く膨大な文書(ユーザーのプロンプト)を読み、詳細なメモを取ります。この部分は非常に高速であり、多くの脳の力(計算能力)を必要とします。
  • チームB(「デコード」チーム): 彼らはライターです。それらのメモを使って、一単語ずつ答えを書いていきます。この部分は、メモを保持するための多くのメモリを必要とし、低速になります。

現代のAIシステムでは、コストを抑え、ワークロードのバランスを取るために、これらの2つのチームが異なる建物(異なるサーバー)で作業することがよくあります。問題は? チームAがメモを書き終えた後、チームBが書き始める前に、そのメモを郵送しなければならないことです。 もしメモが膨大であれば(ユーザーが本一冊について質問した時のように)、郵送に時間がかかりすぎます。ライター(チームB)は、郵便が届くのを待つ間、何もできずに座って待つことになります。この「郵送の遅延」が、システム全体を遅らせるボトルネックとなります。

現在の「郵送」手法の問題点

以前は、メモをより速く郵送するために、それらを圧縮しようとする試みがありました。

  • 「非可逆(ロスy)」方式: スペースを節約するために、メモの一部を捨てようとする人もいました。しかし、これは小説をランダムに文章を削除して要約するようなものです。スペースは節約できるかもしれませんが、物語(AIの答え)が間違ったり、意味不明になったりする可能性があります。
  • 「古い」可逆方式: 他の人々は、情報を一文字も失わずに完璧にジップ(圧縮)しようとしました。しかし、彼らが使用したソフトウェアは、まるで遅くて古臭いタイピストのようでした。チームAが新しいバッチを生成する速さに、追いつくことができなかったのです。メモがジップされる頃には、チームAはすでに次のバッチを生成していました。

解決策:SplitZip

研究者たちは、SplitZipと呼ばれる新しいシステムを作成しました。これは、AIのメモのために特別に設計された、超高速でスマートな宅配便のようなものです。

その仕組みは、以下のシンプルな比喩で説明できます:

1. 「メモ」の構造
AIが生成するメモは数字で構成されています。彼らが使用している形式(BF16と呼ばれます)では、すべての数字には3つのパーツがあります:

  • 符号(Sign): 正か負か?(プラスやマイナスの記号のようなもの)。
  • 仮数(Mantissa): 数字の具体的な詳細。
  • 指数(Exponent): 数字の「パワー」またはスケール(10、100、あるいは1,000といったもの)。

2. 秘密の発見
研究者たちは面白いことに気づきました。「詳細(仮数)」はバラバラですが、「パワー(指数)」は非常に反復的であるということです。これは、もしあなたが本を書いているとしたら、99%の時間は「とても」、「かなり」、「極めて」という言葉だけを使っているようなものです。「やや」や「わずかに」といった言葉を使うことは滅多にありません。

3. SplitZipの戦略
SplitZipは、すべての言葉を書き出す代わりに、次のように行います:

  • ショートカット: 最も一般的な「パワー(指数)」のトップ16リストを作成します。これら16個の一般的なパワーそれぞれに、非常に小さな4文字のコード(秘密の手順のようなもの)を割り当てます。
  • パッキング: これら2つの小さなコードを、単一のバイトのスペースに詰め込みます。これは、2つの秘密の手順を1文字分のスペースに収めるようなものです。
  • 「レア」リスト: 「レアな(珍しい)」パワーが登場する1%のケースについては、それをショートカットに無理やり押し込もうとはしません。代わりに、次のような小さな「脱出ノート」を書き込みます。「位置#50において、パワーは実際には『レア値-99』であった」

4. なぜ速いのか

  • チームA(エンコーディング)にとって: システムが複雑で可変長のコードではなく、固定された短いコードを使用しているため、驚異的な速さでメモをパッキングできます。これは、服をどう畳むのが最適かを毎回考える人間ではなく、決まった場所にアイテムを置くだけのロボットアームのようなものです。
  • チームB(デコーディング)にとって: メモが到着すると、チームBは瞬時に展開できます。彼らは4文字のコードを確認してパワーを取り出し、詳細と組み合わせます。もし「脱出ノート」があれば、その箇所を上書きするだけです。それは、混乱を招く回り道のない、直線的な作業です。

結果

論文によれば、SplitZipはゲームチェンジャーです:

  • スピード: データを613 GB/sおよび2181 GB/sの速度で圧縮および展開します。これを比較すると、CPU上でこれを行おうとした従来のメソッドよりも数百倍高速です。
  • 完璧な正確性: これは「可逆(ロスレス)」です。チームBが受け取るメモは、チームAが書いたものとビット単位で完全に一致しています。情報は一切失われません。
  • 実世界への影響: 彼らが実際のAIシステム(SGLangフレームワークを使用)でテストしたところ、以下のような結果が得られました:
    • サーバー間のメモ転送が1.32倍高速化
    • 最初の回答単語が出るまでの時間(TTFT)が1.30倍高速化
    • 1時間あたりの総リクエスト処理数が1.23倍増加

まとめ

SplitZipは、AIのメモが主に反復的であることを知っている、特化した高速宅配便のようなものです。重い箱をそのまま郵送する代わりに、一般的なアイテムの小さなコード付きリストと、珍しいもののための小さなノートを送信します。これを非常に速く行うため、AIサーバーが待たされることはなく、細部を一切失うことなく、より長く複雑な質問に対してより迅速に答えることが可能になります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →