InferScale: GPU-Native KV Injection for Personalized LLM Serving
InferScaleは、再利用可能なKV状態を事前計算してvLLMキャッシュに直接注入することで、高精度を維持しながら、検索されたコンテキストのサイズから初動トークン生成までのレイテンシを切り離し、パーソナライズされたLLMサービングを加速させるGPUネイティブのメモリシステムです。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、ある超高性能なロボットに、あなたの人生の物語すべてを教えて、そのロボットがあなたに関する質問に答えられるようにしようとしていると想像してください。あなたが質問をするたびに、ロボットが思考するためには、あなたの伝記全体をその脳内にペーストしなければなりません。もしあなたの伝記が短ければ、ロボットは速く考えます。しかし、もしあなたの伝記が長く、年月を重ねた思い出や、身内だけのジョーク、過去の冒険などで満たされていたら、ロボットは単純な「私の好きな色は?」という質問に答えるためだけに、その伝記の全単語を読み直し、再処理しなければなりません。この読み直しのプロセスは遅く、コストがかかります。まるで、たった一冊の本を渡す前に、図書館にあるすべての本を棚に戻し直さなければならない司書のようなものです。これが、現在の「パーソナライズされた」AIの現状です。記憶が増えれば増えるほど、AIがあなたと話すスピードは遅くなってしまいます。
これから読む論文は、コンピュータサイエンスの世界における「Key-Value キャッシング」と呼ばれる巧妙なトリックを使って、この問題に取り組みます。ロボットの脳を、これまでに読んだ内容の中で最も重要な部分を書き留めておく巨大なホワイトボードだと考えてください。そうすることで、元のテキストを読み直す必要がなくなります。通常、もし棚の本の順番を変えると、ロボットはホワイトボード全体を書き直さなければなりません。しかし、もしロボットが、あらかじめ書かれたメモを引き出しから取り出し、それをどこにでも瞬時に貼り付けることができたらどうでしょうか? これが、この研究の核心となるアイデアです。あなたの記憶を毎回読み直させる代わりに、私たちは各記憶の「メモ」を事前に計算し、ロボットの超高速な内部ハードドライブに保存します。そして、あなたが質問をするとき、そのメモをロボットの脳内に直接流し込むのです。
問題点:「読み直し」の罠
今日、長い会話の履歴を持つAIアシスタントを使用する場合、システムは最も関連性の高い記憶を見つけ出し、それをあなたの新しい質問の中にペーストする必要があります。これは「プロンプト・インジェクション」と呼ばれます。想像してみてください。あなたが友人にアドバイスを求めているのに、話すたびに、実際の質問をする前に日記の最後の50ページを音読しなければならない状況を。ページ数が増えれば増えるほど、アドバイスにたどり着くまでの時間は長くなります。たとえ全く同じ質問を10回繰り返したとしても、友人はその50ページを10回読み直さなければなりません。これにより、AIは動作が鈍く感じられます。特に、あなたの個人的な記憶が増えていくにつれて顕著になります。
解決策:InferScale
研究者の Peter Li と Prashant Pandey は、InferScale という新しいシステムを構築しました。AIに記憶を再読させる代わりに、InferScale はあなたが話し始める前に、あらかじめ重い作業を済ませておきます。システムは、あらゆる記憶の事実(例:「私はピザが好き」「私の犬の名前はレックス」)を取り出し、事前にその「脳のメモ」(KV ステートと呼ばれます)を計算します。これらのメモは、コンピュータの超高速な脳であるグラフィックスカード(GPU)に直接保存されます。
あなたが質問をするとき、システムは記憶のテキストをAIに送るのではなく、GPU から適切な「脳のメモ」を見つけ出し、それをAIの作業メモリに直接注入します。これは、図書館が本を手渡す代わりに、司書が必要な段落を正確にあなたの机の上にペーストするようなものです。AIは元のテキストを読み直す必要がなく、ただそのメモを使用するだけなのです。
魔法のトリック
これを実現するために、チームは2つのトリッキーなパズルを解かなければなりませんでした。
「動く標的」問題 (Chunked RoPE):
通常、これらの「脳のメモ」はテキスト内の特定の場所に紐付けられています。もし記憶を物語の最初から中ほどへ移動させると、メモの内容が合わなくなってしまいます。研究者たちは、Chunked RoPE と呼ばれる技術を考案しました。メモが、回転させることができる特殊な紙に書かれていると考えてください。その紙を机のどこに置いたとしても、回転させることで新しい位置に完璧に合わせることができます。これにより、システムは保存された記憶を、数学的な整合性を壊すことなく、会話の中のどこにでも配置できるようになります。「コンテキスト」問題 (Context-Window Encoding):
単に「彼は店に行った」という一文だけを取り出した場合、AIは「彼」が誰であるかを知らない可能性があります。もし記憶を孤立した状態で保存してしまうと、文脈(コンテキスト)が失われてしまいます。これを修正するために、システムは記憶を、その直前の文章(例:「ジョンは店に行った」)を含む小さなウィンドウと共に保存します。ただし、ウィンドウ全体ではなく、特定の記憶部分に対する「脳のメモ」のみを保存します。こうすることで、AIは文脈(「彼」はジョンであること)を理解しながら、毎回段落全体を読み直すことなく、記憶を活用できるのです。
研究結果
結果は素晴らしいものです。研究者たちは、3つの異なるAIモデル(Llama-3.1-8B、Mistral-7B、Qwen2.5-7B)を用い、長い会話のデータセットでテストを行いました。
- 速度: 旧来の手法(Mem0)では、取得する記憶の数を5個から50個に増やすと、AIが話し始めるまでの時間(Time-to-First-Token)が 106% 跳ね上がりました(33.2 ms から 68.3 ms へ)。一方、InferScale では、同じ増加による遅延はわずか 4% でした(16.6 ms から 17.3 ms へ)。
- スループット: 100人が同時にシステムを使用した場合、InferScale は旧来のシステムよりも 3.7 倍から 4.5 倍 多く、秒あたりの質問を処理できました。
- 精度: メモリを個別に保存することによる混乱のリスクがありましたが、「コンテキスト・ウィンドウ」のトリックを使用することで、精度をほぼ完全に回復できました。最高のメモリ負荷時において、InferScale は 60.3% の正解率を記録しました。これは旧来のシステムの 63.3% に非常に近く、かつ遥かに高速でした。
なぜ重要なのか
この論文は、「賢く記憶豊かなAI」と「速いAI」のどちらか一方を選ぶ必要はないということを証明しています。記憶の保存を GPU に移行し、「脳のメモ」を直接注入することで、AI の速度を記憶のサイズから切り離すことに成功しました。このシステムは、AI モデルの再学習や、基礎となるエンジンの変更を必要とせず、パーソナライズされたAIアシスタントの未来に向けた実用的なアップグレードとなります。たとえメモリデータが高速な GPU に収まりきらないほど巨大であっても、通常のコンピュータメモリにオフロードすることで、現在の方法よりも大幅に高速な状態を維持できることが示されました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。