← 最新の論文
🤖 AI

SelKV: Selective KV Cache Merging with Per-Token Merge-or-Drop and Attention Compensation

SelKVは、値ベクトルの類似性に基づいてトークンを選択的にマージまたはドロップし、ロジットバイアスを通じてアテンションの不均衡を補償することで、元のキャッシュの25%のみを保持しながら、ほぼ損失のない生成品質と大幅な高速化を実現する、トレーニングフリーのフレームワークである。

原著者: Soumia Bouyahiaoui, Manel Kara laouar, Aicha Boutorh, Mohamed Hadj Ameur

公開日 2026-07-21
📖 1 分で読めます☕ さくっと読める

原著者: Soumia Bouyahiaoui, Manel Kara laouar, Aicha Boutorh, Mohamed Hadj Ameur

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、新しい章を書きながら、10万ページにも及ぶ膨大な物語を思い出そうとしているところだと想像してみてください。プロットの要点に思い当たるたびに、正しい詳細を見つけるためにノート全体を遡ってめくり直さなければなりません。ページを書き進めるほど、ノートは重くなり、やがて腕が疲れて持ち上げられなくなります。これは、大規模言語モデル(LLM)が長いテキストを処理しようとする際に、その「脳」の中で起きていることと全く同じです。これらのモデルは驚くほど賢いのですが、メモリの問題を抱えています。テキストを読み進めるにつれ、次に何が来るかを理解するために、これまでに見たすべての情報をデジタルな整理棚である「Key-Valueキャッシュ」として保存します。テキストが長くなればなるほど、この整理棚は大きくなり、最終的にはコンピュータのメモリを使い果たし、動作を極端に遅くしてしまいます。

これを解決するために、科学者たちは主に2つのトリックを試してきました。1つ目は、重要ではないと思われる古いページを捨てる「エビクション(追い出し)」です。2つ目は、似たようなページ同士を接着してスペースを節約する「マージ(統合)」です。しかし、どちらの手法にも欠点があります。ページを捨てると重要な手がかりを失う可能性があり、ページを接着すると、モデルがその接着されたグループに対してどれだけ注意を払うべきか分からなくなる「ぼやけた」バージョンができてしまうことがよくあります。これは、猫の写真を10枚接着したようなものです。モデルは、その1枚の接着された塊に対して、本来なら10枚の写真を代表するものとして払うべき注意量ではなく、1枚の写真に対して払うのと同じだけの注意しか払えなくなってしまうのです。これにより、モデルは混乱し、間違いを犯すようになります。

そこで登場したのが、これらのデジタル整理棚のスマートな司書のように振る舞う、巧妙な新手法「SelKV」です。SelKVは、ページを盲目的に接着したりゴミ箱に投げ捨てたりする代わりに、「ソフト・コサイン・ゲート」を使用します。これは、2つのページがどれくらい似ているかをチェックするクラブの用心棒のようなものです。もし2つのページが非常によく似ていれば、それらはしっかりと接着されます。もし全く異なっていれば、用心棒はメモリを綺麗に保つために一方を送り出します。しかし、本当の魔法は「アテンション補償(Attention Compensation)」にあります。ページを接着すると通常モデルがそれらを無視してしまうため、SelKVは接着されたページに小さな「ボリューム・ブースト」を加え、モデルが適切な量の注意を払えるようにします。

研究者たちは、3つの異なるAIモデルを用いて、複数の文書に関する質問への回答からコードの記述まで、16種類のタスクでこのシステムをテストしました。その結果、元のメモリ空間の25%のみを保持することで、SelKVはフルメモリを持っている場合とほぼ同等の性能を発揮し、いくつかの難しいマルチドキュメント・クイズでは、フルバージョンの性能を実際に上回ることさえ分かりました。選択的になることで、AIは物語の最も重要な部分に集中できたようです。さらに、テキストが膨大になったとき(10万トークン)、この手法によってAIのデコード速度は3.3倍速くなりました。論文は、このアプローチが特定のタイプのアテンション(GQAと呼ばれます)を使用する現代のAIモデルに特に適しており、強力な脳のメモリを失うことなく、高速に動作させ続ける方法を提供していると示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →