← 最新の論文
💬 NLP

CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention

CoSAは、カーネル認識プロキシ(Kernel-Aware Proxy)と順序スキップカーネル(Ordered-Skipping Kernel)を組み合わせることでブロックの選択とスキップを動的に最適化し、厳格な計算予算の下でも高い精度を維持しながら、ロングコンテキストLLMに対して大幅な推論速度向上とレイテンシ削減を実現する、学習を必要としない2段階のスパースアテンションフレームワークである。

原著者: Yufei Xue, Lin Niu, Hong Liu, Siran Liu, Hanyong Shao, Wei Liu, Guanghua Yu, Jianchen Zhu, Jun Zhang

公開日 2026-07-29
📖 1 分で読めます☕ さくっと読める

原著者: Yufei Xue, Lin Niu, Hong Liu, Siran Liu, Hanyong Shao, Wei Liu, Guanghua Yu, Jianchen Zhu, Jun Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、たった一つの質問に答えるために、12万8000ページもある膨大な百科事典を読もうとしていると想像してみてください。人工知能の世界では、これらの「百科事典」は大規模言語モデル(LLM)と呼ばれ、その「読む」プロセスが、モデルがいかに文脈を理解するかを決定します。問題は、これらのモデルの標準的な読み方が、質問について考え始める前に、本の最初の単語から最後の単語まで、全ページを読まなければならないと固執する司書のようなものであることです。本が長くなればなるなるほど、この「すべてを読む」というアプローチは、レンガの詰まったバックパックを背負ってマラソンをする時のように、苦痛なほど遅く、高価なものになります。

これを解決するために、科学者たちは司書にもっと選択的になるよう教えようとしてきました。それが「スパース・アテンション(疎な注意)」と呼ばれる技術です。すべてのページを読む代わりに、モデルはどのページが重要かを推測し、残りのページをスキップしようとします。通常、これには2つのステップが含まれます。まず、素早い「プロキシ(代理人/推測役)」が本に目を通し、重要なページに単純な「はい」または「いいえ」のリストを付けてマークします。次に、「カーネル(実作業者)」がそのリストに従い、重労働を行います。これはまともなシステムですが、欠点があります。本が巨大になり、時間を節約するためにスキップするページを非常に厳格に選別しなければならないとき、素早い推測役が間違いを犯し始め、作業者はその不完全なリストを盲目的に従ってしまいます。その結果、モデルは高速化しますが、重要な詳細を見落とし始めます。まるで、退屈だと思ったからといって物語のクライマックスを飛ばしてしまう司書のようなものです。

ここで、CoSA(Co-Designed Sparse Attention)と呼ばれる新しい手法が登場します。CoSAの研究者たちは、「推測役」と「作業者」がバラバラに動いていたことが、負荷がかかった際にシステムを崩壊させる原因であることに気づきました。彼らは、このプロセス全体を再設計し、両者がチームとして機能するようにしました。単に作業者に「はい/いいえ」のリストを渡すのではなく、新しい「推測役」(カーネル・アウェア・プロキシ、KAPと呼ばれます)は、優先順位リストを渡すのです。それは単に「このページを読んで」と言うのではなく、「まずこのページを読み、次にこれ、その次にこれ、という順で読んで」と指示します。

ここにある魔法のトリックがあります。作業者(オーダー・スキッピング・カーネル、OSKと呼ばれます)は、この優先順位リストを使用して、ページの読む順番を並べ替えます。最も重要なページを最初に読むことで、作業者は何が重要であるかについての「走行スコア(running score)」を早い段階で構築できます。重要な情報をすぐに把握できるため、混乱することなく、プロセスの中でさらに多くのページを自信を持ってスキップできるようになります。それは、ミステリー小説を読んでいるときに、探偵から「犯人を見つけるために最初の3章を読みなさい。そうすれば、その後の50章にわたるガーデニングのコツなどは安全にスキップできます」と言われるようなものです。

論文によれば、このチームワークによるアプローチはゲームチェンジャーとなります。12万8000トークン(長い小説一冊分に相当)もの長い文脈を読み取るモデルを用いたテストにおいて、CoSAは「アテンション」部分のプロセスを4.93倍高速化し、最初の単語を生成するまでの時間を2.53倍短縮しました。極めて重要なのは、モデルが物語を理解したり複雑な推論問題を解いたりする能力を失うことなく、これらを実現した点です。研究者たちは、プロキシとカーネルが互いに話し合い、特定の操作手順を共有させることで、モデルの賢さを維持したまま、より積極的に作業をスキップできることを発見しました。AIの世界では、どのページを読むかを知ることと同じくらい、いつ そのページを読むかを知ることが重要であると言えます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →