← 最新の論文
🤖 machine learning

Faster Than Flash: Exploiting Attention Sparsity for Efficient Long-Context Decoding

Faster Flash Decoding (FFD)は、選択と計算を単一のカーネルに融合させ、分布適応型のスパース性を実現するトップデルタ戦略を採用することで、モデルの精度を維持しながら最大11.6倍のカーネルレベルの高速化を実現し、256Kのコンテキスト長までスケールさせる、学習不要のハードウェア・アルゴリズム協調設計フレームワークである。

原著者: Zhigeng Liu, Zhiyuan Ning, Ruixiao Li, Xiaoran Liu, Yuerong Song, Min Zhang, Ziwei He, Xipeng Qiu

公開日 2026-09-02
📖 1 分で読めます☕ さくっと読める

原著者: Zhigeng Liu, Zhiyuan Ning, Ruixiao Li, Xiaoran Liu, Yuerong Song, Min Zhang, Ziwei He, Xipeng Qiu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界において、大規模言語モデルとして知られる現代のコンピュータプログラムは、人間の言語を理解し生成することにおいて驚くほど熟達してきました。これらのシステムは、文章内の次の単語を一度に一つのトークンずつ予測することで、一歩ずつ一貫性のある応答を構築していく仕組みで動作しています。しかし、これらのモデルがより有能になるにつれ、非常に長い文書や会話を処理しようとする際に、重大な物理的障壁に直面します。モデルが記憶すべきコンテキストが増えれば増えるほど、高速な内部メモリとメインストレージの間で絶えずデータをやり取りしなければなりません。この絶え間ないデータの移動は、まるで排水口が大きく開いた状態で庭のホースを使ってスイミングプールを満たそうとしているかのようなボトルネックを生み出します。コンピュータは実際に「思考」するよりも、情報の到着を待っていることにほとんどの時間を費やすことになり、これがプロセス全体の速度を低下させ、モデルが一度に扱えるテキストの量を制限してしまうのです。

この問題を解決するために、復旦大学と上海イノベーション研究所の研究者たちは、「Faster Flash Decoding」と呼ばれる新しい手法を開発しました。彼らのアプローチは、どの情報を保持し、どの情報を無視するかをモデルが決定する方法を変えることで、この問題に対処しています。膨大な文書の中から関連する部分を見つけ出すために、すべての単語を一つひとつ読み取ろうとする代わりに、この新システムは巧妙なショートカットを利用します。まず、会話の全履歴の非常に小さく圧縮された「スケッチ(概略)」を作成します。このスケッチは非常に小さいため、コンピュータはそれをほぼ瞬時にスキャンすることができます。このスケッチを見ることで、システムは履歴のどの部分が重要である可能性が高く、どの部分を安全に無視できるかを素早く特定できます。この迅速なスキャンの後になって初めて、モデルは選択された部分の詳細なフルバージョンを取り出し、最終的な計算を実行します。この二段階のプロセスにより、モデルは核となる意味を理解する能力を失うことなく、膨大な量の無関係なデータをスキップすることができるのです。

研究者たちは、ハイエンドなゲーミングや科学計算に使用される強力なグラフィックスカードを用いてこの手法をテストし、現在の標準的な技術よりも劇的に高速であることを確認しました。256,000トークンのコンテキストを処理する場合、この新システムは、1トークンを生成するのに要する時間を1ミリ秒以上から、そのわずかな一部へと短縮しました。全体的な速度の面では、このシステムは従来のメソッドよりも最大2.37倍速くテキストを生成しながら、同等の精度を維持しました。チームは、複雑な推論や長い文書からの特定の事実の検索を含む幅広いタスクにわたってこの性能を検証し、速度の向上が知能を犠牲にすることなく達成されたことを確認しました。このシステムはモデルを再学習させる必要がないため、既存の人工知能システムに即座に組み込んで効率を向上させることができます。

この研究における主要な革新は、情報のフィルタリングを行う特定の方法にあります。従来の手法は、最も重要な上位10個の単語だけを残すといった固定されたルールや、システム全体が進行前に一時停止して同期する必要がある複雑な計算に依存することがよくありました。新しい手法は、会話の自然な流れに適応する動的な閾値を使用します。これは、現在のコンテキストにおける最も重要な単語と比較して、著しく重要である単語を探すものであり、注意(アテンション)がどの程度集中しているかに基づいて、保持する量を調整することを可能にします。この柔軟性と、初期スキャンにおける極めて低精度のデータの使用を組み合わせることで、コンピュータは長年の課題であったメモリのボトルネックを回避することができます。その結果、提供する回答の質を犠牲にすることなく、以前は不可能だと思われていたスピードで膨大な量のテキストを処理できるシステムが実現したのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →