← 最新の論文
💬 NLP

BLASST: Dynamic BLocked Attention Sparsity via Softmax Thresholding

BLASST は、学習や事前計算を不要とし、既存のフレームワークに容易に統合可能な動的なスパースアテンション手法として、オンラインソフトマックス統計量を活用して不要なアテンションブロックをスキップすることで、精度を維持しつつ推論速度を大幅に向上させる。

原著者: Jiayi Yuan, Cameron Shinn, Kai Xu, Jingze Cui, George Klimiashvili, Guangxuan Xiao, Perkz Zheng, Bo Li, Yuxin Zhou, Zhouhai Ye, Weijie You, Tian Zheng, Dominic Brown, Pengbo Wang, Markus Hoehnerbach
公開日 2026-04-07
📖 1 分で読めます☕ さくっと読める

原著者: Jiayi Yuan, Cameron Shinn, Kai Xu, Jingze Cui, George Klimiashvili, Guangxuan Xiao, Perkz Zheng, Bo Li, Yuxin Zhou, Zhouhai Ye, Weijie You, Tian Zheng, Dominic Brown, Pengbo Wang, Markus Hoehnerbach, Richard Cai, Julien Demouth, John D. Owens, Xia Hu, Song Han, Timmy Liu, Huizi Mao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

BLASST: 長文の AI 読み込みを「無駄な作業」から解放する新技術

こんにちは!今回は、大規模言語モデル(LLM)の「長い文章を読む・考える」能力を劇的に速くする新しい技術**「BLASST(ブラスト)」**について、難しい数式を使わずに、身近な例え話で解説します。

🧠 問題:AI が「長い本」を読むときの悩み

皆さんは、AI に「この 1000 ページの技術書を読んで要約して」と頼んだことがありますか?
従来の AI は、**「すべてのページを、すべてのページと照らし合わせて、重要度を確認する」**という作業を、まるで「全ページを 1 枚ずつコピーして、全ページ同士を比較する」ような重労働で処理していました。

  • 問題点: 文章が長くなると、この作業量は**「2 乗」**で爆発的に増えます。
  • 結果: 100 ページなら瞬時でも、10 万ページ(10 万トークン)になると、AI は「計算しすぎて疲れてしまい、メモリもパンクして、答えが出るのに時間がかかる」という状態になります。

✂️ 解決策:BLASST(ブラスト)の「スマートな捨てる」

BLASST は、この重労働を**「本当に重要な部分だけ残して、それ以外は思い切って捨てる」**という発想で解決します。

🌟 アナロジー:「図書館の司書」の話

AI が文章を処理する様子を、**「巨大な図書館の司書」**に例えてみましょう。

  1. 従来の方法(全照合):
    司書は、読者が「A さんの話」について聞きたいとき、**「図書館にあるすべての本(10 万冊)」**を 1 冊ずつ開いて、「A さんが出てくるか?」をチェックします。

    • 結果: 99% の本には A さんが出てきませんが、確認するために全部開くので、時間と体力(計算リソース)が莫大にかかります。
  2. BLASST の方法(動的な閾値):
    BLASST は、司書に**「魔法のルーレット」**を与えます。

    • 司書は本をパラパラめくりながら、「今のところ、A さんが出てきた**『最も重要なページ』**のスコア」を頭に入れておきます。
    • 次に新しい本を開いたとき、**「この本の中の A さんの登場頻度(スコア)が、今の最高スコアより『かなり低い』なら、この本は開かずにスキップする!」**と即座に判断します。
    • メリット: 99% の本は「開く必要がない」と判断され、司書は**「開く作業(計算)」も「本を棚から出す作業(メモリ読み込み)」も省く**ことができます。

🔑 BLASST の 3 つのすごいポイント

この技術が画期的な理由は、以下の 3 点です。

1. 🚫 事前学習も事前計算も不要(「その場で判断」)

他の多くの技術は、「どのページを捨てるか」を決めるために、事前に特別なトレーニングをしたり、文章全体を一度読んで「重要度マップ」を作成したりしていました。

  • BLASST: 「今、この瞬間に計算している情報」だけで判断します。
    • 例え: 事前に地図を用意する必要はなく、歩きながら「ここは遠回りだな」と思えば、その場でルートを変えるようなものです。そのため、**「すぐに使える(Drop-in)」**のが最大の特徴です。

2. 🏃‍♂️ 読み込み(Prefill)と生成(Decode)の両方を加速

  • 読み込み(文章を全部読む): 計算能力が足りないのがボトルネック。BLASST は「計算自体」を減らします。
  • 生成(1 文字ずつ答える): メモリ(本棚)から本を取り出すのが遅いのがボトルネック。BLASST は「取り出す本(値の読み込み)」自体を減らします。
    • 結果: 文章を読み込む速度も、回答を生成する速度も、どちらも 1.5 倍近く速くなりました。

3. 🎚️ 自動調整機能(「長さ」に合わせた自動感度)

「どのくらい捨てるか」を決める基準(閾値)は、文章の長さによって変える必要があります。

  • 短い文章: 基準を少し厳しくしないと、重要な情報まで捨ててしまいます。
  • 長い文章: 基準を緩くしないと、捨てるべきゴミまで残ってしまいます。
  • BLASST: 「文章の長さ」を測るだけで、「どのくらい厳しく捨てるか」を自動で計算してくれます。人間が手動で調整する必要はありません。

📊 実際の効果は?

実験結果によると、BLASST を使えば:

  • 精度: ほとんど落ちません(むしろ、ノイズを削ぎ落とすことで、在某些のタスクでは精度が上がることも)。
  • 速度: 70% 以上の計算を省いても、1.5 倍速で動作します。
  • 対応: 最新の GPU(Blackwell や Hopper)で最適化されており、既存の AI フレームワークに簡単に取り入れられます。

🎉 まとめ

BLASST は、AI が「長い文章」を処理する際の**「無駄な努力」を排除するスマートな技術**です。

  • 従来の AI: 「全部確認してから捨てる」→ 疲れる、遅い。
  • BLASST の AI: 「重要度を見て、明らかに不要なものは最初から触らない」→ 楽、速い。

これにより、AI は「全コードのレビュー」や「長い論文の要約」、「長時間の会話」を、これまでよりもはるかにスムーズにこなせるようになります。まるで、**「賢い司書が、無駄な本棚巡りをやめて、本当に必要な本だけを素早く取り出せるようになった」**ようなものです。

この技術は、今後、より長く、より複雑なタスクをこなす AI 時代への重要な一歩となるでしょう。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →