← 最新の論文
💬 NLP

Fast Byte Latent Transformer

Byte Latent Transformer(BLT)は、並列生成とスペキュレーティブデコーディングの手法を活用して推論遅延とメモリ帯域幅のコストを大幅に削減しつつ高品質を維持する、BLT-Diffusion、BLT-Self-speculation、および BLT-Diffusion+Verification という 3 つの新たな変種を導入することで、バイトレベル言語モデルの生成速度のボトルネックを解決します。

原著者: Julie Kallini, Artidoro Pagnoni, Tomasz Limisiewicz, Gargi Ghosh, Luke Zettlemoyer, Christopher Potts, Xiaochuang Han, Srinivasan Iyer

公開日 2026-05-11
📖 1 分で読めます☕ さくっと読める

原著者: Julie Kallini, Artidoro Pagnoni, Tomasz Limisiewicz, Gargi Ghosh, Luke Zettlemoyer, Christopher Potts, Xiaochuang Han, Srinivasan Iyer

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

物語を書く必要があるが、1 文字ずつ書くことを強制され、1 文字書き終えるたびに立ち止まり、巨大な図書館へ歩いて行って次の文字を確認するために巨大な百科事典を調べ、その後机まで戻らなければならないと想像してください。これが現在の「バイトレベル」の AI モデルの仕組みです。これらは非常に賢く、事前に作られた単語の断片(トークン)に依存しないためあらゆる言語を完璧に理解できますが、1 文字ごとにその「図書館への移動」を行わなければならないため、痛むほど遅いです。

この論文は、**BLT(Byte Latent Transformer)**と呼ばれる新しいモデルのファミリーと、その賢さを損なわずに実行速度を向上させる 3 つの新しい方法を紹介します。これらの手法は、図書館への往復を頻繁に行うのをやめるための異なる戦略だと考えてください。

以下に、論文が提案する 3 つの主要な戦略を、簡単な比喩を用いて説明します。

1. 「グループ推測」戦略(BLT-Diffusion)

問題点: 標準的なモデルは、1 文字書き、図書館を確認し、次の文字を書き、図書館を確認し、というのを繰り返します。
解決策: この新しい手法(BLT-Diffusion)は、1 文字ずつ推測する代わりに、空の紙のブロック全体(例えば 8 文字分)を掴み、それらを一度に埋めようとします。

  • 仕組み: クロスワードパズルを埋めていると想像してください。1 つのマス目を解くのではなく、ヒントを見て、単語の行全体を同時に推測します。いくつかの文字で行き詰まれば、それらを埋めて確認し、残りを埋めます。
  • 結果: 図書館への移動回数が減ります(モデルを通す「フォワードパス」の回数が減る)。論文によると、これにより時間とエネルギーコストを 50% 以上、場合によっては最大 92% 削減できるとされています。
  • 欠点: 1 度にブロック全体を推測するため、特にブロックが非常に大きい場合、いくつかの文字を間違える可能性があります。これはトレードオフです:速度は向上しますが、コーディングのような複雑なタスクにおける精度はわずかに低下します。

2. 「ドラフト作成アシスタント」戦略(BLT Self-Speculation)

問題点: 標準的なモデルは、不確実を感じたとき(テキストの「パッチ」が複雑になったとき)に、図書館に相談するために書き手を止めます。
解決策: この手法(BLT-S)は、「軽量なアシスタント」(ローカルデコーダ)を使用して、モデルが不確実を感じているときでも書き続けるようにします。

  • 仕組み: 通常、承認する前にすべての文をチェックするマネージャー(重厚なグローバルモデル)を想像してください。この新しいシステムでは、マネージャーはジュニア従業員(ローカルデコーダ)に、数文を自分で書き続けることを許可します。ジュニア従業員はドラフトを作成します。その後、マネージャーはドラフトを素早くレビューします。ジュニア従業員が正しければ、マネージャーはそのバッチ全体に承認を与えます。もし間違いがあれば、マネージャーはその箇所のみを修正して進みます。
  • 結果: マネージャーは頻繁に立ち止まって考える必要がなくなります。この手法は驚くほど高速であり、「グループ推測」法とは異なり、品質は全く低下しません。最終的な物語は、マネージャーがすべての文字をチェックした場合と全く同じ品質ですが、はるかに速く書かれます。

3. 「ハイブリッド」戦略(BLT Diffusion + Verification)

問題点: 「グループ推測」法は速いですが、時には間違いを犯します。「ドラフト作成アシスタント」は完璧ですが、モデルの標準的な書き方に依存します。
解決策: この手法(BLT-DV)は、この 2 つを組み合わせます。

  • 仕組み: まず、モデルは「グループ推測」法を使用してテキストのブロックを素早くドラフトします。その後、即座に「検証」モードに切り替え、そのドラフトを自身の高品質な予測と比較して確認します。
  • 結果: これは安全網として機能します。グループ推測の速度を得つつ、検証ステップが誤りを修正します。純粋なグループ推測よりはわずかに遅くなりますが、はるかに正確であり、「両者の長所を兼ね備えた」中間的な選択肢を提供します。

全体像

この論文では、言語翻訳やコンピュータコードの作成などのタスクにおいて、これらの手法をテストしました。

  • 速度: 3 つの手法すべてが、「メモリ帯域幅」コスト(モデルを実行するために必要なエネルギーとデータ移動)を大幅に削減しました。最も高速な手法(BLT-Diffusion)は、標準的なモデルと比較してコストを 50% 以上削減しました。
  • 品質: 「Self-Speculation」法は、速度を向上させながら品質を 100% 完璧に維持しました。「Diffusion」法は、難しいコーディングタスクではわずかに精度が低下しましたが、特に翻訳においては非常に良好でした。

まとめ: 著者たちは、「文字ごと」の AI モデルを、「単語ごと」のモデルとほぼ同じ速度で実行できるようにする方法を見出しました。これにより、あらゆる言語を理解したり、入力の乱れを完璧に処理したりする能力を放棄することなく、この種の AI を妨げていた最大のボトルネックを実質的に取り除くことに成功しました。彼らは、モデルにグループ単位で推測させ、先取りしてドラフトを作成させ、その作業を検証させることでこれを実現しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →