← 最新の論文
🤖 machine learning

Pipeline-Native Transformers: Co-Designing Model Architecture and CPU Inference for Bandwidth-Efficient Autoregressive Decode

本論文は、単一トークンの自己回帰的デコーディングにおけるメモリ帯域幅のボトルネックを克服するために、パイプラインネイティブなTransformerアーキテクチャと共に設計されたCPUファーストのストリーミングエンジンであるcflowを紹介し、L2サイズのウェイトタイリング、top-kエキスパート選択、および非同期I/Oオーバーラップを活用することで、32-vCPUサーバー上で最大2.00倍のクリティカルパス・ウェイト帯域幅削減と5.94 tokens/sを達成している。

原著者: Tom Poperszky

公開日 2026-08-26
📖 1 分で読めます☕ さくっと読める

原著者: Tom Poperszky

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界において、最も強力なコンピュータプログラムは、しばしば数十億個の小さなスイッチで作られた「脳」を持っていると表現されます。これらのスイッチ、すなわち「重み」は、広大な図書室の棚に並んだ本のように、コンピュータのメインメモリに保存されています。予測を行ったり、単語を一つ生成したりするために、コンピュータは棚から正しい本を取り出し、それを読み、計算を実行しなければなりません。長年、エンジニアたちはこれらの計算の速度こそが制限要因であると考えてきました。つまり、プロセッサの思考を速くできれば、プログラムも速く走るはずだと信じてきたのです。しかし、新しい研究の一派は、この仮定は、これらのプログラムが最も一般的に使用される形態、すなわち「一度に一つの単語を生成する」モードにおいては間違っていると示唆しています。この特定のモードでは、プロセッサは自らの脳が考えるのを待っているのではありません。メモリがデータを受け渡すのを待っているのです。プロセッサは非常に高速であるため、そのほとんどの時間を、次の本が届くのを待ちながら、空の棚をじっと見つめて過ごしている状態になります。これにより、システム全体の速度が、コンピュータがいかに速く計算できるかではなく、メモリの棚からプロセッサへいかに速くデータを移動できるかによって決定されるというボトルネックが生じます。

トム・ポパーズキーという研究者は、これらの「本」を棚に整理する標準的な方法が、全く異なる種類のコンピュータのために設計されたものであると気づくことで、この問題に取り組みました。現代のほとんどのAIモデルは、一度に多くの本を読むことに長けた特化型のグラフィックスチップで動作するように構築されています。しかし、これらのモデルを標準的なコンピュータプロセッサで実行すると、古い整理方法のせいで、プロセッサは棚の中をあちこち飛び回り、ハードウェアが予測できないような無秩序な順序でデータを取得することになり、時間を浪費してしまいます。ポパーズキーの研究は、急進的な解決策を提案しています。それは、古いモデルを新しいハードウェアでより良く動かそうとするのではなく、モデルとそれを実行するソフトウェアの両方を、最初から一体となって機能するように再設計するというものです。彼は、モデルのデータをプロセッサの即時作業スペースに完璧に収まるような小さく整然とした塊(チャンク)として保存する新しい方法を生み出し、コンピュータがこれらの塊を途切れることなくスムーズに連続して読み取れるよう、モデルの内部命令を書き換えました。

この新しいアプローチの中核となるのは、「cflow」と呼ばれる、コンピュータにとって極めて効率的な司書として機能するシステムです。標準的なセットアップでは、コンピュータが単語を生成する必要があるとき、モデルの特定のパーツに関する指示の全セットをロードしなければならないことがよくあります。これは、たった一つの事実を見つけるために百科事典全体を開くようなものです。ポパーズキーのシステムは、データを「タイル」と呼ばれる、およそページ一枚分ほどの大きさの小さな単位に整理し、コンピュータが必要とする正確な順序で保存することで、これを変えました。コンピュータが次の情報のリクエストを行うと、システムは次のタイルを即座にスライドさせて配置し、プロセッサを常に稼働させ続けます。さらに、「混合エキスパート(mixture of experts)」を用いるモデル、つまり各タスクに対していくつかの専門的なサブルーチンを選択する手法を用いるモデルに対しては、新しいシステムは必要な瞬間に必要な特定のサブルーチンのみをロードし、残りは棚に置いたままにします。これにより、単語を一つ生成するたびに、使用されない何千もの命令をロードするという無駄を排除しています。

このシステムを実現するために、研究者はモデル自体のアーキテクチャを変更する必要がありました。標準的なモデルは、一つのステップが完全に終了してから次のステップが始まるという、厳格な組立ラインのような構造で作られています。この構造により、コンピュータは次の指示の読み取りを開始する前に、ライン全体が終了するのを待たなければなりません。ポパーズキーは、コンピュータが現在のステップを完了している間に、次のステップの指示を読み始めることができる「垂直パイプライン」を可能にするよう、モデルを再設計しました。これは、モデルが前のステップからのわずかに遅延した情報を受け入れるように訓練されたからこそ可能になったことであり、標準的なモデルではエラーを引き起こすような変更ですが、この新しい設計では完璧に機能します。これら再設計されたモデルの5つの異なるバージョンを訓練した結果、研究者は、特定の構成を用いることで、コンピュータが移動すべきデータ量を半分に削減できることを見出しました。このデータ移動の削減は、直接的に速度向上につながります。なぜなら、コンピュータが待機する時間を減らし、作業する時間を増やせるからです。

この共同設計の結果は、実際のハードウェア上で測定され、既存のソフトウェアに対する明確な優位性を明らかにしました。標準的なサーバーコンピュータにおいて、新しいシステムは毎秒約6単語の速度でテキストを生成し、同じマシン上でわずか約4.5単語しか生成できなかった最高水準の代替案を上回りました。この改善は単なる理論的な計算ではなく、コンピュータのメモリへのアクセス回数を減らすことによって達成された、現実世界でのスピードアップでした。また、研究では、次にどこを探すべきかをコンピュータに伝える明示的な指示を使用するといった他のアイデアについてもテストが行われました。驚くべきことに、テストの結果、これらの指示は役に立たないばかりか、時にはシステムを遅らせることさえ分かりました。なぜなら、コンピュータ自身のハードウェアが、次に何が必要かを予測する上で既に優れた働きをしていたからです。この発見は極めて重要です。なぜなら、一般的な最適化手法を否定し、真の利点がデータの根本的な再編成とモデルの再編成から来ていることを裏付けるものだからです。

この研究では、モデルが大きくなった場合にこれらの変更がどのように維持されるかについても調査されました。分析によれば、テストされたモデルについては大幅なスピードアップが見られるものの、具体的な恩恵はモデルのサイズや使用されるコンピュータの種類に依存することが示唆されています。非常に大規模なモデルになると、ボトルネックは再び変化する可能性がありますが、原則は変わりません。モデルの構造をコンピュータのメモリ読み取り方式に適合させることで、以前は不可能だと思われていた速度を引き出すことが可能です。この研究は、日常的なコンピュータにおける現在の人工知能の限界は、固定された物理法則ではなく、変更可能な設計上の選択であることを示しています。モデルとランタイムを二つの別々の部品としてではなく、単一の統合されたシステムとして扱うことで、コンピュータが自身のハードウェアの速度で思考できるように、データの移動を整理された図書室のような効率性で実現できるのです。このアプローチは、強力なAIを専用チップのないデバイスで実行するための明確な道筋を示しており、高度な知能をより身近でレスポンシブなものにしていきます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →