← 最新の論文
🤖 AI

Pre-Compiled Pipeline Shards for Distributed LLM Inference on Intel AI PC Fleets

本論文は、単一デバイスのメモリ制限を超える大規模LLM(最大70Bパラメータ)のインタラクティブな速度での実行を可能にするため、複数のアイドル状態のIntel AI PC間で事前コンパイルされたOpenVINOパイプラインシャードを活用する分散推論システムを提示し、最適化されたグラフ融合、投機的デコーディング、およびリクエストインターリービングを通じて高いスループットを実現するものである。

原著者: Tate Berenbaum, Muthaiah Venkatachalam

公開日 2026-08-20
📖 1 分で読めます☕ さくっと読める

原著者: Tate Berenbaum, Muthaiah Venkatachalam

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代のコンピューティングの世界において、人工知能に特化して設計された強力なプロセッサを搭載した、新しい種類のパーソナルコンピュータが登場しました。これらのマシンは、洗練されたノートパソコンによく見られ、大規模言語モデル(文章を書いたり、推論したり、会話したりできるプログラム)を実行できる専用チップを内蔵しています。しかし、単一のマシンには厳しい限界があります。そのメモリは、最も高度なモデルが持つ巨大な「脳」を保持するには小さすぎ、それらのモデルは一台のデバイスが提供できる容量をはるかに超えるストレージを必要とするのです。従来、これらの巨大なモデルを実行するために、ユーザーは遠く離れた高価なクラウドサーバーに頼り、インターネット経于て質問を送り、返答を待たなければなりませんでした。これは外部インフラへの依存を生み、機密情報がローカルマシンから離れなければならないというデータプライバシーへの懸念を引き起こします。研究者たちが直面した問いは、標準的なオフィスネットワークで接続された、これらの一連のありふれたアイドル状態のパーソナルコンピュータのグループが、単独のコンピュータには収まりきらないほど大きなモデルを実行しつつ、データをローカルに保持し、かつ現実的な会話が可能なほど高速なレスポンスを実現できるかどうかでした。

研究チームはこの問いに答えるため、大規模な人工知能モデルを小さな断片に分割し、小さな艦隊(フリート)内の各コンピュータに一つの断片を割り当てるシステムを構築することで、この問題に挑みました。あまりにも重くて一人では運べない巨大な本を想像してみてください。代わりに、一列に並んだグループの人々が、それぞれ一章ずつを持つことにします。物語が進むにつれて、最初の人が自分の章を読み、その文脈を次の人に渡し、次の人が自分の章を読み、といった具合に、最後の人が文章を終えるまで続きます。このシステムにおいて、「章」はAIモデルのレイヤーであり、「受け渡し」は標準的なネットワーク接続を通じて行われます。研究者たちは、単にこのようにモデルを分割するだけでは不十分であることを発見しました。コンピュータ間の受け渡しが遅すぎ、また作業のチェックプロセスがぎこちないため、システムが鈍重になってしまうのです。これを解決するために、彼らは、この遅い実験的なセットアップを、高速で実用的なツールへと変貌させる3つの具体的な手法を開発しました。

第一の突破口は、モデルの断片が起動される前の準備段階における、微細な変更に関わるものでした。研究者がモデルのレイヤーをコンピュータのグラフィックスチップ上で実行するためにエクスポートした際、ソフトウェアは通常速度を上げるための重要な最適化を見落としていました。各断片のコードに特定の単純な命令を注入することで、彼らはグラフィックスプロセッサの隠れた効率性を解き放ちました。この小さな調整により、分割された断片は、単一のマシンで実行される元の分割されていないモデルとほぼ同等の速度で動作できるようになりました。この修正がなければ、システムは著しく低速になりますが、この修正によってパフォーマンスの差はほぼ消失し、モデルを分割しても速度を犠牲にすることなく実行できることが証明されました。

第二の課題は、AIの思考を加速させるために使用される「ドラフト(下書き)」プロセスの処理でした。通常、より小さく高速なモデルが次の数語を予測し、メインのモデルがそれらを検証します。もし予測が間違っていた場合、メインのモデルは誤った予測を破棄して最初からやり直さなければなりません。これらのコンピュータで使用されている専用チップでは、誤った予測を破棄する標準的な方法は非常に遅く、修正のたびに0.5秒近くかかることもあり、会話の流れを台無しにするのに十分な時間でした。研究者たちは賢明な回避策を見出しました。誤った予測をコンピュータのメモリから物理的に削除する代わりに、単にAIにそれらを無視するように指示したのです。背景データの中で誤った予測を「不可視」としてマークすることで、システムは削除する場合と全く同じ結果を、わずかな時間で達成しました。これにより、システムはペナルティを受けることなく高速なドラフト技術を使用できるようになり、AIのレスポンスが大幅に向上しました。

第三の革新は、システムが複数のユーザーに同時にサービスを提供できるようにしたことです。標準的なセットアップでは、ラインの中の一台のコンピュータが作業している間、他のコンピュータは自分の番を待ってアイドル状態になることがよくあります。研究者たちは、コンピュータが異なるユーザーからのリクエストを同時に処理できる方法を設計しました。あるコンピュータがユーザーAのために文章を書き終えている間に、ラインの次のコンピュータはすでにユーザーBのために文章を開始することができます。このようなタスクのインターリービング(交互処理)により、艦隊内のすべてのマシンが稼働状態に保たれ、グループ全体の総速度を効果的に倍増させました。他の2つの修正と組み合わせることで、このアプローチにより、2台のコンピュータの艦隊は、単一のコンピュータが1人のユーザーにサービスを提供する速度のほぼ2倍の速度で、2人のユーザーにサービスを提供することができました。

結果は、標準的なWi-Fiネットワークで接続された3台のハイエンドノートパソコンの艦隊を用いて測定されました。テストでは、2台のコンピュータ構成で動作する人気のある80億パラメータのモデルは、自然でインタラクティブな会話に十分な、毎秒約44語の速度で2人のユーザーにサービスを提供しました。これは、単一のコンピュータが同じモデルを1人のユーザーに対して実行する場合よりも1.79倍高速でした。さらに印象的なことに、研究者が低速で長距離のインターネット接続をシミュレートした場合でも、システムは使用可能な状態を維持しましたが、最適化されていない同様のセットアップは実用的ではないほど低速になりました。また、システムは巨大な700億パラメータのモデルを実行する際にも成功し、そのサイズは艦隊内のどの単一のコンピュータでも保持できないものでした。この巨大なモデルを4台のコンピュータに分割することで、チームはインタラクティブな速度を達成し、消費者向けのデバイスのグループが、かつては大規模なデータセンターに予約されていたタスクを処理できることを証明しました。

研究では、このシステムが異なる条件下でどのように動作するかについても調査されました。彼らは、ネットワークの速度よりも、コンピュータ間の受け渡しの効率の方が重要であることを発見しました。接続が遅い場合、システムは一度のパスでより多くの単語を処理することで補完し、遅延を平滑化しました。また、広域ネットワーク(WAN)接続を用いたテストにおいても、適切な最適化を行えば、コンピュータ同士が離れていても艦隊が安定した会話速度を維持できることが確認されました。研究者たちは、このシステムは良好に動作するものの、暗号化や認証のような組み込みのセキュリティ機能を含んでいないため、信頼できる環境に依存していると指摘しました。さらに、計算中に発生する物理的な熱が、持続的な使用によって最終的に処理速度を低下させる可能性があることも観察されており、これは実際の運用において管理すべき要因となります。

結局のところ、この研究は、強力な人工知能を実行するための障壁はハードウェアだけでなく、そのハードウェアがいかに使われるかにあることを示しています。モデルの分割方法、エラーの修正方法、そして複数のユーザーへの提供方法を再考することで、平凡なコンピュータの小さなグループが、単一の強力なマシンのように振る舞うことができます。研究者たちは、結果を検証し、システムを構築できるように、彼らのコードとデータを一般に公開しました。これらの知見は、近い将来、組織がすでに所有しているコンピュータを使用して、独自のプライベートで高速なAIクラスターを運用し、データをローカルに保持しながら、外部のクラウドサービスへの依存を減らせる可能性を示唆しています。このシステムは、適切なソフトウェアがあれば、アイドル状態の機械の艦隊の集合的な力が、かつてはスーパーコンピュータを必要とすると考えられていた問題を解決するために活用できることを証明しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →