← 最新の論文
💬 NLP

Efficient INT8 Inference of Small NLP Models on Server CPUs with PyTorch Native Stack

本論文は、グラフレベルの融合と最適化されたカーネル選択を通じて、精度低下をほとんど伴わずに小規模なNLPモデルのサーバーCPU上でのINT8推論において最大5.8倍のスループット向上を実現する、SmoothQuantのネイティブなPyTorch実装を提示しており、このソリューションは現在PyTorchおよびTorchAOにアップストリームされています。

原著者: Weiwen Xia, Yuxin Cui, E Cao

公開日 2026-08-20
📖 1 分で読めます☕ さくっと読める

原著者: Weiwen Xia, Yuxin Cui, E Cao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界では、巨大で全知全能なチャットボットに関する派手な見出しの傍らで、静かな革命が起きている。大衆の目が、詩を書いたり複雑な論理パズルを解いたりできる巨大なモデルに釘付けられている一方で、検索結果、製品の推奨、スパムフィルターといったインターネットの日常的なトラフィックを支えるエンジンは、より小さく特化したプログラムに依存している。これらのプログラムは、多くの場合、BERTとして知られる設計のファミリーに基づいた「働き手」である。これらは、特殊で高価なグラフィックスカードではなく、世界中のデータセンターで見られるような標準的なコンピュータサーバー上で動作する。これらのシステムにとっては、生の大きさよりも、速度とコストが重要なのである。エンジニアにとっての長年の課題は、有用性を維持するための精度を犠牲にすることなく、いかにしてこれらのモデルを高速化するかであった。これを行う強力な方法の一つは、コンピュータが行う数学的計算を簡略化し、わずかな精度を犠牲にして大幅な速度向上を得ることであり、この手法は「量子化(クオンタイゼーション)」として知られている。

Intel Corporationの研究チームは現在、これらの小型言語モデルが、開発者が今日使用している最も普及したソフトウェアツールの中で、この簡略化された数学を用いて直接動作することを可能にする架け橋を築いた。彼らの研究は、SmoothQuantと呼ばれる特定の手法に焦点を当てており、これは言語を理解する能力を失うことなく、モデルが簡略化された数学を扱えるように準備するものである。この手法を標準的なPyTorchソフトウェアスタックに統合することで、彼らは特別なサードパーティ製ツールや複雑な書き換えを必要としない経路を作り出した。その結果、標準的な言語モデルを取り込み、現代のサーバープロセッサ上で大幅に高速化させつつ、提供される回答の正確性を以前と同様に維持できるシステムが誕生した。

研究者たちは一般的な問題から着手した。すなわち、現代のコンピュータプロセッサには簡略化された数学を迅速に処理するための組み込み命令が存在するものの、モデルを構築するために使用されるソフトウェアツールが、それらを効率的に使用する方法を知らないことが多かったのである。モデルを高速化するために準備された際、ソフトウェアはデータの変換や簡略化された計算の管理に必要なステップで停滞し、ハードウェアが約束していたはずの速度を浪費してしまうことがよくあった。これを解決するため、チームは3つの異なるテクノロジーの断片を、単一のシームレスなワークフローへと結合した。まず、モデルを準備するためにTorchAOというツールを使用し、データを滑らかにすることで安全に簡略化できるようにした。次に、TorchInductorというコンパイラを使用して、モデルの計算全体の流れを俯瞰し、それらを統合して、通常は処理を遅延させる不要なステップを取り除いた。最後に、コンピュータのプロセッサが、高度な機能を備えた新しいモデルであるか、あるいは依然として広く使用されている信頼性の高い古いモデルであるかに応じて、コアとなる数学的操作を実行するための絶対的に最も速い方法を選択するようにシステムを学習させた。

彼らの創造物をテストするために、チームは2世代の異なるIntelサーバープロセッサを用いて実験を行った。彼らは、大規模で複雑なバージョンから、より小さくコンパクトなものまで、3つの異なるタイプの言語モデルを用いてテストを行った。結果は驚くべきものであった。新しいプロセッサでは、システムは標準的な未最適化バージョンよりも最大5.8倍速く動作した。古いプロセッサにおいても、依然として3倍近い速度を実現した。おそらく最も重要なことは、この速度が品質を犠牲にしなかったことである。研究者がテキストからの質問への回答や文章の感情分析といった実世界のタスクに対してモデルをテストした際、簡略化されたモデルは、元の低速なバージョンと同じ頻度で正解を導き出した。多くの場合、精度の差は非常に小さく、測定すら不可能なレベルであった。

チームはまた、データの移動速度と計算速度の限界をマッピングする手法を用いて、なぜ速度向上が起こったのかを詳細に調査した。その結果、新しいプロセッサにおいては、速度はデータの移動速度によって制限されており、古いプロセッサにおいては、計算の実行速度によって制限されていることが分かった。彼らのシステムは、これら両方の制限を効果的に回避していた。彼らは、データを事前に準備しておくことで、コンピュータが作業中に情報を再編成するために停止する必要をなくし、それによってハードウェアの潜在能力を最大限に引き出せることを発見した。さらに、簡略化された数学のための特定の命令を持たない古いプロセッサに対して、別の利用可能な命令を使用して同様の結果を得るという、巧妙な回避策も見出した。

この研究が重要である理由は、これらのモデルを効率的に展開したいと考えている企業にとって、大きな障壁を取り除くからである。以前は、このレベルのパフォーマンスを得るためには、メンテナンスが困難な特殊なツールを使用するか、標準的なソフトウェア環境を離れる必要があった。現在では、開発者はすでに使い慣れたツールを使用するだけで、同じ高いパフォーマンスを得ることができる。研究者たちはコードをコミュニティ全体に共有しており、これは、標準的なツールを使用している誰もが、即座にこのスピードアップの恩恵を受けられることを意味している。この研究は、モデルやそれが実行するソフトウェアの根本的な性質を変えることなく、インターネットの働き手をより速く、より効率的にすることが可能であることを裏付けている。コンピュータが数学をどのように処理するかを注意深く最適化することで、チームは、標準的なサーバー上での効率的な人工知能の未来が、単なる可能性ではなく、今日から利用可能な現実であることを示したのである。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →