← 最新の論文
💻 computer science

BF16 Component-Product Emulation of FP32 and FP64 GEMM on Intel AMX

本論文は、Intel AMX BF16行列積を利用して高精度なFP32およびFP64のGEMM演算をエミュレートするCPU指向のアルゴリズムを提案しており、オペランドを複数の低精度コンポーネントに分解し、それらをより高い精度で累積させることで、競争力のあるスループットと調整可能な精度を実現している。

原著者: Bing Cui, Yu Liu

公開日 2026-09-07✓ Author reviewed
📖 1 分で読めます☕ さくっと読める

原著者: Bing Cui, Yu Liu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代のコンピュータは、その内部構造において拡大する分裂を抱えています。一方には、人工知能のために特別に設計された強力なエンジンがあり、これらは数十億もの単純な計算を極めて高速に実行することに長けています。これらのエンジンは、膨大なスピードを得るために、わずかな詳細さを犠牲にして、短く単純な数値を扱うことを得意としています。もう一方には、気象パターンのシミュレーション、原子の結合モデル、流体の流れの予測といった科学的発見の世界があり、そこでは依然として長く精密な数値が求められています。これらの科学的な計算は、安定性と正確性を維持するためにあらゆる細部を必要としますが、それらを処理する標準的なコンピュータ部品は、新しいAIエンジンほど高速で効率的ではないことがよくあります。これはジレンマを生み出しています。科学者は新しいハードウェアのスピードを必要としていますが、彼らの研究が求める精度を失うわけにはいかないのです。

中国のMaginfra Co., Ltd.の研究者たちは、Intel AMXと呼ばれる特定の種類のコンピュータチップを使用して、この溝を埋める方法を模索しました。彼らの目標は、高速で低精度のAIエンジンを、科学に必要な低速で高精度の数学を実行するように「騙す」ことができるかどうかを確認することでした。チップに直接難しい数学を行わせる代わりに、彼らは問題をより小さく単純な断片へと分解しました。非常に長い距離を、1インチ単位の目盛りしかない定規で測ろうとしている場面を想像してみてください。あなたはまず整数部分のインチを測り、次に残った端数を測り、さらに残った極小の破片を測り、それらすべてを足し合わせることで、正確な合計値を導き出すことができます。研究者たちはこの論理を数値にも適用しました。彼らは一つの複雑な数値を、高速なAIエンジンが容易に扱えるいくつかの単純なパーツに分割しました。そして、それらのパーツに対して多くの迅速な計算を行い、最終的に高度に正確な答えを再構成するために、結果を注意深く足し合わせたのです。

チームはこのアプローチを、2つの異なる精度レベルでテストしました。まず、多くの科学的アプリケーションの標準である単精度数学に取り組みました。彼らは、各数値を3つのパーツに分割し、6つの特定の計算を実行することで、既存の最高水準のソフトウェアと同等の精度を実現しつつ、大幅に高速化できることを見出しました。テストしたコンピュータチップにおいて、この手法は標準的な計算方法よりも1.14倍から2.56倍高速に動作しました。このスピードアップは、数値を分割して再組み立てする際のオーバーヘッドが、純粋な計算速度に比べて重要性を失うような、より大きなデータセットにおいて最も顕著に見られました。

さらに、より厳密で、最も要求の厳しい科学シミュレーションに使用される倍精度数学へと移行すると、課題は増大しました。ここでは、研究者は各数値を6つのパーツに分割する必要がありました。計算結果を極めて慎重に再組み立てする必要があるため、プロセスはより複雑になりました。彼らは、6個から21個の小さな計算パーツを保持するという、さまざまなバージョンのこの手法をテストしました。彼らは明確なトレードオフを発見しました。つまり、パーツを多く保持するほど答えはより正確になりますが、同時にプロセスも遅くなるということです。わずか6つのパーツを使用した場合、この手法は非常に大規模な問題に対して標準的なソフトウェアを打ち負かすのに十分な速さであり、最大1.7倍高速に動作しました。しかし、精度を高めるためにパーツを増やしていくと、それらを管理するための余分な作業がスピードの利点を食いつぶしてしまいました。最終的に、21個のパーツを保持しようとすると、たとえより正確であったとしても、標準的な手法よりも遅くなってしまいました。

この研究はまた、このテクニックがあらゆる状況に対する普遍的な解決策ではないことも明らかにしました。この手法は、計算される数値が特定の範囲内に留まっている場合に最も効果を発揮します。これは、限られた長さの定規では、特別な調整なしにはあまりに広大な距離や、あまりに微小な距離を測ることができないのと似ています。研究者たちは、彼らの手法がすべての種類の数値に対して機能するわけではなく、特に極端に大きい、あるいは極端に小さい数値には適さないことを指摘しました。また、既存のソフトウェアとビット単位で完全に一致することを保証するものでもありません。むしろ、これはデータが手法の制限内に収まっている場合に、高いスピードと高い精度を必要とする科学者に新たなツールを提供するものです。低精度のハードウェアを用いて高精度の問題を解決できることを示すことで、この研究は、人工知能のために構築された特化したエンジンが、科学的発見の重労働を加速させる未来を示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →