← Neueste Arbeiten
💻 computer science

BF16 Component-Product Emulation of FP32 and FP64 GEMM on Intel AMX

Dieses Paper präsentiert einen CPU-orientierten Algorithmus, der Intel AMX BF16-Matrixprodukte nutzt, um hochpräzise FP32- und FP64-GEMM-Operationen zu emulieren, wobei durch die Zerlegung der Operanden in mehrere Niedrigpräzisionskomponenten und deren Akkumulation in höherer Präzision ein wettbewerbsfähiger Durchsatz sowie eine abstimmbare Genauigkeit erreicht werden.

Ursprüngliche Autoren: Bing Cui, Yu Liu

Veröffentlicht 2026-09-07✓ Author reviewed
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Bing Cui, Yu Liu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Moderne Computer werden mit einer wachsenden Spaltung in ihrer internen Mechanik gebaut. Auf der einen Seite gibt es leistungsstarke Motoren, die speziell für künstliche Intelligenz entwickelt wurden und sich darin auszeichnen, Milliarden einfacher Berechnungen sehr schnell durchzuführen. Diese Motoren arbeiten am besten mit Zahlen, die kurz und einfach sind, wobei sie ein winziges Stück Detailgenauigkeit zugunsten massiver Geschwindigkeit opfern. Auf der anderen Seite stützt sich die Welt der wissenschaftlichen Entdeckung – die Simulation von Wettermustern, die Modellierung der Bindung von Atomen oder die Vorhersage von Fluidströmungen – immer noch auf Zahlen, die lang und präzise sind. Diese wissenschaftlichen Berechnungen benötigen jedes Detail, um stabil und genau zu bleiben, aber die Standard-Computerbauteile, die diese verarbeiten, sind oft langsamer und weniger effizend als die neuen KI-Motoren. Dies schafft ein Dilemma: Wissenschaftler benötigen die Geschwindigkeit der neuen Hardware, können es sich aber nicht leisten, die Präzision zu verlieren, die ihre Arbeit erfordert.

Forscher bei Maginfra Co., Ltd. in China haben einen Weg erforscht, um diese Lücke mithilfe eines speziellen Typs von Computerchip namens Intel AMX zu schließen. Ihr Ziel war es zu sehen, ob man die schnellen, niedrig-präzisen KI-Motoren dazu überlisten könnte, die langsame, hoch-präzise Mathematik auszuführen, die für die Wissenschaft erforderlich ist. Anstatt den Chip zu bitten, die schwierige Mathematik direkt auszuführen, brachen sie das Problem in kleinere, einfachere Teile auf. Stellen Sie sich vor, Sie versuchen, eine sehr lange Distanz mit einem Lineal zu messen, das nur Markierungen für ganze Zoll besitzt. Sie könnten die ganzen Zoll messen, dann den verbleibenden Bruchteil messen, dann den winzigen Restabschnitt messen und alles zusammenzählen, um ein präzises Gesamtergebnis zu erhalten. Die Forscher wandten dieselbe Logik auf Zahlen an. Sie nahmen eine einzelne komplexe Zahl und spalteten sie in mehrere einfachere Teile auf, die der schnelle KI-Motor problemlos bewältigen konnte. Sie führten dann viele schnelle Berechnungen auf diesen Teilen durch und fügten die Ergebnisse sorgfältig wieder zusammen, um das endgültige, hochgenaue Ergebnis zu rekonstruieren.

Das Team testete diesen Ansatz auf zwei verschiedenen Ebenen der Präzision. Zuerst widmeten sie sich der Single-Precision-Mathematik (einfacher Genauigkeit), die der Standard für viele wissenschaftliche Anwendungen ist. Sie fanden heraus, dass sie, indem sie jede Zahl in drei Teile zerlegten und sechs spezifische Berechnungen durchführten, Ergebnisse erzielen konnten, die so genau waren wie die beste existierende Software, aber signifikant schneller waren. Auf den von ihnen getesteten Computerchips lief diese Methode zwischen 1,14 und 2,56 Mal schneller als die Standardmethode der Mathematik. Die Beschleunigung war bei größeren Datensätzen am deutlichsten, wo der Aufwand für das Aufteilen und Zusammensetzen der Zahlen im Vergleich zur reinen Geschwindigkeit der Berechnungen weniger wichtig wurde.

Als sie zur Double-Precision-Mathematik (doppelter Genauigkeit) übergingen, die noch exakter ist und für die anspruchsvollsten wissenschaftlichen Simulationen verwendet wird, nahm die Herausforderung zu. Hier mussten die Forscher jede Zahl in sechs Teile zerlegen. Da die Berechnungen mit äußerster Sorgfalt wieder zusammengesetzt werden mussten, wurde der Prozess komplizierter. Sie testeten verschiedene Versionen dieser Methode, wobei sie zwischen sechs und einundzwanzig der kleinen Berechnungsteile behielten. Sie entdeckten einen klaren Kompromiss: Je mehr Teile man behielt, desto genauer wurde das Ergebnis, aber es verlangsamte auch den Prozess. Mit nur sechs Teilen war die Methode schnell genug, um die Standardsoftware für sehr große Probleme zu schlagen, wobei sie bis zu 1,mal 1,7 schneller lief. Wenn sie jedoch mehr Teile hinzufügten, um die Genauigkeit zu verbessern, fraß die zusätzliche Arbeit, die für deren Verwaltung erforderlich war, den Geschwindigkeitsvorteil auf. Schließlich machte der Versuch, einundzwanzig Teile zu behalten, die Methode langsamer als den Standardansatz, obwohl sie präziser war.

Die Studie hob auch hervor, dass diese Technik keine universelle Lösung für jede Situation ist. Sie funktioniert am besten, wenn die berechneten Zahlen innerhalb eines bestimmten Bereichs bleiben, ähnlich wie ein Lineal mit einer begrenzten Länge keine Distanz messen kann, die zu groß oder zu klein ist, ohne spezielle Anpassungen vorzunehmen. Die Forscher merkten an, dass ihre Methode nicht für jede Art von Zahl funktioniert, insbesondere nicht für extrem große oder extrem kleine Zahlen, und dass sie keinen perfekten, Bit-für-Bit-Vergleich mit bestehender Software garantiert. Stattdessen bietet sie ein neues Werkzeug für Wissenschaftler, die hohe Geschwindigkeit und hohe Genauigkeit benötigen, sofern ihre Daten innerhalb der Grenzen der Methode liegen. Durch die Demonstration, dass Niedrig-Präzisions-Hardware zur Lösung von Hoch-Präzisions-Problemen verwendet werden kann, deutet die Arbeit auf eine Zukunft hin, in der die spezialisierten Motoren, die für künstliche Intelligenz gebaut wurden, auch die schwere Arbeit der wissenschaftlichen Entdeckung beschleunigen können.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →