← Neueste Arbeiten
🤖 machine learning

Hardware-Aware FP4 FlashAttention-4

Dieses Paper stellt Hardware-Aware FP4 FlashAttention-4 vor, eine Methode, welche die Einschränkungen der Blackwell-FP4-Tensor-Kerne durch den Einsatz von Direct-P für nicht-kausale Inferenz und eines kausalen Pfades mit FP8-Gradienten überwindet und dabei bis zu 2,13-mal schnelleren Forward-Durchsatz sowie 1,14-mal schnellere Single-GPU-Trainings-Updates erreicht, während sie gleichzeitig die bei MXFP4 beobachteten Divergenzprobleme vermeidet.

Ursprüngliche Autoren: Robert Hu

Veröffentlicht 2026-09-04✓ Author reviewed
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Robert Hu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der Welt der künstlichen Intelligenz verlassen sich die leistungsfähigsten Modelle auf einen Mechanismus namens „Attention“ (Aufmerksamkeit), um Kontext zu verstehen. Stellen Sie sich einen Leser vor, der ein langes Dokument scannt; Attention ermöglicht es dem Modell, sich auf die relevantesten Wörter in einem Satz zu konzentrieren und den Rest zu ignorieren, während es Ideen über große Distanzen hinweg miteinander verknüpft. Um dies zu tun, führt der Computer eine massive Serie von Berechnungen durch, bei denen jedes Wort mit jedem anderen verglichen wird, um deren Beziehungen zu bestimmen. Jahrelang wurden diese Berechnungen mit hochpräzisen Zahlen durchgeführt, vergleichbar mit der Verwendung eines Lineals mit winzigen, präzisen Markierungen, um ein Gebäude zu vermessen. Dies stellt sicher, dass das Modell korrekt lernt, ist aber langsam und verbraucht enorme Mengen an Energie. Da Modelle immer größer werden, wird die Notwendigkeit von Geschwindigkeit kritisch. Forscher haben kürzlich Chips entwickelt, die in der Lage sind, viel kleinere, gröbere Zahlen – vier-Bit-Gleitkommazahlen – zu verwenden, um diese Vergleiche wesentlich schneller durchzuführen. Es reicht jedoch nicht aus, einfach nur zu diesen kleineren Zahlen zu wechseln; auch die Software, die den Datenfluss verwaltet, muss sich ändern, sonst verpuffen die Geschwindigkeitsgewinne.

Ein Forscher bei Graphcore hat genau diesen Engpass mit einer neuen Methode angegangen, die er Direct-P nennt. Seine Arbeit konzentriert sich auf den „Forward“-Pass (Vorwärtsgang) der Attention, bei dem das Modell Informationen verarbeitet, um eine Antwort zu generieren, und den „Backward“-Pass (Rückwärtsgang), bei dem es aus seinen Fehlern lernt. Der Forscher entdeckte, dass die Chips zwar in der Lage sind, Zahlen unglaublich schnell zu multiplizieren, aber der Schritt dazwischen – die Umwandlung von Rohwerten in Wahrscheinlichkeiten – alles verlangsamte. Es war wie eine superschnelle Montagestraße, die ständig stoppte, weil ein Arbeiter jedes einzelne Teil sorgfältig vermessen musste, bevor er es weiterreichte. Der Forscher fand heraus, dass die Standardmethode zur Handhabung dieser Umwandlung, die komplexe Skalierung und Rundungen beinhaltete, einen Stau verursachte, der die Geschwindigkeitsvorteile der neuen Hardware zunichtemachte.

Um dies zu lösen, gestaltete der Forscher den Umwandlungsprozess neu, um ihn direkt und gestrafft zu gestalten. Anstatt eine präzise Wahrscheinlichkeit zu berechnen und sie dann zu runden, bildet seine Methode die Rohwerte direkt auf die spezifischen Codes ab, die die Hardware verwendet. Dies eliminiert die Zwischenschritte, die die Verzögerungen verursachten. Als er diesen Ansatz auf die neueste Generation von Rechenzentrumschips testete, waren die Ergebnisse beeindruckend. Für bestimmte gängige Datenformen verarbeitete die neue Methode Informationen mehr als doppelt so schnell wie der bisherige Standard, der auf höherpräzisen Zahlen basierte. Dies gelang ihr, während der Output präzise genug für komplexe Aufgaben wie die Videogenerierung und das Sprachverständnis blieb. In Tests mit einem Videogenerierungsmodell war die neue Methode fast doppelt so schnell wie der Standardansatz, wobei die Ergebnisse, die zwar endlich und nutzbar waren, eine messbare Drift und geringere Ähnlichkeitswerte im Vergleich zur langsameren, präziseren Version zeigten.

Die Geschichte handelt jedoch nicht nur von Geschwindigkeit; es geht auch darum, was passiert, wenn das Modell versucht zu lernen. Der Forscher untersuchte, ob er diese ultraschnellen, niedrigpräzisen Zahlen für den gesamten Trainingsprozess nutzen könnte, einschließlich des Backward-Passes, bei dem das Modell sein Wissen aktualisiert. Er fand heraus, dass der Forward-Pass zwar mit voller Geschwindigkeit laufen konnte, der Backward-Pass jedoch einen sorgfältigen Kompromiss erforderte. Als er versuchte, das schnellste Vier-Bit-Format für die Wahrscheinlichkeitswerte während des Trainings zu verwenden, wurde der Lernprozess instabil und das Modell konnte sich nicht verbessern. Die Zahlen wurden zu grob, was dazu führte, dass das Lernsignal zusammenbrach. Folglich stellte der Forscher fest, dass für ein stabiles Training ein etwas präziseres Acht-Bit-Format für die Wahrscheinlichkeitswerte verwendet werden muss, selbst wenn der Rest der Berechnung das schnellere Vier-Bit-Format nutzt. Dieser hybride Ansatz ermöglichte es ihm, den gesamten Trainingszyklus auf einem einzelnen leistungsstarken Chip um etwa 14 Prozent zu beschleunigen, ein signifikanter Gewinn für groß angelegte Modelle.

Der Forscher untersuchte auch die physischen Grenzen der Computerchips selbst. Er stellte fest, dass die Geschwindigkeit der Berechnung nicht mehr das Hauptproblem war; das Problem war, wie die Daten innerhalb des Chips gespeichert und bewegt wurden. Der Chip besitzt einen kleinen, ultraschnellen Speicherbereich, in dem er die Zahlen hält, während er an ihnen arbeitet. Der Forsge fand heraus, dass dieser Speicherplatz vollständig belegt war, sodass kein Raum blieb, um verschiedene Stadien der Berechnung zu überlappen. Es war wie in einer Küche, in der die Arbeitsplatte so voll mit Zutaten ist, dass der Koch erst mit dem Schneiden des nächsten Gemüses beginnen kann, wenn das aktuelle fertig ist, selbst wenn das Messer unglaublich scharf ist. Da der Speicherplatz voll ausgelastet war, konnte der Chip nicht mehrere Schritte gleichzeitig bearbeiten, was limitierte, wie viel schneller der gesamte Prozess werden konnte.

Diese Arbeit verdeutlicht einen entscheidenden Wandel in der Art und Weise, wie wir über die Beschleunigung künstlicher Intelligenz nachdenken. Es reicht nicht aus, einfach nur schnellere Rechenmaschinen zu bauen; der gesamte Arbeitsablauf muss neu gestaltet werden, um den Fähigkeiten der Hardware gerecht zu werden. Der Forscher zeigte, dass durch die Änderung der Art und Weise, wie Wahrscheinlichkeiten berechnet werden, und durch ein sorgfältiges Management des Datenflusses, massive Geschwindigkeitsverbesserungen freigesetzt werden konnten. Dennoch bewies er auch, dass es harte Grenzen gibt. Die Speicherbeschränkungen des Chips bedeuten, dass selbst mit der schnellsten möglichen Mathematik eine Obergrenze für die mögliche Überlappung besteht. Der Weg nach vorn liegt, so schlägt er vor, nicht nur in schnellerer Arithmetik, sondern in klügeren Wegen, die Daten zu organisieren, damit die Ressourcen des Chips niemals warten müssen. Dieses Gleichgewicht zwischen roher Geschwindigkeit und sorgfältigem Datenmanagement ist das, was die nächste Generation künstlicher Intelligenz effizient laufen lassen wird.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →