← Nieuwste papers
🤖 machine learning

Hardware-Aware FP4 FlashAttention-4

Dit artikel introduceert Hardware-Aware FP4 FlashAttention-4, een methode die de beperkingen van Blackwell's FP4 tensor cores overwint door Direct-P te gebruiken voor niet-causale inferentie en een causaal pad met FP8 gradiënten, waarmee tot 2,13× snellere forward throughput en 1,14× snellere single-GPU training updates worden bereikt terwijl de divergentieproblemen die bij MXFP4 training worden waargenomen, worden vermeden.

Oorspronkelijke auteurs: Robert Hu

Gepubliceerd 2026-09-04✓ Author reviewed
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Robert Hu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de wereld van kunstmatige intelligentie vertrouwen de krachtigste modellen op een mechanisme genaamd "attention" (aandacht) om context te begrijpen. Stel je een lezer voor die een lang document scant; aandacht stelt het model in staat om zich te concentreren op de meest relevante woorden in een zin terwijl de rest wordt genegeerd, waarbij ideeën over grote afstanden met elkaar worden verbonden. Om dit te doen, voert de computer een enorme reeks berekeningen uit, waarbij elk woord met elk ander woord wordt vergeleken om hun relaties te bepalen. Jarenlang zijn deze berekeningen uitgevoerd met hoogprecisiegetallen, vergelijkbaar met het gebruik van een liniaal met piepkleine, precieze markeringen om een gebouw te meten. Dit zorgt ervoor dat het model correct leert, maar het is traag en verbruikt enorme hoeveelheden energie. Naarmate modellen groter worden, wordt de behoefte aan snelheid cruciaal. Onderzoekers hebben recentelijk chips ontwikkeld die in staat zijn om veel kleinere, grovere getallen te gebruiken—vierbits floating-point-waarden—om deze vergelijkingen veel sneller uit te voeren. Het simpelweg overstappen naar deze kleinere getallen is echter niet genoeg; de software die de datastroom beheert, moet ook veranderen, anders verdwijnen de snelheidswinsten.

Een onderzoeker bij Graphcore heeft dit specifieke knelpunt aangepakt met een nieuwe methode die zij Direct-P noemen. Hun werk richt zich op de "forward" pass (voorwaartse stap) van attention, waarbij het model informatie verwerkt om een antwoord te genereren, en de "backward" pass (achterwaartse stap), waarbij het leert van zijn fouten. De onderzoeker ontdekte dat hoewel de nieuwe chips getallen ongelooflijk snel kunnen vermenigvuldigen, de stap daartussenin—het omzetten van ruwe scores naar waarschijnlijkheden—alles vertraagde. Het was alsof er een super-snelle lopende band was die steeds stopte omdat een arbeider elk onderdeel zorgvuldig moest opmeten voordat hij het kon doorgeven. De onderzoeker ontdekte dat de standaardmanier om deze conversie af te handelen, die complexe schaling en afronding inhield, een verkeersopstopping veroorzaakte die de snelheidsvoordelen van de nieuwe hardware tenietdeed.

Om dit op te lossen, heeft de onderzoeker het conversieproces herontworpen om direct en gestroomlijnd te zijn. In plaats van een precieze waarschijnlijkheid te berekenen en deze vervolgens af te ronden, brengt hun methode de ruwe scores direct in kaart naar de specifieke codes die de hardware gebruikt. Dit elimineert de tussenstappen die de vertragingen veroorzaakten. Toen ze deze aanpak testten op de nieuwste generatie data-center chips, waren de resultaten opmerkelijk. Voor bepaalde veelvoorkomende vormen van data verwerkte de nieuwe methode informatie meer dan twee keer zo snel als de vorige standaard, die vertrouwde op getallen met een hogere precisie. Dit werd bereikt terwijl de output nauwkeurig genoeg bleef voor complexe taken zoals videogeneratie en taalbegrip. In tests met een videogeneratiemodel was de nieuwe methode bijna twee keer zo snel als de standaardaanpak, waarbij de resultaten, hoewel eindig en bruikbaar, een meetbare drift en lagere gelijkenisscores vertoonden vergeleken met de tragere, meer precieze versie.

Het verhaal gaat echter niet alleen over snelheid; het gaat ook over wat er gebeurt wanneer het model probeert te leren. De onderzoeker onderzocht of zij deze ultra-snelle, lage-precisiegetallen voor het gehele trainingsproces konden gebruiken, inclusief de backward pass waar het model zijn kennis bijwerkt. Zij ontdekten dat hoewel de forward pass op volle snelheid kon draaien, de backward pass een zorgvuldige afweging vereiste. Wanneer zij probeerden de snelste vierbits-indeling voor de waarschijnlijkheidswaarden te gebruiken tijdens de training, werd het leerproces onstabiel en slaagde het model er niet in om te verbeteren. De getallen werden te grof, waardoor het leersignaal uiteenviel. Bijgevolg bepaalde de onderzoeker dat voor een stabiele training een iets preciezere achtbits-indeling voor de waarschijnlijkheidswaarden moet worden gebruikt, zelfs als de rest van de berekening de snellere vierbits-indeling gebruikt. Deze hybride aanpak stelde hen in staat om de volledige trainingscyclus met ongeveer 14 procent te versnellen op een enkele krachtige chip, een aanzienlijke winst voor grootschalige modellen.

De onderzoeker keek ook naar de fysieke limieten van de computerchips zelf. Zij ontdekten dat de snelheid van de berekening niet langer het hoofdprobleem was; het probleem was hoe de data werd opgeslagen en rondbewogen binnen de chip. De chip heeft een klein, ultra-snel geheugengebied waar de getallen worden vastgehouden terwijl er aan gewerkt wordt. De onderzoeker vond dat deze geheugenruimte volledig bezet was, waardoor er geen ruimte was om verschillende stadia van de berekening te overlappen. Het was als een keuken waar het aanrecht zo vol staat met ingrediënten dat de chef niet kan beginnen met het snijden van de volgende groente totdat de huidige klaar is, zelfs als het mes ongelooflijk scherp is. Omdat de geheugenruimte volledig bezet was, kon de chip niet aan meerdere stappen tegelijk werken, wat beperkte hoeveel sneller het hele proces kon worden.

Dit werk benadrukt een cruciale verschuiving in hoe we denken over het sneller maken van kunstmatige intelligentie. Het is niet genoeg om simpelweg snellere rekenmachines te bouwen; de volledige workflow moet worden herontworpen om aan te sluiten bij de mogelijkheden van de hardware. De onderzoeker liet zien dat door de manier waarop waarschijnlijkheden worden berekend te veranderen en door de datastroom zorgvuldig te beheren, zij enorme snelheidsverbeteringen konden ontsluiten. Toch bewezen zij ook dat er harde grenzen zijn. De geheugenbeperkingen van de chip betekenen dat zelfs met de snelst mogelijke wiskunde, er een plafond is aan hoeveel overlap mogelijk is. De weg vooruit, suggereren zij, ligt niet alleen in snellere aritmetiek, maar in slimmere manieren om de data te organiseren zodat de middelen van de chip nooit onbenut blijven wachten. Deze balans tussen brute snelheid en zorgvuldig databeheer is wat de volgende generatie kunstmatige intelligentie efficiënt zal laten draaien.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →