← Nieuwste papers
🤖 AI

FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs

Dit artikel introduceert FlashMLA-ETAP, een nieuw framework dat een Efficient Transpose Attention Pipeline gebruikt om de inferentie van Multi-Head Latent Attention op NVIDIA H20 GPU's aanzienlijk te versnellen door WGMMA-operaties te optimaliseren, waarbij substantiële snelheidsverbeteringen worden bereikt ten opzichte van bestaande methoden terwijl een hoge numerieke stabiliteit behouden blijft.

Oorspronkelijke auteurs: Pengcuo Dege, Qiuming Luo, Rui Mao, Chang Kong

Gepubliceerd 2026-06-03
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Pengcuo Dege, Qiuming Luo, Rui Mao, Chang Kong

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een heel lang boek probeert te lezen (de "context") om één korte vraag (de "query") te beantwoorden. Dit is in essentie wat een groot AI-model zoals DeepSeek-R1 doet wanneer het tekst genereert: het kijkt terug naar alles wat het tot nu toe heeft gelezen om te beslissen welk woord het als volgende moet zeggen.

Het paper introduceert een nieuwe methode genaamd FlashMLA-ETAP, wat lijkt op het aanleren van een slimmere manier aan de AI om door de pagina's van dat boek te bladeren, specif으로 voor een bepaald type computerchip genaamd de NVIDIA H20.

Hier is de onderverdeling van het probleem en de oplossing met behulp van alledaagse analogieën:

Het Probleen: Het "Onhandige Plank"-probleem

Beschouw de NVIDIA H20 GPU als een bibliothecaris die werkt in een bibliotheek met een specifieke regel: Planken moeten minstens 64 boeken breed zijn om stabiel te zijn. Als je probeert om slechts 16 boeken op een plank te zetten, moet de bibliothecaris de lege ruimte opvullen met nepplanken (padding) zodat de plank niet instort. Dit verspilt tijd en energie.

In de AI-wereld zijn de "boeken" de attention heads (de delen van het brein die zich op verschillende dingen concentreren). Wanneer het enorme DeepSeek-R1 model wordt gedraaid op een enkele server met 8 H20 GPU's, wordt het werk verdeeld. Elke GPU eindigt met het verwerken van slechts 16 heads.

Omdat 16 minder is dan de vereiste 64, moet de H20 GPU veel "nepwerk" (padding) verrichten om aan de hardware-regels te voldoen. Het is alsof je de bibliothecaris dwingt om 64 lege dozen te dragen om slechts 16 echte dozen te transporteren. Dit maakt de AI traag en inefficiënt, vooral wanneer het "boek" dat het leest (lange context) erg lang is, maar de vraag die het beantwoordt (slechts één woord per keer) erg kort is.

De Oplossing: Het Boek Op Zijn Zijkant Leggen (ETAP)

De auteurs hebben een techniek ontwikkeld genaamd ETAP (Efficient Transpose Attention Pipeline). In plaats van te proberen de 16 heads in de regel van 64 breed te dwingen, draaien ze het probleem op zijn zijkant.

Stel je voor dat je in plaats van naar 16 heads over een korte rij te kijken, naar de lengte van het boek (die duizenden pagina's lang kan zijn) kijkt als de belangrijkste dimensie. Omdat het boek erg lang is, vult het de "64 breedte van de plank" gemakkelijk zonder dat er dummy-boeken nodig zijn.

Door de dimensies te wisselen—de lange geschiedenis van het gesprek te behandelen als de belangrijkste "breedte" en de korte vraag als de "hoogte"—kan de H20 GPU op volle snelheid werken zonder tijd te verspillen aan lege padding. Het is alsonderken dat je, in plaats van te proberen 16 kleine items in een grote doos te passen, ze verticaal moet stapelen waar nog volop ruimte is.

De Resultaten: Sneller en Nauwkeuriger

Het paper beweert dat deze "op de zijkant" aanpak een groot verschil maakt op de H20 GPU:

  1. Veel Sneller: Bij lange gesprekslengtes (64.000 woorden) is FlashMLA-ETAP 2,78 keer sneller dan de vorige beste methode voor dit specifieke model (FlashMLA). Het is ook aanzienlijk sneller dan andere populaire methoden zoals FlashAttention-3 en FlashInfer.
  2. Nauwkeuriger: Meestal, wanneer je probeert AI-berekeningen te versnellen, kun je een beetje precisie verliezen (zoals het te agressief afronden van getallen). Echter, deze nieuwe methode is juist nauwkeuriger dan FlashAttention-3, met een veel lagere foutmarge (RMSE). Het is alsof je het boek sneller leest en het beter begrijpt.

Waarom het ertoe doet

De meeste AI-optimalisaties zijn ontworpen voor superdure, high-end chips (zoals de H100). De H20 is een "mid-tier" chip—goed, maar niet de meest krachtige. Dit paper laat zien dat je met de juiste softwaretruc (ETAP), een mid-tier chip veel beter kunt laten presteren voor specifieke taken. Het is alsof je een manier vindt om een standaard sedan even efficiënt te laten rijden als een sportwagen op een specifiek type weg, door de manier waarop je schakelt te veranderen.

Kortom: FlashMLA-ETAP is een software-update die de NVIDIA H20 GPU vertelt hoe hij de manier waarop hij lange AI-gesprekken leest moet reorganiseren, waardoor verspilde inspanning wordt geëlimineerd en de AI sneller en nauwkeuriger reageert.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →