← Nieuwste papers
🤖 AI

TileMix: Tile-Centric Mixed-Precision Attention for LLM Inference Acceleration

TileMix is een training-vrije, tile-gecentreerde mixed-precision kernel die de inferentie van long-context LLM's versnelt door hardware-gealigneerde attention score tiles dynamisch tussen FP16- en INT8-paden te routeren binnen een gefuseerde dense attention operatie, waardoor de nauwkeurigheid die verloren gaat door uniforme low-precision methoden wordt hersteld terwijl de throughput wordt verbeterd.

Oorspronkelijke auteurs: Hanzhi Zhang, Qiao Zhang, Qinglei Cao, Heng Fan, Yan Huang, Kewei Sha, Yunhe Feng

Gepubliceerd 2026-08-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hanzhi Zhang, Qiao Zhang, Qinglei Cao, Heng Fan, Yan Huang, Kewei Sha, Yunhe Feng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Large language models zijn de motoren geworden achter een nieuwe generatie kunstmatige intelligentie, in staat om hele boeken samen te vatten, complexe vragen te beantwoorden uit lange documenten en gesprekken te voeren die duizenden woorden beslaan. Om dit te doen, vertrouwen deze modellen op een mechanisme genaamd aandacht (attention), dat hen in staat stelt de belangrijkheid van elk woord in een zin af te wegen tegen elk ander woord. Wanneer de tekst kort is, gaat dit proces snel. Maar naarmate de context groeit tot het omvat van hele hoofdstukken of juridische contracten, explodeert de computationele kost. Het model moet een score berekenen voor elk mogelijk paar woorden, wat een enorme grid aan gegevens creëert die enorme hoeveelheden geheugen en rekenkracht vereist. Deze bottleneck heeft het moeilijk gemaakt om deze krachtige tools efficiënt te draaien op standaard hardware, vooral bij het werken met de lange sequenties die nodig zijn voor taken in de echte wereld, zoals juridische analyse of het beoordelen van medische dossiers.

Onderzoekers hebben geprobeerd dit op te lossen door de wiskunde te vereenvoudigen. Een veelgebruikte aanpak is het verlagen van de precisie van de getallen die de computer gebruikt, waarbij wordt overgeschakeld van hoog-nauwkeurige berekeningen naar snellere, minder nauwkeurige berekeningen. Dit is als het overschakelen van het meten van ingrediënten met een laboratoriumschaal naar het gebruik van een eetlepel; het is veel sneller, maar als je dit voor elke stap van een complex recept doet, kan het uiteindelijke gerecht verkeerd smaken. Een andere aanpak is om berekeningen volledig over te slaan, door woorden te negeren die onbelangrijk lijken. Hoewel dit tijd bespaart, brengt het het risico met zich mee dat precies die verbindingen worden afgesneden die het model nodig heeft om het verhaal te begrijpen. De uitdaging is geweest om een manier te vinden om de snelheid van lage-precisie wiskunde te gebruiken zonder de nauwkeurigheid van de hoge-precisie wiskunde op te offeren, terwijl het vermogen van het model om het volledige plaatje te zien behouden blijft.

Een team van onderzoekers heeft een nieuwe methode geïntroduceerd genaamd TileMix, die dit probleem aanpakt door het aandachtsproces niet te behandelen als één enkele, uniforme blok werk, maar als een verzameling kleinere, beheersbare tegels (tiles). Stel je de enorme grid van woord-paar scores voor als een grote mozaïek. In plaats van de hele mozaïek met één type verf te schilderen, verdeelt TileMix het in kleine, door de hardware uitgelijnde vierkante secties. Voor elk van deze secties neemt het systeem een beslissing in een fractie van een seconde: heeft deze specifieke groep woordparen de hoge-precisie, trage berekening nodig, of kan het toe met de snelle, lage-precisie berekening? Deze beslissing wordt genomen op basis van een vooraf gepland landschap dat deze tegels bij elkaar groepeert, waardoor de computer kan schakelen tussen hoge en lage precisie binnen dezelfde operatie zonder de data te hoeven reorganiseren.

De kern van deze innovatie is een routingsysteem dat fungeert als een verkeersregelaar voor de processor van de computer. Het verpakt deze beslissingen in een compacte code, in feite een reeks bits die de processor vertelt welk pad hij voor elke tegel moet nemen. Als een tegel gemarkeerd is voor hoge precisie, gebruikt de processor zijn meest nauwkeurige rekeneenheden. Als hij gemarkeerd is voor lage precisie, schakelt hij over naar zijn snelste, energiezuinige eenheden. Cruciaal is dat beide paden een gedeelde geheugenstatus bijwerken die de algemene resultaten bijhoudt, om ervoor te zorgen dat de uiteindelijke output consistent blijft. Dit stelt het systeem in staat om de volledige connectiviteit van het model te behouden — wat betekent dat woordinteracties nooit worden genegeerd — terwijl het toch profiteert van de snelheidswinst van lage-precisie wiskunde voor de delen van de berekening die dat kan verdragen.

In hun experimenten testten de onderzoekers deze methode op verschillende populaire large language models, waaronder LLaMA, Qwen en Vicuna, met sequenties variërend van 16.000 tot 64.000 woorden. Ze vergeleken hun aanpak met de standaard hoge-precisie methode en een versie die lage-precisie wiskunde voor alles gebruikte. De resultaten lieten zien dat het gebruik van lage-precisie wiskunde voor de gehele berekening vaak leidde tot een aanzienlijke daling in nauwkeurigheid, waardoor het model details miste of faalde bij retrieval-taken. Echter, TileMix was in staat om het grootste deel van die verloren kwaliteit te herstellen. Door zorgvuldig alleen specifieke groepen tegels naar het hoge-precisie pad te routeren, behield het systeem nauwkeurigheidsniveaus die zeer dicht bij de volledige hoge-precisie baseline lagen, terwijl het tegelijkertijd veel snellere verwerkingssnelheden behaalde.

De studie onderzocht ook verschillende patronen voor het beslissen welke tegels de hoge-precisie behandeling moeten krijgen. Ze ontdekten dat de arrangement matters; sommige patronen, die hoge-precisie berekeningen in specifieke ruimtelijke regio's van de woordgrid hielden, werkten beter dan andere, afhankelijk van de taak. Bijvoorbeeld, bepaalde lay-outs die hoge precisie behielden voor lokale woordinteracties presteerden beter op taken van feitelijke herinnering (factual recall), terwijl andere robuuster waren voor algemene vraagbeantwoording. De onderzoekers demonstreerden dat deze methode toegepast kan worden zonder de modellen opnieuw te trainen, wat betekent dat het direct op bestaande systemen kan worden ingezet. Ze toonden ook aan dat de aanpak goed werkt met variabel lengte batches en verschillende modelarchitecturen, wat suggereert dat het een flexibele tool is voor het verbeteren van efficiëntie.

Uiteindelijk biedt TileMix een controleerbare balans tussen snelheid en nauwkeurigheid. Het suggereert dat de toekomst van efficiënte long-context verwerking niet vereist dat men moet kiezen tussen snel zijn of slim zijn. In plaats daarvan, door de twee intelligent te mengen, kunnen systemen lange documenten verwerken met een snelheid die de theoretische limieten van de hardware benadert, zonder de ernstige nauwkeurigheidsstraf die gepaard gaat met het overal gebruiken van lage-precisie wiskunde. Deze aanpak biedt een praktisch pad voor het inzetten van large language models in scenario's waar zowel snelheid als precisie cruciaal zijn, zoals de real-time analyse van massieve datasets of interactieve tools die instaat zijn om lange, complexe contexten direct te begrijpen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →