← Nieuwste papers
🤖 machine learning

TileQ: Efficient Low-Rank Quantization of Mixture-of-Experts with 2D Tiling

TileQ is een post-training-quantisatiemethode zonder fijnafstemming die gebruikmaakt van gestructureerde 2D-tegelvormige low-rank factoren die worden gedeeld over invoer- en uitvoerdimensies, gecombineerd met een gefuseerde inferencetechniek in één doorgang, om het geheugengebruik en de latentie in Mixture-of-Experts-modellen aanzienlijk te verminderen terwijl de nauwkeurigheid behouden blijft.

Oorspronkelijke auteurs: Hongyaoxing Gu, Xinzhe Chen, Lijuan Hu, Fangfang Liu

Gepubliceerd 2026-05-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hongyaoxing Gu, Xinzhe Chen, Lijuan Hu, Fangfang Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme bibliotheek hebt van experts (specialisten) die werken voor een gigantisch AI-bedrijf. Dit bedrijf gebruikt een "Mixture-of-Experts" (MoE)-systeem. Zo werkt het: wanneer je een vraag stelt, laat de AI niet alle experts wakker worden. Het kiest er slechts een paar (misschien 2 of 4 van de 100) die het beste geschikt zijn voor die specifieke vraag. Dit maakt de AI zeer slim, maar ook zeer efficiënt.

Het Probleem:
Hoewel de AI op elk moment slechts een paar experts gebruikt, moeten alle van hen in het geheugen van de computer (RAM) zitten en klaarstaan om te worden opgeroepen. Het is alsof je een bibliotheek hebt waar elk enkel boek op het bureau moet liggen, zelfs als je op dat moment maar één pagina van één boek leest. Dit neemt een enorme hoeveelheid ruimte in beslag en maakt de computer traag, omdat het door een enorme stapel boeken moet bladeren om slechts een paar te vinden die het nodig heeft.

De Oude Oplossing (en waarom deze faalde):
Wetenschappers probeerden deze boeken te comprimeren door ze samen te vatten (kwantisatie) of in kleinere delen te breken (low-rank).

  • Het Probleem: Als je elke expert individueel samenvat, heb je nog steeds te veel samenvattingen. Als je probeert samenvattingen tussen experts te delen, waren de oude methoden als het proberen van boeken in een enkele lange rij (1D) te stapelen. Het bespaarde wat ruimte, maar de computer moest nog steeds veel springen om de juiste pagina's te vinden, wat het traag maakte. Bovendien namen de "samenvattingsnotities" zelf zo veel extra ruimte in beslag dat de besparingen teniet werden gedaan.

De Nieuwe Oplossing: TILEQ
De auteurs van dit artikel stellen TILEQ voor. Denk hierbij aan het herschikken van de bibliotheek in een 2D-rooster van planken (zoals een schaakbord) in plaats van een enkele lange rij.

Hier is de eenvoudige uitleg van hoe TILEQ werkt:

1. De "2D Tiling"-truc (De Slimme Planken)

Stel je voor dat je 64 experts hebt. In plaats van ze te behandelen als 64 aparte personen, kijkt TILEQ naar hen en beseft: "Hé, Expert #1 en Expert #5 denken zeer vergelijkbaar, en Expert #2 en Expert #6 zijn ook tweelingen."

  • De Oude Manier: Je vat Expert #1 samen, dan Expert #2, dan Expert #3... waardoor je 64 aparte samenvattingen creëert.
  • De TILEQ-Manier: Je schikt deze 64 experts in een 8x8-rooster (zoals een kruis-en-krulbord, maar groter).
    • Experts in dezelfde rij delen een "linkerhand-notitie" (een gemeenschappelijke samenvatting van hun invoer).
    • Experts in dezelfde kolom delen een "rechterhand-notitie" (een gemeenschappelijke samenvatting van hun uitvoer).
    • Het Resultaat: In plaats van 64 unieke samenvattingen nodig te hebben, heb je slechts 8 rij-notities en 8 kolom-notities nodig. Dit reduceert drastisch het geheugen dat nodig is om de "notities" op te slaan.

2. De "Eén-Pas"-Inferentie (Het Expresslift)

Wanneer de AI een vraag moet beantwoorden, moet het meestal een aparte berekening uitvoeren voor elke enkele expert die het kiest. Dit is alsof je voor elke persoon apart een lift belt, één voor één. Dit is traag en inefficiënt.

  • De TILEQ-Fix: Omdat de experts nu in een net 2D-rooster zijn gerangschikt en notities delen, kan de computer de "actieve" experts allemaal in één keer verwerken in één vloeiende beweging. Het is alsof je een transportband aanzet die alle geselecteerde boeken in één keer naar de lezer verplaatst, in plaats van ze één voor één te halen.
  • Het Voordeel: Dit maakt de AI veel sneller (lagere latentie) omdat de computertoestel (de GPU) kan werken aan een groot, massief blok gegevens in plaats van aan kleine, verspreide stukjes.

3. Geen "Opnieuw-Opleiden" Nodig

Normaal gesproken moet je, wanneer je een AI comprimeert, het opnieuw leren (fine-tuning) om ervoor te zorgen dat het niet vergeet hoe het moet spreken. TILEQ is een "Post-Training Quantization" (PTQ)-methode.

  • Analogie: Het is alsof je een afgemaakte, hoog-resolutie foto neemt en comprimeert naar een kleiner bestandsgrootte zonder de foto opnieuw te hoeven nemen. Je verwerkt gewoon het bestaande beeld. Dit bespaart een enorme hoeveelheid tijd en rekenkracht.

De Resultaten

Het artikel beweert dat door dit 2D-rooster en de "één-pas"-methode te gebruiken:

  • Geheugen: Het de extra geheugen die nodig is voor deze "notities" met maximaal 10 keer reduceert in vergelijking met oudere methoden.
  • Snelheid: Het de tijd die nodig is om een vraag te beantwoorden (latentie) reduceert tot ongeveer 5% van wat het voor deze specifieke onderdelen van het model was.
  • Nauwkeurigheid: Ondanks dat het zo klein en snel is, beantwoordt de AI vragen nog steeds net zo goed als de grote, niet-gecomprimeerde versie.

Samenvattend:
TILEQ is een slimme manier om de "geheugennotities" van een slimme AI te organiseren. In plaats van elke expert een zware rugzak te geven, groepeer je ze in teams die lichte rugzakken delen. Dit zorgt ervoor dat het hele systeem in kleinere computers past en veel sneller draait, zonder enig van zijn slimheid te verliezen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →