← Nieuwste papers
🤖 machine learning

Reduced Matrix Multiplication: Input-Adaptive Matrix-Product Reduction for LLM Inference

Dit artikel introduceert Reduced Matrix Multiplication (RMM), een training-vrije, input-adaptieve inferentiemethode die de computationele kosten in Transformer-gebaseerde modellen vermindert door selectief informatieve segmenten van matrixproducten te behouden, waarmee schaalbare nauwkeurigheid-efficiëntie-afwegingen wordt bereikt over diverse modelgroottes, taken en modaliteiten zonder de modelgewichten aan te passen.

Oorspronkelijke auteurs: Zixuan Lan, Yanhong Li, Jiawei Zhou

Gepubliceerd 2026-08-14
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zixuan Lan, Yanhong Li, Jiawei Zhou

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je de hersenen van een moderne computer voor als een enorme, hyperintelligente bibliothecaris. Deze bibliothecaris leest niet alleen boeken; hij schrijft ze ook, lost wiskundige problemen op en kijkt zelfs naar plaatjes om verhalen te vertellen. Om dit te doen, gebruikt hij een speciale soort hersenarchitectuur die een "Transformer" wordt genoemd. Denk aan een Transformer als een enorme fabriek waar informatie door lopende banden stroomt. Op elk station op deze banden voert de fabriek een massale berekening uit: het vermenigvuldigt enorme rasters van getallen met elkaar. Dit zijn de "matrixvermenigvuldigingen" die de magie aandrijven. Het probleem is dat deze berekeningen ongelooflijk zwaar zijn. Ze vereisen veel energie en tijd, zoals het proberen te verplaatsen van een berg zand met een theelepel. Naarmate deze AI-modellen slimmer en groter worden, wordt de "berg" hoger, wat het duur en traag maakt om ze te draaien. Wetenschappers vragen zich al lang af: gebruikt de bibliothecaris eigenlijk elk enkel korrel zand in die berg voor elke specifieke taak, of is er veel onnodig zand dat we weg kunnen vegen zonder dat de bibliothecaris het merkt?

Dit artikel introduceert een slimme nieuwe truc genaamd Reduced Matrix Multiplication (RMM). In plaats van te proberen de fabriek permanent te verkleinen of delen van het geheugen van de bibliothecaris te verwijderen (wat dingen kan kapotmaken), werkt RMM als een slim, on-the-fly filter. Elke keer dat de bibliothecaris op het punt staat een massale berekening uit te voeren, pauzeert RMM en vraagt: "Welke specifieke getallen in dit raster zijn op dit moment eigenlijk het zware werk aan het doen?" Vervolgens kiest het alleen de belangrijkste getallen uit—zeg bijvoorbeeld de bovenste 50% of 70%—en negeert de rest voor dat specifieke moment. Het is als een chef-kok die, in plaats van alle groenten in de koelkast te snijden voor een soep, snel de bouillon proeft en besluit om alleen de wortels en uien te gebruiken die op dit moment nodig zijn voor deze specifieke smaak. Het beste eraan? De bibliothecaris hoeft niet opnieuw getraind of geleerd te worden om dit te doen; het werkt gewoon natuurlijk met de getallen die hij al genereert.

De onderzoekers testten dit idee op een breed scala aan AI-modellen, variërend van kleine modellen met 1 miljard parameters tot reuzen met 70 miljard. Ze ontdekten dat deze modellen verrassend flexibel zijn. Wanneer ze de hoeveelheid wiskunde die wordt uitgevoerd verminderden door slechts een deel van de getallen te behouden, stortten de modellen niet in. Sterker nog, hoe groter het model, hoe meer zand het leek te willen loslaten zonder zijn verstand te verliezen. Zo kon het gigantische 70-miljard-parameters model een reductie van 50% in berekeningen opvangen terwijl het nog steeds bijna even goed vragen beantwoordde en verhalen schreef als voorheen. Echter, het papier ontdekte ook een grappige eigenaardigheid in hoe deze fabrieken zijn gebouwd: de "attention"-delen van de hersenen (waar het model beslist waar het zich op moet concentreren) zijn erg relaxed en kunnen het makkelijk hebben met het verliezen van de helft van hun werk. Maar de "MLP"-delen (de delen die de informatie daadwerkelijk verwerken en transformeren) zijn veel gevoeliger; als je daar te veel wegknipt, begint het model te struikelen.

Het team heeft ook aangetoond dat deze truc werkt voor modellen die kunnen zien en praten, niet alleen voor tekstmodellen. Ze hebben zelfs speciale softwaretools gebouwd om te bewijzen dat het overslaan van deze getallen de computer in de echte wereld sneller maakt, vooral wanneer de verhalen of zinnen erg lang worden. Hoewel het artikel suggereert dat dit een veelbelovende manier is om AI goedkoper en sneller te maken, merkt het ook op dat er niet één "perfecte" instelling is voor iedereen. Je moet hoe veel je wegknipt afstemmen op het specifieke model en wat je het model vraagt te doen. Maar over het algemeen biedt RMM een frisse, training-vrije manier om deze digitale reuzen lichter te laten draaien, wat bewijst dat minder wiskunde doen je soms juist helkerder en helderder kan laten denken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →