← Nieuwste papers
🤖 machine learning

EnergyLens: Interpretable Closed-Form Energy Models for Multimodal LLM Inference Serving

EnergyLens introduceert een interpreteerbaar, gesloten energie-model met twaalf parameters, afgeleid via symbolische regressie, dat de inferentie-energie nauwkeurig voorspelt voor diverse multimodale LLM's en hardware met minimale profileringdata, en dat bestaande black-box- en analytische baselines overtreft bij configuratie-selectie en extrapolatie.

Oorspronkelijke auteurs: Vittorio Palladino, Gianluca Palermo, Michael E. Papka, Zhiling Lan

Gepubliceerd 2026-05-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Vittorio Palladino, Gianluca Palermo, Michael E. Papka, Zhiling Lan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, supersnelle bezorgdienst runt voor een gigantisch bedrijf. Je "vrachtwagens" zijn AI-modellen (Large Language Models) en je "pakketten" zijn gebruikersverzoeken (zoals het schrijven van een gedicht, het analyseren van een foto of het samenvatten van een video).

Het doel is om elk pakket zo snel mogelijk (lage latentie) en zo goedkoop mogelijk (lage energieverbruik) te bezorgen. Maar hier zit het probleem: Snel betekent niet altijd goedkoop.

Soms is het sneller om twee vrachtwagens over een smalle weg te sturen (een strategie genaamd Tensor Parallelism) dan één grote vrachtwagen, maar dit verbrandt veel meer brandstof omdat de vrachtwagens voortdurend tegen elkaar schreeuwen om te coördineren. Op andere momenten kan het opsplitsen van het werk over een lange rij vrachtwagens (genaamd Pipeline Parallelism) iets langzamer zijn, maar het bespaart een hoop brandstof omdat de vrachtwagens pauzes kunnen nemen tussen de stops.

Lange tijd maakten mensen die probeerden deze bezorgdienst te optimaliseren een grote fout: ze gingen ervan uit dat als een route de snelste was, deze automatisch ook de meest brandstofefficiënte was. Ze probeerden ook "black box"-computers ( complexe AI-modellen) te gebruiken om het brandstofverbruik te voorspellen, maar deze computers hadden duizenden testruns nodig om de regels te leren, en ze konden niet uitleggen waarom ze een bepaalde voorspelling deden.

Dan komt EnergyLens in beeld.

Wat is EnergyLens?

Stel je EnergyLens voor als een hoofdmechanicus die de exacte verkeersregels in gewone taal opschrijft.

In plaats van te gokken of duizenden proefritten nodig te hebben, gebruikt EnergyLens een speciaal hulpmiddel genaamd "symbolische regressie". Stel je voor dat je een computer een stapel brandstofbonnen geeft en vraagt om het verborgen wiskundige patroon te vinden. In plaats van je een verwarrende lijst met cijfers te geven, spitst het een eenvoudige, leesbare formule uit (zoals een recept) die precies uitlegt hoeveel energie er wordt verbruikt op basis van:

  • Hoeveel vrachtwagens je gebruikt (Parallelism).
  • Hoe groot het pakket is (Batch Size).
  • Hoe lang de bezorgroute is (Sequence Length).

Hoe het werkt (De analogie)

Het paper legt uit dat AI-inferentie plaatsvindt in twee distincte fasen, net als in een restaurantkeuken:

  1. De "Prefill"-fase (Het bestelling klaarmaken): De keuken leest de hele bestelling (de invoer tekst of afbeelding) in één keer. Dit is zwaar werk.
  2. De "Decode"-fase (Het opdienen van de gerechten): De keuken begint met het opdienen van één gerecht per keer (het genereren van het output woord voor woord). Dit is geheugenintensief.

EnergyLens behandelt deze twee fasen apart. Het beseft dat de "brandstofkosten" van het klaarmaken van de bestelling anders zijn dan de kosten van het opdienen van de gerechten. Het beseft ook dat de "vrachtwagen-coördinatie" (Tensor Parallelism) het klaarmaken anders beïnvloedt dan het opdienen.

Door deze factoren te scheppen, creëert EnergyLens een recept met 12 ingrediënten (een gesloten formule) dat het energieverbruik met hoge nauwkeurigheid voorspelt.

Waarom het beter is dan de oude methoden

Het paper vergelijkt EnergyLens met twee andere methoden:

  1. De "Snelheid-proxy"-methode: Deze gaat ervan uit dat "Snel = Goedkoop". Het paper toont aan dat dit fout is. In meer dan 20% van de gevallen is de snelste configuratie eigenlijk de grootste energieverbrander. EnergyLens vindt de ware brandstofefficiënte route, niet alleen de snelle.
  2. De "Black Box"-methode: Dit zijn complexe AI-modellen die honderden testruns nodig hebben om te leren. Ze zijn als een student die de antwoorden uit het hoofd leert maar de wiskunde niet begrijpt.
    • EnergyLens heeft slechts 50 testruns nodig (ongeveer 10 keer minder) om de regels te leren.
    • EnergyLens is interpreteerbaar: Je kunt naar de formule kijken en zeggen: "Ah, ik zie dat het gebruik van 4 vrachtwagens hier energie bespaart vanwege deze specifieke term." De black box kan je dat niet vertellen.

De resultaten

De onderzoekers testten EnergyLens op een breed scala aan "vrachtwagens" (verschillende AI-modellen), "wegen" (verschillende computerchips van NVIDIA, Intel en AMD) en "pakketten" (tekst, afbeeldingen en video's).

  • Nauwkeurigheid: Toen gevraagd werd om de enige beste, meest brandstofefficiënte configuratie te kiezen, had EnergyLens het 88,2% van de tijd goed. De vorige beste methode had het slechts 60,9% van de tijd goed.
  • Generalisatie: Zodra het "recept" is geschreven, werkt het op nieuwe soorten vrachtwagens en wegen zonder herschreven te hoeven worden. Je hoeft alleen maar een paar getallen (coëfficiënten) aan te passen op basis van een kleine nieuwe testrun.
  • Extrapolatie: Zelfs als je EnergyLens vraagt het brandstofverbruik te voorspellen voor een bezorgroute die 10 keer langer is dan iets dat het eerder heeft gezien, gokt het nog steeds correct. De "black box"-methodes falen in dit scenario.

De conclusie

EnergyLens is een praktisch, transparant hulpmiddel dat datacenters helpt stoppen met gokken en beginnen met rekenen. Het bewijst dat je geen enorme supercomputer nodig hebt om het energieverbruik te voorspellen; je hebt gewoon de juiste wiskundige formule nodig die de fysica begrijpt van hoe deze AI-modellen eigenlijk werken. Het verandert het mysterie van "hoeveel energie kost dit?" in een eenvoudige, oplosbare vergelijking.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →