← Nieuwste papers
🤖 AI

Transferable Latency Prediction for Fast LLM Screening on Heterogeneous Edge Devices

Dit artikel stelt een runtime-bewust latentievoorspellingsframework voor dat adaptief statische modelbeschrijvers fuseert met dynamische hardwaretelemetrie om nauwkeurige, overdraagbare LLM-deployment screening mogelijk te maken over heterogene edge-apparaten met minimale kalibratie.

Oorspronkelijke auteurs: Xiaolong Tu, Vinod K. Mishra, Venkat R. Dasari, Anu G. Bourgeois, Haoxin Wang

Gepubliceerd 2026-07-27
📖 8 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xiaolong Tu, Vinod K. Mishra, Venkat R. Dasari, Anu G. Bourgeois, Haoxin Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de perfecte videogame probeert te kiezen om op een handheld console te spelen. Je hebt een enorme bibliotheek aan games, van kleine puzzelavonturen tot enorme, uitgestrekte rollenspel-epics. Maar hier is de crux: je console is een beetje grillig. Hij wordt heet als je te lang speelt, de batterij gaat snel leeg, en hij reageert op verschillende games op vreemde manieren, afhankelijk van hoe je hem vasthoudt of hoe laat het is. Als je probeert elke game te downloaden en te testen om te zien welke er soepel op draait, zou je de hele dag wachten op downloads, om er vervolgens achter te komen dat de helft van ze crasht of hapert. Je hebt een manier nodig om, enkel door naar de beschrijving van de game en de huidige stemming van je console te kijken, te raden welke er daadwerkelijk zal werken. Dit is exact het probleem waar de wereld van Kunstmatige Intelligentie op onze telefoons en kleine gadgets voor staat.

Wetenschappers proberen "Large Language Models" (LLM's) — superintelligente AI-hersenen die verhalen kunnen schrijven, vragen kunnen beantwoorden en problemen kunnen oplossen — rechtstreeks op onze apparaten te draaien in plaats van gegevens naar gigantische cloudservers te sturen. Dit is geweldig voor de privacy en snelheid, maar het is een nachtmerrie om te voorspellen. Een AI-model kan perfect draaien op de ene telefoon, maar vastlopen op een andere, zelfs als de telefoons er hetzelfde uitzien. Waarom? Omdat de snelheid van een AI afhangt van een chaotische mix van zaken: hoe lang de vraag is, hoe heet de telefoon wordt, hoeveel batterij er nog over is, en zelfs de specifieke software die wordt gebruikt om de AI te draaien. Als we niet kunnen voorspellen hoe snel een AI zal draaien voordat we het daadwerkelijk proberen, verspillen we enorme hoeveelheden tijd en energie aan het testen van modellen die misschien falen. Hier komt het verhaal van "de toekomst voorspellen" om de hoek kijken.

De Kristallen Bol voor AI-snelheid

In dit artikel heeft een team onderzoekers van de Georgia State University en het Army Research Laboratory een "kristallen bol" gebouwd voor AI-snelheid. Ze noemen het een runtime-aware latency prediction framework. Laten we dat ontleden. "Latency" (latentie) is gewoon een chic woord voor hoe lang iets duurt om plaats te vinden. "Runtime-aware" (tijdens de uitvoering bewust) betekent dat het systeem aandacht besteedt aan wat er gebeurt terwijl de AI werkt, en niet alleen naar hoe de AI er op papier uitziet. En "transferable" (overdraagbaar) betekent dat deze kristallen bol ook werkt als je overgaat van het ene type apparaat naar het andere.

De onderzoekers realiseerden zich dat het proberen te testen van elke AI-model op elk enkel apparaat is als het proberen te proeven van elke ijsjes smaak ter wereld om je favoriet te vinden. Het is te traag en te duur. In plaats daarvan wilden ze een systeem dat naar een nieuw apparaat en een nieuw AI-model kan kijken en kan zeggen: "Hé, deze combinatie zal waarschijnlijk ongeveer 10 seconden duren om te antwoorden."

Hoe de Kristallen Bol Werkt

Het geheime ingrediënt van hun systeem is dat het niet alleen naar statische feiten kijkt. Stel je voor dat je probeert te raden hoe snel een auto zal rijden. Een "statische" gok zou alleen naar de motorinhoud en het gewicht van de auto kijken. Maar een "runtime-aware" gok zou ook naar het weer, het verkeer en of de bestuurder slaperig is kijken.

Het systeem van de onderzoekers doet twee dingen tegelijkertijd:

  1. Het Statische Pad: Het kijkt naar de "identiteitskaart" van de opstelling. Dit omvat de grootte van het model, het type telefoon of gadget, en de instellingen.
  2. Het Dynamische Pad: Het houdt de "hartslag" van het apparaat in de gaten terwijl het draait. Het houdt zaken bij zoals hoe heet de chip wordt, hoe snel de processor draait en hoeveel geheugen er wordt gebruikt.

Het systeem splitst het werk van de AI in twee fasen, als een tweeledige race:

  • De Prefill Fase: Dit is wanneer de AI jouw vraag leest en zijn gedachten verzamelt. Het is meestal een snelle, explosieve sprint.
  • De Decode Fase: Dit is wanneer de AI het antwoord uitschrijft, woord voor woord. Dit is een langere, gestage jog.

Door deze twee fasen apart te behandelen en de "identiteitskaart"-informatie te mengen met de "hartslag"-gegevens, bouwt het systeem een veel slimmere voorspelling. Ze gebruikten een speciaal "gated fusion" mechanisme, wat een soort slimme verkeerslicht is dat beslist of het meer moet luisteren naar de statische feiten of naar de live verkeersomstandigheden, afhankelijk van de situatie.

De Magie van Kalibratie

Hier is de belangrijkste truc: het systeem is niet perfect uit de doos. Als je het traint op een Pixel 8 telefoon en het probeert te gebruiken op een Pixel 8 Pro, kan het de getallen fout krijgen omdat de twee telefoons net iets verschillend zijn.

Om dit op te lossen, gebruiken de onderzoekers een kalibratieset. Denk aan dit als een snelle "proefrit". Je draait de AI op het nieuwe apparaat slechts een paar keer (misschien 6 tot 20 keer) om te zien hoe het daadwerkelijk gedraagt. Het systeem gebruikt deze paar echte resultaten vervolgens om de kristallen bol bij te stellen, zodat de voorspellingen worden afgestemd op de realiteit van het nieuwe apparaat.

De resultaten van deze kalibratie zijn spectaculair. Zonder deze kalibratie waren de voorspellingen van het systeem voor hoe lang de AI nodig heeft om te "decoderen" (het antwoord te schrijven) op een Pixel 8 Pro er vreselijk naast met een score (genoemd R2R^2) van -1.085. Dat is een verschrikkelijke score, wat betekent dat de voorspelling slechter was dan simpelweg willekeurig gokken. Maar na slechts een klein beetje kalibratie sprong die score naar 0.927, wat bijna perfect is. Het is also kind als je een wazige foto neemt en die plotseling in kristalheldere focus brengt met slechts een paar aanpassingen.

Het Systeem Testen

Het team heeft hun idee getest op een verscheidenheid aan gadgets om er zeker van te zijn dat het geen toevalstreffer was voor één specifieke telefoon. Ze gebruikten:

  • Pixel 8 en Pixel 8 Pro: De hoofdrolspelers van de show, die moderne mobiele telefoons vertegenwoordigen.
  • Jetson Nano: Een kleine computer die vaak voor robots en drones wordt gebruikt.
  • Orange Pi 5 Pro: Een kleine single-board computer.
  • RTX 3090: Een krachtige grafische kaart die meestal in high-end gaming pc's te vinden is.

Ze ontdekten dat hetzelfde AI-model ongelooflijk snel kon zijn op de grote grafische kaart (64,38 tokens per seconde) maar pijnlijk traag op de kleine Orange Pi (8,42 tokens per second). Dit bewijst dat je de snelheid niet alleen kunt raden op basis van het model alleen; je moet het apparaat kennen.

Waarom Dit Belangrijk Is: Het Selectieproces

Het uiteindelijke doel is niet alleen om snelheid te voorspellen; het is om tijd te besparen. Stel je voor dat je 100 verschillende AI-modellen hebt en je wilt de beste voor jouw specifieke telefoon kiezen. Zonder dit systeem zou je alle 100 moeten downloaden en testen. Met dit systeem kun je de snelheid van alle 100 direct voorspellen.

De onderzoekers gebruiken vervolgens een strategie die Pareto-optimalisatie wordt genoemd. Dit is een chique manier om te zeggen dat ze zoeken naar het "optimale evenwicht". Ze willen een model dat zowel snel áls slim is. Als Model A langzamer is dan Model B maar niet slimmer, is Model A nutteloos. Het systeem filtert de slechte opties eruit en laat je een korte lijst achter van de beste kandidaten om echt te testen.

In hun tests slaagde dit selectieproces erin om de best mogelijke modellen in de race te houden. Bijvoorbeeld, bij de overgang van een Pixel 8 Pro naar een Pixel 8, filterde het systeem de helft van de kandidaten eruit, maar zorgde het ervoor dat de absoluut beste er nog steeds was.

Wat Ze Vonden (en Wat Ze Niet Vonden)

Het artikel suggereert dat deze methode een krachtig hulpmiddel is om de implementatie van AI sneller en goedkoper te maken. Ze ontdekten dat:

  • Statische gokken niet genoeg zijn: Alleen de grootte van het model kennen, vertelt je niet hoe snel het op een specifieke telefoon zal draaien.
  • Kalibratie essentieel is: Je kunt een voorspelling niet zomaar van het ene apparaat naar het andere kopiëren; je hebt een klein beetje echte data nodig om de voorspelling te corrigeren.
  • Fase ertoe doet: Het behandelen van het "lezen"-gedeelte en het "schrijven"-gedeelte van de AI als verschillende fasen maakt de voorspelling veel nauwkeuriger.

De auteurs merken echter voorzichtig op dat dit een startpunt is. Hun beste resultaten kwamen van de Pixel-telefoons, en hoewel ze lieten zien dat het systeem ook op andere apparaten zoals de Jetson en Orange Pi kon werken, hebben ze daar nog geen volledige, diepgaande training op uitgevoerd. Ze merkten ook op dat op krachtige computers kleinere modellen soms niet altijd sneller draaien dan grotere modellen, een vreemde eigenschap die hun systeem juist helpt verklaren.

Kortom, dit artikel biedt een slimme, flexibele manier om te raden hoe snel een AI op jouw gadget zal draaien zonder dat je urenlang hoeft te wachten om het te weten. Het verandert een chaotisch gokspel in een berekende, op data gebaseerde beslissing, waardoor we de beste AI-ervaringen op onze apparaten kunnen krijgen zonder dat het al onze tijd of batterij opslokt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →