Ranking Before Serving: Low-Latency LLM Serving via Pairwise Learning-to-Rank
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een druk koffietentje runt. Je hebt een rij klanten (de verzoeken) die wachten om drankjes te bestellen, en je hebt één barista (het Large Language Model of LLM) die de drankjes één voor één maakt.
Het Probleen: De "Lange Bestelling" Bottleneck
In een traditionele koffietent gebruik je de regel "Wie het eerst komt, het eerst maalt". Als de eerste persoon in de rij een complexe, 20 minuten durende latte bestelt, moet iedereen achter die persoon — zelfs de persoon die alleen een snelle espresso wil — 20 minuten wachten. Dit wordt Head-of-Line (HOL) blocking genoemd.
In de wereld van AI is dit een enorm probleem. Sommige AI-vragen zijn simpel en duren slechts een seconde om te beantwoorden. Andere, vooral de nieuwe "redenerende" AI-modellen die stapsgewijs nadenken over wiskundige problemen of code, kunnen minutenlang bezig zijn met het genereren van een antwoord. Als een lang, intensief denkverzoek vast komt te zitten aan het begin van de rij, vertraagt dit iedereen achter hen, waardoor het hele systeem traag en stroperig aanvoelt.
De Oplossing: De "Slimme Voorspeller" (PARS)
Het paper introduceert een nieuw systeem genaamd PARS (Prompt-Aware Ranking Scheduler). Denk aan PARS als een super slimme, onzichtbare manager die achter de toonbank staat en direct kan raden hoe lang een drankje gaat duren om te maken, voordat de barista zelfs maar begint.
In plaats van mensen te bedienen in de volgorde waarin ze arriveerden, zet deze manager de rij opnieuw in zodat de "snelle espresso"-bestellingen eerst gaan, gevolgd door de "gemiddelde" bestellingen, en de "20-minuten durende latte"-bestellingen naar de achterkant gaan. Dit staat bekend als Shortest-Job-First (SJF) scheduling.
Hoe het werkt: De "Pairwise" Truc
Het lastige deel is dat AI onvoorspelbaar is. Soms krijgt dezelfde vraag een kort antwoord, en soms een lang antwoord, gewoon door toeval. Als de manager probeert de exacte tijd te raden (bijv. "Dit zal 42 seconden duren"), kan hij het fout hebben en de rij verstoren.
Om dit op te lossen, gebruikt PARS een slimme truc genaamd Pairwise Learning.
- De oude manier: Proberen de exacte tijd voor elke bestelling te raden. (Zoals het exact gewicht van een watermeloen raden).
- De PARS-manier: Gewoon twee bestellingen tegelijk vergelijken. Vragen: "Is Bestelling A waarschijnlijk langer nodig dan Bestelling B?" (Zoals zeggen: "Deze watermeloen is duidelijk zwaarder dan die appel").
Het systeem is getraind om de kleine, verwarrende verschillen te negeren en zich alleen te concentreren op de duidelijke verschillen (bijv. "Dit wiskundige probleem is veel moeilijker dan deze simpele groet"). Door zich te richten op deze duidelijke vergelijkingen, wordt de manager erg goed in het sorteren van de rij zonder in de war te raken door de willekeurige schommelingen van de AI.
De Resultaten: Snellere Service voor Iedereen
De onderzoekers hebben dit systeem getest in een real-world setting met behulp van een populaire AI-serving tool genaamd vLLM. Ze ontdekten dat:
- Enorme Versnellingen: Door de korte taken eerst te laten gaan, hebben ze de gemiddelde wachttijd voor gebruikers met wel 15,7 keer verminderd vergeleken met de standaard "Wie het eerst komt, het eerst maalt"-methode.
- Geen Extra Kosten: De "manager" (de voorspeller) is zeer lichtgewicht. Het kost bijna geen tijd om de rij te sorteren, dus het vertraagt de barista niet.
- Werkt op Elk Model: Het systeem is zo goed in raden dat als je het traint op één type AI (zoals GPT-4), het nog steeds effectief de rij kan sorteren voor een totaal ander AI-model (zoals Llama of DeepSeek) zonder dat het opnieuw getraind hoeft te worden. Het is alsof een manager die heeft geleerd om bestellingen te sorteren in een koffietentje, onmiddellijk hetzelfde werk kan doen in een theehuistje.
- Eerlijkheid: Om er zeker van te zijn dat de "20-minuten durende latte"-bestellingen niet eeuwig moeten wachten, heeft het systeem een veiligheidsventiel. Als een lange bestelling te lang heeft gewacht, wordt deze naar voren in de rij geschoven zodat niemand uithongert.
Samenvattend
Het paper presenteert PARS, een slim schedulingsysteem dat fungeert als een verkeersregelaar voor AI-verzoeken. In plaats van een lang, ingewikkeld verzoek de rij te laten blokkeren, gebruikt het een slimme, op vergelijking gebaseerde gokmethode om de snelle verzoeken er eerst doorheen te laten glippen. Dit maakt het hele AI-systeem veel sneller en responsiever, vooral bij de nieuwe generatie AI die graag lang wil "nadenken" voordat hij antwoordt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.