RequestRouter: Request-Boundary Routing for Efficient Single-GPU LLM Inference
RequestRouter is een lichtgewicht, request-boundary controller die optimaal gekozen inferentiemodi (zoals kwantisatie, speculative decoding of prefix caching) dynamisch selecteert voor single-GPU LLM-serving, waarbij significante reducties in latentie en energie worden bereikt met verwaarloosbare overhead terwijl een bijna identieke nauwkeurigheid aan full-precision inferentie behouden blijft.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Moderne kunstmatige intelligentie vertrouwt op grote taalmodellen om tekst te genereren, vragen te beantwoorden en problemen op te lossen. Deze systemen zijn krachtig, maar ze zijn ook hongerig naar elektriciteit. Elke keer dat een gebruiker een vraag stelt, moet de computer miljarden berekeningen uitvoeren om een antwoord te produceren, een proces dat aanzienlijke energie verbruikt en tijd kost. Voor de mensen die deze systemen beheren, is de uitdaging om de computer zo snel mogelijk te laten werken zonder energie te verspillen. Momenteel gebruiken de meeste systemen een enkele, vaste instelling voor elke aanvraag, ongeacht of de taak eenvoudig of complex is. Dit is als het rijden met een zware vrachtwagen op snelwegtempo, of je nu een stadsblok oversteekt of een land doorreist; het werkt wel, maar het is vaak inefficiënt. Onderzoekers zoeken nu naar manieren om de instellingen van de computer af te stemmen op de specifieke opdracht, in de hoop energie te besparen en de reactiesnelheid te verhogen zonder de onderliggende intelligentie van het model zelf te veranderen.
Een team van onderzoekers aan de New York University heeft een nieuwe aanpak ontwikkeld genaamd RequestRouter om dit probleem op te lossen. In plaats van elke aanvraag door hetzelfde trage, energie-intensieve proces te dwingen, fungeert hun systeem als een lichtgewicht verkeersregelaar. Voordat de computer begint met het genereren van een antwoord, bekijkt deze controller enkele eenvoudige details over de aanvraag, zoals hoe lang de vraag van de gebruiker is, hoe lang het verwachte antwoord is en of de vraag een veelvoorkomende beginzin deelt met andere recente vragen. Op basis van deze aanwijzingen selecteert de controller onmiddellijk de meest efficiënte manier om die specifieuk aanvraag te verwerken uit een menu van bestaande opties. Deze opties omvatten het draaien van het model met lagere precisienummers om energie te besparen, het gebruik van een techniek die de volgende woorden voorspelt om de generatie te versnellen, of het hergebruiken van delen van het gesprek die al zijn berekend. Het systeem traint het model niet opnieuw of verandert de architectuur niet; het kiest simpelweg het beste gereedschap voor de klus uit de gereedschappen die al beschikbaar zijn.
De onderzoekers testten dit idee op een krachtige grafische kaart, een veelgebruikte hardware voor het draaien van deze modellen, met behulp van een standaard taalmodel met acht miljard parameters. Ze voerden duizenden tests uit met verschillende soorten aanvragen, variërend van korte, snelle interacties tot lange, complexe gesprekken. Ze vergeleken de prestaties van hun slimme controller met de standaardmethode van het gebruik van een enkele, niet-geoptimaliseerde instelling voor alles. De resultaten waren opmerkelijk. Gemiddeld maakte de controller het systeem twee keer zo snel als de standaardmethode, terwijl het minder dan de helft van de energie per gegenereerd woord verbruikte. In een strengere test, waarbij ze dezelfde aanvragen meerdere keren herhaalden om er zeker van te zijn dat de resultaten geen toevalstreffer waren, behield de controller nog steeds een bijna tweevoudige snelheidsverhoging en een aanzienlijke vermindering van het energieverbruik. De controller was ook extreem snel in het maken van zijn eigen beslissingen, waarbij hij minder dan vijf duizendsten van een milliseconde nodig had om een pad te kiezen, een vertraging die zo klein is dat deze effectief onzichtbaar is voor de gebruiker.
Cruciaal is dat de onderzoekers ontdekten dat deze winst in efficiëntie niet ten koste ging van de kwaliteit. Ze testten het systeem op een verscheidenheid aan benchmarks die bedoeld zijn om te meten hoe goed het model vragen begrijpt en beantwoordt. De slimme controller behield bijna de volledere nauwkeurigheid van de standaardmethode en behield meer dan negentig procent van de prestaties. Dit is belangrijk omdat sommige van de snellere, energiebesparende methoden de nauwkeurigheid van het model soms kunnen verminderen. De controller gebruikt een eenvoudig regelgebaseerd beleid om deze valkuilen te vermijden door moeilijke vragen naar de meest betrouwbare instellingen te leiden, terwijl eenvoudigere taken naar de snellere, efficiëntere modi worden gestuurd. De studie vergeleek hun eenvoudige, regelgebaseerde controller ook met complexere, geleerde systemen die proberen de beste instelling te voorspellen met behulp van kunstmatige intelligentie. Ze ontdekten dat de complexe systemen veel trager waren in het maken van beslissingen, waardoor ze zoveel vertraging toevoegden dat de energiebesparingen teniet werden gedaan. De eenvoudige, regelgebaseerde aanpak bleek de meest praktische oplossing te zijn, die de beste balans bood tussen snelheid, energie en kwaliteit.
Dit werk suggereert dat de toekomst van efficiënte kunstmatige intelligentie mogelijk niet vereist om nieuwe, slimmere modellen te bouwen of nieuwe hardware uit te vinden. In plaats daarvan kunnen aanzienlijke verbeteringen worden gerealiseerd door simpelweg aandacht te besteden aan de structuur van de binnenkomende aanvragen en ze te matchen met de juiste verwerkingsmodus. De onderzoekers hebben aangetoond dat door verschillende optimalisatietechnieken niet als permanente instellingen maar als selecteerbare opties te behandelen, zij een aanzienlijke efficiëntie konden terugwinnen. Deze aanpak respecteert de kwaliteit van de output terwijl de energiekosten van het draaien van deze systemen drastisch worden verminderd. Het biedt een duidelijk pad vooruit om grote taalmodellen duurzamer te maken, waarbij wordt aangetoond dat de meest effectieve manier om energie te besparen soms niet is om harder te werken, maar om slimmer te werken door het juiste gereedschap voor elke specifieke taak te kiezen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.