HeraSys: Collaborative Serving of Multiple LLM Workflows via Fine-Grained End-to-End Optimization
HeraSys is een LLM-serving systeem dat de end-to-end prestaties van gelijktijdige multi-tenant workflows optimaliseert door computationele redundantie tussen workflows te elimineren via structurele node-merging en een belastingsbewuste gezamenlijke scheduling-policy toe te passen om de tail latency aanzienlijk te verminderen terwijl de throughput wordt verhoogd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een bruisende keuken voor waar een team van chefs probeert om honderden complexe maaltijden tegelijkertijd te bereiden. In de wereld van Kunstmatige Intelligentie zijn deze "maaltijden" taken die worden uitgevoerd door Large Language Models (LLM's)—de superintelligente computerbreinen die verhalen schrijven, vragen beantwoorden en problemen oplossen. Meestal, wanneer je een AI vraat om iets te doen, wordt het behandeld als een enkele, geïsoleerde bestelling. Maar in de echte wereld worden applicaties meer als uitgebreide banketten: één enkel verzoek kan het doorzoeken van informatie, het controleren van een database en het vervolgens schrijven van een samenvatting inhouden, allemaal in één keer. Dit worden "workflows" genoemd.
Het probleem is dat wanneer veel mensen deze complexe banketten bestellen op hetzelfde moment, de keuken chaotisch wordt. Als twee klanten vragen om hetzelfde ingrediënt te snijden, snijdt de keuken het misschien twee keer, wat tijd en energie verspilt. Erger nog, als één klant een enorme, langzaam garenende stoofpot bestelt, kunnen de chefs erdoor blijven hangen, waardoor iedereen moet wachten op hun snelle salades die geserveerd moeten worden. Dit is de uitdaging van het "serveren" van AI: hoe beheer je een vloedgolf aan complexe, overlappende verzoeken zonder dat het systeem tot stilstand komt of sommige mensen eeuwig moet wachten?
Hier komt een nieuw systeem genaamd HeraSys in beeld. Zie HeraSys als een revolutionaire keukenmanager die niet alleen naar één bestelling tegelijk kijert, maar de hele keuken vloer in de gaten houdt om te zien hoe verschillende bestellingen elkaar kunnen helpen. In plaats van elk verzoek als een apart eiland te behandelen, zoekt HeraSys naar overlap. Als twee verschillende klanten hetzelfde document geanalyseerd willen hebben of hetzelfde hulpmiddel willen gebruiken, zegt HeraSys: "Hé, laten we dat één keer doen en het resultaat delen!" Het fungeert ook als een verkeersregelaar, die ervoor zorgt dat de snelle, eenvoudige bestellingen niet vastlopen achter de langzame, zware bestellingen, en dat de zware bestellingen niet zonder aandacht komen te zitten.
De onderzoekers achter HeraSys hebben een systeem gebouwd dat deze complexe AI-taken opbreekt in kleine, fijnmazige stukjes. Ze ontdekten dat door dubbele stappen samen te voegen en slim te plannen wie de middelen van de keuken krijgt (zoals krachtige computerchips), ze het hele systeem veel sneller konden maken. In hun tests lieten ze zien dat HeraSys de tijd die de langzaamste verzoeken in beslag neemt met wel 2,17 keer kan verkorten (wat betekent dat ze meer dan twee keer zo snel waren) en het totale aantal taken dat het systeem kan afhandelen met wel 1,85 keer heeft verhoogd vergeleken met de beste bestaande systemen.
Het artikel pleit tegen de oude manier van doen, waarbij systemen elk verzoek behandelen als een onafhankelijke, geïsoleerde taak. Ze laten zien dat deze "isolatie" onnodige verspilling en knelpunten creëert. In plaats daarvan stellen ze een collaboratieve aanpak voor waarbij het systeem actief op zoek gaat naar gedeeld werk. Ze argumenteren ook tegen eenvoudige planningsregels zoals "wie het eerst komt, het eerst maalt", wat ervoor kan zorgen dat lange taken iedereen blokkeren, of "kortste taak eerst", wat ervoor kan zorgen dat lange taken eeuwig moeten wachten. HeraSys suggereert een gebalanceerde, "belastingbewuste" strategie die enkele middelen reserveert voor de zware taken terwijl de snelle taken prioriteit krijgen, wat zorgt voor eerlijkheid en snelheid voor iedereen.
De resultaten, gemeten via uitgebreide experimenten op echte hardware, suggereren dat deze fijnmazige, collaboratieve aanpak een belangrijke stap voorwaarts is. Door redundante stappen te fuseren en dynamisch aan te passen hoe taken worden gegroepeerd en uitgevoerd, beheert HeraSys de gemiddelde wachttijd laag te houden terwijl het de "staart" van langzame, frustrerende vertragingen voorkomt die complexe AI-systemen vaak teisteren. Het is een beetje alsof je beseft dat als je een groep vrienden organiseert om een huis schoon te maken, je niet alleen aan elke persoon een kamer moet toewijzen; je zou moeten merken dat twee mensen allebei dezelfde gang aan het stofzuigen zijn en hen samen moet laten werken, terwijl je ervoor zorgt dat de persoon die de ramen wast niet hoeft te wachten op de stofzuiger.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.