← Nieuwste papers
💻 computer science

Benchmarking LLM Serving Systems for Agentic AI Workloads with XPerf

Dit artikel introduceert XPerf, een benchmarkingframework dat reproduceerbare belastingstests en gedetailleerde prestatieprofielering van LLM-serving-systemen onder diverse agentic AI-workloads mogelijk maakt door gebruik te maken van een fijnmazige trace-replay-aanpak om de uitdagingen van niet-deterministische control flows te overwinnen.

Oorspronkelijke auteurs: Michael Wang, Yikang Yue, Shaobo Li, Yirui Eric Zhou, Chen Wang, Jian Huang

Gepubliceerd 2026-08-24
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Michael Wang, Yikang Yue, Shaobo Li, Yirui Eric Zhou, Chen Wang, Jian Huang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In het snel evoluerende landschap van kunstmatige intelligentie is een nieuwe generatie software opgekomen die meer doet dan alleen vragen beantwoorden; het handelt. Deze programma's, bekend als agents, kunnen complexe taken opdelen in kleinere stappen, digitale hulpmiddelen gebruiken om informatie te verzamelen en beslissingen nemen op basis van wat ze vinden. In tegenstelling tot een standaard chatbot die na elke reactie wacht op een nieuwe opdracht, kan een agent bijvoorbeeld een onderzoeksproject plannen, het web doorzoeken naar data, code schrijven om die data te analyseren en vervolgens zijn aanpak verfijnen op basis van de resultaten. Dit proces omvat een continue lus van denken en handelen, waarbij de software vele malen binnen één enkele sessie een groot taalmodel oproept om zijn reis te begeleiden.

Om deze agents bruikbaar te maken in de echte wereld, moeten de computersystemen die hen aandrijven ongelooflijk snel en efficiënt zijn. Deze systemen, genaamd serving engines, zijn verantwoordelijk voor het verwerken van de berekeningen van het taalmodel. Het testen van hoe goed deze engines presteren is echter moeilijk omdat het pad dat een agent aflegt onvoorspelbaar is. Net zoals een mens een probleem vandaag in vijf stappen kan oplossen en morgen in tien stappen, verandert de reis van een agent elke keer dat deze wordt uitgevoerd, zelfs wanneer dezelfde begininstructies worden gegeven. Deze onvoorspelbaarheid maakt het voor ingenieurs moeilijk om te weten of een systeem echt snel is of dat het gewoon geluk heeft gehad dat een specifieke test toevallig eenvoudig was.

Om dit probleem op te lossen, hebben onderzoekers van de University of Illinois en IBM Research een nieuwe tool ontwikkeld genaamd XPerf. Dit systeem stelt ingenieurs in staat om het exacte pad dat een agent tijdens een echte taak aflegt vast te leggen en datzelfde pad vervolgens herhaaldelijk af te spelen om verschillende computersystemen te testen. Door de specifieke sequentie van beslissingen en acties vast te leggen, elimineert XPerf het element van toeval. Het zorgt ervoor dat wanneer een ingenieur een nieuwe software-update test, hij deze vergelijkt met exact dezelfde werklast, in plaats van te gokken hoe het systeem een andere, willekeurige reeks stappen zou afhandelen. Deze precisie is cruciaal voor het identificeren van knelpunten en het begrijpen waarom een systeem onder druk vertraagt.

De onderzoekers gebruikten XPerf om acht verschillende soorten agent-applicaties te bestuderen, variërend van tools die code schrijven en software debuggen tot systemen die diepgaand onderzoek doen en complexe vragen beantwoorden. Ze ontdekten dat deze applicaties heel anders functioneren dan standaard chatbots. Waar een typisch gesprek uit een paar heen-en-weer berichten bestaat, kan een agent tientallen interne oproepen naar het taalmodel triggeren om één enkele gebruikersaanvraag te voltooien. In sommige gevallen resulteerde een enkele aanvraag aan een coding agent in een gemiddelde van zeventien aparte oproepen naar het taalmodel, waarbij sommige aanvragen bijna veertig oproepen triggerden. Deze complexiteit betekent dat het systeem een web van afhankelijke taken moet beheren, waarbij één stap niet kan beginnen voordat de vorige is voltooid.

Een belangrijke ontdekking van hun testen was dat de prestaties van deze systemen zeer gevoelig zijn voor de manier waarop de aanvragen worden afgehandeld. De onderzoekers observeerden dat wanneer veel agents tegelijkertijd draaien, het systeem vaak moeite heeft om de context van eerdere stappen te onthouden. Taalmodellen vertrouwen op een vorm van kortetermijngeheugen, een cache, om informatie die ze al hebben verwerkt niet opnieuw te hoeven lezen. Echter, wanneer het systeem onder zware belasting staat, gooit het soms oude informatie eruit om ruimte te maken voor nieuwe aanvragen, zelfs als die informatie een moment later weer nodig zal zijn. Dit dwingt de computer om alles vanaf nul opnieuw te berekenen, wat tijd en energie verspilt. De studie toonde aan dat dit "thrashing"-effect kan leiden tot een aanzienlijke vertraging van het systeem, waarbij sommige applicaties een snelheidverlies van bijna veertig procent lieten zien wanneer het aantal aanvragen toenam.

Het team testte ook hoe goed verschillende strategieën voor het beheren van meerdere computerprocessoren werkten. Ze ontdekten dat het simpelweg gelijkmatig verdelen van het werk over alle beschikbare processoren niet altijd tot de beste resultaten leidde. Sterker nog, een strategie die alle stappen van de reis van een enkele agent op hetzelfde proces hield, was veel efficiënter. Deze aanpak stelde het systeem in staat om de noodzakelijke context in het geheugen te houden, waardoor de noodzaak om informatie opnieuw te berekenen werd vermeden. Door met XPerf exact dezelfde werklast onder verschillende omstandigheden te herhalen, konden de onderzoekers duidelijk zien dat deze gerichte aanpak de verwerkingssnelheid met meer dan drie keer verbeterde vergeleken met de standaardmethode van het willekeurig verdelen van het werk.

Naast het enkel meten van snelheid, bood XPerf ook een gedetailleerd kijkje in de innerlijke werking van de computerhardware zelf. De onderzoekers konden precies zien hoeveel van het geheugen van de computer werd gebruikt en hoe hard de processorchips werkten. Ze ontdekten dat wanneer het systeem werd gedwongen om informatie opnieuw te berekenen vanwege slecht geheugenbeheer, de processoren van de computer hard werkten maar geen nuttige resultaten produceerden. Het was een geval van hoge inspanning met een lage efficiëntie. Dit niveau van detail helpt ingenieurs niet alleen te begrijpen dat een systeem traag is, maar ook exact waarom het traag is, zodat ze het specifieke deel van de software kunnen repareren dat het probleem veroorzaakt.

De studie benadrukte ook dat de manier waarop een agent is ontworpen net zo belangrijk is als de computer waarop hij draait. Sommige applicaties bleken veel efficiënter te zijn dan andere, niet omdat ze slimmer waren, maar omdat ze beter ontworpen waren om met het geheugen van de computer samen te werken. Zo ontdekten onderzoekers dat een onderzoekstool die bij elke verzonden boodschap een veranderende tijdstempel toevoegde, per ongeluk het vermogen vernietigde om geheugen te hergebruiken, waardoor het systeem telkens weer vanaf nul moest beginnen. Door deze onnodige verandering te verwijderen, konden de onderzoekers de efficiëntie van het systeem aanzienlijk verbeteren. Dit suggereert dat kleine wijzigingen in de manier waarop software wordt geschreven een enorme impact kunnen hebben op de prestaties.

Uiteindelijk dient XPerf als een betrouwbare spiegel voor de wereld van kunstmatige intelligentie-agents. Het stelt ontwikkelaars in staat om hun systemen helder te zien, zonder de verstoring van willekeurige variatie. Door een manier te bieden om deze complexe applicaties te testen, te meten en te begrijpen, helpt het hulpmiddel ervoor te zorgen dat de volgende generatie AI-software robuust, snel en klaar is voor de eisen van de echte wereld. De onderzoekers hebben dit hulpmiddel publiekelijk beschikbaar gesteld, in de hoop dat het de ontwikkeling van betere systemen voor iedereen zal versnellen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →