← Nieuwste papers
🤖 AI

Towards Understanding, Analyzing, and Optimizing Agentic AI Execution: A CPU-Centric Perspective

Dit artikel analyseert de CPU-bottlenecks bij Agentic AI-workloads en introduceert twee scheduling-optimalisaties, COMB en MAS, die de CPU-GPU-concurrentie verbeteren en de latentie aanzienlijk verlagen.

Oorspronkelijke auteurs: Ritik Raj, Souvik Kundu, Ishita Vohra, Hong Wang, Tushar Krishna

Gepubliceerd 2026-04-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ritik Raj, Souvik Kundu, Ishita Vohra, Hong Wang, Tushar Krishna

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat een Agentic AI (een slimme AI-agent) niet zomaar een antwoord geeft, maar als een echte detective werkt. Hij moet plannen maken, verschillende gereedschappen gebruiken (zoals een rekenmachine, een zoekmachine of een code-editor) en soms zelfs zelf beslissen wat hij als volgende moet doen.

Vroeger dachten we dat de zware klus bij deze AI's altijd door de GPU (de krachtige grafische chip) werd gedaan. Maar dit paper laat zien dat we een groot deel van het probleem over het hoofd hebben gezien: de CPU (de "hoofd" van de computer) zit verstopt als de echte bottleneck.

Hier is een uitleg van het onderzoek in simpele taal, met een paar creatieve vergelijkingen.

1. Het Probleem: De Snelle Sportauto met een Trage Chauffeur

Stel je voor dat je een Formule 1-auto hebt (de GPU). Die auto kan ontzettend snel rijden. Maar de AI-agent is niet alleen een auto; het is een complete reis.

  • De GPU is de auto die razendsnel rijdt (het beantwoorden van vragen).
  • De CPU is de chauffeur die moet zoeken naar de route, de benzine tanken, de kaart lezen en de banden controleren (het gebruik van tools, zoeken op het internet, code schrijven).

Het probleem: De auto (GPU) is zo snel dat hij vaak moet wachten tot de chauffeur (CPU) klaar is met zijn klusjes.

  • Als de chauffeur te traag is, staat de snelle auto stil.
  • Als je te veel auto's tegelijk op de weg zet (te veel verkeer), raakt de chauffeur in de war, wordt hij overbelast en blokkeert hij de hele weg.

De onderzoekers ontdekten dat bij deze slimme AI's de CPU vaak 88% van de totale tijd in beslag neemt. Zelfs als je de snelste GPU ter wereld hebt, helpt dat niet als de CPU in de knel zit.

2. De Analyse: Waarom zit de CPU vast?

De onderzoekers keken naar verschillende soorten "reizen" (werklasten) die de AI maakt:

  • Soms moet de AI zelf beslissen welke route hij neemt (Dynamisch).
  • Soms volgt hij een vast stappenplan (Statisch).
  • Soms is het één korte rit, soms moet hij vele stops maken.

Ze zagen dat wanneer de AI veel "handenwerk" moet doen op de CPU (zoals het lezen van een groot document of het uitvoeren van een stukje code), de CPU het niet meer haalt. Het is alsof je probeert 100 mensen tegelijk in een klein kantoor te proppen; ze beginnen elkaar te blokkeren in plaats van te werken.

3. De Oplossingen: Twee Slimme Manieren om het Verkeer te Regelen

Om dit op te lossen, bedachten de onderzoekers twee nieuwe verkeersregels (scheduling strategieën):

Oplossing A: COMB (De "Micro-Bus" Strategie)

Voor situaties waar iedereen hetzelfde doet (bijvoorbeeld allemaal zoeken op het internet).

Stel je voor dat je een grote groep mensen (128 vragen) naar een snelweg wilt sturen.

  • De oude manier: Je zet ze allemaal tegelijk op de weg. De snelweg (GPU) is vol, maar de ingang (CPU) raakt verstopt. De mensen staan in de file.
  • De nieuwe manier (COMB): Je deelt de grote groep op in kleine groepjes (micro-bussen) van bijvoorbeeld 64 mensen.
    • Je laat de eerste groep de snelweg oprijden.
    • Terwijl de eerste groep rijdt, bereidt de ingang de tweede groep voor.
    • Zo rijden de auto's en de chauffeurs gelijktijdig en blokkeren ze elkaar niet.

Resultaat: De wachttijd wordt veel korter. De auto's (GPU) staan niet meer stil, en de chauffeurs (CPU) werken rustiger en efficiënter.

Oplossing B: MAS (De "Scheiding van Verkeersstromen" Strategie)

Voor situaties waar verschillende soorten verkeer door elkaar lopen (sommige vragen zijn zwaar voor de CPU, andere voor de GPU).

Stel je voor dat je een wegdeeltje hebt waar vrachtwagens (CPU-zware taken) en sportauto's (GPU-zware taken) tegelijk moeten rijden.

  • Het oude probleem: Als er een stroom vrachtwagens komt, blokkeren ze de hele weg. De sportauto's moeten urenlang wachten, zelfs als er ruimte is voor hen.
  • De nieuwe manier (MAS): Je maakt twee aparte rijstroken aan.
    • De vrachtwagens krijgen hun eigen strook met een limiet (niet te veel tegelijk).
    • De sportauto's krijgen hun eigen strook.
    • Er is ook een kleine "wachtstrook" voor als er een piek is.

Resultaat: De sportauto's hoeven niet te wachten op de vrachtwagens, en de vrachtwagens vertragen elkaar niet. Zelfs als er maar weinig sportauto's zijn, krijgen ze toch een eerlijke kans om vooruit te komen.

4. Wat levert dit op?

Door deze slimme regelingen toe te passen, zagen de onderzoekers enorme verbeteringen:

  • Snelheid: De wachttijd voor de eerste helft van de gebruikers (de "normale" tijd) werd tot 3,9 keer sneller.
  • Rechtvaardigheid: Zelfs de "minderheid" (bijvoorbeeld de sportauto's in een stroom vrachtwagens) kreeg tot 2,5 keer sneller antwoord.
  • Energie: Omdat de CPU niet meer in paniek hoeft te werken door overbelasting, gaat er minder energie verloren.

Conclusie

Dit onderzoek zegt eigenlijk: "Stop met alleen maar snellere auto's (GPU's) te kopen. Zorg dat je chauffeurs (CPU's) ook slim worden geregeld."

Door het verkeer van de AI-agenten slimmer te verdelen en niet alles tegelijk te laten gebeuren, kunnen we deze slimme systemen veel sneller, eerlijker en zuiniger laten werken. Het is een beetje als het verschil tussen een chaotische drukke markt en een goed georganiseerd treinstation: als je de stromen goed regelt, komt iedereen sneller op zijn bestemming.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →