← Nieuwste papers
🤖 machine learning

TraceLab: Characterizing Coding Agent Workloads for LLM Serving

Dit artikel introduceert TraceLab, een uitgebreide dataset en analyse van meer dan 4.300 real-world coding-agent sessies, om unieke werkbelastingspatronen zoals lange autonome loops en diverse tool calls te karakteriseren, om zo specifieke mogelijkheden voor het optimaliseren van LLM-serving systemen te identificeren.

Oorspronkelijke auteurs: Kan Zhu, Mathew Jacob, Chenxi Ma, Yi Pan, Stephanie Wang, Arvind Krishnamurthy, Baris Kasikci

Gepubliceerd 2026-06-30
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Kan Zhu, Mathew Jacob, Chenxi Ma, Yi Pan, Stephanie Wang, Arvind Krishnamurthy, Baris Kasikci

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een super-slimme, onvermoeibare digitale assistent hebt (een "coding agent") die je helpt bij het schrijven van software. Je vraagt de assistent om een bug op te lossen, en hij geeft niet alleen een antwoord; hij gaat een kamer binnen, opent bestanden, voert tests uit, leest de resultaten, en komt dan terug om aan je te vragen: "Zal ik dit andere ding eens proberen?" Hij doet deze lus keer op keer totdat de klus geklaard is.

Het paper TraceLab is als een gigantisch, gedetailleerd dagboek van 4.300 van deze werksessies. De onderzoekers hebben gekeken naar hoe deze assistenten er in de echte wereld (niet in een testlab) daadwerkelijk aan het werk gingen om erachter te komen hoe ze de computers die hen aansturen sneller en goedkoper kunnen maken.

Hier zijn hun bevindingen, uitgelegd aan de hand van alledaagse analogieën:

1. De "Lange Conversatie, Korte Antwoorden" Paradox

De Bevinding: De assistent leest een enorme hoeveelheid geschiedenis voordat hij spreekt, maar wanneer hij eindelijk spreekt, zegt hij heel weinig.
De Analogie: Stel je een bibliothecaris voor die de hele encyclopedie (100.000 pagina's) opnieuw moet lezen om één specifiek feit te vinden. Zodra hij het vindt, fluistert hij slechts één zin tegen je.
Waarom het ertoe doet: De meeste computersystemen zijn gebouwd om lange toespraken aan te kunnen. Maar deze coding agents zijn als bibliothecarissen die enorme boeken lezen maar korte antwoorden fluisteren. De computer verspilt 90% van zijn energie aan het "opnieuw lezen" van de geschiedenis (de context) in plaats van het genereren van nieuwe tekst.

2. Het "Geheugen Cache" Probleem

De Bevinding: Het systeem probeert de "geschiedenis" op te slaan in een speciaal, snel geheugen (een prefix cache), zodat het niet de hele boekenreeks telkens opnieuw hoeft te lezen. Dit werkt 96% van de tijd, maar faalt wanneer je een lange pauze neemt.
De Analogie: Denk aan het snelle geheugen als een post-it op je bureau. Als je doorwerkt, blijft de post-it daar plakken. Maar als je gaat lunchen, een dutje doet of naar huis gaat, valt de post-it eraf (wordt deze "geëvict") . Wanneer je terugkomt, moet de assistent het hele boek opnieuw lezen vanaf de plank in de bibliotheek in plaats van alleen even op de post-it te kijken.
De Kosten: Het paper vond dat ongeveer 13% van de totale kosten van het gebruik van deze agents voortkomt uit het per ongeluk verliezen van die post-it en het daardoor opnieuw moeten lezen van het boek omdat je een menselijke pauze had genomen.

3. De "Tool Call" Achtbaan

De Bevinding: De assistenten gebruiken "tools" (zoals het openen van een bestand of het uitvoeren van een commando) constant. De meeste tools zijn direct klaar, maar een paar duren erg lang, wat zorgt voor een "long tail" aan vertragingen.
De Analogie: Stel je voor dat je eten bestelt. 90% van de tijd vraag je gewoon om een glas water (direct). Maar soms vraag je om een biefstuk die bereid moet worden, wat 20 minuten duurt. Hoewel de biefstuk-bestellingen zeldzaam zijn, nemen ze bijna alle tijd in de keuken in beslag.
Het Inzicht: De onderzoekers ontdekten dat hoewel de assistenten tientallen verschillende tools gebruiken, slechts drie of vier van hen (zoals het uitvoeren van een commando of het lezen van een bestand) 80% van het werk doen. Echter, de "trage" tools (zoals het wachten tot een complex proces is voltooid) zijn de tools waardoor de gebruiker het langst moet wachten.

4. De "Menselijke Pauze" Bottleneck

De Bevinding: Het eigenlijke computerwerk gaat snel, maar de sessies bestaan grotendeels uit wachten tot de mens nadenkt, typt of leest.
De Analogie: Stel je een coureur voor (de AI) die met 200 mph kan rijden, maar die vaststaat in een file veroorzaakt door een voetganger (de mens) die even stopt om zijn veters te strikken. De auto is klaar om te gaan, maar moet stilstaan.
Het Inzicht: De computer staat vaak stil, wachtend op de mens. Het paper suggereert dat als de computer de stoel "warm kon houden" (het geheugen levend kon houden) tijdens deze lange menselijke pauzes, dit veel geld en tijd zou besparen.

5. De "Tool Switching" Overhead

De Bevinding: Elke keer dat de AI schakelt van "denken" naar "een tool gebruiken" en weer terug, is er een klein beetje verspilde tijd en energie.
De Analogie: Het is als een chef-kok die naar de koelkast moet lopen, een ingrediënt pakt, terugloopt naar het fornuis, kookt, weer terugloopt naar de koelkast, en dit herhaalt. Als hij drie ingrediënten tegelijk zou kunnen pakken en ze samen zou kunnen koken, zou hij veel efficiënter zijn.
De Suggestie: Het paper suggereert dat we, in plaats van de AI telkens één klein dingetje te laten doen, de AI moeten aanmoedigen om meerdere tool-acties te bundelen om het "heen en weer lopen" te verminderen.

Samenvatting van de "TraceLab" Bijdrage

Vóór dit paper probeerden mensen deze coding agents te begrijpen met behulp van kleine, nep-tests (zoals de AI een enkel wiskundig probleem laten oplossen). Maar echt coderen is een lange, rommelige conversatie met vele stappen.

TraceLab is de eerste keer dat onderzoekers naar een enorme, echte log van deze gesprekken hebben gekeken. Ze ontdekten dat om deze AI-assistenten beter te maken, we niet alleen moeten focussen op het "slimmer" maken van de AI. In plaats daarvan moeten we betere "bibliotheken" (geheugensystemen) bouwen die enorme boeken kunnen verwerken, betere "post-its" (caches) die niet van de tafel vallen tijdens de lunchpauze, en betere "keukens" (tool-systemen) die de zeldzame, trage bestellingen kunnen afhandelen zonder het hele systeem te verstoppen.

De onderzoekers hebben hun data en tools vrijgegeven zodat andere engineers deze inzichten kunnen gebruiken om snellere, goedkopere en efficiëntere AI-coding assistenten te bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →