← Nieuwste papers
💻 computer science

ClawTrace: Cost-Aware Tracing for LLM Agent Skill Distillation

ClawTrace introduceert een kostenbewust traceerplatform dat gedetailleerde TraceCards genereert om de CostCraft-distillatiepiplijn mogelijk te maken, die de kosten van LLM-agenten effectief met 32% verlaagt door gerichte verwijdering van dure, redundante stappen terwijl succesvol gedrag behouden blijft.

Oorspronkelijke auteurs: Boqin Yuan, Renchu Song, Yue Su, Sen Yang, Jing Qin

Gepubliceerd 2026-04-28
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Boqin Yuan, Renchu Song, Yue Su, Sen Yang, Jing Qin

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar dure, robotassistent hebt (een LLM-agent) die probeert complexe problemen op te lossen, zoals het organiseren van een spreadsheet of het schrijven van code. Soms doet deze robot de klus perfect. Op andere momenten faalt hij of volgt hij een wild inefficiënt pad, waarbij hij bij elke stap geld verbrandt.

Het artikel introduceert een nieuw systeem genaamd ClawTrace en een methode genaamd CostCraft om deze robot slimmer en goedkoper te maken, zonder dat zijn hersenen opnieuw getraind hoeven te worden.

Hier is de uitleg met eenvoudige analogieën:

1. Het Probleem: De "Blinde" Leraar

Stel je een leraar voor die probeert de studiehouding van een leerling te verbeteren door naar zijn toetsen te kijken.

  • Oude Methode: De leraar kijkt alleen of de leerling een "A" of een "F" heeft gehaald.
    • Als de leerling een "A" haalt, zegt de leraar: "Goed gedaan, blijf precies doen wat je deed!"
    • Als de leerling een "F" haalt, zegt de leraar: "Repareer deze fout."
  • De Fout: Dit is gevaarlijk.
    • Scenario A: De leerling haalde een "A", maar besteedde 10 uur aan studeren voor een toets die slechts 1 uur duurde. De oude leraar zegt: "Blijf het doen!" omdat het resultaat goed was. De leerling blijft tijd verspillen.
    • Scenario B: De leerling haalde een "F" omdat hij zijn naam vergeten was te schrijven. De leraar zegt: "Repareer de naam." Maar misschien heeft de leerling ook 5 uur verspild aan een verkeerd wiskundeprobleem. De leraar mist die verspilling omdat hij alleen naar het eindcijfer keek.

Het artikel betoogt dat bestaande AI-trainingstools zoals deze "blinde" leraar zijn. Ze weten of de AI geslaagd of gefaald is, maar ze weten niet hoeveel elke stap kostte (in geld en tijd). Zonder dat kostensignaal kan de AI niet leren dure, nutteloze stappen weg te laten.

2. De Oplossing: De "Kasbon" (ClawTrace)

De auteurs bouwden een tool genaamd ClawTrace. Denk hierbij aan een supergedetailleerde kasbonprinter voor het brein van de robot.

  • Elke keer dat de robot met zijn brein praat (LLM-call), een tool gebruikt (zoals het openen van een bestand) of een helper-robot opstart, registreert ClawTrace dit.
  • Het zegt niet alleen "Taak Klaar". Het print een TraceCard (een kleine samenvatting) die zegt:
    • "Stap 1: Bestand lezen. Kosten: $0,02."
    • "Stap 2: Lees het zelfde bestand opnieuw. Kosten: $0,02. Overbodig!"
    • "Stap 3: Antwoord schrijven. Kosten: $0,01."
  • Deze kasbon is compact en makkelijk te lezen, waardoor andere systemen de "kasbon" kunnen analyseren zonder de hele rommelige conversatiegeschiedenis te hoeven bekijken.

3. De Leraar: CostCraft (Het Drie-Actiesysteem)

Met behulp van deze "kasbonnen" creëert een nieuwe distillatiepijplijn genaamd CostCraft een reeks regels (een "Vaardigheid") voor de robot. Het werkt als een coach die drie specifieke soorten advies geeft:

  1. Behouden (De "Blijf Doen"-Regel):
    • Analogie: "Je haalde een A, en je deed dit specifieke ding goed. Blijf het doen."
    • Bron: Gehaald uit succesvolle runs.
  2. Snoeien (De "Snijd het Vet Af"-Regel):
    • Analogie: "Je haalde een A, maar je hebt $5 verspild door hetzelfde bestand twee keer te lezen. Lees het de volgende keer één keer en bespaar de rest. Je verliest het cijfer niet, maar je bespaart geld."
    • Bron: Gehaald uit succesvolle runs die dure, onnodige stappen bevatten. Dit is de grote innovatie van het artikel.
  3. Repareren (De "Repareer de Fout"-Regel):
    • Analogie: "Je faalde omdat je vergeten was de wiskunde te controleren. Controleer de volgende keer de wiskunde dubbel voordat je indient."
    • Bron: Gehaald uit gefaalde runs, met gebruik van een "spiekbriefje" (oracle) om te zien wat het juiste antwoord was.

4. De Resultaten: Wat Gebeurde Er?

De onderzoekers testten dit op 30 spreadsheet-taken (zoals een wiskunde-examen voor robots).

  • Kosten Maken Uit: Toen ze de "kosten"-informatie uit de kasbonnen verwijderden, begon de robot dure fouten te maken. Hij zou volledig stoppen met werken of onzin produceren omdat hij niet wist welke stappen verspillend waren.
  • De "Snoeien"-Verrassing: De meest interessante bevinding ging over de Snoeien-regels.
    • De onderzoekers dachten dat deze regels alleen geld zouden besparen.
    • Realiteit: Ze redden daadwerkelijk de prestaties van de robot. Toen ze de "Snoeien"-regels verwijderden, faalde de robot veel vaker.
    • Waarom? Het blijkt dat wanneer een robot mag zijn verspillend (bestanden twee keer lezen, dingen controleren die hij niet nodig heeft), hij vaak in de war raakt en vergeet het eindantwoord te schrijven. De "Snoeien"-regels fungeren als een vangrail, waardoor de robot gefocust blijft zodat hij niet crasht.
  • Cross-Benchmark Test: Ze probeerden de regels die van spreadsheets waren geleerd op totaal verschillende taken (zoals het schrijven van code of het analyseren van documenten).
    • De "Snoeien"-regels (verspilling weghalen) werkten overal geweldig. Ze bespaarden ook geld op niet-gerelateerde taken.
    • De "Behouden"-regels (specifieke gewoontes behouden) maakten de dingen juist slechter op de nieuwe taken. Waarom? Omdat de robot gewoontes had geleerd die specifiek waren voor spreadsheets (zoals een bepaalde opmaakstijl) die geen zin hadden voor coderen.

Samenvatting

Het artikel beweert dat je om een AI-agent efficiënt te maken, niet alleen naar het eindcijfer (Succes/Faal) kunt kijken. Je hebt een kasbon (ClawTrace) nodig die precies laat zien hoeveel elke stap kostte.

Door deze kasbon te gebruiken, kun je de AI drie dingen leren:

  1. Behoud wat werkt.
  2. Snijd weg wat duur maar nutteloos is (wat verrassend genoeg helpt de AI op koers te houden).
  3. Repareer wat kapot is.

Zonder de kosten te kennen, leert de AI om "duur" en "onhandig" te zijn, en faalt het vaak taken die het makkelijk had kunnen oplossen als het gewoon stopte met tijdverspilling.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →