From Failed Trajectories to Reliable LLM Agents: Diagnosing and Repairing Harness Flaws
Dit artikel introduceert HarnessFix, een trace-gestuurd framework dat fouten in agents diagnosticeert door executietraces en harness-code te analyseren om gerichte, gevalideerde patches te genereren die de betrouwbaarheid van LLM-agents over meerdere benchmarks aanzienlijk verbeteren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een briljante maar soms verwarde assistent hebt (de LLM Agent) die complexe puzzels probeert op te lossen, zoals het repareren van een kapot computerprogramma of het plannen van een reis. Deze assistent werkt niet alleen; het werkt in een "controlekamer" die door ingenieurs is gebouwd. Deze controlekamer wordt de Harness genoemd.
De Harness is de set regels, hulpmiddelen en veiligheidscontroles die de assistent vertellen:
- Welke hulpmiddelen het kan gebruiken (zoals een schroevendraaier of een zoekmachine).
- Welke informatie het kan zien (zoals een kaart of een handleiding).
- Hoe het voortgang moet rapporteren.
- Wanneer het moet stoppen en moet zeggen: "Ik ben klaar."
Het Probleem: De "Black Box" van Falen
Soms faalt de assistent. In het verleden probeerden ingenieurs zaken op te lossen wanneer er iets misging door:
- De instructies van de assistent aan te passen: "Hé, probeer wat voorzichtiger te zijn!" (Dit is als een chauffeur vertellen dat hij "beter moet rijden" zonder de defecte remmen te repareren).
- Te gokken: Kijken naar het eindresultaat en hopen dat een willekeurige verandering helpt.
Het probleem is dat deze methoden vaak de echte oorzaak missen. De fout ligt misschien niet bij de assistent; het kan zijn dat de Harness de assistent het verkeerde hulpmiddel gaf, een cruciale foutmelding verborg, of de assistent liet stoppen voordat het werk voltooid was. Omdat de acties van de assistent plaatsvinden in een lange, rommelige keten van gebeurtenissen, is het moeilijk om precies aan te wijzen waar de controlekamer faalde.
De Oplossing: HARNESSFIX (De Detective)
De auteurs van dit paper hebben een nieuw systeem ontwikkeld genaamd HARNESSFIX. Beschouw dit als een forensische detective voor de controlekamer. In plaats van te gokken, onderzoekt het de plaats delict (de mislukte poging) stap voor stap om het exacte kapotte onderdeel van de Harness te vinden.
Zo werkt HARNESSFIX, met behulp van een eenvoudige analogie:
1. De "Vertaler" (HTIR)
Eerst vertaalt de detective het rommelige, verwarrende logboek van wat er is gebeurd (de "trace") en de code van de controlekamer naar een schone, georganiseerde kaart genaamd HTIR.
- Analogie: Stel je een chaotische plaats delict voor met verspreide aanwijzingen. De detective organiseert deze in een duidelijke tijdlijn: "Om 10:00 vroeg de agent om een hulpmiddel. Om 10:01 gaf het hulpmiddel een foutmelding. Om 10:02 negeerde de agent de foutmelding." Deze kaart verbindt de acties van de agent direct met de regels die hen bestuurden.
2. De "Diagnose" (De dader vinden)
Vervolgens kijkt de detective naar de kaart om te vinden waar de keten precies is doorbroken.
- Analogie: De detective vraagt: "Faalde de agent omdat het wachtwoord niet bekend was? Of omdat de deur werd vergrendeld door het beveiligingssysteem (de Harness)?"
- HARNESSFIX identificeert of het probleem lag in de Tool Interface (slechte instructies), de Lifecycle (het te vroeg laten stoppen van de agent), of de Observability (het verbergen van foutmeldingen). Het creëert een specifiek "Flaw Report" voor terugkerende problemen.
3. De "Reparatieplaats" (Scoped Fixes)
Zodra de fout is geïdentificeerd, laat HARNESSFIX niet zomaar iedereen de hele controlekamer herschrijven. Dat zou gevaarlijk zijn en andere dingen zou kunnen breken. In plaats daarvan gebruikt het een set Repair Operators.
- Analogie: Denk aan deze als specifieke gereedschappen in een gereedschapskist van een monteur. Als het probleem een losse bout is, gebruikt de monteur een sleutel. Als het probleem een lekke band is, gebruikt hij een krik. HARNESSFIX gebruikt alleen de specifieke "sleutel" die nodig is voor die specifieke fout. Het schrijft een kleine, precieze patch om alleen dat kapotte deel te repareren, zodat het niet per ongeluk de motor beschadigt.
4. De "Veiligheidsinspecteur" (Validatie)
Voordat de nieuwe patch wordt geïnstalleerd, controleert een veiligheidsinspecteur deze.
- Analogie: De inspecteur stelt twee vragen:
- "Heeft deze fix het specifieke probleem dat we vonden opgelost?"
- "Heeft deze fix per ongeluk iets anders gebroken dat wel goed functioneerde?"
- Als het antwoord op de tweede vraag "Ja" is, wordt de patch afgewezen. Dit voorkomt dat het systeem slechter wordt terwijl het probeert beter te worden.
Wat hebben ze ontdekt?
De onderzoekers hebben dit detectivesysteem getest op vier verschillende soorten moeilijke taken (software repareren, de command line gebruiken, onderzoek doen en apps automatiseren).
- De resultaten: HARNESSFIX verbeterde het succespercentage van de agents met 15% tot 50% vergeleken met de oorspronkelijke opstelling.
- De vergelijking: Het presteerde beter dan:
- Menselijke experts die de controlekamers handmatig ontwierpen.
- Andere AI-systemen die probeerden zichzelf te repareren door simpelweg instructies te wijzigen of te gokken.
- De ontdekking: Ze ontdekten dat veel fouten niet voortkwamen uit het feit dat de AI "dom" was, maar omdat de "controlekamer" verborgen gebreken had, zoals het verbergen van foutmeldingen of het te vroeg laten stoppen van de AI. HARNESSFIX vond deze verborgen gebreken en repareerde ze.
Samenvattend
HARASSFIX is een systeem dat een mislukte AI-poging behandelt als een plaats delict. Het geeft niet alleen de AI de schuld; het onderzoekt de omgeving waarin de AI werkte, vindt de specifieke kapotte regel of het kapotte hulpmiddel, en past een precieze, veilige fix toe. Dit maakt de AI veel betrouwbaarder zonder dat de "hersenen" van de AI opnieuw getraind hoeven te worden of dat er gegokt hoeft te worden wat er misging.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.