Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows
Harness-Bench is een diagnostische benchmark die bestaat uit 106 realistische, in een zandbak uitgevoerde taken en die evalueert hoe verschillende configuraties op systeemniveau (harnesses) de prestaties van LLM-agenten beïnvloeden, waarbij wordt aangetoond dat uitvoeringsresultaten aanzienlijk variëren tussen model-harness-combinaties en wordt benadrukt dat agentcapaciteiten op configuratieniveau moeten worden gerapporteerd in plaats van uitsluitend aan het basismodel te worden toegeschreven.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een briljante, wereldklasse chef-kok hebt (het AI-model). Deze kok kan alles koken als hij de juiste instructies krijgt. Maar in de realiteit staat een kok niet in een vacuüm; ze werken in een keuken met specifieke gereedschappen, een set regels, een manager die de bestellingen controleert en een systeem voor het afhandelen van fouten.
Dit paper, Harness-Bench, gaat over het testen van dat keukensysteem (de "harness" genoemd), niet alleen de kok.
Het Probleem: We Hebben de Keuken Genegeerd
Tot nu toe, toen mensen AI-agenten testten, vroegen ze vooral: "Hoe goed is de kok?" Ze keken naar het eindgerecht (heeft de AI de taak voltooid?) maar negeerden hoe de keuken was ingericht.
- Had de kok het juiste messen (gereedschappen)?
- Wist de kok hoe hij een verbrande pan moest aanpakken (herstel)?
- Hield de keukenmanager (het systeem) de kok ervan af om de verkeerde ingrediënten te gebruiken (rechten)?
De auteurs betogen dat je het vermogen van een AI niet kunt beoordelen door alleen naar het model te kijken. Je moet kijken naar het Model + Het Keukensysteem samen. Een geweldige kok in een rommelige, kapotte keuken zal falen, terwijl een goede kok in een perfecte, goed georganiseerde keuken misschien wel slaagt.
De Oplossing: Een "Keukensimulator" voor AI
De onderzoekers bouwden Harness-Bench, een groot testterrein met 106 verschillende kookuitdagingen (taken). Dit zijn niet zomaar simpele vragen; het zijn complexe banen zoals het repareren van code, het analyseren van financiële gegevens of het beheren van een project.
Zo testten ze het:
- Hetzelfde Ingrediënten, Verschillende Keukens: Ze namen dezelfde 106 taken en gaven ze aan verschillende AI-modellen.
- De Variabele: Ze hielden de taak exact hetzelfde, maar wisselden het "keukensysteem" (de harness) voor elke run. Sommige keukens waren high-tech en streng; anderen waren los en simpel.
- Het Resultaat: Ze draaiden meer dan 5.000 experimenten.
Wat Ze Vonden
De resultaten waren verrassend en duidelijk: De keuken is net zo belangrijk als de kok.
- Enorme Verschillen: Toen ze hetzelfde AI-model gebruikten maar het in verschillende "keukens" zetten, varieerde het slagingspercentage enorm. Het ene keukensysteem behaalde een slagingspercentage van 76%, terwijl het andere slechts 52% haalde met exact hetzelfde model.
- De "Slimme" Keuken Wint: De best presterende systemen waren niet alleen de systemen met de slimste AI-modellen. Het waren de systemen waarbij het systeem de AI hielp op koers te blijven, zich te herstellen van fouten en gereedschappen correct te gebruiken.
- Het "Drift"-Probleem: De onderzoekers ontdekten dat AI vaak begint met een goed plan, maar dan "aflaat". Het kan logisch nadenken maar vergeten het bestand daadwerkelijk op te slaan, of het kan een gereedschapsfout negeren en doorgaan met hetzelfde te proberen. De beste "keukensystemen" vingen deze afwijkingen op en corrigeerden ze.
De Grote Conclusie
Het paper concludeert dat we moeten stoppen met zeggen "Dit AI-model is 90% goed". In plaats daarvan moeten we zeggen: "Dit AI-model is 90% goed wanneer gekoppeld aan dit specifieke systeem."
Als je een betrouwbare AI-agent wilt bouwen, kun je niet alleen de slimste hersenen kiezen; je moet het beste lichaam en zenuwstelsel (de harness) bouwen dat erbij past. Harness-Bench is het gereedschap dat ze hebben gecreëerd om ingenieurs te helpen dat lichaam te meten en te verbeteren.
In Het Kort
Denk eraan als het testen van een raceauto. Je kunt niet alleen naar de motor (het AI-model) kijken en zeggen dat het snel is. Je moet de motor testen op verschillende tracks met verschillende banden en bestuurders (de harness). Harness-Bench is het nieuwe circuit dat bewijst dat de snelheid van de auto sterk afhankelijk is van het circuit en de banden, niet alleen van de motor.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.