It's Not the Capability: Harness Sensitivity Is Non-Monotone Across LLM Agent Tiers
Dit artikel weerlegt de aanname dat de optimale complexiteit van een harness monotoon afneemt met de modelcapaciteit, en onthult door middel van een experiment met 432 runs dat de gevoeligheid van het harness niet-monotoon is en kritiek afhangt van het modeltype, waarbij uitgebreide structuren frontier-chatmodellen belemmeren terwijl strikte begeleiding frontier-resonatiemodellen ten goede komt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een team van verschillende werknemers inhuurt om een rommelige kamer (de "werkruimte") op te ruimen. Je hebt een manager die hen instructies geeft (de "harnas").
Het gangbare geloof in de AI-wereld is geweest: "Hoe slimmer de werknemer, hoe minder gedetailleerde instructies ze nodig hebben." Met andere woorden: een genie heeft een simpele notitie nodig, terwijl een beginner een strikte, stap-voor-stap handleiding nodig heeft. Dit artikel betoogt dat dit geloof onjuist is.
Hier is de uiteenzetting van wat de onderzoekers hebben gevonden, met behulp van eenvoudige analogieën:
1. Het Experiment: Een Testkeuken voor AI
De onderzoekers hebben een "testkeuken" opgezet genaamd HEAT-24.
- De Kamer: Een digitale werkruimte met 12 bestanden (zoals code, notities en data).
- De Taken: 24 specifieke taken, zoals "repareer deze kapotte code", "vind een specifiek bestand" of "schrijf een rapport in een strikt formaat".
- De Werknemers: Ze testten 6 verschillende AI-modellen, variërend van "Frontier" (super-slim, duur) tot "Constrained" (kleiner, goedkoper).
- De Instructies: Ze gaven de werknemers drie soorten instructiehandleidingen:
- Licht: Een simpele notitie van twee zinnen.
- Gebalanceerd: Een vierstappenhandleiding met een lijst van toegestane bestanden.
- Strikt: Een enorme, 6-staps handleiding met strikte regels over hoe het werk moet worden geverifieerd en exact hoe de output moet worden opgemaakt.
Ze voerden dit experiment 432 keer uit om te zien welke combinatie het beste werkte.
2. De Grote Verrassing: De "Eén Maat Past Allen"-Regel is Gebroken
De onderzoekers verwachtten een gladde curve: Slimmere AI = Simpele instructies. In plaats daarvan vonden ze een chaotische, niet-lineaire puinhoop. De "beste" instructiestijl hangt volledig af van welk type AI je gebruikt, niet alleen van hoe slim het is.
De "Overdenker" (Frontier Chat-model)
- Wie het is: Een zeer slim model ontworpen voor chatten (zoals een conversatiepartner).
- Wat er gebeurde: Toen het de Strikte handleiding kreeg, crashte het. Het slagingspercentage daalde met bijna 30%.
- De Analogie: Stel je voor dat je een briljante dichter vraagt om een complex belastingformulier in te vullen. Als je hen een simpele prompt geeft ("Schrijf een gedicht"), zijn ze perfect. Maar als je hen een 10-pagina's tellend juridisch contract geeft over hoe ze het gedicht moeten schrijven, raken ze in de war, beginnen ze te zwammen en vergeten ze daadwerkelijk het gedicht te schrijven.
- Het Resultaat: Voor dit type AI geldt: minder is meer. Simpele instructies werken het beste.
De "Architect" (Frontier Reasoning-model)
- Wie het is: Een super-slim model ontworpen voor diepe logica en probleemoplossing (met "extended thinking" ingeschakeld).
- Wat er gebeurde: Toen het de Strikte handleiding kreeg, presteerde het beter dan met simpele notities. Het voltooide de taak ook sneller.
- De Analogie: Stel je voor dat je een meester-architect vraagt. Als je zegt: "Bouw een huis", kan hij wegdromen over 100 verschillende mogelijkheden. Maar als je hen een strikte blauwdruk geeft met exacte maten en een checklist, gaan ze direct aan het werk, negeren ze afleidingen en bouwen ze het huis perfect.
- Het Resultaat: Voor dit type AI geldt: meer structuur is beter. Het gebruikt de strikte regels als een steiger om zijn denken te focussen.
De "Klein maar Krachtig" (Constrained-model)
- Wie het is: Een klein model (slechts 2 miljard parameters) dat verrassend goed was getraind.
- Wat er gebeurde: Het presteerde even goed als de enorme, dure modellen over alle instructietypes heen.
- De Analogie: Dit is als een kleine, zeer gedisciplineerde leerling die, ondanks een klein brein, zo goed is getraind in hoe hij orders moet volgen, dat hij de taak even goed kan uitvoeren als een PhD-professor.
- Het Resultaat: Je kunt de "harnas-behoeften" van een model niet beoordelen op basis van alleen zijn grootte (aantal parameters). De kwaliteit van de training is belangrijker.
De "Verloren Beginner" (Modellen met lage capaciteit)
- Wie het is: Kleinere modellen met minder training.
- Wat er gebeurde: Ze hadden moeite met alles. Simpele notities lieten hen de verkeerde bestanden kiezen; strikte notities overweldigden hen.
- Het Resultaat: Ze hebben een "Goudlokje"-benadering nodig: net genoeg structuur om hen te leiden, maar niet zo veel dat ze in de war raken.
3. De Twee Hoofdfouten
De onderzoekers categoriseerden waarom de AI faalde:
- De "Kletskous"-Fout (Formaat Overtreding): De slimme modellen begrepen de taak, maar konden niet stoppen met praten. In plaats van de vereiste data te geven (zoals een JSON-bestand), schreven ze een lang verhaal waarin ze uitlegden waarom ze het deden. Dit gebeurde vooral wanneer de instructies te complex waren.
- De "Verkeerde Deur"-Fout (Verkeerd Bestand): De kleinere modellen wisten vaak niet welk bestand ze moesten aanraken. Zonder een duidelijke lijst van "toegestane bestanden" bewerkten ze het verkeerde document.
4. De Conclusie: Stop met Gissen, Begin met Matchen
Het artikel concludeert dat er geen enkele "beste" manier is om een AI te prompten.
- Als je een Chat-AI hebt, houd instructies licht en simpel. Overleg niet.
- Als je een Reasoning-AI hebt, geef hem strikt, gedetailleerde regels. Het gedijt op structuur.
- Als je een klein, goed getraind AI hebt, kan het net zo goed zijn als de grote modellen, ongeacht de instructies.
Kortom: Je zou een peuter geen complex juridisch contract geven, en je zou een rechter van het Hooggerechtshof geen post-it notitie geven. Je moet de instructiestijl matchen met het type werknemer, niet alleen met hun intelligentieniveau.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.