Recursive Agent Harnesses
Dit artikel introduceert de Recursive Agent Harness (RAH), een code-first framework waarbij parent-agents parallelle subagent-harnesses genereren met filesystem- en executietools, wat significante verbeteringen demonstreert in long-context redeneren en programmeertaken ten opzichte van traditionele model-recursie baselines wanneer geëvalueerd met vaste en sterkere backbone-modellen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme bibliotheek hebt met miljoenen boeken en dat je een specifieke feit in elk van die boeken moet vinden.
De Oude Manier: De Overwerkte Bibliothecaris
Voorheen, als je een slimme AI (een "coding agent") zou vragen om dit te doen, zou deze proberen te fungeren als een supersnelle bibliothecaris. Het zou de boeken scannen met behulp van eenvoudige regels (zoals zoeken naar specifieke trefwoorden) om antwoorden te vinden. Maar omdat de bibliotheek zo groot is, kan de bibliothecaris slechts een paar boeken tegelijk in zijn handen houden. Hij moet het daadwerkelijke lezen van de tekst van de meeste boeken overslaan en vertrouwen op die eenvoudige regels. Als het antwoord diep nadenken over een specifieke pagina vereist, mist de bibliothecaris het.
De "Model Recursion" Manier: De Ketting van Gedachten
Een andere aanpak, genaald "Recursive Language Models" (RLM), probeerde dit op te lossen door de bibliotheek in kleinere stapels op te delen. De AI zou over één stapel nadenken, dan over de volgende, dan over de volgende, in een lange keten van gedachten. Deze AI is echter als een bibliothecaris die verboden is om de boeken aan te raken. Hij kan alleen nadenken over de tekst die hem wordt gegeven, maar hij kan geen bestanden openen, geen hulpmiddelen gebruiken of een vergrootglas hanteren. Hij is slim, maar hulpeloos zonder de daadwerkelijke instrumenten om met de documenten te interageren.
De Nieuwe Manier: De "Recursive Agent Harness" (RAH)
Dit artikel introduceert een nieuwe strategie genaamd de Recursive Agent Harness (RAK).
Zie RAH niet als één bibliothecaris, maar als een hoofdaannemer die een heel nieuw team opzet voor de klus.
- Het Hoofdplan: De hoofd-AI (de ouder) kijelt naar de enorme bibliotheek en realiseert zich: "Ik kan dit niet alleen, en ik kan er niet alleen over nadenken."
- Het Schrijven van het Script: In plaats van het werk zelf te doen, schrijft de ouder een computerprogramma (een script). Dit script is een reeks instructies die zegt: "Huur voor elk enkel boek in deze bibliotheek een nieuwe, volledig uitgeruste assistent in."
- De Sub-teams: Het script draait en creëert onmiddellijk honderden sub-agents. Cruciaal is dat elk van deze sub-agents een volwaardige werker is. Ze hebben hun eigen bureau, hun eigen gereedschap (zoals bestandsopeners, zoekmachines en code-executeurs) en hun eigen contextvenster (hun eigen mentale ruimte).
- Parallel Werk: Terwijl de oude bibliothecaris slechts één boek tegelijk kon bekijken, en de chain-of-thought AI slechts over één stapel tegelijk kon nadenken, stuurt RAH duizenden van deze volledig uitgeruste assistenten uit om tegelijkertief aan hun specifieke boeken te werken.
- Het Resultaat: Elke assistent leest zijn specifieke boek, gebruikt zijn gereedschap om het antwoord te vinden en schrijft het resultaat op. De ouder verzamelt vervolgens alle antwoorden.
De Analogie van de "Gereedschapskist"
Het belangrijkste verschil is de gereedschapskist.
- De Coding Agent heeft een gereedschapskist, maar kan slechts een paar boeken tegelijk bekijken.
- De RLM heeft een enorm brein maar geen gereedschapskist; hij kan de bestanden niet openen.
- RAH geeft elke werker zijn eigen volledige gereedschapskist en laat hen parallel werken.
Wat het Papier Vond
De onderzoekers testten dit op een zeer moeilijke test genaamd "Oolong", die het vinden van antwoorden in documenten omvat die zo lang zijn als 4 miljoen woorden (ongeveer de omvang van een kleine roman, maar met duizenden vermeldingen).
- Ze gebruikten dezelfde "hersenen" (GPT-5) voor alle tests om een eerlijke vergelijking te maken.
- De oude "Coding Agent" kreeg ongeveer 72% correct.
- De "Model Recursion" (zonder hulpmiddelen) kreeg ongeveer 64% correct.
- De nieuwe RAH-methode kreeg 81% correct.
De Kernboodschap
Het papier stelt dat de verbetering niet kwam door een slimmer AI-model te gebruiken. Het kwam volledig voort uit het veranderen van hoe het werk wordt georganiseerd. Door de "recursieve eenheid" (het ding dat het werk herhaalt) te veranderen van een eenvoudige "gedachte" naar een "volwaardige werker met gereedschap", werd het systeem veel beter in het oplossen van complexe, grootschalige problemen.
De auteurs merken op dat dit niet slechts een theorie is; het is vergelijkbaar met hoe sommige echte productiesystemen (zoals de dynamische workflows van Anthropic) nu al beginnen te werken. Ze hebben dit patroon simpelweg een naam gegeven en bewezen dat het beter werkt dan de oude manieren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.