← Nieuwste papers
💬 NLP

Co-Harness: Co-Evolving Harnesses and Model Weights for LLM Agents

Co-Harness is een framework dat de runtime-harness van een LLM-agent en de modelparameters gezamenlijk optimaliseert door middel van een alternerend proces van harness-verfijning en model-fine-tuning, wat autonome herstel, efficiëntiewinst en strategie-ontdekking mogelijk maakt die verder gaan dan de beperkingen van fixed-harness post-training.

Oorspronkelijke auteurs: Zhengyu Chen, Teng Xiao, Huaisheng Zhu, Yige Yuan, Luan Zhang, Jingang Wang

Gepubliceerd 2026-07-28
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zhengyu Chen, Teng Xiao, Huaisheng Zhu, Yige Yuan, Luan Zhang, Jingang Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante maar onervaren leerling probeert te leren hoe je complexe puzzels oplost. In de wereld van kunstmatige intelligentie is deze leerling een "Large Language Model" (LLM)—een computerprogramma dat kan lezen, schrijven en redeneren. Maar een LLM werkt niet in een vacuüm; het heeft een werkplaats nodig. Deze werkplaats wordt een "Harness" genoemd. Denk aan de Harness als de set gereedschappen, de instructiehandleiding, de veiligheidsleuningen en de geheugenbank die de leerling gebruikt om zijn werk te doen. Het bevat zaken zoals hoe de computer met een rekenmachine communiceert, hoe hij eerdere stappen onthoudt en hoe hij weet wanneer hij om hulp moet vragen.

Lange tijd behandelden wetenschappers de leerling en de werkplaats als twee aparte dingen. Ze besteedden jaren aan het trainen van de leerling om slimmer te worden, maar hielden de werkplaats exact hetzelfde, gebruikmakend van dezelfde oude gereedschappen en instructies die ze met de hand hadden ontworpen. Het probleem is dat zelfs de slimste leerling zal struikelen als de werkplaats een wiebelige tafel of een verwarrende kaart heeft. Ze kunnen falen, niet omdat ze niet slim genoeg zijn, maar omdat de omgeving waarin ze werken kapot is. Dit artikel stelt een eenvoudige maar krachtige vraag: Wat als we niet alleen de leerling trainden, maar ook de werkplaats tegelijkertijd zouden verbeteren? Wat als de leerling ons zou kunnen helpen uitzoeken wat er mis was met het gereedschap, en we hen vervolgens konden onderwijzen met de nieuwe, betere gereedschappen?

Dit is precies wat de onderzoekers achter Co-Harness ontdekten. Ze creëerden een systeem waarbij het AI-model en zijn "werkplaats" (de Harness) samen evolueren, als een danspartner die leert om in sync te bewegen. In plaats van alleen de AI te repareren en op het beste te hopen, kijkt hun systeem naar elk moment waarop de AI een taak niet volbrengt. Het vraagt: "Was dit omdat de AI in de war was, of omdat het gereedschap dat hij vasthield kapot was?" Als het gereedschap het probleem was—bijvoorbeeld een verwarrende instructie of een ontbrekende veiligheidshaak—dan repareert het systeem dat gerecht automatisch. Vervolgens gebruikt het het succes van de AI met het nieuwe gereedschap om de AI te leren hoe hij nog beter kan worden.

De resultaten zijn als het kijken naar een sneeuwbal die uitgroeit tot een rotsblok. De onderzoekers hebben dit getest op moeilijke wiskunde- en logische puzzels. Ze ontdekten dat door de AI en de gereedschappen samen te laten verbeteren, het systeem aanzienlijk slimmer werd. Na slechts twee rondes van deze "co-evolutie" sprong de nauwkeurigheid van de AI op moeilijke wiskundetoetsen met gemiddeld meer dan 20 procentpunten. In één specifiek geval draaide het systeem meer dan 200 uur zonder menselijke hulp, waarbij het zijn eigen crashes oploste, zijn werk versnelde en zelfs een nieuwe strategie bedacht om meerdere pogingen te combineren om het juiste antwoord te krijgen. Het artikel suggereert dat deze "dual-loop"-aanpak—het gelijktijdig verbeteren van de omgeving en het trainen van de hersenen—een veel krachtigere manier is om intelligente agenten te bouwen dan de oude methode waarbij de omgeving statisch blijft. Het blijkt dat je, om een genie te maken, soms eerst een betere speeltuin moet bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →