← Nieuwste papers
🤖 AI

Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories

Harness-R1 introduceert een nieuwe methode die online reinforcement learning gebruikt om een toegewijde "harness engineer" te trainen om automatisch uitvoerbare runtime-patches te genereren vanuit falende trajecten van de agent, wat de succespercentages van taken over meerdere benchmarks aanzienlijk verbetert zonder dat de modelgewichten van de doelagent bijgewerkt hoeven te worden.

Oorspronkelijke auteurs: Shuai Shao, Kangning Zhang, Qingyao Li, Shijian Wang, Hao Wang, Wenxiang Jiao, Yuan Lu, Yi Guo, Weiwen Liu, Weinan Zhang

Gepubliceerd 2026-08-04
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Shuai Shao, Kangning Zhang, Qingyao Li, Shijian Wang, Hao Wang, Wenxiang Jiao, Yuan Lu, Yi Guo, Weiwen Liu, Weinan Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante, superintelligente robotassistent hebt. Je geeft het een opdracht, zoals "zoek het perfecte rode shirt onder de $20," en het begint aan het werk. Maar soms raakt de robot in de war. Misschien klikt hij op de verkeerde knop, vergeet hij waar hij naar op zoek was, of blijft hij in een lus hangen waarbij hij steeds hetzelfde item probeert te kopen. In de wereld van kunstmatige intelligentie wordt deze robot een "agent" genoemd, en het rommelige spoor van zijn gedachten, acties en fouten wordt een "traject" genoemd.

Normaal gesproken is de enige manier om een fout van een robot te herstellen, teruggaan naar de tekentafel en zijn hele brein opnieuw trainen. Dat kost veel tijd en energie. Maar er is een andere manier: in plaats van het brein van de robot te veranderen, zou je het "tuig" kunnen veranderen dat hij draagt. Denk aan het tuig als de veiligheidsuitrusting van de robot, zijn checklist en zijn communicatiegids, allemaal in één. Het is de code die de robot vertelt hoe hij met de wereld moet communiceren, hoe hij zijn werk moet controleren en hoe hij kan herstellen wanneer hij struikelt. De grote vraag die onderzoekers stellen is: Kunnen we een robot leren om zijn eigen tuig te repareren op basis van zijn eerdere fouten, zonder dat hij elke keer zijn hele brein opnieuw hoeft te trainen?

Dit is precies wat het artikel "Harness-R1" onderzoekt. De onderzoekers hebben een systeem gebouwd waarin een speciale "Engineer" AI leert om het tuig van de robot te herschrijven door naar zijn eerdere fouten te kijken. Zo werkt het: Eerst laten ze een standaard robot (de "Target") taken proberen op te lossen en te falen. Vervolgens kijkt de Engineer AI naar die mislukte verhalen en schrijft het een nieuwe set instructies — een patch — om het tuig te reparen. Cruciaal is dat ze niet alleen raden of de patch goed is; ze plaatsen de patch daadwerkelijk op de robot en laten hem de taken opnieuw proberen. Als de robot vaker slaagt, krijgt de Engineer een beloning en leert hij betere patches te schrijven. Als de patch de situatie verslechtert, leert de Engineer dat hij dat niet weer moet doen.

De resultaten zijn behoorlijk gaaf. Toen ze dit testten op drie verschillende uitdagende spellen (online winkelen, navigeren door een tekstgebaseerd huis en het beheren van een database), slaagde de standaard robot slechts ongeveer 44,3% van de tijd. Nadat de Harness-R1 Engineer leerde om zijn tuig te repareren, sprong het succespercentage naar 53,6%. Dat is een verbetering van 9,3 procentpunt, enkel door het tuig aan te passen, niet het brein. Nog beter nog: ze probeerden dit op een robot die al getraind was om slimmer te zijn, en de Engineer slaagde er nog steeds in om de prestaties met nog eens 5,0 punten te verhogen.

Het artikel laat ook zien dat dit niet slechts een toevalstreffer is voor één specifieke robot. De Engineer die ze trainden, kon naar een compleet nieuwe, andere robot kijken die hij nog nooit eerder had gezien, diens fouten bestuderen en een aangepaste oplossing schrijven die ook die nieuwe robot hielp slagen. Dit suggereert dat het leren bewerken van het "tuig" een vaardigheid is die aan een AI kan worden aangeleerd, waardoor het mee kan evolueren met de robots die het helpt, waardoor ze slimmer en betrouwbaarder worden zonder dat hun kernbrein ooit opnieuw getraind hoeft te worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →