RHO: Your Coding Agent is Secretly a Roboticist
Het artikel introduceert Robotics Harness Optimization (RHO), een nieuw trainingsparadigma waarbij door gereedschap ondersteunde coderende agenten zoeken naar interpreteerbare, multi-file neurosymbolische beleidsrepositories met behulp van omgevingsfeedback, waarmee zij state-of-the-art prestaties en superieure efficiëntie bereiken ten opzichte van bestaande multi-turn agentische systemen in realtime robotica-taken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot probeert te leren hoe hij een kopje moet oppakken en op een tafel moet zetten.
De Oude Manier: De "On-the-Fly" Programmeur
Voorheen was de beste manier om dit te doen een superintelligente AI (een Large Language Model) die fungeerde als een gehaaste programmeur. Elke keer dat de robot het kopje liet vallen of de tafel miste, stopte de AI, dacht na, schreef nieuwe code om de fout te herstellen, en probeerde het opnieuw. Dit is alsof een chef een soep proeft, beseft dat er zout bij moet, stopt met koken, een nieuw recept schrijft en dan weer opnieuw begint. Het werkt, maar het is traag, rommelig, en de robot kan niet snel genoeg bewegen om nuttig te zijn in de echte wereld omdat hij constant pauzeert om zijn eigen instructies te herschrijven.
De Nieuwe Manier: RHO (De "Pre-Game" Coach)
RHO (Robotics Harness Optimization) introduceert een andere aanpak. In plaats van de AI code te laten schrijven terwijl de robot beweegt, fungeert RHO als een strende, reflectieve coach tijdens de training.
Zo werkt RHO, met behulp van een eenvoudige analogie:
1. De "Repository" (De hele gereedschapskist, niet slechts een briefje)
De meeste AI-systemen proberen een robot te repareren door een enkele zin of een kleine functie aan te passen (zoals het veranderen van één ingrediënt in een recept). RHO is anders. Het behandelt de hersenen van de robot als een volledige bibliotheek met bestanden (een "Repository").
- Analogie: Stel je voor dat de hersenen van de robot niet alleen een briefje met instructies zijn; het is een volledige werkplaats met een handleiding, een set gereedschappen, een veiligheidschecklist en een navigatiekaart. RHO bewerkt niet alleen het briefje; het organiseert de hele werkplaats opnieuw, vervangt de gereedschappen en herschrijft alle handleidingen tegelijkertijd.
2. De "Tool-Enabled Agent" (De leerling die daadwerkelijk kan bouwen)
RHO gebruikt een speciale AI-agent die niet alleen een tekstgenerator is. Het is een coderingsagent met handen.
- Analogie: In plaats van alleen over het repareren van de robot te praten, krijgt deze agent de toestemming om de codebestanden van de robot te openen, tests uit te voeren, naar de "videofeed" van de robot te kijken om te zien wat er misging, de foutlogs te controleren en vervolgens de code daadwerkelijk te herschrijven. Het is als een leerling die de handleiding kan lezen, een moersleutel kan pakken, de motor kan repareren en vervolgens de auto kan testen, allemaal in één keer.
3. De "Evolutionary Search" (Survival of the Fittest)
RHO probeert niet slechts één oplossing. Het voert een evolutionair proces uit.
- Analogie: Stel je een toernooi voor. De AI creëert 100 verschillende versies van de "hersenen" van de robot (verschillende code-repositories). Het stuurt ze allemaal naar een simulatie om de taak te proberen te voltooien.
- Sommigen falen jammerlijk.
- Sommigen doen het oké.
- Een paar doen het geweldig.
- De AI neemt de "winnaars", mengt hun beste kenmerken samen en creëert een nieuwe generatie van 100 robots. Dit proces herhaalt zich honderden keren.
- Cruciaal is dat het een "Pareto Frontier" behoudt. Dit betekent dat het niet alleen de robot houdt die het beste is in alles. Het houdt de robot die het beste is in deze specifieke taak, zelfs als hij in een andere taak slecht is. Dit zorgt ervoor dat de uiteindelijke robot een specialist is, en geen generalist die bij specifieke taken faalt.
4. Het Resultaat: Een "Ready-to-Deploy" Robot
Aan het einde van de training produceert RHO een enkele, perfecte "Repository" (een complete set codebestanden).
- De Magie: Wanneer deze robot in de echte wereld wordt ingezet, heeft hij de AI niet meer nodig om na te denken. Hij stopt niet om code te schrijven. Hij voert simpelweg de vooraf geschreven, hoogst geoptimaliseerde code uit.
- De Analogie: Het is het verschil tussen een student die tijdens een toets bij elke wiskundige formule moet kijken, versus een student die de formules heeft uit het hoofd geleerd en duizenden problemen heeft geoefend. De RHO-robot is de student die het harde werk al heeft gedaan tijdens het "huiswerk" (training) en er klaar voor is om de test (deployment) direct te halen.
Wat hebben ze daadwerkelijk bereikt?
Het paper beweert dat deze methode aanzienlijk beter is dan de huidige state-of-the-art:
- Snelheid & Betrouwbaarheid: Op standaard robotica-benchmarks (zoals het stapelen van blokken of het verplaatsen van objecten) behaalde RHO een succespercentage van 70% met een enkele, snelle uitvoering. De vorige beste methode (die vereiste dat de AI constant pauzeerde en code herschreef) behaalde slechts 68% en was veel langzamer.
- Omgaan met Chaos: Wanneer de onderzoekers de regels veranderden (zoals het verplaatsen van objecten naar andere plekken of het veranderen van de taakbeschrijving), faalden andere AI-modellen (zoals OpenVLA) volledig (0% succes). RHO slaagde er nog steeds in om 45% van de tijd te slagen.
- Efficiëntie: In een complexere real-world simulatie verminderde RHO de tijd die de robot doorbracht met "denken" met 20% en verminderde het het aantal tools dat het moest aanroepen met 27%, terwijl het het succespercentage verdubbelde.
De Kernboodschap
RHO verandert het spel door het zware werk te verplaatsen van de deployment (wanneer de robot werkt) naar de training (wanneer de robot leert). Het gebruikt een slimme, gereedschap-gebruikende AI om een complete, multi-file codebibliotheek te evolueren die robuust is, interpreteerbaar (mensen kunnen de code lezen) en klaar is om direct te draaien zonder dat er een supercomputer nodig is om de instructies onderweg te herschrijven.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.