← Nieuwste papers
💻 computer science

TraceFlow: Guiding Frozen Flow-Matching Robot Policies with Success and Failure Traces

TraceFlow introduceert een methode voor guidance tijdens de testtijd die bevroren flow-matching robotbeleid verbetert door gebruik te maken van een progressie-gealigneerd correctieveld afgeleid van zowel succesvolle als mislukte rollout-traces opgeslagen in een TraceBank, wat de taaksuccespercentages op real-world packing en specifieke simulatiebenchmarks aanzienlijk verbetert zonder dat modelgewichtsupdates vereist zijn.

Oorspronkelijke auteurs: Jiaxuan Zhang, Ruizhe Liu, Yu Zhang, Yanchao Yang

Gepubliceerd 2026-09-18
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jiaxuan Zhang, Ruizhe Liu, Yu Zhang, Yanchao Yang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots die kunnen zien, taal begrijpen en hun armen kunnen bewegen om complexe taken te voltooien, zijn niet langer sciencefiction; ze zijn een realiteit die vandaag de dag in laboratoria wordt gebouwd. Deze machines vertrouwen op een type software dat een vision-language-action policy wordt genoemd. Denk aan deze policy als een brein dat naar een camerabeeld kijkt, een menselijke instructie leest en vervolgens beslist welke fysieke beweging het daarna moet maken. Om veilig en betrouwbaar te zijn, "bevriezen" ingenieurs deze breinen vaak zodra ze getraind zijn, wat betekent dat de interne instellingen worden vastgelegd zodat de robot niet per ongeluk vergeet wat hij weet terwijl hij werkt. Een bevroren brein heeft echter een blinde vlek: als de robot een fout maakt tijdens een taak, kan hij die mislukking niet gebruiken om zijn directe volgende beweging aan te passen, omdat zijn instructies vaststaan. Het is als een bestuurder die een route perfect heeft uit het hoofd geleerd, maar niet kan bijsturen wanneer hij plotseling een kuil ziet, omdat zijn handen gebonden zijn aan een vooraf geschreven script. De vraag waar onderzoekers voor staan is hoe ze een robot in real-time kunnen laten leren van zijn eigen fouten zonder het hele brein opnieuw te trainen of complexe nieuwe sensoren toe te voegen.

Een team van onderzoekers aan de Universiteit van Hong Kong en de Southern University of Science and Technology heeft een methode ontwikkeld genaamd TraceFlow om dit probleem op te lossen. In plaats van te proberen het bevroren brein van de robot opnieuw te trainen, hebben ze een systeem gebouwd dat fungeert als een tijdelijke gids, waarbij een eenvoudig verslag van de eerdere pogingen van de robot wordt gebruikt om de huidige acties te sturen. Het systeem werkt door elke keer dat de robot een taak probeert op te slaan, waarbij wordt genoteerd of het is geslaagd of mislukt, en een gedetailleerd logboek bijhoudt van de bewegingen die onderweg zijn gemaakt. Wanneer de robot een nieuwe poging start, kijkt TraceFlow naar de huidige situatie en zoekt snel in dit logboek naar vergelijkbare momenten uit het verleden. Als het een eerdere poging vindt die succesvol was, trekt het de huidige bewegingsplanning van de robot voorzichtig richting wat eerder werkte. Als het een eerdere poging vindt die mislukte, duwt het de planning van de robot weg van die specifieke fout. Cruciaal is dat deze begeleiding begrensd is, wat betekent dat het sterk genoeg is om een koers te corrigeren, maar zwak genoeg om nooit de kerntraining van de robot te overschrijven, waardoor de machine veilig en stabiel blijft.

De onderzoekers testten deze aanpak op een echte robotarm in een rommelige kamer, waarbij ze de robot vroegen een specifieke reeks taken uit te voeren, zoals het verplaatsen van een stuk tape en vervolgens een hamer op een kast plaatsen. Zonder het begeleidingssysteem voltooide de robot de volledige reeks in de juiste volgorde slechts 21 keer in 50 pogingen, waarbij de volgorde van de stappen vaak fout ging. Met TraceFlow actief slaagde de robot 39 keer in 50 pogingen. De verbetering was nog dramatischer nadat de onderzoekers de robot een extra ronde met taken lieten uitvoeren, waarbij de nieuwe successen en mislukkingen van de robot terug in het systeem werden gevoed. In die tweede ronde voltooide de robot de reeks correct 47 keer in 50 pogingen, en maakte hij nul fouten in de volgorde van de stappen. Het systeem bereikte dit met slechts één "ja" of "nee" label voor elke eerdere poging om succes of falen aan te geven, zonder dat er een complexe analyse nodig was van waar precies de robot de fout in ging.

In computersimulaties waren de resultaten selectiever, wat aantoonde dat de methode het beste werkt voor taken die het onthouden van de juiste volgorde van stappen vereisen of het overdragen van een vaardigheid naar een nieuw object. Bijvoorbeeld, in een simulatie waarbij het stapelen van blokken betrokken was, sprong het succespercentage van ongeveer 54% naar 62% wanneer het systeem werd toegestaan om van zijn eigen fouten te leren. Echter, de onderzoekers ontdekten dat deze begeleiding niet bij elk type taak hielp. Wanneer de robot objecten moest tellen of items moest vinden die achter andere objecten verborgen waren, verbeterde het systeem de prestaties niet en maakte het deze soms zelfs iets slechter. Dit suggereert dat de methode specifiek goed is in het corrigeren van fouten in de sequentie van acties, maar het kan geen problemen oplossen waarbij de robot simpelweg de informatie mist die nodig is om de scène te zien of te begrijpen.

De studie onderzocht ook hoe lang de robot vanuit zijn eigen geschiedenis kon blijven leren. De onderzoekers lieten de robot tien rondes met taken uitvoeren, waarbij nieuwe ervaringen na elke ronde aan het systeem werden toegevoegd. Ze ontdekten dat de prestaties van de robot in het begin snel verbeterden, maar daarna afvlakten, met een piek rond de tweede of zevende ronde, afhankelijk van de taak. Dit geeft aan dat er een limiet is aan hoeveel een robot kan profiteren van zijn eigen recente geschiedenis zonder zijn onderliggende brein te veranderen. Bovendien ontdekten het team dat de verhouding tussen succesvolle en mislukte eerdere pogingen niet voorspelde hoe goed het systeem zou werken; de robot kon zelfs verbeteren als hij veel meer fouten dan successen in zijn geheugen had. Deze bevinding daagt het idee uit dat een robot een perfect trackrecord nodig heeft om van zijn verleden te leren.

Uiteindelijk biedt TraceFlow een praktische manier om bevroren robot-policies aanpasbaarder te maken. Door een eenvoudige, begrensde correctie te gebruiken op basis van een geschiedenis van winst en verlies, kan de robot complexe, opeenvolgende taken met grotere betrouwbaarheid uitvoeren zonder dat hij vanaf nul opnieuw getraind hoeft te worden. De onderzoekers lieten zien dat deze aanpak effectief werkt op echte hardware, waarbij een robot die moeite had met de volgorde van stappen werd veranderd in een machine die een reeks acties betrouwbaar kan voltooien. Hoewel het geen magische oplossing is voor elke robotuitdaging, met name die waarbij het tellen of verborgen objecten betrokken is, biedt het een duidelijk pad om robots robuuster te maken in de echte wereld door ze in het moment te laten leren van hun eigen fouten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →