← Nieuwste papers
💻 computer science

SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies

Dit artikel introduceert SUN (Semantically UNified) Programma's en het Kuafu-systeem, die modelgebaseerde controle en geleerde beleidssystemen overbruggen door automatisch getypeerde, taalgegronde uitvoerbare bestanden te synthetiseren die MPC-verificatie en RL-training verenigen, waardoor robuuste manipulatie over lange termijn mogelijk wordt zonder handmatige dichte beloningen of menselijke demonstraties.

Oorspronkelijke auteurs: Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao, Yuxin Jiang, Chenfanfu Jiang, Yingnian Wu, Demetri Terzopoulos, Ran Gong

Gepubliceerd 2026-09-01
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao, Yuxin Jiang, Chenfanfu Jiang, Yingnian Wu, Demetri Terzopoulos, Ran Gong

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots zijn al lang meesters op de fabrieksvloer, waarbij ze duizenden keren dezelfde precieze beweging zonder fouten herhalen. Maar wanneer ze gevraagd wordt om een complexe, meerstaps taak uit te voeren in een rommelig, onvoorspelbaar huis — zoals het openen van een lade, het pakken van een fles en het plaatsen ervan op een tafel — gaan ze vaak de mist in. De moeilijkheid ligt in het overbruggen van de kloof tussen twee verschillende manieren van denken over beweging. De ene benadering vertrouwt op rigide wiskundige regels om elke gewrichtshoek en kracht te berekenen, wat ervoor zorgt dat de robot niet botst, maar deze methode is broos en faalt als de wereld enigszins verandert. De andere benadering maakt gebruik van trial-and-error leren, waarbij een robot oefent totdat hij de handeling onder de knie krijgt, maar dit vereist vaak duizenden uren aan menselijke demonstraties of zorgvuldig ontworpen beloningen die moeilijk te definiëren zijn. Jarenlang hebben deze twee methoden in aparte silo's ge opereerd, waarbij de rigide planners niet in staat waren zich aan te passen en de lerende systemen de diepere logica van de taak niet begrepen.

Onderzoekers aan de University of California, Los Angeles, en hun collega's hebben een nieuw systeem geïntroduceerd genaamd Kuafu, dat probeert deze twee benaderingen met elkaar te verweven. In plaats van de instructies van de robot te behandelen als een vluchtige reeks doelen of een rigide script, hebben ze een persistent, getypeerd programma gecreëerd dat fungeert als een enkele bron van waarheid voor het hele proces. Dit programma, dat ze een "Semantically Unified" of SUN-programma noemen, is geschreven op een manier waarop een computer de fysieke relaties tussen objecten kan begrijpen, zoals de richting waarin een ladehandgreep wijst of hoe ver een fles moet worden opgetild. Cruciaal is dat ditzelfde programma wordt gebruikt om de acties van de robot te verifiëren, om hem te leren hoe hij moet bewegen, en om de gegevens te genereren die nodig zijn om vanuit het niets te leren. Door de kernbetekenis van de taak constant te houden van de initiële planningsfase tot de uiteindelijke leerfase, voorkomt het systeem dat de robot afdwaalt van wat hij eigenlijk had moeten doen.

Het systeem begint door een eenvoudige taalinstructie van een mens te nemen, zoals "open de lade en plaats de beker erin". Een kunstmatige intelligentie-agent leest deze instructie en construeert het SUN-programma door vooraf gedefinieerde bouwstenen te selecteren die fysieke acties en beperkingen beschrijven. Vervolgens test het dit programma in een hoogwaardige simulatie, waarbij een geavanceerde besturingsmethode wordt gebruikt om te zien of de taak fysiek mogelijk is. Als de simulatie onthult dat de instructies gebrekkig of onmogelijk uit te voeren zijn, repareert het systeem automatisch het programma voordat er aan het leren wordt begonnen. Dit screeningsproces is essentieel omdat het ervoor zorgt dat de robot nooit wordt gevraagd een taak te leren die niet uitgevoerd kan worden, waardoor slechte ideeën worden gefilterd voordat ze tijd en rekenkracht verspillen.

Zodra het programma is gevalideerd, gebruikt het systeem dit om duizenden succesvolle voorbeelden te genereren van de robot die de taak uitvoert. Deze voorbeelden zijn niet zoma van willekeurige bewegingen; ze worden gestuurd door het persistente programma, dat elke fase van de taak bijhoudt, van het moment dat de grijper de handgreep aanraakt tot het moment dat de lade volledig open is. De robot leert vervolgens van deze voorbeelden, eerst door de succesvolle bewegingen na te bootsen en daarna door ze te verfijnen via een proces van trial-and-error dat strikt begrensd wordt door het oorspronkelijke programma. Dit zorgt ervoor dat hoewel de robot leert om flexibel en reactief te zijn, hij het uiteindelijke doel nooit uit het oog verliest. Het resultaat is een beleid dat complexe, meerfasige taken kan uitvoeren met een niveau van betrouwbaarheid dat voorheen onbereikbaar was.

In een reeks tests met negen verschillende manipulatietaken, variërend van het stapelen van blokken tot het heroriënteren van flessen en het openen van laden, toonde het systeem een significante verbetering ten opzichte van bestaande methoden. Terwijl andere benaderingen die vertrouwen op ijle beloningen (sparse rewards) of online planning moeite hadden om vaker dan een derde te slagen, behaalde dit nieuwe systeem een succespercentage van meer dan 82 procent. De onderzoekers ontdekten dat het systeem bijzonder effectief was bij taken die veel stappen vereisten, waarbij het zijn prestaties behield naarmate de complexiteit van de sequentie toenam. Bovendien was de door dit systeem gegenereerde data van zulke hoge kwaliteit dat het een visueel leermodel in staat stelde om in 46 procent van de gevallen te slagen, een cijfer dat meer dan het dubbele is van het succespercentage van modellen die getraind zijn op data van andere generatiemethoden.

De echte test van elk robotisch systeem is of het de veiligheid van een computersimulatie kan verlaten naar de echte wereld. Om dit te verifiëren, zetten de onderzoekers de getrainde beleidsregels in op fysieke robots gemaakt door Franka en Kinova, waarbij camera's werden gebruikt om de acties van de robot te sturen zonder enige voorkennis van de specifieke taakstructuur. Zonder extra afstemming of praktijk in de echte wereld, voltooiden de robots 34,7 procent van de fysieke proeven succesvol over diverse configuraties heen. Deze zero-shot transfer, waarbij een robot die volledig in simulatie is getraind direct op een echte machine werkt, suggereert dat het persistente programma de essentiële logica van de taak succesvol heeft gevangen, waardoor de geleerde gedragingen kunnen generaliseren naar de fysieke wereld.

De onderzoekers erkennen dat deze benadering beperkingen heeft. Het is momenteel afhankelijk van een vooraf gedefinieerde bibliotheek van fysieke acties en vereist een duidelijk begrip van de objecten in de scène, wat betekent dat het nog niet in staat is om vervormbare objecten zoals stof of vloeistoffen te hanteren zonder aanzienlijke nieuwe programmering. Daarnaast legt het systeem de taken in één richting uit en kan het niet terugkeren als er een fysieke fout optreedt, wat de capaciteit om te herstellen van bepaalde soorten fouten beperkt. Desalniettemin vestigen de resultaten een nieuw principe voor robotisch leren: dat het consistent houden van de semantische betekenis van een taak over planning, verificatie en leren een robuuste fundering voor automatisering creëert. Door ervoor te zorgen dat het begrip van de robot over de taak niet afwijkt, overbrugt het systeem de kloof tussen rigide controle en flexibel leren, wat een pad biedt naar robots die in staat zijn om betrouwbaar complexe taken in de echte wereld uit te voeren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →