← Nieuwste papers
💻 computer science

EMERGE-Policy: A Robot Mind Emerges Beyond a Single Policy

EMERGE-Policy introduceert een graafgestructureerd agentisch framework waarbij een centrale Main Agent gespecialiseerde Sub Agents coördineert voor perceptie, redenering en verificatie binnen geïsoleerde contexten, wat robuuste, zonder fine-tuning onafhankelijke robotprestaties mogelijk maakt door middel van emergente systeemniveau-samenwerking en closed-loop correctie.

Oorspronkelijke auteurs: Zhirui Fang, Qingchi Yu, Ziyang Chen, Longfei Li, Haoran Ma, Keru Zhou, Xinrun Xu, Samith Va, Yuxuan Hu, Peixuan Song, Qiang Du, Bin Qian, Yongkang Deng, Xin Li, Yezhen Wang, Zhe Li, Hao Luo, Shuyan L
Gepubliceerd 2026-09-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhirui Fang, Qingchi Yu, Ziyang Chen, Longfei Li, Haoran Ma, Keru Zhou, Xinrun Xu, Samith Va, Yuxuan Hu, Peixuan Song, Qiang Du, Bin Qian, Yongkang Deng, Xin Li, Yezhen Wang, Zhe Li, Hao Luo, Shuyan Li, Ziwei Wang, Weijian Deng, Xiu Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots zijn al lang experts in het herhalen van een enkele, perfecte beweging, zoals een lasrobot op een assemblagelijn of een arm die identieke dozen stapelt. Maar het geven aan een robot een geest die in staat is om met een rommelige, onvoorspelbare echte wereld om te gaan, is veel moeilijker gebleken. Decennialang probeerden onderzoekers dit op te lossen door één enkel, massief computerprogramma te bouwen—een "brein"—dat tegelijkertijd een object kon zien, een commando kon begrijpen en de arm kon bewegen. Hoewel deze systemen indrukwekkend zijn geworden, struikelen ze vaak wanneer er iets misgaat. Als een beker uitschiet of het licht verandert, kan het enkele brein in de war raken omdat het probeert alles in één grote sprong te doen. Het nieuwe denken in de robotica suggereert dat intelligentie misschien niet op één plek hoeft te wonen. In plaats daarvan zou de geest van een robot kunnen voortkomen uit een team van gespecialiseerde helpers die samenwerken, waarbij één deel kijkt, een ander plant, een derde het werk controleert en een vierde onthoudt wat er is gebeurd. Deze aanpak behandelt de robot niet als een enkel entiteit, maar als een gecoördineerde groep, waardoor het kan herstellen van fouten en zich kan aanpassen aan veranderingen op manieren die een enkel programma niet kan.

Dit is de kern van het idee achter een nieuw framework genaamd EMERGE-Policy, ontwikkeld door onderzoekers van verschillende universiteiten, waaronder Tsinghua en Peking University. In plaats van te vertrouwen op één groot model dat alles doet, hebben de onderzoekers een systeem gebouwd waarin een centrale "Main Agent" optreedt als een projectmanager. Deze manager bekijkt de ruwe videofeed niet zelf of berekent elke motorbeweging. In plaats daarvan breekt hij een complexe taak, zoals "stap deze bekers in een piramide", op in kleinere stappen. Hij delegeert vervolgens specifieke taken aan gespecialiseerde "Sub Agents". Eén team van helpers focust puur op het zien van de scène en het vinden van de bekers. Een ander team houdt de arm van de robot in de gaten om te controleren of deze correct beweegt. Een derde team controleert of de beker na het plaatsen daadwerkelijk stabiel is. Als er iets misgaat, helpt een vierde team de robot te onthouden wat de fout was en een andere aanpak te proberen. De Main Agent coördineert deze groepen en ontvangt alleen de essentiële, samengevatte informatie die hij nodig heeft om de volgende beslissing te nemen, terwijl het zware werk van het verwerken van ruwe gegevens op de achtergrond plaatsvindt.

De onderzoekers testten dit systeem op een reeks uitdagende benchmarks, waaronder taken waarbij de robot objecten op een tafel moest manipuleren onder moeilijke omstandigheden. Ze vergeleken deze teamgebaseerde aanpak met de beste single-programma modellen die momenteel beschikbaar zijn. De resultaten lieten zien dat het gecoördineerde team de single modellen aanzienlijk versloeg, vooral wanneer de omgeving veranderde of wanneer de instructies vaag waren. Op standaardtests behaalde het systeem succespercentages nabij de 99 procent, een kleine maar betekenisvolle verbetering ten opzichte van de beste single modellen. Belangrijker nog, toen de onderzoekers verstoringen introduceerden—zoals het veranderen van de verlichting, het wijzigen van de grootte van de bekers of het blokkeren van het zicht van de robot—bleef het teamgebaseerde systeem robuust. Terwijl de single modellen vaak volledig faalden onder deze nieuwe omstandigheden, was het EMERGE-Policy systeem in staat om het probleem te detecteren, de oorzaak te diagnosticeren en het plan aan te passen om te slagen. In één specifieke test waarbij een echte robot papieren bekers in een drielaagse piramide stapelde, slaagde het systeem in 94 procent van de gevallen, zelfs toen de bekers verschillende maten hadden of de camerahoeken verschoven.

Een cruciaal onderdeel van dit succes is hoe het systeem omgaat met geheugen en fouten. In plaats van te proberen elke enkele videoframe te onthouden, wat de computer zou overweldigen, schrijft het systeem een beknopte samenvatting van wat er is gebeurd in een digitaal logboek. Als de robot een beker laat vallen, probeert het systeem niet simpelweg blindelings opnieuw. Het analyseert waarom de val gebeurde, schrijft een notitie over de fout en maakt een specifiek plan om juist dat deel van het probleem op te lossen voordat het verdergaat. Dit stelt de robot in staat om lokaal te herstellen van fouten zonder de hele taak opnieuw te hoeven starten. De onderzoekers ontdekten ook dat het geven van een "preview" van wat er hierna zou kunnen gebeuren de robot hielp om fouten te voorkomen voordat ze optraden. Door een paar mogelijke bewegingen in zijn geest te simuleren en te controleren welke er het beste uitzag, kon de robot het veiligste pad kiezen. Deze "verbeeldingsstap", gecombineerd met een strikt verificatieproces, betekende dat de robot minder waarschijnlijk onomkeerbare fouten maakte.

De experimenten waren niet beperkt tot computer simulaties. Het team heeft het systeem ingezet op een fysieke robotarm om een lange reeks taken uit te voeren: papieren bekers van een tafel verwijderen, ze ondersteboven neerzetten en ze in lagen op elkaar stapelen. Deze real-world test bewees dat het framework de onvoorspelbaarheid van fysieke objecten kon afhandelen, zoals bekers die kunnen wankelen of schuiven. Het systeem voltooide de taak in 94 procent van de gevallen, en zelfs toen de onderzoekers het proces onderbraken of de verlichting veranderden, was de robot in staat om opnieuw te plannen en de klus te klaren. De studie suggereert dat de toekomst van robotintelligentie niet ligt in het bouwen van een groter, slimmer enkel brein, maar in het creëren van een betere manier waarop veel kleinere, gespecialiseerde tools samenwerken. Door deze tools te organiseren in een duidelijke hiërarchie waar elk een specifieke taak heeft en een duidelijke manier heeft om terug te rapporteren, hebben de onderzoekers een systeem gecreëerd dat niet alleen nauwkeuriger is, maar ook veerkrachtiger tegen de chaos van de echte wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →