← Nieuwste papers
💻 computer science

Memory as Plans: World-Action Modeling with Memory-Grounded Planning

Het artikel introduceert MaP-WAM, een Memory-as-Plans-framework dat de niet-Markoviaanse aard van complexe robotische taken aanpakt door geheugenafhankelijke modellering te deconstrueren in geheugen-gegronde planning en plan-geconditioneerde executie, waarbij compacte episodische geheugenrepresentaties worden benut om state-of-the-art prestaties te behalen op zowel benchmarks als real-robot taken, terwijl een constante inferentielatentie behouden blijft.

Oorspronkelijke auteurs: Sizhe Zhao, Haozhe Xie, Weiyu Zhao, Chenchu Zhang, Huan Wang, Chenyang Wang, Qinglin Liu, Shengping Zhang

Gepubliceerd 2026-09-11
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sizhe Zhao, Haozhe Xie, Weiyu Zhao, Chenchu Zhang, Huan Wang, Chenyang Wang, Qinglin Liu, Shengping Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots zijn al lang meesters van het huidige moment. Als je een kopje voor een robotarm plaatst, kan deze uitreiken, het vastpakken en het met indrukwekkende precisie optillen. Deze vaardigheid berust op een eenvoudige regel: de robot beslist zijn volgende zet volledig op basis van wat hij nú ziet. De echte wereld is echter zelden zo eenvoudig. Veel taken vereisen dat een robot dingen onthoudt die niet langer zichtbaar zijn. Stel je voor dat je een robot vraagt om een specifieke knop te vinden die een paar minuten geleden nog bedekt was, of om twee objecten te verwisselen die hij eerder die dag op verschillende locaties heeft gezien. Om te slagen, moet de machine een mentaal beeld van het verleden vasthouden, niet alleen van het heden. Dit is de uitdaging van geheugenafhankelijke manipulatie, een hindernis die robots ervan heeft weerhouden complexe, meerstaps-taken in onze huizen en werkplaatsen uit te voeren.

Jarenlang probeerden onderzoekers dit op te lossen door de robot steeds meer videohistorie te voeren. Ze gaven de machine een groeiend venster van elk frame dat de machine ooit had gezien, in de hoop dat als de machine genoeg zou zien, hij zou onthouden wat hij nodig had. Maar deze aanpak loopt tegen een harde muur aan. Naarmate de historie langer wordt, vertraagt de computer die de robot aanstuurt, om uiteindelijk stil te vallen omdat het geheugen vol raakt. Andere teams probeerden het verleden samen te vatten in een korte lijst met woorden, maar deden daarmee vaak de fijne details weg—de exacte kleur van een object of de precieze positie—die cruciaal zijn voor succes. Het resultaat was een afweging: of de robot was snel maar vergeetachtig, of hij was gedetailleerd maar te traag om nuttig te zijn.

Een nieuwe aanpak, ontwikkeld door een team van onderzoekers, verandert de strategie volledig. In plaats van de robot te dwingen om voortdurend zijn hele geschiedenis opnieuw te lezen terwijl hij beweegt, leren ze hem om eerst een plan te maken. Denk aan het verschil tussen het lezen van een kaart terwijl je rijdt versus het hebben van een navigator die je één duidelijke instructie geeft voor het volgende deel van de reis. De onderzoekers noemen hun systeem MaP-WAM. Het werkt door een lange taak op te delen in kleinere segmenten. Voordat de robot begint te bewegen, kijkt hij naar zijn langetermijngeheugen—ijle, zorgvuldig geselecteerde momentopnames uit het verleden—en schrijft een specifiek plan voor de volgende stap. Dit plan bevat zowel een beschrijving van wat te doen als een visuele gids van hoe de scène eruit moet zien terwijl de robot werkt.

Zodra dit plan is geschreven, voert de robot het uit zonder de volledige geschiedenis opnieuw te hoeven zien. Hij hoeft alleen naar de huidige weergave en het plan te kijken dat hij zojuist heeft gemaakt. Dit houdt het "werkgeheugen" van de robot klein en snel, waardoor hij soepel kan draaien zelfs als de taak langer wordt. Om ervoor te zorgen dat de robot niet verdwaalt of van koers afwijkt, houdt het systeem ook zijn voortgang bij. Het controleert voortdurend de huidige positie ten opzichte van de visuele gids in het plan. Als de robot ziet dat hij iets achterloopt of voorloopt op waar hij zou moeten zijn, past hij zijn interne klok aan om bij het plan te passen, waardoor fouten worden gecorrigeerd voordat ze zich opstapelen. Dit creëert een gesloten lus waarbij de robot plant, handelt, zijn voortgang controleert en vervolgens zijn geheugen bijwerkt voor de volgende stap, terwijl de computationele belasting constant blijft.

Het team testte deze methode in zowel computersimulaties als op een echte robotarm. In de simulaties, die taken omvatten zoals het verwisselen van blokken of het vinden van verborgen knoppen, slaagde het nieuwe systeem in 83,3% van de gevallen, waarmee het eerdere methoden die worstelden met geheugen versloeg. Op een echte robot behaalde het een succespercentage van 88% bij een taak waarbij de robot een specifieke knop moest vinden, en een succespercentage van 68% bij een taak waarbij de robot knoppen in een specifieke volgorde moest indrukken. Cruciaal was dat naarmate de taken langer werden en de geschiedenis van eerdere acties toenam, de tijd die de robot nodig had om zijn volgende zet te beslissen ongeveer gelijk bleef, rond de 827 milliseconden schommelend. In contrast hiermee werden oudere methoden die probeerden de volledige geschiedenis van frames te verwerken zo traag en geheugenintensief dat ze crashten na ongeveer 1.700 frames.

De onderzoekers ontdekten dat de sleutel tot dit succes niet alleen het hebben van geheugen was, maar hoe ze het gebruikten. Door lange, complexe geschiedenissen om te zetten in compacte, op het geheugen gebaseerde plannen, konden ze de robot in staat stellen om fijnmazig visueel bewijs te behouden zonder de kosten van real-time verwerking. Ze ontdekten ook dat het expliciet bijhouden van de voortgang essentieel was; zonder dit zou de robot vaak visueel gelijkaardige momenten verwarren, zoals het indrukken van een knop versus het loslaten ervan, wat leidde tot herhaalde fouten. Het systeem bewees dat een robot niet zijn hele verleden in zijn hoofd hoeft te dragen om wijs te handelen; hij hoeft alleen te weten hoe hij dat verleden kan omzetten in een duidelijk, actiegericht plan voor het heden. Deze verschuiving van reactief geheugen naar proactieve planning biedt een veelbelovend pad naar robots die de rommelige, meerstaps-realiteiten van het menselijk leven kunnen aan kunnen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →