← Nieuwste papers
💻 computer science

Enfold: Folding World-Generator Computation into Predictive Representations for Efficient Embodied Control

Enfold is een nieuw raamwerk dat het meerlagige computationele proces van wereldgeneratieve modellen destilleert tot een predictieve representatie die uitsluitend wordt afgeleid uit de huidige visuele en linguïstische context, waardoor belichaamde agenten sterke controle kunnen bereiken met aanzienlijk verminderde latentie door de toekomstige generatieve structuur te internaliseren zonder de noodzaak om bij elke stap toekomstige trajecten te materialiseren.

Oorspronkelijke auteurs: Weili Zeng, Yitong Xing, Fulong Liu, Chengqun Yang, Antao Xiang, Feng Tian, Jingnan Gao, Jisong Cai, Xin Wang, Xiaomin Wu, Yao Mu, Yichao Yan

Gepubliceerd 2026-07-30
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Weili Zeng, Yitong Xing, Fulong Liu, Chengqun Yang, Antao Xiang, Feng Tian, Jingnan Gao, Jisong Cai, Xin Wang, Xiaomin Wu, Yao Mu, Yichao Yan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert hoe hij een broodje moet maken. De oude manier om dit aan te leren was door de robot een kristallen bol te geven. Voordat de robot ook maar één hand bewoog, gebruikte de robot zijn kristallen bol om een volledige, high-definition video van de toekomst te genereren: het zien hoe het brood wordt gesneden, hoe de kaas op het brood glijdt en hoe het bord wordt neergezet. Pas nadat de robot deze hele film in zijn geest had bekeken, besloot hij wat de volgende stap zou zijn. Het is alsof je probeert een auto te besturen door eerst een volledige film van de weg voor je te bekijken voordat je überhaupt het stuur draait. Het is krachtig, maar ook ongelooflijk traag en rekenkundig duur, alsof je een blockbuster-film probeet te renderen om slechts te beslissen of je links of rechts moet afslaan.

Dit artikel komt uit het vakgebied van de robotica en kunstmatige intelligentie, en richt zich specificaal op "wereldmodellen". Een wereldmodel is in essentie een AI die leert hoe de fysieke wereld werkt door te voorspellen wat er vervolgens gebeurt. Het kernidee waar de auteurs mee spelen, is "predictieve representaties". Denk aan het verschil tussen het uit het hoofd leren van een heel filmscript versus het begrijpen van de regels van het verhaal. Je hoeft niet de hele film opnieuw te kijken om te weten dat als je een glas laat vallen, het zal breken; je hoeft alleen maar de natuurkunde van zwaartekracht en breekbaarheid te begrijpen. De grote vraag die de auteurs stellen is: kunnen we een robot leren om de structuur van de toekomst te begrijpen zonder hem daadwerkelijk te dwingen om elke keer de volledige, zware video te genereren?

Het artikel introduceert een nieuwe methode genaamd Enfold. De naam is een woordspeling op "unfolding" (het ontvouwen van een toekomst, wat de oude, trage methoden doen) en "enfolding" (het insluiten van die toekomstige kennis in het huidige moment). In plaats van de robot een volledige video van de toekomst te laten genereren voordat hij handelt, leert Enfold een "predictieve encoder" om de berekening van hoe die toekomst eruit zou zien, te absorberen.

Zo werkt het: de onderzoekers gebruiken een krachtige "docent"-AI (een videogenerator) die heel goed is in het voorstellen van de toekomst. Terwijl deze docent-AI een video verwerkt van wat er zal gebeuren, doorloopt deze vele interne stappen, waarbij de scène, de objecten en de interacties worden georganiseerd. Enfold kijkt naar deze interne stappen en leert deze te voorspellen met behulp van alleen de huidige afbeelding en de instructie van de robot. Het is alsof een student toekijkt hoe een meesterkok een complex gerecht bereidt. In plaats van dat de student telkens probeert het hele gerecht vanaf nul te maken wanneer hij een broodje wil maken, leert hij de interne "spiergeheugen" en "keukenlogica" van de chef. Ze leren de volgende stap te anticiperen op basis van de huidige staat van de pan, zonder dat ze eerst de hele maaltijd in hun hoofd hoeven te simuleren.

Het artikel concludeert dat deze aanpak een gamechanger is voor snelheid en efficiëntie. In tests was de Enfold-robot in staat om beslissingen te nemen die 3,7 keer sneller waren dan een eerdere state-of-the-art methode genaamd Fast-WAM, en een geoptimaliseerde versie genaamd Enfold-Flash was zelfs 10,1 keer sneller. Ondanks het feit dat het veel sneller was, verloor het niet zijn intelligentie; het presteerde zelfs iets beter op complexe taken, met een succespercentage van 97,8% op de ene benchmark en 91,77% op de andere.

Cruciaal is dat het artikel pleit tegen het idee dat een robot een volledige video moet genereren om intelligent te kunnen handelen. Ze laten zien dat door de toekomstige-generatieve berekening te "enfolden" in een compacte representatie, de robot nog steeds kan adapteren als de wereld verandert. Bijvoorbeeld, als een mens een bord verplaatst terwijl de robot van plan is het te pakken, herhaalt Enfold niet simpelweg een vooraf opgenomen script; het herrekent onmiddellijk de toekomst op basis van de nieuwe realiteit en past zijn acties aan. De auteurs suggereren dat dit bewijst dat de robot een flexibel, voorspellend begrip van de wereld heeft geleerd, in plaats van slechts een vast pad te onthouden.

Kortom, Enfold suggereert dat we niet de volledige toekomst hoeven te renderen om een robot aan te sturen. We hoeven de robot alleen maar te leren om de logica van de toekomst in zijn zak te dragen, waardoor hij direct en adaptief kan handelen, en een traag proces van video-rendering verandert in een razendsnelle, intuïtieve besluitvorming.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →