← Nieuwste papers
🤖 AI

Nano World Models: A Minimalist Implementation of Future Video Prediction

Dit artikel introduceert "Nano World Models", een minimalistische en reproduceerbare codebase gebaseerd op diffusion forcing die diverse componenten van videopredictie verenigt om gecontroleerde, wetenschappelijke studies van wereldmodelontwerpkeuzes in uiteenlopende omgevingen mogelijk te maken.

Oorspronkelijke auteurs: Siqiao Huang, Partha Kaushik, Michael Chen, Hengkai Pan, Omar Chehab, Fernando Moreno-Pino, Max Simchowitz

Gepubliceerd 2026-05-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Siqiao Huang, Partha Kaushik, Michael Chen, Hengkai Pan, Omar Chehab, Fernando Moreno-Pino, Max Simchowitz

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een magische kristallen bol hebt die je niet alleen de toekomst toont, maar je ook laat spelen met die toekomst. Je kunt vragen: "Wat gebeurt er als ik deze blok duwt?" of "Wat als ik linksaf sla?" en de bol toont je direct de volgende paar seconden aan video.

Dit is waar Nano World Models (NanoWM) om draait. Het is een nieuwe, open-source toolkit die door onderzoekers is ontwikkeld om wetenschappers te helpen deze "kristallen bollen" voor robots en videospellen te bouwen en te bestuderen.

Hier is de eenvoudige uitleg van hoe het werkt en wat ze hebben ontdekt, met behulp van alledaagse analogieën:

1. Het Probleem: Te Veel Verschillende Recepten

Op dit moment is het bouwen van deze "toekomstvoorspellende" modellen als proberen een taart te bakken terwijl elke bakker een andere oven, een ander maatbekertje en een ander geheim ingrediënt gebruikt. Sommigen gebruiken enorme, dure industriële ovens (industriële modellen), terwijl anderen kleine, kapotte broodroosters gebruiken. Omdat iedereen het anders doet, is het moeilijk om te weten waarom de ene taart beter smaakt dan de andere. Is het het meel? De oven? De bakker?

NanoWM is als een universele, modulaire keuken. Het geeft iedereen dezelfde set gereedschappen, dezelfde maatbekertjes en dezelfde oveninstellingen. Op deze manier kun je, als je wilt testen of "meer suiker toevoegen" (een specifiek ontwerpkeuze) de taart beter maakt, dit eerlijk doen zonder je zorgen te hoeven maken dat je oven kapot was.

2. De Kernmotor: "Diffusion Forcing"

Het artikel maakt gebruik van een techniek die Diffusion Forcing heet. Denk hierbij aan een onscherpe foto die langzaam scherp wordt.

  • Normaal gesproken probeert een model de hele toekomstscène in één keer te raden, wat moeilijk is.
  • Met Diffusion Forcing raadt het model de toekomst in stappen. Het begint met een zeer wazige, ruizige gok en "ontruist" deze langzaam tot het eruitziet als een helder videoframe.
  • Het "forcing"-gedeelte betekent dat het verschillende delen van de video in verschillende stadia van helderheid kan hanteren. Het kan het "nu" scherp houden terwijl de "toekomst" nog een beetje wazig is, om dat vervolgens ook scherp te maken. Dit maakt het uitstekend geschikt voor lange, continue video's.

3. Het "Lego"-ontwerp (Modulariteit)

Het grootste kenmerk van NanoWM is dat het is gebouwd als Lego-blokjes. Je kunt verschillende stukjes aan elkaar klikken om te zien wat er gebeurt:

  • De Grootte van het Brein: Je kunt een klein brein (40 miljoen parameters) ruilen voor een gigantisch brein (830 miljoen parameters) om te zien of groter altijd beter is.
  • De Taal: Je kunt het model leren om verschillende "talen" van data te spreken. Sommige modellen kijken naar ruwe pixels (zoals een camera), terwijl anderen kijken naar "concepten" (zoals een mens die vormen en objecten begrijpt).
  • De Besturing: Je kunt veranderen hoe het model luistert naar je instructies (acties). Voegt het gewoon een notitie aan de zijkant toe? Of verandert het zijn hele persoonlijkheid op basis van wat je het vertelt te doen?

4. Wat Ze Hebben Ontdekt (De Bevindingen)

De onderzoekers hebben deze toolkit gebruikt om veel experimenten uit te voeren en hebben enkele verrassende dingen gevonden:

  • Groter is niet altijd het enige antwoord, maar het helpt: Over het algemeen voorspelden de grotere modellen (de "XL"-versie) de toekomst nauwkeuriger dan de kleine modellen.
  • De "Taal" maakt veel uit: Dit was een grote verrassing. Ze probeerden het model te leren met behulp van "semantische" talen (zoals DINO of V-JEPA, die objectvormen en betekenissen begrijpen) versus "visuele" talen (zoals VAE, die gewoon onthoudt hoe het plaatje eruitziet).
    • Het Resultaat: De modellen die de "visuele" taal leerden, waren uitstekend in plannen. Ze konden uitzoeken hoe ze een blok naar een doel moesten duwen.
    • De Mislukking: De modellen die de "semantische" taal leerden (diegene die concepten "begrijpen") faalden volledig in plannen. Hoewel ze slim leken, konden ze niet uitzoeken hoe ze het blok moesten verplaatsen. Het blijkt dat een robot om te leren hoe het dingen beweegt moet onthouden hoe de pixels er precies uitzien, niet alleen wat het object is.
  • Het "Drift"-probleem: Als je het model vraagt om een zeer verre toekomst te voorspellen (bijvoorbeeld 50 seconden vooruit), begint het een beetje "drunk" te raken van zijn eigen voorspellingen. De eerste paar seconden zijn perfect, maar tegen het einde worden de details wazig en vreemd. Het artikel vond dat als je het model meer tijd geeft om na te denken (meer steekproefstappen) voor elk frame, het langer helder blijft.

5. Wat Kun Je Er Mee Doen?

Het artikel benadrukt twee hoofdwijzen om deze modellen te gebruiken:

  • De Simulator: Je kunt het model gebruiken om plannen te testen voordat je ze in het echt uitvoert. "Als ik dit pad probeer, zal ik dan tegen een muur aanlopen?" Het model simuleert de video zodat je het kunt controleren.
  • De 3D-Bouwer: Je kunt de video die het model genereert omzetten in een 3D-scène. Het is alsof je een film neemt en er een videowereld van maakt waarin je kunt rondlopen.

De Conclusie

Nano World Models probeert niet de grootste, duurste AI ter wereld te bouwen. In plaats daarvan bouwt het een wetenschappelijk laboratorium. Het is een gratis, open-source kit die onderzoekers toelaat om te stoppen met gokken en te beginnen met testen. Het helpt hen precies te begrijpen welke "ingrediënten" een wereldmodel slim maken en welke ervoor zorgen dat het faalt, zodat we in de toekomst betere robots en simulatoren kunnen bouwen.

De onderzoekers hebben al hun code, data en vooraf getrainde modellen gratis vrijgegeven en nodigen de hele wereld uit om binnen te komen, met de Lego-blokjes te spelen en te helpen de toekomst van AI te bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →