← Nieuwste papers
🤖 AI

HaM-World: Soft-Hamiltonian World Models with Selective Memory for Planning

HaM-World introduceert een gestructureerd wereldmodel dat Mamba-gebaseerde selectieve geheugenintegratie combineert met een ontlede Soft-Hamiltoniaanse latente ruimte om langetermijnplanning te stabiliseren en de robuustheid tegen dynamische verschuivingen buiten de verdeling aanzienlijk te verbeteren.

Oorspronkelijke auteurs: Haoyun Tang, Haodong Cui, Keyao Xu, Kun Wang, Zhandong Mei

Gepubliceerd 2026-05-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Haoyun Tang, Haodong Cui, Keyao Xu, Kun Wang, Zhandong Mei

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een robot te leren een complex spel te spelen, zoals goochelen of een paal in evenwicht houden. Om dit goed te doen, heeft de robot een "wereldmodel" nodig—een interne simulatie die het toelaat om te bedenken wat er zal gebeuren als het een bepaalde actie uitvoert, voordat het die actie daadwerkelijk uitvoert.

Het artikel introduceert HaM-World, een nieuw type wereldmodel dat is ontworpen om deze mentale simulaties stabieler en nauwkeuriger te maken, vooral over langere perioden of wanneer de regels van het spel lichtelijk veranderen.

Hieronder wordt uitgelegd hoe het werkt, opgesplitst in eenvoudige concepten en analogieën:

1. Het Probleem: De "Droom" wordt Mistig

Huidige wereldmodellen zijn als een student die probeert een verhaal te onthouden door het één zin per zin te lezen. Als het verhaal kort is, onthoudt het het perfect. Maar als ze proberen het verhaal 100 stappen in de toekomst te visualiseren, worden de details wazig en valt het verhaal uit elkaar.

  • Het Probleem: Naarmate de robot verder vooruit plant, worden zijn voorspellingen onstabiel. Het heeft ook moeite als de omgeving verandert (bijvoorbeeld als de vloer glad wordt of als de arm van de robot zwaarder wordt).
  • De Oorzaak: Het artikel stelt dat bestaande modellen te veel dingen door elkaar halen in hun "hersenen". Ze verwarren de positie van de robot (waar hij is), zijn momentum (hoe snel hij beweegt) en de context (wat het doel is of of de vloer nat is). Deze verwarring zorgt ervoor dat fouten zich snel ophopen.

2. De Oplossing: Een Gespecialiseerd "Hersenen" met Drie Kamers

HaM-World lost dit op door de interne staat van de robot te organiseren in drie aparte "kamers" of compartimenten, in plaats van één grote rommelige kamer:

  • Kamer A: De Fysica-engine (q en p)
    Deze kamer behandelt de pure fysica: positie (qq) en momentum (pp). De auteurs gebruiken hier een wiskundig concept genaamd Hamiltoniaanse dynamica.

    • De Analogie: Denk hierbij aan een biljarttafel. Op een biljarttafel wordt energie behouden; ballen stuitten op voorspelbare manieren van elkaar af. HaM-World probeert het gedrag van de positie en het momentum van de robot te laten lijken op biljartballen. Dit creëert een stabiele "ruggengraat" voor de simulatie, waardoor de robot geen onmogelijke fysica verbeeldt (zoals een bal die plotseling versnelt zonder reden).
    • De "Zachte" Twist: Het echte leven is geen perfecte biljarttafel; er is wrijving en de robot heeft motoren. Daarom gebruikt HaM-World een "Soft-Hamiltoniaanse" aanpak. Het behoudt de stabiele biljarttafel-structuur, maar voegt een "residulaire" laag toe die het rommelige, echte wereldse materiaal leert, zoals wrijving en motorbesturing.
  • Kamer B: De Contextkamer (c)
    Deze kamer bevat informatie die niet volgt de regels van de biljarttafel.

    • De Analogie: Dit is het notitieboek van de robot. Het schrijft dingen op zoals "het doel is om met de vinger te draaien", "de vloer is glad" of "ik moet voorzichtig zijn". Dit zijn semantische details die niet passen in de pure fysica van positie en snelheid, maar cruciaal zijn om te weten wat er gedaan moet worden.
  • Kamer C: Het Geheugen (Mamba)
    Dit is het kortetermijngeheugen van de robot.

    • De Analogie: Soms kan de robot niet alles zien (gedeeltelijke waarneembaarheid), of is er een vertraging tussen het moment waarop het besluit te bewegen en het moment waarop het daadwerkelijk beweegt. Een standaardmodel zou kunnen vergeten wat er 5 seconden geleden gebeurd is. HaM-World gebruikt een speciaal geheugensysteem genaamd Mamba dat fungeert als een selectieve filter. Het onthoudt de belangrijke delen van het verleden die nodig zijn om nu een beslissing te nemen, zodat de robot niet "verdwaalt" in zijn eigen dagdroom.

3. Hoe Het Samenwerkt

Wanneer de robot een zet plant, raadt hij niet zomaar. Hij voert een simulatie (een "rollout") uit in zijn hoofd:

  1. Hij kijkt naar de huidige staat.
  2. Hij gebruikt het Geheugen om ontbrekende details uit het verleden in te vullen.
  3. Hij werkt de Fysica-kamer bij met de stabiele biljarttafel-regels, aangepast door de motorbesturing.
  4. Hij werkt de Contextkamer bij met nieuwe informatie over het doel of de omgeving.
  5. Hij herhaalt dit voor vele stappen in de toekomst om te zien welke actie leidt tot het beste resultaat.

Omdat het fysica-deel zo stabiel is (zoals de biljarttafel) en het geheugendeel zo goed is in het opvullen van gaten, blijft de "dagdroom" van de robot helder en nauwkeurig, zelfs voor lange planningstermijnen.

4. De Resultaten: Beter in Alles

De auteurs hebben HaM-World getest op vier standaard robottaken (zoals een cheeta die rent of een vinger die een object draait).

  • Nauwkeurigheid: Het maakte veel minder fouten bij het verbeelden van de toekomst in vergelijking met andere topmodellen. Sterker nog, zijn lange-termijn voorspelfouten waren minder dan de helft van die van het op één na beste model.
  • Robuustheid: Toen de onderzoekers de regels van het spel veranderden (bijvoorbeeld de robot zwaarder maakten, zijn acties vertraagden, of delen van zijn zicht verborgen), bleef HaM-World goed presteren. Het was het enige model dat de hoogste score behaalde in elke enkele moeilijke testconditie.
  • Efficiëntie: Het leerde de robots sneller te besturen en met minder trainingpogingen dan andere methoden.

Samenvatting

HaM-World is als het geven van een betere interne kaart aan een robot. In plaats van een wazige, door elkaar gehaalde schets, geeft het de robot een gestructureerde kaart met een stabiele fysische basis (de biljarttafel), een plek voor belangrijke notities (de context) en een betrouwbaar geheugen (de filter). Dit stelt de robot in staat complexe, langetermijnacties te plannen zonder in de war te raken of de weg kwijt te raken, zelfs als de wereld om hem heen verandert.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →