← Nieuwste papers
💻 computer science

HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy

Dit paper introduceert HAMLET, een schaalbaar kader dat bestaande Vision-Language-Action-modellen omzet in historisch bewust beleid door tijdscontrastief leren en een lichtgewicht geheugenmodule te gebruiken, wat leidt tot aanzienlijke prestatieverbeteringen bij robotmanipulatie taken die afhankelijk zijn van historische context.

Oorspronkelijke auteurs: Myungkyu Koo, Daewon Choi, Taeyoung Kim, Kyungmin Lee, Changyeon Kim, Younggyo Seo, Jinwoo Shin

Gepubliceerd 2026-04-16
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Myungkyu Koo, Daewon Choi, Taeyoung Kim, Kyungmin Lee, Changyeon Kim, Younggyo Seo, Jinwoo Shin

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

HAMLET: De robot die zijn verleden niet vergeet

Stel je voor dat je een robot hebt die heel slim is, maar een heel kort geheugen heeft. Hij kijkt alleen naar wat hij nu ziet. Als je hem vraagt om een blokje op een tafel te leggen, kijkt hij naar zijn camera. Maar als het blokje even door een kopje wordt bedekt, raakt hij in paniek. Hij weet niet meer of hij het blokje al vasthad of niet. Hij denkt: "Waar is het? Moet ik grijpen? Moet ik loslaten?" Omdat hij alleen naar het huidige plaatje kijkt, is hij als iemand die elke seconde zijn geheugen leegt en opnieuw begint.

Dit is het probleem met de meeste moderne robots (die "Vision-Language-Action" modellen worden genoemd). Ze zijn slim, maar ze vergeten wat er net gebeurd is.

HAMLET is een nieuwe uitvinding die dit oplost. Het is als het geven van een dagboek aan die robot. Hier is hoe het werkt, in simpele termen:

1. De "Moment-Tokens": De robot schrijft een samenvatting

Stel je voor dat de robot elke seconde een foto maakt. Als hij al die foto's opslaat, wordt zijn hoofd (de computer) snel vol en traag. Dat is niet efficiënt.

In plaats van elke foto op te slaan, leert HAMLET de robot om op elk moment een korte samenvatting te maken van wat hij ziet. De auteurs noemen dit "moment tokens".

  • De analogie: Stel je voor dat je een film kijkt. In plaats van elke seconde de hele film op te slaan, schrijf je op een briefje: "Op dit moment houdt ik een blauwe kubus vast." Dat briefje is het "moment token". Het is klein, maar het bevat precies de belangrijke informatie die je later nodig hebt.

2. Het "Geheugen": Een slimme archiefbewaarder

Nu heeft de robot een stapel met die kleine briefjes (de samenvattingen). Maar hoe weet hij welke briefjes belangrijk zijn? Soms is het belangrijk om te weten wat er 10 seconden geleden gebeurde, soms is dat niet zo relevant.

HAMLET heeft een lichtgewicht geheugenmodule. Dit is als een slimme archiefbewaarder die door de stapel briefjes bladeren.

  • De analogie: Als de robot moet beslissen welke kubus hij nu moet pakken, kijkt de archiefbewaarder in de stapel en zegt: "Wacht, kijk eens naar dat briefje van 5 seconden geleden. Daar staat dat de blauwe kubus al op de grond is gezet. Dat is cruciaal!"
  • De robot slaat dus niet alles blindelings op, maar zoekt actief naar de juiste herinnering om de volgende stap te nemen.

3. Waarom is dit zo slim? (De "Tijd-Contrastieve" truc)

Om ervoor te zorgen dat die briefjes (moment tokens) goed worden geschreven, gebruikt HAMLET een slimme truc tijdens het leren. Ze laten de robot oefenen met foto's die op elkaar lijken, maar dan op verschillende tijdstippen.

  • De analogie: Het is alsof je iemand leert om te onderscheiden tussen "gisteren" en "vandaag". Als je alleen naar de huidige foto kijkt, zie je misschien een statische achtergrond (een muur). Maar als je leert om te kijken naar wat verandert (de hand die beweegt, het blokje dat verschuift), dan schrijft de robot alleen die veranderingen op in zijn briefje. Hierdoor wordt het briefje veel nuttiger.

Wat levert dit op?

De onderzoekers hebben getest of dit werkt in de echte wereld en in simulaties.

  • Vroeger: De robot (zonder HAMLET) faalde vaak bij taken die meerdere stappen nodig hadden, zoals "pak het blokje, leg het onder een kopje, en stapel er nog een kopje op". Als het blokje even bedekt was, wist de robot niet meer wat hij moest doen.
  • Met HAMLET: De robot slaagt er bijna altijd in. Hij weet nog steeds dat hij het blokje vasthad, zelfs als hij het even niet kan zien.

De resultaten in cijfers:

  • Bij moeilijke, lange taken in de echte wereld verbeterde HAMLET de succesrate met maar liefst 47% ten opzichte van de standaard robot.
  • Zelfs bij simpele taken in de computerwereld (zoals in de keuken) werd de robot slimmer en sneller.

Conclusie

HAMLET is geen nieuwe robot die je van nul af aan moet bouwen. Het is een upgrade die je bestaande, slimme robots kunt geven. Het is alsof je een slimme assistent aanstelt die voor je onthoudt wat je net hebt gedaan, zodat je niet steeds opnieuw hoeft te beginnen.

Het maakt robots niet alleen slimmer, maar ook efficiënter. In plaats van dat de robot een zware berg met oude foto's moet dragen (wat zijn computer traag maakt), draagt hij alleen een klein, slim dagboekje mee. Hierdoor kunnen we nu veel complexere taken laten uitvoeren, zoals het stapelen van borden of het verplaatsen van objecten, zonder dat de robot in de war raakt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →