← Nieuwste papers
💻 computer science

Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force

Dit artikel stelt MuSe voor, een multisensorisch continual learning-framework dat vooraf getrainde visuele robotbeleid effectief aanpast aan nieuwe kracht-koppel-modaliteiten met behulp van multi-stage fusie en experience replay, waardoor de prestaties op contactrijke taken worden verbeteren zonder de oorspronkelijke capaciteiten te vergeten.

Oorspronkelijke auteurs: Jaden Clark, Changhao Wang, Yihuai Gao, Seongheon Hong, Hojung Choi, Mark Cutkosky, Yifan Hou, Shuran Song

Gepubliceerd 2026-07-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jaden Clark, Changhao Wang, Yihuai Gao, Seongheon Hong, Hojung Choi, Mark Cutkosky, Yifan Hou, Shuran Song

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot hebt getraind om een meesterkok te zijn, maar je hebt hem alleen geleerd door te kijken met ogen. Het heeft leren snijden, roeren en opmaken door duizenden video's te bekijken. De robot is geweldig in zien wat er moet gebeuren, maar weet niet hoe hard hij moet drukken of wanneer iets wegglijdt.

Stel je nu voor dat je de robot een nieuwe vaardigheid wilt aanleren: voelen. Je wilt dat de robot een krachtsensor gebruikt (zoals een gevoelige tastzin) om delicate taken uit te voeren, zoals het afnemen van een vaas zonder deze te breken of het indraaien van een gloeilamp zonder deze te barsten.

Hier is het probleem: je hebt geen enorme bibliotheek met video's die zowel de ogen van de robot als zijn nieuwe "tast"-sensoren bevatten. Je hebt alleen een kleine, nieuwe dataset met deze nieuwe sensoren. Als je de robot alleen met deze kleine nieuwe data probeer te leren, kan hij in de war raken en alles vergeten wat hij heeft geleerd door te kijken. Dit wordt "catastrofale vergetelheid" genoemd.

Dit artikel introduceert een oplossing genaamd MuSe (Multisensory Continual Learning). Denk aan MuSe als een slimme studiehandleiding die de robot helpt een nieuwe zintuig te leren zonder zijn oude te vergeten.

Zo werkt MuSe, met eenvoudige analogieën:

1. De "Tweerichtingsverkeer" Verbinding (Multi-Stage Fusion)

Normaal gesproken, wanneer je een nieuw zintuig aan een robot toevoegt, plak je het gewoon aan het einde vast, zoals het toevoegen van een bijgerecht aan een maaltijd. MuSe is anders. Het creëert een tweerichtingsverkeer tussen de ogen van de robot en zijn nieuwe tastzensoren.

  • Vroege Fusie (Early Fusion): Het mengt de "tast"-data met de "zicht"-data direct aan het begin, zoals het mengen van bloem en eieren voordat je bakt. Dit laat de robot direct begrijpen hoe tast en zicht met elkaar samenhangen.
  • Late Fusie (Late Fusion): Het controleert ook later in het proces, zoals een proever die halverwege het koken de kruiden aanpast.
  • Het Resultaat: De robot ziet niet alleen of hij voelt; hij leert een verenigd begrip waarbij zicht en tast elkaar helpen.

2. De "Toekomstige Kristallen Bol" (Multisensory Future Prediction)

Om ervoor te zorgen dat de robot de nieuwe zintuig echt begrijpt, vraagt MuSe de robot niet alleen om "de taak uit te voeren". Het vraagt de robot om de toekomst te voorspellen.

  • De robot wordt getraind om te raden: "Wat ga ik de volgende seconde zien? Wat ga ik de volgende seconde voelen? Welke actie moet ik ondernemen?"
  • De Analogie: Stel je een bestuurder voor die leert rijden in de regen. In plaats van alleen maar te rijden, wordt de bestuurder gevraagd te voorspellen: "Als ik nu aan het stuur draai, zal de auto dan slippen?" en "Zullen de ruitenwissers het water wegvegen?".
  • Door de robot te dwingen om zowel de visuele scène als de krachtsignalen te voorspellen, bouwt het een diepe, interne kaart van hoe de fysieke wereld werkt. Dit helpt de robot te generaliseren, wat betekent dat hij zijn nieuwe "tast"-vaardigheden zelfs kan gebruiken voor taken die hij nog niet eerder heeft gezien.

3. De "Flashcard Review" (Experience Replay)

Dit is het meest cruciale deel voor het voorkomen van vergetelheid bij de robot. Wanneer de robot de nieuwe "tast"-vaardigheden leert, dwingt MuSe hem om tegelijkertijd zijn oude "zicht"-vaardigheden te blijven oefenen.

  • De Analogie: Stel je een student voor die een nieuwe taal (Frans) leert terwijl hij probeert zijn Spaanse vaardigheden scherp te houden. Als hij een maand lang alleen Frans studeert, kan hij Spaans vergeten. MuSe is als een leraar die zegt: "Voor elk uur dat je Frans studeert, moet je 30 minuten de tijd besteden aan het herhalen van Spaans."
  • In het geval van de robot mengt het de kleine nieuwe "tast"-data met de enorme oude "zicht"-data. Wanneer de robot een taak ziet waarbij hij geen tast-data heeft (omdat de oude data die niet had), dekt MuSe simpelweg het "tast"-gedeelte af en laat de robot de vraag beantwoorden op basis van zicht alleen. Dit houdt de oude vaardigheden levend.

Wat hebben ze ontdekt?

De onderzoekers hebben dit getest op een echte robotarm.

  • Forward Transfer (Nieuwe dingen leren): De robot werd veel beter in contact-intensieve taken (zoals het afnemen van een vaas of het insteken van een pen) met behulp van de nieuwe tastzensoren. Hij leerde niet alleen de taak; hij leerde hoe hij moest voelen tijdens de uitvoering.
  • Backward Transfer (Niet vergeten): Verrassend genoeg werd de robot, nadat hij had geleerd om de tastzensoren te gebruiken, zelfs beter in zijn oorspronkelijke taken die alleen op zicht gebaseerd waren. Het lijkt erop dat het leren om te "voelen" hielp om de fysica van de wereld beter te begrijpen, wat zijn "zicht"-vaardigheden ook scherper maakte.
  • Cross-Modal Generalization: Zelfs bij taken waarbij de robot tijdens de training nooit de tast-data te zien kreeg, kon de robot nog steeds voorspellen welke krachten er zouden zijn geweest. Hij leerde een algemeen concept van "kracht" dat hij overal kon toepassen.

De Kern van het Verhaal

MuSe laat zien dat je geen enorme, perfecte dataset nodig hebt van elke mogelijke sensor om een robot te trainen. Je kunt een robot nemen die al een expert is in zien, hem een kleine hoeveelheid nieuwe "tast"-data geven, en deze speciale trainingsmethode gebruiken om hem te upgraden. De robot leert het nieuwe zintuig, behoudt zijn oude vaardigheden en wordt zelfs slimmer als geheel.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →