← Nieuwste papers
💻 computer science

RoboMIND 2.0: A Multimodal, Bimanual Mobile Manipulation Dataset for Generalizable Embodied Intelligence

Dit artikel introduceert RoboMIND 2.0, een uitgebreide dataset met meer dan 310.000 real-world bimanuele en mobiele manipulatie-trajecten, aangevuld met tactiele data en simulaties, en presenteert het hiërarchische MIND-2-systeem om generaliseerbare embodied intelligence voor complexe taken te realiseren.

Oorspronkelijke auteurs: Chengkai Hou, Kun Wu, Jiaming Liu, Zhengping Che, Di Wu, Fei Liao, Guangrun Li, Jingyang He, Qiuxuan Feng, Zhao Jin, Chenyang Gu, Zhuoyang Liu, Nuowei Han, Xiangju Mi, Yaoxu Lv, Yankai Fu, Gaole Dai
Gepubliceerd 2026-03-02
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Chengkai Hou, Kun Wu, Jiaming Liu, Zhengping Che, Di Wu, Fei Liao, Guangrun Li, Jingyang He, Qiuxuan Feng, Zhao Jin, Chenyang Gu, Zhuoyang Liu, Nuowei Han, Xiangju Mi, Yaoxu Lv, Yankai Fu, Gaole Dai, Langzhe Gu, Tao Li, Yuheng Zhang, Yixue Zhang, Xinhua Wang, Shichao Fan, Meng Li, Zhen Zhao, Ning Liu, Zhiyuan Xu, Pei Ren, Junjie Ji, Haonan Liu, Kuan Cheng, Shanghang Zhang, Jian Tang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot wilt leren om te koken, de was te doen en tegelijkertijd de auto te besturen. In het verleden waren robots als slimme kinderen die slechts één ding konden: bijvoorbeeld alleen een blokje op een blokje zetten. Ze waren niet flexibel en konden niet goed omgaan met nieuwe situaties.

Dit paper introduceert RoboMIND 2.0, wat je kunt zien als de "grootste en meest complete schoolboekenreeks" die ooit is geschreven voor robots. Hier is hoe het werkt, vertaald naar alledaagse taal:

1. De Grote Verzameling (RoboMIND 2.0)

Voorheen hadden robot-onderzoekers slechts kleine, losse verzamelingen van voorbeelden. RoboMIND 2.0 is een enorme bibliotheek met 310.000 voorbeelden (trajecten) van robots die werk doen.

  • Verschillende lichamen: Het is niet alleen voor één type robot. Het bevat data van zes verschillende soorten robots: van vaste armen op een tafel tot mobiele robots met wielen en zelfs mensachtige humanoïden.
  • Twee handen: In tegenstelling tot oudere datasets die vaak maar één arm gebruikten, leert deze dataset robots om met twee handen te werken, net zoals wij dat doen (bijvoorbeeld: één hand houdt een pot vast, de andere schroeft de dop los).
  • De "gevoel" toevoegen: Dit is het meest bijzondere: de robots hebben ook tactiele sensoren (gevoel). Het is alsof je een robot niet alleen leert zien, maar ook leert voelen of iets vastzit, of of het glad is. Dit helpt hen om voorzichtig te zijn met breekbare voorwerpen.

2. De Twee Delen van het Brein (MIND-2 Systeem)

Om al deze data te gebruiken, hebben de onderzoekers een nieuw "brein" voor robots bedacht, genaamd MIND-2. Ze vergelijken dit met hoe wij mensen werken: we hebben een traag, denkend deel en een snel, handelend deel.

  • Het Trage Brein (MIND-2-VLM): Dit is de "chef" of de "planner". Als je zegt: "Maak een boterham," denkt dit deel eerst na: "Eerst brood pakken, dan kaas snijden, dan smeren." Het beseft de grote lijnen en de volgorde van dingen.
  • Het Snelle Brein (MIND-2-VLA): Dit is de "handwerker". Zodra de planner zegt "pak het brood", voert dit deel de bewegingen uit. Het kijkt naar de handen en de camera's en zorgt dat de greep precies goed is, zonder na te denken over de grote strategie.

Door deze twee samen te laten werken, kunnen robots veel langere en complexere taken uitvoeren zonder in de war te raken.

3. De Virtuele Oefenruimte (Digital Twins)

Het is duur en tijdrovend om robots in de echte wereld te laten oefenen (ze kunnen kapot gaan of dingen breken). Daarom hebben de onderzoekers een perfecte virtuele wereld gebouwd die er 1-op-1 uitziet als de echte wereld.

  • Ze hebben robots in deze virtuele wereld duizenden keren laten oefenen.
  • Het beste nieuws: wat ze in de virtuele wereld leren, werkt ook echt in de echte wereld. Het is alsof je een piloot eerst duizenden uren in een vliegsimulator laat vliegen voordat hij echt vliegt.

4. Wat leert dit ons?

De onderzoekers hebben getest of hun nieuwe systeem werkt.

  • 3D is beter dan 2D: Robots die de wereld in 3D begrijpen (diep en breed), werken veel beter dan robots die alleen naar platte foto's kijken, vooral als ze met twee handen moeten samenwerken.
  • Oefenen met fouten: Ze hebben de robots niet alleen laten oefenen met perfecte voorbeelden, maar ook met voorbeelden van mislukte pogingen. Door te leren wat niet werkt, worden de robots veiliger en slimmer.
  • Alles kan: De robots kunnen nu taken doen die ze nog nooit eerder hebben gezien, zoals het hanteren van vreemde voorwerpen of werken in een nieuwe keuken.

Kortom: RoboMIND 2.0 is de "super-supermarkt" van robotdata. Het combineert zien, voelen, twee handen en een slim brein (planner + uitvoerder) om robots te leren om echt nuttig en flexibel te zijn in onze complexe, echte wereld. Het is een enorme stap richting robots die niet alleen in fabrieken werken, maar ook bij ons thuis kunnen helpen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →