← Nieuwste papers
🤖 machine learning

Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models

Qwen-RobotManip is een generaliseerbaar Vision-Language-Action fundamentaal model dat een verenigd uitlijningskader over representatie-, bewegings- en gedragsdimensies benut om grootschalige training op een open-source corpus van circa 38.100 uur mogelijk te maken, waarbij het de staat van de kunst bereikt en emergente generalisatiecapaciteiten vertoont over diverse robotplatforms en out-of-distribution benchmarks.

Oorspronkelijke auteurs: Haoqi Yuan, Zhixuan Liang, Anzhe Chen, Ye Wang, Haoyang Li, Pei Lin, Yiyang Huang, Zixing Lei, Tong Zhang, Jiazhao Zhang, Jie Zhang, Jingyang Fan, Gengze Zhou, Qihang Peng, Chenxu Lv, Xiaoyue Chen, An
Gepubliceerd 2026-06-17
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Haoqi Yuan, Zhixuan Liang, Anzhe Chen, Ye Wang, Haoyang Li, Pei Lin, Yiyang Huang, Zixing Lei, Tong Zhang, Jiazhao Zhang, Jie Zhang, Jingyang Fan, Gengze Zhou, Qihang Peng, Chenxu Lv, Xiaoyue Chen, An Yang, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Chenfei Wu, Xiong-Hui Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: Robots leren "denken" als mensen

Stel je voor dat je een robot wilt leren hoe hij huishoudelijke taken moet uitvoeren. In het verleden probeerden wetenschappers robots te leren door ze duizenden video's te laten zien van andere robots die specifieke taken uitvoeren. Maar dit is als proberen een hond schaken te leren door hem video's te laten zien van andere honden die schaken. Het is duur, de data is zeldzaam, en als de nieuwe robot er iets anders uitziet (een andere vorm van de arm heeft), raakt hij in de war.

Het Qwen-RobotManip-team stelde een andere vraag: Kunnen we robots leren met hetzelfde "scaling recept" dat AI-chatbots zo slim heeft gemaakt?

Chatbots werden slim omdat ze alles op het internet hebben gelezen—boeken, fora, artikels en video's. Ze leerden ideeën te verbinden omdat al die tekst "gealigneerd" was (alles gebruikte dezelfde taal). Het team wilde kijken of ze hetzelfde konden doen voor robots: alle beschikbare robotdata (zelfs van verschillende robots) en alle beschikbare video's van menselijke handbewegingen samenvoegen, en de robot leren om de wereld algemeen te begrijpen, niet slechts één specifieke taak.

Het Probleen: De "Taalbarrière" tussen robots

Het team realiseerde zich dat er een groot probleem was. Tekst is makkelijk te aligneren; "kat" betekent "kat" in elk boek. Maar robotdata is rommelig.

  • Verschillende lichamen: De ene robot heeft een lange arm; een andere heeft een korte arm. De ene heeft twee handen; een andere heeft er één.
  • Verschillende perspectieven: Eén camera kijkt van bovenaf; een andere kijkt vanaf de zijkant.
  • Verschillende talen: Eén robot registreert beweging in "gewrichtshoeken" (hoeveel de elleboog buigt); een andere registreert het in "3D-ruimte" (waar de hand zich in de kamer bevindt).

Als je al deze data gewoon in een blender gooit, krijgt de robot hoofdpijn. Het is alsoam te leren een taal door te luisteren naar Franse, Japanse en Spaanse sprekers die tegelijkertijd tegen elkaar schreeuwen zonder vertaler. De signalen conflicteren, en de robot leert niets.

De Oplossing: De "Universele Vertaler"

Om dit op te lossen, bouwde het team Qwen-RobotManip, een robotbrein dat fungeert als een Universele Vertaler. Ze gooiden niet zoma van de data erin; ze creëerden een strikte set regels om alles te vertalen naar een gemeenschappelijke taal voordat ze de robot leerden.

Ze aligneerden drie dingen:

  1. Het Lichaam (Representatie): Ze creëerden een "gestandaardiseerde lichaamkaart". Of de robot nu een mensachtige arm is of een simpele grijper, het brein vertaalt de bewegingen naar één enkel, gedeeld formaat.
  2. Het Perspectief (Beweging): In plaats van de robot te vertellen "beweeg je elleboog 30 graden", leren ze hem "beweeg je hand naar die beker". Ze verankeren alle bewegingen aan het perspectief van de camera. Als de camera de beker naar links ziet bewegen, leert de robot om naar links te bewegen, ongeacht wat zijn eigen gewrichten doen. Dit is als leren autorijden door naar de weg te kijken, in plaats van uit het hoofd te leren hoeveel je het stuur moet draaien.
  3. De Context (Gedrag): Ze gaven de robot een "geheugenvenster". Voordat de robot een beweging maakt, kijkt hij naar wat hij een seconde geleden deed. Dit helpt hem om ter plekke aan te passen, net zoals een mens zijn grip aanpast als hij voelt dat een doos wegglijdt.

De Data: De "Mens-naar-Robot" Magische Truc

Het team had een enorme hoeveelheid data nodig om dit brein te trainen. Ze hadden geen miljoenen uren aan dure robotopnames. Dus gebruikten ze een slimme truc: Mens-naar-Robot Synthese.

  • De Bron: Ze verzamelden duizenden uren aan video's van mensen die taken uitvoeren (zoals koken of schoonmaken), gefilmd vanuit een eerste-persoonsperspectief (zoals met een GoPro).
  • De Magie: Ze gebruikten AI om de menselijke handen in de video te "vervangen" door robotarmen.
    • Analogie: Stel je voor dat je een video hebt van een menselijke chef die groenten snijdt. De AI kijkt naar de beweging van de menselijke hand, berekent waar het mes zou moeten zijn, en vervangt vervolgens de menselijke hand digitaal door een robotarm, waarbij de robotarm exact dezelfde snijbeweging maakt.
  • Het Resultaat: Ze veranderden 1.900 uur aan menselijke video's in 24.800 uur aan robotdata verspreid over 15 verschillende soorten robots.

In totaal bouwden ze een trainingsbibliotheek van 38.100 uur aan data, waarbij ze alleen open-source data gebruikten (geen geheime bedrijfsdata).

De Resultaten: Werkt het echt?

Het team testte dit robotbrein op twee manieren:

  1. De "Textboek" Test: Standaard tests waarbij de robot exact dezelfde kamer en objecten ziet waarop hij getraind is. Hier presteerde de robot goed, maar dat deden veel andere modellen ook.
  2. De "Echte Wereld" Test (OOD): Dit is waar de magie gebeurde. Ze testten de robot in nieuwe kamers, met nieuwe objecten, andere verlichting en zelfs op robots die hij nog nooit eerder had gezien.

De Bevindingen:

  • Generalisatie: Terwijl andere robots faalden wanneer de lichten veranderden of de tafel verschoof, bleef Qwen-RobotManip gewoon werken. Het begreep het concept van de taak, niet alleen het visuele patroon.
  • Cross-Body Transfer: Ze trainden de robot op een robot met twee armen (AgileX) en testten hem vervolgens op een compleet andere robot (zoals een Franka of UR5 arm) die hij nog nooit had gezien. Hij slaagde daar waar anderen faalden.
  • Zelfcorrectie: In tests in de echte wereld, als de robot een object liet vallen, gaf hij niet zomaar op. Hij probeerde het opnieuw en paste zijn grip aan, net zoals een mens dat zou doen.
  • Instructie-opvolging: Als je zei "Pak de rode beker op", pakte hij de rode beker op, zelfs als de beker op een vreemde plek stond of de verlichting slecht was. Andere modellen negeerden de instructie vaak en pakten gewoon wat het dichtstbij was.

De Kernboodschap

Het artikel betoogt dat het geheim van slimme robots niet alleen het verzamelen van meer data is, maar het eerst correct aligneren van die data.

Denk aan het bouwen van een bibliotheek. Als je boeken uit verschillende talen, maten en formaten op één hoop gooit, kan niemand ze lezen. Maar als je ze allemaal vertaalt naar één standaardtaal en ze op dezelfde planken organiseert, kun je alles lezen.

Qwen-RobotManip bewees dat door alle robot- en mensdata te vertalen naar een "gemeenschappelijke taal" (camera-gealigneerde acties), je een robot kunt trainen om een echte generalist te zijn—in staat om nieuwe taken te leren en op verschillende lichamen te werken zonder dat hij vanaf nul opnieuw getraind hoeft te worden. Ze bereikten dit met alleen gratis, open data, wat suggereert dat de drempel om slimme robots te bouwen lager is dan we dachten, mits we de juiste "vertaaltools" hebben.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →