← Nieuwste papers
💻 computer science

OneVLA: A Unified Framework for Embodied Tasks

OneVLA introduceert een verenigd framework dat navigatie en manipulatie integreert in een enkele architectuur met een gedeelde actie-kop en een meerfasige progressieve trainingsstrategie, waarmee het de staat van de techniek bereikt in zowel gesimuleerde als real-world omgevingen om de ontwikkeling van algemene robotische agenten te bevorderen.

Oorspronkelijke auteurs: Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang, Lei Zhou, Shuyi Zhang, Jinkun Liu, Hongsheng Li, Chenhao Zhang, Qiang Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

Gepubliceerd 2026-06-02
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang, Lei Zhou, Shuyi Zhang, Jinkun Liu, Hongsheng Li, Chenhao Zhang, Qiang Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robotassistent hebt. Tot nu toe was het bouwen van deze robot als het inhuren van twee aparte specialisten: één persoon die een expert is in lopen (navigatie) maar verschrikkelijk is in het gebruiken van de handen, en een andere persoon die een meester kok is (manipulatie) maar niet door de kamer kan lopen om ingrediënten te halen. Als je wilde dat de robot "naar de keuken liep en een kopje in de magnetron plaatste", moest je wisselen tussen deze twee verschillende "hersenen" of twee aparte modellen trainen.

Het paper introduceert OneVLA, wat het inhuren van een enkele "Zwitsers zakmes"-werknemer is die van nature goed is in zowel lopen als het gebruiken van de handen, allemaal binnen één enkel brein.

Hier is een eenvoudige uitsplitsing van hoe ze het hebben gedaan:

1. De "Universele Afstandsbediening" (Unified Action Head)

De meeste robots hebben verschillende "afstandsbedieningen" voor verschillende taken. De ene afstandsbediening heeft knoppen om naar voren te bewegen of naar links af te buigen. Een andere afstandsbediening heeft schuifregelaars om een robotarm omhoog, omlaag of draaiend te bewegen.

OneVLA creëert een enkele, universele afstandsbediening.

  • Het combineert de knoppen voor het lopen en de schuifregelaars voor de arm tot één lange strook met besturingen.
  • Wanneer de robot een instructie krijgt zoals "Ga naar de deur", drukt hij alleen op de "loopknoppen" op de strook.
  • Wanneer de instructie "Pak de kop op" is, beweegt hij alleen de "arm-schuifregelaars".
  • De Magie: De robot hoeft niet van brein of van afstandsbediening te wisselen. Hij weet gewoon welk deel van de afstandsbediening hij moet gebruiken op basis van de taak.

2. Het "Drietraps Trainingskamp" (Multi-Stage Strategy)

Je kunt een robot niet zomaar in een complexe wereld gooien en verwachten dat hij meteen alles weet. De auteurs hebben OneVLA in drie specifieke fasen getraind, zoals een student die door de schoolgaande jaren gaat:

  • Fase 1: Leren hoe de handen te gebruiken. Eerst leerden ze de robot hoe hij objecten kan grijpen, tillen en plaatsen met een robotarm. Ze leerden hem ook om naar afbeeldingen te kijken en deze te beschrijven (zodat hij de wereld begrijpt).
  • Fase 2: Leren lopen. Vervolgens voegden ze navigatiegegevens toe. Nu leert de robot hoe hij van punt A naar punt B beweegt. Omdat de robot al weet hoe hij moet "zien" en "denken" uit Fase 1, leert hij sneller en slimmer te lopen.
  • Fase 3: Leren hardop nadenken (Chain-of-Thought). Ten slotte leerden ze de robot om zijn denkproces "door te praten". Voordat hij beweegt, zegt hij tegen zichzelf: "Ik ben in de gang. Ik moet rechtsaf slaan om bij de keuken te komen." Deze stap helpt de robot om de verbanden te leggig tussen wat hij ziet, wat hij moet doen en hoe hij moet bewegen.

3. Het Resultaat: Twee Vaardigheden, Eén Brein

Het paper stelt dat door deze twee vaardigheden samen te trainen, ze elkaar daadwerkelijk helpen beter te worden.

  • De Analogie: Denk aan een basketballer die ook voetbal speelt. Het leren dribbelen met een basketbal (manipulatie) kan de voetbewegingen en het evenwicht verbeteren, wat helpt om beter te rennen op het voetbalveld (navigatie).
  • Het Bewijs: In tests versloeg deze enkele robot (OneVLA) robots die alleen gespecialiseerd waren in lopen of alleen in het gebruiken van de handen. Het was ook beter dan andere "hybride" robots die probeerden beide te doen, maar nog steeds aparte "modi" of instellingen vereisten voor elke taak.

In het kort

OneVLA is een nieuw type robotbrein dat niet opnieuw geprogrammeerd hoeft te worden wanneer je het vraagt om te lopen of wanneer je het vraagt om iets te pakken. Het gebruikt één verenigd systeem om taal te begrijpen, de wereld te zien en zowel de voeten als de handen te besturen. De auteurs laten zien dat het samen aanleren van deze vaardigheden de robot slimmer maakt in beide taken dan wanneer je ze apart zou aanleren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →