← Nieuwste papers
💻 computer science

OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning

Dit paper introduceert OneTwoVLA, een unificerend visueel-taal-actie-model dat adaptief schakelt tussen directe actie en expliciete redenering om robuuste, langdurige robottaken uit te voeren door middel van een schaalbaar trainingsproces met synthetische data.

Oorspronkelijke auteurs: Fanqi Lin, Ruiqian Nai, Yingdong Hu, Jiacheng You, Junming Zhao, Yang Gao

Gepubliceerd 2026-03-03
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Fanqi Lin, Ruiqian Nai, Yingdong Hu, Jiacheng You, Junming Zhao, Yang Gao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot wilt die niet alleen maar een knop kan indrukken, maar echt kan nadenken terwijl hij werkt. Een robot die, net als een mens, soms even stopt om te zeggen: "Wacht even, ik heb een plan nodig," en dan weer doorgaat met het uitvoeren van taken.

Dat is precies wat dit nieuwe onderzoek, genaamd OneTwoVLA, voorstelt. Hier is de uitleg in simpele taal, met een paar leuke vergelijkingen.

🤖 Het Probleem: De Twee Robots die niet met elkaar praten

Vroeger (en bij veel huidige robots) was het zo: je had een "slimme" computer (het brein) die het grote plan maakte, en een "snelle" robotarm (de handen) die de uitvoering deed.

  • Het probleem: Het brein en de handen waren als twee mensen die in verschillende kamers werken en alleen via een postbode communiceren.
    • Het brein zegt: "Pak die kom op."
    • De handen wachten... en wachten... (vertraging).
    • Soms zegt het brein iets wat de handen fysiek niet kunnen doen, of ze krijgen een verouderd berichtje ("De kom is nog steeds daar!" terwijl de kom net is omgevallen).
    • Het resultaat: De robot is traag en raakt in de war als er iets misgaat.

💡 De Oplossing: OneTwoVLA (De "Alles-in-Één" Robot)

De onderzoekers hebben een nieuw model bedacht, OneTwoVLA. Dit is één enkele robot die twee dingen tegelijk kan:

  1. Systeem 1 (De Handen): Snel, automatisch handelen.
  2. Systeem 2 (Het Brein): Langzaam, diep nadenken.

Het magische is dat deze robot zelf besluit wanneer hij moet nadenken en wanneer hij moet handelen.

De Vergelijking:
Stel je voor dat je een kok bent die een ingewikkeld gerecht maakt (bijvoorbeeld een cocktail of een stoofpot).

  • Soms doe je dingen automatisch: "Giet de melk erbij, roer om." Je hoeft niet na te denken; je handen weten wat ze moeten doen.
  • Maar soms moet je even stoppen en nadenken: "Wacht, ik heb de suiker vergeten!" of "Oh nee, de pan is te heet, ik moet hem verschuiven."

OneTwoVLA doet precies dit. Hij werkt snel (System 1), maar op cruciale momenten schakelt hij over naar "nadenken-modus" (System 2). Hij zegt dan hardop (in tekst): "Ik heb net de siroop toegevoegd. Nu moet ik de jus d'orange pakken." En daarna gaat hij weer snel aan de slag.

🎓 Hoe leer je een robot dit? (De "Cursus")

Een robot leren nadenken is lastig. Je kunt hem niet zomaar een boek geven. De onderzoekers hebben een slimme truc bedacht:

  1. Menselijke voorbeelden: Ze hebben mensen robots laten zien hoe ze taken uitvoeren.
  2. De "Gedachtenkrant": Ze hebben voor elk moment in die video's een "gedachtenkrant" geschreven. Niet alleen wat de robot deed, maar waarom.
    • Voorbeeld: "Ik zie een mes. Ik heb een mes nodig om de tomaat te snijden. Ik pak het mes."
  3. De "Fictieve Oefening": Omdat echte robotvideo's duur zijn om te maken, hebben ze een AI gebruikt om duizenden fictieve tafels te tekenen met daarop allerlei voorwerpen. De robot heeft geoefend op deze virtuele tafels om te leren hoe hij plannen maakt voor situaties die hij nog nooit echt heeft gezien.

Dit noemen ze "co-training": de robot leert van echte mensen én van deze slimme, virtuele oefeningen.

🏆 Wat kan deze robot nu?

De tests laten zien dat OneTwoVLA veel beter is dan de oude modellen:

  • Langdurige taken: Hij kan een hele maaltijd klaarmaken (van het snijden tot het koken) zonder de draad kwijt te raken.
  • Fouten herstellen: Als hij een flesje laat vallen, denkt hij niet: "Oh nee, ik stop." Nee, hij denkt: "Oh, de fles is gevallen. Ik moet hem oppakken en steviger vasthouden." En hij doet het opnieuw.
  • Mensen begrijpen: Als jij zegt: "Geef me de rode kom," en er staan twee rode kommen, vraagt hij niet raar, maar denkt hij: "Welke rode kom bedoelt de mens?" en hij kan zelfs vragen om verduidelijking.
  • Alles herkennen: Hij kan zelfs voorwerpen vinden die hij nooit eerder heeft gezien in de echte wereld, omdat hij ze kent uit zijn "virtuele oefeningen".

🚀 Conclusie

OneTwoVLA is als het geven van een tweede hersenstam aan een robot. Het is niet meer alleen een machine die knoppen indrukt; het is een robot die begrijpt wat hij doet, plannen maakt, fouten ziet en zich aanpast aan de mens.

Het is een grote stap in de richting van robots die echt in onze huizen kunnen werken, van het koken van een hotpot tot het mixen van een cocktail, zonder dat je constant hoeft te sturen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →