← Nieuwste papers
🤖 AI

FluxVLA Engine: A One-Stop VLA Engineering Platform for Embodied Intelligence

De FluxVLA Engine is een open, configuratiegestuurd platform dat de engineering-bottlenecks in embodied intelligence aanpakt door interfaces te standaardiseren en tools te integreren voor datageneratie, training, simulatie en real-robot deployment om een reproduceerbare workflow mogelijk te maken van heterogene policy-componenten naar betrouwbare executie.

Oorspronkelijke auteurs: Yinhao Li, Weixin Mao, Zihan Lan, Jikun Rong, Qirui Hu, Yiming Zhang, Weipeng Deng, Bowen Shen, Minzhao Zhu, Yiming Mao, Yan Yang, Chenguang Cui, Hongyuan Chen, Xu Huang, Zheyi Zhao, Pinxi Shen, Bozhe
Gepubliceerd 2026-09-16
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yinhao Li, Weixin Mao, Zihan Lan, Jikun Rong, Qirui Hu, Yiming Zhang, Weipeng Deng, Bowen Shen, Minzhao Zhu, Yiming Mao, Yan Yang, Chenguang Cui, Hongyuan Chen, Xu Huang, Zheyi Zhao, Pinxi Shen, Bozhen He, Zhen Fu, Yifan Wang, Zexin Zhang, Ang Gao, Haoyu Chen, Chengqi Shi, Hua Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots zijn al lang meesters in herhaling, in staat om dezelfde precieze beweging duizenden keren zonder fouten uit te voeren. Toch struikelen ze vaak wanneer ze gevraagd wordt een rommelige keuken te navigeren, een gesproken instructie te begrijpen of zich aan te passen aan een nieuw object. De kloof tussen een robot die een script kan volgen en een robot die echt kan interageren met de wereld, is de afgelopen jaren kleiner geworden dankzij een nieuwe generatie kunstmatige intelligentie. Deze systemen, vaak vision-language-action modellen genoemd, leren door video's te bekijken en tekst te lezen, waarbij ze verbinden wat ze zien en horen direct aan de fysieke bewegingen die de robot moet maken. Ze herkennen niet alleen objecten; ze leren hoe ze deze moeten grijpen, tillen en plaatsen op basis van menselijke taal. Het omzetten van deze veelbelovende computerprogramma's naar betrouwbare, werkende machines blijft echter een enorme technische uitdaging. De software die deze modellen traint, spreekt vaak een andere taal dan de hardware die de robot beweegt, wat een gefragmenteerd landschap creëert waar elk nieuw experiment vereist dat de hele brug van data naar actie opnieuw wordt gebouwd.

Een team van onderzoekers heeft nu een uitgebreid platform gebouwd dat ontworpen is om deze kapotte brug te repareren. Ze noemen het FluxVLA Engine, een systeem dat fungeert als een universele vertaler en assemblagelijn voor belichaamde intelligentie. In plaats van een nieuw type robotbrein uit te vinden, richtte het team zich op de infrastructuur die de hersenen met het lichaam verbindt. Hun werk pakt een specifieke, frustrerende realiteit in robotonderzoek aan: de tools die worden gebruikt om een model te trainen, de methoden die worden gebruikt om het te testen in een computersimulatie, en de code die nodig is om het op een echte robot te draaien, zijn vaak incompatibel. Een wetenschapper kan er succesvol een model voor trainen om blokken te sorteren in een simulatie, om er vervolgens achter te komen dat de code niet naar een fysieke robot kan worden overgebracht zonder wekenlang herschrijven. FluxVLA lost dit op door een enkele, gestandaardiseerde workflow te creëren die alles afhandelt, van de ruwe data tot de uiteindelijke beweging, waardoor wordt gewaarborgd dat wat in de training wordt geleerd, exact wordt uitgevoerd in de echte wereld.

Het platform werkt als een zeer georganiseerde fabrieksvloer waar elk onderdeel door ontwerp bij elkaar past. Wanneer een onderzoeker een robot wil trainen, hoeft hij geen aangepaste code te schrijven voor elke nieuwe camera, sensor of robotarm. In plaats daarvan gebruiken ze een configuratiebestand dat de taak, de data en het model beschrijft. Het systeem assembleert vervolgens automatisch de benodigde onderdelen, waarbij ruwe video- en sensorgegevens worden omgezet in een formaat dat het model kan begrijpen, en de voorspellingen van het model worden vertaald naar commando's die de robot kan uitvoeren. Dit proces is consistent, of de robot nu leert in een virtuele omgeving of beweegt over een fysieke werkplaatsvloer. De onderzoekers hebben ondersteuning geïntegreerd voor een breed scala aan bestaande robotleermethoden, inclusief die welke een reeks acties in één keer voorspellen en die welke bewegingen stap voor stap genereren. Door te standaardiseren hoe deze verschillende methoden met de rest van het systeem communiceren, stelt FluxVLA wetenschappers in staat om een ander leeralgoritme te vervangen zonder de hele opstelling te demonteren.

Om te bewijzen dat deze technische aanpak werkt, testte het team het platform met een diverse collectie robotbeleid over verschillende uitdagende benchmarks. In een reeks gesimuleerde taken waarbij objecten werden verplaatst en gereedschap werd gehanteerd, draaide het systeem succesvol veertien verschillende soorten robotbreinen. De resultaten toonden aan dat deze modellen hoge succespercentages konden bereiken, waarbij sommige bijna negentig procent nauwkeurigheid bereikten in taken zoals het stapelen van blokken of het openen van laden. Het platform was niet beperkt tot eenvoudige simulaties; het slaagde er ook in om deze modellen te implementeren op echte fysieke robots. In tests waarbij handdoeken werden gevouwen en objecten werden opgepakt, leidde het systeem robots naar taken met een succespercentage van meer dan zestig procent voor een van de geteste modellen. Deze cijfers zijn significant, niet omdat ze de hoogste ooit geregistreerde zijn, maar omdat ze werden behaald met behulp van één enkel, verenigd systeem dat de overgang van training naar uitvoering in de echte wereld beheerde zonder het gebruikelijke verlies van prestaties of betrouwbaarheid.

Een cruciaal onderdeel van het succes van het systeem ligt in de manier waarop het de timing van robotbewegingen afhandelt. Wanneer een robot leert, voorspelt hij vaak een hele reeks toekomstige acties tegelijk, een techniek die bekend staat als 'action chunking'. Echter, als de robot te lang wacht om de volgende 'chunk' te berekenen, verandert de wereld en wordt de oude voorspelling nutteloos. De FluxVLA-engine bevat een gespecialiseerd mechanisme dat de acties van de robot vloeiend en continu houdt, zelfs wanneer de computer nog bezig is met het berekenen van de volgende stap. Dit doet het door de komende bewegingen constant aan te passen op basis van wat de robot op dit moment daadwerkelijk doet. Dit zorgt ervoor dat de robot niet schokkerig of ongemakkelijk pauzeert, waardoor een vloeiende beweging wordt behouden die essentieel is voor delicate taken. De onderzoekers hebben ook tools ingebouwd om het denkproces van de computer te versnellen, waardoor de robot veel sneller kan reageren dan voorheen, wat essentieel is voor interactie met een dynamische omgeving.

De onderzoekers waren zorgvuldig in het onderscheid tussen wat hun systeem bereikte en wat het niet deed. Ze beweerden niet een nieuw algoritme te hebben ontdekt dat robots slimmer maakt dan ze voorheen waren. In plaats daarvan toonden ze aan dat de flessenhals in robotleren vaak niet de intelligentie van het model is, maar de complexiteit van de techniek die nodig is om het te gebruiken. Door een stabiel, reproduceerbaar pad van data naar implementatie te bieden, lieten ze zien dat verschillende robotleermethoden eerlijk vergeleken en betrouwbaar ingezet kunnen worden. Het systeem garandeert niet dat elke robot bij elke taak zal slagen, maar het zorgt ervoor dat wanneer er een fout optreedt, dit te wijten is aan de leerbeperkingen van de robot en niet aan een glitch in de softwareverbinding. Deze helderheid stelt onderzoekers in staat zich te concentreren op het verbeteren van de werkelijke intelligentie van de robots, wetende dat de machinerie die hen ondersteunt solide is.

Vooruitblikkend zien het team dit platform als de fundering voor een groter ecosysteem van tools. Ze stellen voor dat toekomstige ontwikkelingen modulair moeten blijven, met aparte systemen die dataverzameling, simulatie en evaluatie afhandelen, en die allemaal communiceren via de door FluxVLA gevestigde, duidelijke interfaces. Deze aanpak zou het verschillende onderzoeksgroepen mogelijk maken om hun werk gemakkelijker te delen en voort te bouwen op elkaars vooruitgang zonder vast te lopen in incompatibele code. Het uiteindelijke doel is om een cyclus te creëren waarbij robots leren van hun fouten in de echte wereld, die data terugvoeren in het trainingssysteem en hun prestaties in de loop van de tijd verbeteren. Door het technische puzzelstukje op te lossen van hoe je deze onderdelen verbindt, biedt de FluxVLA Engine de noodzakelijke infrastructuur voor de volgende generatie robots om van het laboratorium naar de complexe, onvoorspelbare realiteit van het menselijk leven te bewegen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →