← Nieuwste papers
💻 computer science

Wall-OSS-0.5 Technical Report

Het artikel introduceert Wall-OSS-0.5, een open-source 4B Vision-Language-Action model dat aantoont dat VLA-pretraining op zichzelf direct uitvoerbaar zero-shot robotgedrag over diverse belichamingen oplevert, terwijl het tegelijkertijd de prestaties van downstream fine-tuning verbetert en gegronde visuele-linguïstische capaciteiten behoudt.

Oorspronkelijke auteurs: Ryan Yu, Pushi Zhang, Starrick Liu, Brae Liu, Miracle Kang, Shalfun Li, Lights Shi, Ellie Ma, Ping Yang, Chris Pan, Jerry Chen, Dongxiu Liu, Rain Sun, Miles Guo, Byron Zhang, Hugo Zhou, Zach Xu, Vince
Gepubliceerd 2026-06-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ryan Yu, Pushi Zhang, Starrick Liu, Brae Liu, Miracle Kang, Shalfun Li, Lights Shi, Ellie Ma, Ping Yang, Chris Pan, Jerry Chen, Dongxiu Liu, Rain Sun, Miles Guo, Byron Zhang, Hugo Zhou, Zach Xu, Vincent Chen, Harrison Huang, James Wang, Dance Kuzi, Andy Zhai, Hang Su, Roy Gan, Lucy Liang, Hao Wang, Qian Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: "Eén keer trainen, overal handelen"

Stel je voor dat je een robot wilt leren om huishoudelijke taken uit te voeren. Normaal gesproken moet je hem eerst de basis leren (zoals wat een beker is) en daarna maandenlang specifieke vaardigheden aanleren (zoals hoe hij die specifieke beker moet oppakken).

Het team achter Wall-OSS-0.5 stelde een gedurfde vraag: Wat als we een robot zo goed konden trainen op algemene kennis en beweging, dat hij eigenlijk direct bij de start al echte taken kan uitvoeren, zonder dat er extra training nodig is voor elke nieuwe klus?

Ze bouwden een robotbrein genaamd Wall-OSS-0.5. Het is een "Vision-Language-Action" (VLA) model. Zie het als een robot die tegelijkertijd kan zien (Vision), instructies kan begrijpen (Language) en zijn armen kan bewegen (Action).

Het Probleem dat ze Oplosten: De kloof tussen "Het Handboek" en "De Praktijk"

In het verleden waren robotbreinen als studenten die elk boek in de bibliotheek hadden gelezen, maar nog nooit een keuken in waren gestapt. Ze kenden de theorie perfect, maar bevroren zodra er gevraagd werd om daadwerkelijk te koken.

De meeste eerdere robotmodellen werden pas getest nadat ze waren bijgeschaafd (fine-tuned) voor een specifieke taak. Dit liet een mysterie achter: Leerde de initiële training de robot eigenlijk hoe hij moest bewegen, of gaf het de robot alleen een goed startpunt?

Wall-OSS-0.5 bewijst dat de initiële training de robot wel leert hoe hij moet bewegen. Zelfs vóór enige specifieke "finishing school"-training, kon de robot al complexe taken uitvoeren zoals het sorteren van fruit, het stapelen van ringen en zelfs het aantrekken van een touw (een zeer lastige, rekbare taak) door simpelweg een eenvoudige instructie te lezen.

Hoe ze het Deden: De "Driepotige Kruk"

Om dit werkend te krijgen, gaven ze de robot niet alleen data; ze gebruikten een speciaal trainingsrecept genaamd Gradient-Bridged Co-Training. Stel je voor dat het brein van de robot wordt getraind door drie verschillende coaches die samenwerken:

  1. De "Actie-Coach" (Discrete Tokens): Deze coach leert de robot om de volgende beweging te voorspellen, net zoals een woord in een zin. Deze coach is erg goed in het aanleren van de "grammatica" van beweging aan het brein. Het fungeert als een brug die sterke signalen naar het hoofdbrein stuurt om te leren hoe het lichaam te besturen.
  2. De "Begrips-Coach" (Multimodale Data): Deze coach zorgt ervoor dat de robot niet vergeet hoe hij moet lezen, zien en de wereld begrijpen. Deze houdt de robot geworteld in de realiteit, zodat hij weet hoe een "beker" eruitziet en wat "zet hem in de gootsteen" betekent.
  3. De "Smooth Operator-Coach" (Flow Matching): Deze coach leert de robot om vloeiend en continu te bewegen, als een danser, in plaats van in schokkerige, robotachtige stappen. Dit is wat de robot daadwerkelijk gebruikt wanneer hij in de echte wereld werkt.

De Magische Truc: Meestal vechten deze coaches met elkaar. De "Actie-Coach" wil het brein leren bewegen, maar de "Smooth Operator" gebruikt een andere taal. Wall-OSS-0.5 heeft een brug gebouwd tussen hen. De "Actie-Coach" spreekt de taal die het brein het beste begrijpt, terwijl de "Smooth Operator" ervoor zorgt dat de uiteindelijke bewegingen vloeiend en precies zijn.

De Resultaten: Een Robot die Echt Dingen Kan Doen

Ze testten deze robot op een echte fysieke robotarm met 17 verschillende taken.

  • Zero-Shot (Geen extra training): Zonder specifieke training voor deze taken, voltooide de robot er verschillende succesvol.
    • Blokken sorteren: 100% succes.
    • Fruit sorteren: 96% succes.
    • Touwtje aantrekken: 82% succes (Dit is enorm, omdat touwen slap zijn en moeilijk te controleren zijn!).
  • Na Fine-Tuning: Toen ze de robot een beetje specifieke training gaven voor 15 taken, werd hij nog beter en versloof hij de vorige beste robotmodellen met een aanzienlijke marge (17,5% beter).

Waarom dit Belangrijk is (In Simpele Termen)

Vóór dit moment dachten mensen dat het voor-trainen van een robot vergelijkbaar was met het geven van een goed gemiddelde aan een student — het helpt hen om de eindtoets te halen, maar ze moeten nog steeds studeren voor de specifieke toets.

Wall-OSS-0.5 laat zien dat de voor-training zelf de toets is. De robot leerde algemene "spiergeheugen" en "gezond verstand" tijdens de grote trainingsfase. Het is als een kind dat, na het spelen met allerlei soorten speelgoed en het kijken naar hoe volwassenen bewegen, een nieuwe kamer binnenloopt en uitfiguurt hoe het een deur opent of een speeltje oppakt zonder dat het daar eerst precies voor geïnstrueerd is.

Het Technische "Geheime Sausje"

  • Het Brein: Het is gebouwd op een "brein" van 3 miljard parameters (een groot taalmodel) dat is geüpgraded om robotbewegingen te kunnen verwerken.
  • De Data: Ze trainden het op meer dan één miljoen robotbewegingen van meer dan 20 verschillende soorten robots, plus een enorme bibliotheek aan afbeeldingen en tekst.
  • Snelheid: Ze zorgden ervoor dat de robot snel genoeg nadenkt om een echte arm in realtime aan te sturen (15 keer per seconde), wat cruciaal is om niets te laten vallen.

Samenvatting

Wall-OSS-0.5 is een doorbraak omdat het bewijst dat als je een robotbrein traint op voldoende diverse data met de juiste "brug"-technieken, de robot niet alleen een slimme waarnemer wordt, maar direct een bekwaam uitvoerder. Het kan naar een rommelige tafel kijken, de instructie "ruim op" begrijpen, en beginnen met het sorteren van items zonder dat het een handleiding nodig heeft voor elk object op de tafel.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →