← Neueste Arbeiten
💻 computer science

Wall-OSS-0.5 Technical Report

Das Paper stellt Wall-OSS-0.5 vor, ein Open-Source 4B Vision-Language-Action-Modell, das zeigt, dass das VLA-Pretraining selbst direkt ausführbares Zero-Shot-Roboterverhalten über diverse Embodiments hinweg ermöglicht und gleichzeitig die Performance des Downstream-Fine-Tunings verbessert sowie die fundierten Vision-Language-Fähigkeiten bewahrt.

Ursprüngliche Autoren: Ryan Yu, Pushi Zhang, Starrick Liu, Brae Liu, Miracle Kang, Shalfun Li, Lights Shi, Ellie Ma, Ping Yang, Chris Pan, Jerry Chen, Dongxiu Liu, Rain Sun, Miles Guo, Byron Zhang, Hugo Zhou, Zach Xu, Vince
Veröffentlicht 2026-06-01
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Ryan Yu, Pushi Zhang, Starrick Liu, Brae Liu, Miracle Kang, Shalfun Li, Lights Shi, Ellie Ma, Ping Yang, Chris Pan, Jerry Chen, Dongxiu Liu, Rain Sun, Miles Guo, Byron Zhang, Hugo Zhou, Zach Xu, Vincent Chen, Harrison Huang, James Wang, Dance Kuzi, Andy Zhai, Hang Su, Roy Gan, Lucy Liang, Hao Wang, Qian Wang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Hier ist die Erklärung des technischen Berichts zu Wall-OSS-0.5, übersetzt in eine alltagssprachliche Form mit kreativen Analogien.

Die große Idee: „Einmal vortrainieren, überall handeln“

Stellen Sie sich vor, Sie möchten einem Roboter beibringen, im Haushalt zu helfen. Normalerweise müssen Sie ihm erst die Grundlagen beibringen (wie zum Beispiel, was ein Becher ist) und dann Monate damit verbringen, ihm spezifische Fähigkeiten zu lehren (wie zum Beispiel, wie er genau diesen speziellen Becher aufhebt).

Das Team hinter Wall-OSS-0.5 stellte eine kühne Frage: Was wäre, wenn wir einen Roboter so gut auf allgemeines Wissen und Bewegungen trainieren könnten, dass er tatsächlich direkt einsatzbereit Aufgaben erledigen kann, ohne für jeden neuen Job zusätzliches Training zu benötigen?

Sie bauten ein Robotergehirn namens Wall-OSS-0.5. Es ist ein „Vision-Language-Action“ (VLA)-Modell. Denken Sie an einen Roboter, der gleichzeitig sehen (Vision), Anweisungen verstehen (Language) und seine Arme bewegen kann (Action).

Das Problem, das sie gelöst haben: Die Lücke zwischen „Lehrbuch und Praxis“

In der Vergangenheit waren Robotergehirne wie Studenten, die jedes Lehrbuch in der Bibliothek gelesen haben, aber noch nie eine Küche betreten haben. Sie kannten die Theorie perfekt, erstarrten aber, wenn man sie fragte, tatsächlich zu kochen.

Die meisten bisherigen Robotermodelle wurden erst nachdem sie für eine spezifische Aufgabe feinjustiert (nachtrainiert) wurden, getestet. Dies ließ ein Rätsel offen: Hat das ursprüngliche Training dem Roboter tatsächlich beigebracht, wie man sich bewegt, oder gab es ihm nur einen guten Startpunkt?

Wall-OSS-0.5 beweist, dass das initiale Training dem Roboter tatsächlich beibringt, wie man sich bewegt. Selbst noch vor einem spezifischen „Abschlussklassen“-Training konnte der Roboter bereits komplexe Aufgaben wie das Sortieren von Obst, das Stapeln von Ringen und sogar das Festziehen eines Seils (eine sehr schwierige, instabile Aufgabe) allein durch das Lesen einer einfachen Anweisung bewältigen.

Wie sie es geschafft haben: Der „Dreibeinige Hocker“

Um dies zu erreichen, haben sie dem Roboter nicht einfach nur Daten gefütet; sie nutzten ein spezielles Trainingsrezept namens Gradient-Bridged Co-Training. Stellen Sie sich vor, das Gehirn des Roboters wird von drei verschiedenen Trainern gleichzeitig trainiert:

  1. Der „Aktions-Coach“ (Diskrete Token): Dieser Coach lehrt den Roboter, den nächsten Schritt vorherzusagen, ähnlich wie ein Wort in einem Satz. Er ist großartig darin, dem Gehirn die „Grammatik“ der Bewegung beizubringen. Er fungt als Brücke, die starke Signale an das Hauptgehirn sendet, um zu lernen, wie man den Körper steuert.
  2. Der „Verständnis-Coach“ (Multimodale Daten): Dieser Coach stellt sicher, dass der Roboter nicht vergisst, wie man liest, sieht und die Welt versteht. Er hält den Roboter in der Realität verwurzelt, damit er weiß, wie ein „Becher“ aussieht und was „stell es in die Spüle“ bedeutet.
  3. Der „Smooth Operator Coach“ (Flow Matching): Dieser Coach lehrt den Roboter, sich flüssig und kontinuierlich zu bewegen, wie ein Tänzer, anstatt in ruckartigen, roboterhaften Schritten. Dies ist das, was der Roboter tatsächlich nutzt, wenn er in der realen Welt arbeitet.

Der magische Trick: Normalerweise bekämpfen sich diese Coaches gegenseitig. Der „Aktions-Coach“ will dem Gehirn das Bewegen beibringen, aber der „Smooth Operator“ spricht eine andere Sprache. Wall-OSS-0.5 hat eine Brücke zwischen ihnen gebaut. Der „Aktions-Coach“ spricht die Sprache, die das Gehirn am besten versteht, während der „Smooth Operator“ sicherstellt, dass die endgültigen Bewegungen flüssig und präzise sind.

Die Ergebnisse: Ein Roboter, der tatsächlich Dinge tun kann

Sie testeten diesen Roboter an einem echten physischen Roboterarm bei 17 verschiedenen Aufgaben.

  • Zero-Shot (Kein zusätzliches Training): Ohne spezifisches Training für diese Aufgaben konnte der Roboter mehrere davon erfolgreich abschließen.
    • Block-Sortieren: 100 % Erfolg.
    • Obst-Sortieren: 96 % Erfolg.
    • Seil-Festziehen: 82 % Erfolg (Das ist enorm, da Seile labil sind und schwer zu kontrollieren sind!).
  • Nach der Feinjustierung: Als sie dem Roboter ein wenig spezifisches Training für 15 Aufgaben gaben, wurde er noch besser und übertraf die bisher besten Robotermodelle um eine deutliche Marge (um 17,5 % besser).

Warum das wichtig ist (in einfachen Worten)

Vor diesem Durchbruch dachten die Leute, das Vortraining eines Roboters sei wie ein guter Notenschnitt bei einem Studenten – es hilft ihm, die Abschlussprüfung zu bestehen, aber er muss trotzdem noch für den spezifischen Test lernen.

Wall-OSS-0.5 zeigt, dass das Vortraining selbst die Prüfung ist. Der Roboter hat während seiner großen Trainingsphase allgemeines „Muskelgedächtnis“ und „gesunden Menschenverstand“ gelernt. Es ist wie ein Kind, das nach dem Spielen mit allen möglichen Spielzeugen und dem Beobachten der Bewegungen von Erwachsenen in ein neues Zimmer kommen und lernen kann, eine Tür zu öffnen oder ein Spielzeug aufzuheben, ohne vorher genau gesagt bekommen zu haben, wie es das zu tun hat.

Das technische „Geheimrezept“

  • Das Gehirn: Es basiert auf einem 3-Milliarden-Parameter-„Gehirn“ (einem Large Language Model), das aufgestellt wurde, um Roboterbewegungen zu verarbeiten.
  • Die Daten: Sie trainierten es mit über einer Million Roboterbewegungen von mehr als 20 verschiedenen Arten von Robotern sowie einer massiven Bibliothek von Bildern und Texten.
  • Geschwindigkeit: Sie machten den Roboter schnell genug, um einen echten Arm in Echtzeit zu steuern (15 Mal pro Sekunde), was entscheidend ist, um nichts fallen zu lassen.

Zusammenfassung

Wall-OSS-0.5 ist ein Durchbruch, weil es beweist, dass ein Robotergehirn, wenn man es mit genügend vielfältigen Daten und den richtigen „Brücken“-Techniken trainiert, nicht nur ein kluger Beobachter wird, sondern sofort zu einem fähigen Akteur wird. Er kann auf einen unordentlichen Tisch schauen, die Anweisung „Räum auf“ verstehen und anfangen, Gegenstände zu sortieren, ohne für jeden einzelnen Gegenstand auf dem Tisch ein Handbuch zu benötigen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →