← Neueste Arbeiten
💻 computer science

OneVLA: A Unified Framework for Embodied Tasks

OneVLA führt ein einheitliches Framework ein, das Navigation und Manipulation in einer einzigen Architektur mit einem gemeinsamen Action-Head und einer mehrstufigen progressiven Trainingsstrategie integriert und so eine führende Leistung in sowohl simulierten als auch realen Umgebungen erzielt, um die Entwicklung allgemeiner Roboteragenten voranzutreiben.

Ursprüngliche Autoren: Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang, Lei Zhou, Shuyi Zhang, Jinkun Liu, Hongsheng Li, Chenhao Zhang, Qiang Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

Veröffentlicht 2026-06-02
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang, Lei Zhou, Shuyi Zhang, Jinkun Liu, Hongsheng Li, Chenhao Zhang, Qiang Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie hätten einen Roboter-Assistenten. Bis jetzt war der Bau dieses Roboters so, als würde man zwei verschiedene Spezialisten einstellen: eine Person, die eine Expertin im Gehen (Navigation) ist, aber schrecklich darin, ihre Hände zu benutzen, und eine andere Person, die eine Meister-Köchin (Manipulation) ist, aber nicht durch den Raum laufen kann, um Zutaten zu holen. Wenn Sie wollten, dass der Roboter „in die Küche geht und eine Tasse in die Mikrowelle stellt“, mussten Sie zwischen diesen zwei verschiedenen „Gehirnen“ oder Modellen wechseln.

Das Paper stellt OneVLA vor, was so ist, als würde man einen einzigen „Schweizer Taschenmesser“-Mitarbeiter einstellen, der von Natur aus sowohl gut im Gehen als auch im Benutzen seiner Hände ist – und das alles in einem einzigen Gehirn.

Hier ist eine einfache Aufschlüsselung, wie sie es gemacht haben:

1. Die „Universalfernbedienung“ (Unified Action Head)

Die meisten Roboter haben verschiedene „Fernbedienungen“ für verschiedene Aufgaben. Eine Fernbedienung hat Knöpfe, um vorwärts zu gehen oder nach links zu drehen. Eine andere Fernbedienung hat Schieberegler, um einen Roboterarm hoch, runter oder zu drehen.

OneVLA erschafft eine einzelne, universelle Fernbedienung.

  • Es kombiniert die Knöpfe für das Gehen und die Schieberegler für den Arm zu einem einzigen langen Streifen von Bedienelementen.
  • Wenn der Roboter eine Anweisung erhält wie „Geh zur Tür“, drückt er nur die „Geh-Knöpfe“ auf dem Streifen.
  • Wenn die Anweisung „Heb die Tasse auf“ lautet, bewegt er nur die „Arm-Schieberegler“.
  • Die Magie: Der Roboter muss nicht sein Gehirn oder seine Fernbedienung austauschen. Er weiß einfach, welchen Teil der Fernbedienung er je nach Aufgabe benutzen muss.

2. Das „Drei-Stufen-Trainingslager“ (Multi-Stage Strategy)

Man kann einen Roboter nicht einfach in eine komplexe Welt werfen und erwarten, dass er sofort alles weiß. Die Autoren haben OneVLA in drei spezifischen Phasen trainiert, wie ein Schüler, der die Schule durchläuft:

  • Stufe 1: Das Benutzen der Hände lernen. Zuerst haben sie dem Roboter beigebracht, wie man Objekte mit einem Roboterarm greift, hebt und platziert. Sie haben ihm auch beigebracht, Bilder anzusehen und sie zu beschreiben (damit er die Welt versteht).
  • Stufe 2: Das Gehen lernen. Als Nächstes haben sie Navigationsdaten hinzugefügt. Nun lernt der Roboter, wie er von Punkt A nach Punkt B kommt. Da er bereits aus Stufe 1 weiß, wie man „sieht“ und „denkt“, lernt er schneller und intelligenter zu gehen.
  • Stufe 3: Das „Laut-Denken“ lernen (Chain-of-Thought). Schließlich haben sie dem Roboter beigebracht, seinen Denkprozess „laut durchzusprechen“. Bevor er sich bewegt, sagt er sich selbst: „Ich bin im Flur. Ich muss nach rechts abbiegen, um in die Küche zu gelangen.“ Dieser Schritt hilft dem Roboter, die Verbindung zwischen dem, was er sieht, dem, was er tun muss, und wie er sich bewegt, herzustellen.

3. Das Ergebnis: Zwei Fähigkeiten, ein Gehirn

Das Paper behauptet, dass diese beiden Fähigkeiten sich gegenseitig verbessern, wenn man sie zusammen trainiert.

  • Die Analogie: Denken Sie an einen Basketballspieler, der auch Fußball spielt. Das Erlernen des Dribbelns eines Basketballs (Manipulation) kann die Fußarbeit und das Gleichgewicht verbessern, was wiederum hilft, besser auf dem Fußballfeld (Navigation) zu laufen.
  • Der Beweis: In Tests schlug dieser einzelne Roboter (OneVLA) Roboter, die entweder nur im Gehen oder nur im Benutzen der Hände spezialisiert waren. Er war auch besser als andere „Hybrid“-Roboter, die zwar versuchten, beides zu tun, aber immer noch separate „Modi“ oder Einstellungen für jede Aufgabe benötigten.

Zusammenfassend

OneVLA ist eine neue Art von Robotergehirn, das nicht umprogrammiert werden muss, wenn man es bittet zu gehen oder etwas zu greifen. Es nutzt ein einheitliches System, um Sprache zu verstehen, die Welt zu sehen und sowohl seine Füße als auch seine Hände zu steuern. Die Autoren zeigen, dass das gemeinsame Training dieser Fähigkeiten den Roboter bei beiden Fähigkeiten intelligenter macht, als wenn man sie separat gelehrt hätte.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →