← Neueste Arbeiten
💻 computer science

FlashVLA: Streaming Action Decoding for Fast and Asynchronous VLA Inference

FlashVLA ist ein vereinheitlichtes Streaming-Action-Decoding-Framework, das eine schnelle, asynchrone VLA-Inferenz durch die Aufrechterhaltung eines Multi-Chunk-Action-Buffers mit Chunk-weiser kausaler Aufmerksamkeit ermöglicht und dabei eine Steuerungsfrequenz von über 30 Hz erreicht, während es gleichzeitig eine glatte, zeitlich konsistente robotische Ausführung gewährleistet.

Ursprüngliche Autoren: Zekai Li, Jiaming Tang, Zhijian Liu

Veröffentlicht 2026-08-28
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Zekai Li, Jiaming Tang, Zhijian Liu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter, die sehen, verstehen und sich mit menschenähnlicher Geschicklichkeit bewegen können, sind seit langem der heilige Gral der Automatisierung. Jahrelang haben Forscher Systeme entwickelt, die in der Lage sind, einen Becher auf einem Tisch zu identifizieren oder einem verbalen Befehl wie „heb ihn auf“ zu folgen. Doch das Verständnis in eine flüssige, Echtzeit-Physische Bewegung zu übertragen, blieb ein hartnäckiger Engpass. Die Kernschwierigkeit liegt im Timing: Ein Roboter muss ständig die Welt betrachten, dieses Bild verarbeiten, entscheiden, was als Nächstes zu tun ist, und dann seinen Arm bewegen – und das alles innerhalb eines Bruchteils einer Sekunde. Wenn der Denkprozess zu lange dauert, hinkt der Roboter hinterher, agiert auf Basis veralteter Informationen und verfehlt sein Ziel. Diese Verzögerung ist besonders akut bei der neuesten Generation der Robotergehirne, den sogenannten Vision-Language-Action-Modellen. Diese Systeme sind leistungsfähig, weil sie die Fähigkeit zu sehen und zu lesen mit der Fähigkeit zur Bewegungsplanung kombinieren, aber sie sind auch langsam. Sie arbeiten oft dadurch, dass sie eine Bewegung in kleine Stücke zerlegen und jedes Stück durch eine Reihe von repetitiven, zeitintensiven Berechnungen verfeinern, bevor sie den Befehl an den Motor senden. Das Ergebnis ist ein Roboter, der zögert, ruckelt oder mit einer Latenz agiert, die komplexe Aufgaben unmöglich macht.

Um dies zu lösen, stellte ein Forscherteam der UC San Diego und des MIT ein neues Framework namens FlashVLA vor, das darauf ausgelegt ist, dass diese Robotergehirne gleichzeitig denken und bewegen, anstatt nacheinander. Stellen Sie sich eine Fabrik-Montagelinie vor, bei der ein Arbeiter wartet, bis ein fertiges Produkt vollständig inspiziert wurde, bevor er mit dem nächsten beginnt; die Linie stoppt ständig. FlashVLA ändert den Arbeitsablauf so, dass der Arbeiter immer an einem anderen Stadium des Produkts gleichzeitig arbeitet, was einen stetigen, kontinuierlichen Fluss gewährleistet. In technischer Hinsicht ersetzten die Forscher die alte Methode, eine vollständige Bewegung nach der anderen zu dekodieren, durch einen „Streaming“-Ansatz. Anstatt darauf zu warten, dass ein vollständiger Bewegungsplan perfekt ist, bevor gehandelt wird, hält das System einen Puffer aus mehreren Bewegungsplänen in verschiedenen Stadien der Fertigstellung bereit. Einige Pläne sind fast fertig und bereit zur Ausführung, während andere gerade erst beginnen und noch verfeinert werden. Das System aktualisiert alle diese Pläne gleichzeitig in einem einzigen Schritt und sendet den am weitesten fortgeschrittenen Plan sofort an die Motoren des Roboters. Dies ermöglicht es dem Roboter, sich weiterzubewegen, während der Computer noch die nächsten Schritte plant, wodurch die Zeit, die das Denken beansprucht, effektiv verborgen wird.

Die Auswirkung dieser Änderung ist dramatisch. In ihren Tests fanden die Forscher heraus, dass diese Streaming-Methode die Zeit, die zur Generierung einer einzelnen Aktion benötigt wird, im Vergleich zum Standardansatz um bis zu zwanzigmal reduzierte. Auf einer einzelnen Grafikkarte erreichte das System eine Steuerungsfrequenz von mindestens dreißig Mal pro Sekunde – eine Geschwindigkeit, die für einen menschlichen Beobachter unmittelbar wirkt. Wichtiger noch: Diese Geschwindigkeit ging nicht zu Lasten der Genauigkeit. Da das System diese Bewegungsstücke gemeinsam verarbeitet, lernen die zukünftigen Schritte natürlich von den Schritten, die gerade jetzt stattfinden sollen. Dies erzeugt eine glatte, kontinuierliche Bewegung und vermeidet die ruckartigen, abgehackten Bewegungen, die oft Roboter plagen, die versuchen, auf alten Informationen zu reagieren. In simulierten Umgebungen und realen Tests mit Roboterarmen erreichte das neue System die Erfolgsrate der langsameren, traditionellen Modelle oder übertraf sie sogar, während es signifikant schneller lief.

Die Forscher entdeckten auch, dass diese Methode Roboter bei langen, komplexen Aufgaben überraschend besser macht. Wenn ein Roboter eine Sequenz von Aktionen durchführen muss, die lange dauert, hilft ihm die Fähigkeit des neuen Systems, in die Zukunft zu blicken und die unmittelbare Vergangenheit zu berücksichten, um auf Kurs zu bleiben. In einem Testlauf mit Langzeitaufgaben (Long-Horizon-Tasks) stieg die Erfolgsrate im Vergleich zur bisher besten Methode um mehr als sechsunddreißig Prozentpunkte. Dies deutet darauf hin, dass die Art und Weise, wie das System seine aktuellen Handlungen mit seinen zukünftigen Plänen verbindet, eine Art Kurzzeitgedächtnis schafft, das dem Roboter hilft, komplizierte Sequenzen zu durchlaufen, ohne den Faden zu verlieren. Das Team testete diese Ideen an verschiedenen Roboter-Setups, einschließlich Einarm- und Zweiarm-Systemen, und stellte fest, dass die Verbesserungen bei Geschwindigkeit und Geschmeidigkeit über verschiedene Hardware und verschiedene Arten von Aufgaben hinweg Bestand hatten.

Was diese Arbeit besonders bedeutsam macht, ist, dass sie zwei Probleme gleichzeitig löst: die Langsamkeit der Berechnung und die Diskrepanz zwischen dem, was der Roboter sieht, und dort, wo er sich tatsächlich befindet. Frühere Versuche, die Langsamkeit zu beheben, führten oft dazu, dass der Roboter auf veralteten Daten agierte, während Versuche, die Daten-Diskrepanz zu beheben, oft komplexe Zusatzberechnungen erforderten, die den Roboter wieder verlangsamten. FlashVLA hebt diesen Zielkonflikt auf, indem es den Denkprozess selbst als kontinuierlich strukturiert. Die Forscher zeigten, dass sie allein durch die Änderung der Art und Weise, wie der Roboter seine Bewegungspläne verarbeitet – indem sie einen rollierenden Puffer von Plänen in verschiedenen Stadien der Bereitschaft halten –, ein Maß an Fluidität erreichen konnten, das zuvor unerreichbar war. Das Ergebnis ist ein Roboter, der schnell reagieren, sich geschmeidig bewegen und komplexe Manipulationsaufgaben mit einer Zuverlässigkeit bewältigen kann, die den Traum von agiler, realer Automatisierung einen Schritt näher bringt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →