← Neueste Arbeiten
🤖 machine learning

Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model

Dynin-Robotics führt ein omnimodales, vereinheitlichtes Diffusionsmodell ein, das Sprache, Vision und Aktionen als diskrete Token behandelt, um die Zielvorhersage, die Dynamikmodellierung und die Aktionsgenerierung gemeinsam zu erlernen, wobei durch gemeinsame Trajektorienmodellierung und Testzeit-Skalierung eine wettbewerbsfähige Leistung auf mehreren Benchmarks erreicht wird.

Ursprüngliche Autoren: Hoeun Lee, Jaeik Kim, Jusang Oh, Jinhyeok Kim, Geon Choi, Hyeonggeun Kim, Jaeyoung Do

Veröffentlicht 2026-09-14
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Hoeun Lee, Jaeik Kim, Jusang Oh, Jinhyeok Kim, Geon Choi, Hyeonggeun Kim, Jaeyoung Do

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter haben lange Zeit damit gekämpft, die Welt so zu verstehen, wie Menschen es tun. Während eine Maschine darauf programmiert werden kann, ihren Arm zu einer bestimmten Koordinate zu bewegen, scheitert sie oft, wenn die Aufgabe eine vage Anweisung wie „Reich mir etwas, um das Paket aufzuschneiden“ erfordert. Um dies zu lösen, bauen Forscher Systeme auf, die Sprache, Sehen und physische Bewegung in einem einzigen Gehirn vereinen. Diese Systeme, bekannt als Vision-Language-Action-Modelle, versuchen nicht nur zu lernen, was ein Objekt ist, sondern auch, wie es sich verhält und wie man es manipuliert. Die Herausforderung bestand darin, dass die meisten aktuellen Ansätze diese Fähigkeiten getrennt behandeln: Ein Teil des Systems erkennt vielleicht die Wörter, ein anderer das Bild und ein dritter berechnet die Motorbefehle. Diese Trennung führt oft dazu, dass der Roboter verwirrt ist, wenn sich die reale Welt verändert oder die Anweisungen auf unerwartete Weise formuliert sind.

Ein Forschungsteam der Seoul National University hat einen neuen Ansatz namens Dynin-Robotics vorgestellt, der diese getrennten Fähigkeiten in einem kohärenten Modell vereint. Anstatt ein Robotergehirn mit verschiedenen Modulen für verschiedene Aufgaben zu bauen, haben sie ein einzelnes System geschaffen, das lernt, die Zukunft auf vielfältige Weise gleichzeitig vorherzusagen. Stellen Sie sich einen Roboter vor, der bei einer Aufgabe nicht nur den nächsten Schritt berechnet, sondern sich auch vorstellt, wie die Szene nach diesem Schritt aussehen wird, wie der endgültige Zielzustand aussehen sollte und wie man die Aufgabe in Worten beschreiben kann. Durch das Training eines einzelnen Modells, das alle diese Vorhersagen gleichzeitig bewältigt, stellten die Forscher fest, dass der Roboter viel besser darin wird, Anweisungen zu befolgen, selbst wenn diese anders formuliert sind, als er es während des Trainings gelernt hat.

Der Kern dieses Systems ist eine Methode namens Masked Diffusion. Vereinfacht ausgedrückt ist dies ein Lernprozess, bei dem dem Modell eine Sequenz von Informationen gezeigt wird – wie etwa ein Video einer Aufgabe, eine schriftliche Anweisung und die Bewegungen des Roboters –, wobei einige Teile dieser Sequenz verborgen oder „maskiert“ sind. Die Aufgabe des Modells besteht darin, die sichtbaren Teile zu betrachten und zu erraten, was die verborgenen Teile sein sollten. Zum Beispiel sieht es vielleicht ein Bild eines Bechers und die Worte „Hebe den Becher auf“, aber die Bewegungsdaten sind verborgen, sodass es die korrekte Bewegung vorhersagen muss. In einem anderen Szenario sieht es die Bewegung und die Anweisung, aber das fertige Bild des Bechers in der Hand ist verborgen, sodass es das Ergebnis vorhersagen muss. Durch das Üben dieser verschiedenen Arten von Ratespielen an einem massiven Datensatz von über 1,3 Millionen Roboter-Trajektorien lernt das Modell ein tiefes Verständnis dafür, wie Sprache, Sehen und Handeln miteinander verbunden sind.

Was diesen Ansatz einzigartig macht, ist, dass dasselbe Modell augenblicklich zwischen diesen verschiedenen Rollen wechseln kann. Es kann als Policy agieren, die entscheidet, welche Aktion als Nächstes zu treffen ist; als Weltmodell, das vorhersagt, was die Kamera nach einer Aktion sehen wird; als Ziel-Prädiktor, der den erfolgreichen Endzustand visualisiert; oder als Lehrer, der die ursprüngliche Anweisung aus einem Video der Roboterarbeit rekonstruiert. Diese Flexibilität ermöglicht es dem System, seine eigenen Vorhersagen zur Verbesserung seiner Leistung zu nutzen. Beispielsweise kann der Roboter, bevor er entscheidet, wie er seinen Arm bewegt, zuerst vorhersagen, wie der Zielzustand aussieht. Er nutzt dann diesen vorhergesagten Zielzustand als Leitfaden, um seinen Aktionsplan zu verfeinern. Dieser Prozess des Vorausblickens und des Echtzeit-Anpassens des Plans hilft dem Roboter, komplexe Aufgaben zu bewältigen, die eine präzise Ausrichtung erfordern, wie etwa das Einführen einer Blume in eine Vase oder das Stapeln von Blöcken in einer bestimmten Reihenfolge.

Die Forscher testeten dieses System auf einer Vielzahl von Benchmarks, um zu sehen, wie gut es im Vergleich zu anderen führenden Robotermodellen abschneidet. Bei Standard-Simulationsaufgaben erreichte das Modell eine Erfolgsquote von 98,1 % und gehört damit zu den leistungsstärksten Modellen auf diesem Gebiet. Wichtiger noch: Als das System mit Aufgaben getestet wurde, bei denen die Anweisungen indirekter oder abstrakter formuliert waren, zeigte es eine signifikante Anpassungsfähigkeit. In einem Satz von Experimenten wurde das Modell mit einer Aufgabe getestet, bei der es eine Frucht basierend auf einer Beschreibung wie „etwas natürlich Süßes und Saftiges“ auswählen musste, anstatt eines direkten Befehls wie „Hebe den Apfel auf“. Während andere Modelle bei diesen sprachlichen Verschiebungen Schwierigkeiten hatten, behielt Dynin-Robotics eine hohe Erfolgsquote bei, was zeigt, dass es das zugrunde liegende Konzept der Aufgabe gelernt hat und nicht nur spezifische Phrasen auswendig gelernt hat.

Das System erwies sich auch in der realen Welt als effektiv. Die Forscher setzten das Modell auf einem physischen Roboterarm namens Franka Research 3 ein. In einer Reihe von realen Tests, die das Aufheben von Obst, das Sortieren farbiger Würfel und das Stapeln in einer bestimmten Reihenfolge beinhalteten, erreichte der Roboter eine durchschnittliche Erfolgsquote von 78,4 % über vier verschiedene Manipulationsbedingungen hinweg. Diese Leistung war besonders stark bei Aufgaben, die das Befolgen einer Sequenz von Schritten erforderten, wie etwa das Stapeln von Würfeln in einer vom Benutzer spezifizierten Farbreihenfolge. Die Fähigkeit, das Ziel und die Zwischenschritte zu visualisieren, ermöglichte es dem Roboter, seinen Kurs zu korrigieren, falls er einen Fehler machte – eine Fähigkeit, die einfacheren Systemen oft fehlt.

Über die Fähigkeit zur Steuerung eines Roboters hinaus zeigte das Modell eine überraschende Kapazität für das Verständnis und die Generierung von Beschreibungen. Wenn ihm ein Video eines Roboters gezeigt wurde, der eine Aufgabe ausführt, konnte das System genau beschreiben, was geschah, indem es Verben wie „greifen“, „platzieren“ und „falten“ verwendete und Objekte durch ihre Farbe und Position identifizierte. Umgekehrt konnte es bei einer Aufgabenbeschreibung eine visuelle Vorhersage dessen generieren, wie die endgültige Szene aussehen würde. Diese Fähigkeiten legen nahe, dass das Modell eine reiche, interne Repräsentation der physischen Welt aufgebaut hat, die über einfache Motorsteuerung hinausgeht.

Um dieses System schnell genug für den Echtzeitgebrauch zu machen, entwickelten die Forscher auch eine spezialisierte Methode zur Ausführung des Modells. Da das Modell dadurch arbeitet, dass es seine Vermutungen iterativ verfeinert, kann es langsam sein, wenn es jeden einzelnen Schritt nacheinander verarbeiten muss. Das Team entwickelte eine Technik, die es dem Modell ermöglicht, mehrere Schritte der Bewegung gleichzeitig vorherzusagen und festzulegen. Diese Optimierung beschleunigte den Entscheidungsprozess des Roboters um fast das 30-fache im Vergleich zur Standardmethode, was es ermöglicht, das komplexe Modell auf Hardware laufen zu lassen, die mit der Geschwindigkeit eines physischen Roboters mithalten kann.

Die Ergebnisse dieser Arbeit legen nahe, dass die Behandlung des Roboterlernens als einheitliches Vorhersageproblem eine leistungsstarke Strategie ist. Durch die Kombination der Fähigkeit, Sprache zu verstehen, visuelle Veränderungen vorherzusagen und Aktionen zu generieren, in einem einzigen Framework haben die Forscher ein System geschaffen, das robuster und anpassungsfähiger ist als bisherige Modelle. Der Erfolg von Dynin-Robotics deutet darauf hin, dass ein Roboter, der die Zukunft imaginieren und den Kontext einer Aufgabe verstehen kann, wesentlich besser in der Lage ist, die Unvorhersehbarkeit der realen Welt zu bewältigen. Obwohl noch Arbeit zu leisten bleibt, insbesondere bei der Erweiterung dieser Fähigkeiten auf längere und komplexere Aktionssequenzen, bietet dieser Ansatz einen vielversprechenden Weg zu Robotern, die ihre Umgebung wirklich verstehen und mit ihr interagieren können.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →