← Neueste Arbeiten
💻 computer science

ICI-VLA: In-Context Imitation with Spatiotemporally Aligned Demonstrations for Vision-Language-Action Models

ICI-VLA ist ein Trainings- und Retrieval-Framework, das es fixierten Vision-Language-Action-Modellen ermöglicht, eine schnelle Few-Shot-Testzeit-Adaption zu erreichen, indem die Aktionsgenerierung auf spatiotemporal ausgerichteten, semantisch annotierten Mikro-Demonstrationen konditioniert wird, wodurch die Notwendigkeit zusätzlicher Gradienten-Updates eliminiert wird, während gleichzeitig mehrere Baselines in multiplen Benchmarks für die robotische Manipulation signifikant übertroffen werden.

Ursprüngliche Autoren: Songhua Yang (Wuhan University), Ziyu Liu (Wuhan University), Xuetao Li (Wuhan University), Ruqi Xiao (Wuhan University), Kangxin Zhu (Wuhan University), Miao Li (Institute of Technological Sciences
Veröffentlicht 2026-09-09
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Songhua Yang (Wuhan University), Ziyu Liu (Wuhan University), Xuetao Li (Wuhan University), Ruqi Xiao (Wuhan University), Kangxin Zhu (Wuhan University), Miao Li (Institute of Technological Sciences, Wuhan University)

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter haben lange Zeit damit gekämpft, neue Aufgaben schnell zu erlernen. Traditionelle Methoden erfordern oft, dass ein Roboter jedes Mal von Grund auf neu trainiert werden muss, wenn er vor einer neuen Aufgabe steht – ein Prozess, der enorme Mengen an Daten und Rechenleistung verlangt. Dies macht es schwierig, Roboter in sich verändernden Umgebungen einzusetzen, in denen sie sich spontan anpassen müssen. Ein neuerer Ansatz, bekannt als In-Context-Learning, bietet einen anderen Weg. Anstatt das „Gehirn“ des Roboters neu zu trainieren, ermöglicht diese Methode dem System, sich ein paar Beispiele dafür anzusehen, wie eine Aufgabe zuvor ausgeführt wurde, und diese Informationen zu nutzen, um zu entscheiden, was als Nächstes zu tun ist, ohne dabei seine internen Einstellungen zu ändern. Während diese Technik die Art und Weise, wie Computer Sprache und Bilder verstehen, revolutioniert hat, ist die Anwendung auf physische Roboter weita viel komplexer. Ein Roboter muss nicht nur eine visuelle Szene und eine gesprochene Anweisung verstehen, sondern auch seine eigenen Körperbewegungen in Echtzeit koordinieren, wobei bereits eine geringfügige Abweichung in Zeit oder Position zu einem Fehlschlag führen kann.

Forscher der Universität Wuhan haben ein neues Framework namens ICI-VLA entwickelt, das diese „Lernen aus Beispielen“-Fähigkeit erfolgreich auf Roboterarme überträgt. Ihr System ermöglicht es einem Roboter, einige kurze Videoclips einer ausgeführten Aufgabe zu beobachten und dieses Wissen dann sofort auf eine neue, ähnliche Situation anzuwenden. Die entscheidende Innovation liegt darin, wie das System die Beispiele handhabt. Anstatt dem Roboter ganze, lange Videos einer Aufgabe zuzuführen, zerlegen die Forscher diese Demonstrationen in winzige, beschriftete Segmente, die exakt zu bestimmten Momenten der aktuellen Aufgabe des Roboters passen. Sie trainieren dann ein spezialisiertes Suchwerkzeug, um genau das Segment zu finden, das mit dem übereinstimmt, was der Roboter gerade sieht, wodurch sichergestellt wird, dass der Roboter die richtige Bewegung zur richtigen Zeit kopiert. Um zu verhindern, dass der Roboter lediglich die Zahlenwerte in den Beispielvideos auswendig lernt, wird das System darauf trainiert, das genaue Ende des Beispiels zu ignorieren und stattdessen den aktuellen Blickwinkel zu fokussieren, was den Roboter dazu zwingt, die Aktion zu verstehen, anstatt sie nur stumpf zu wiederholen.

In ihren Experimenten testete das Team diesen Ansatz in zwei verschiedenen simulierten Umgebungen sowie an einem echten physischen Roboter mit zwei Armen. In der ersten Simulation, die eine Vielzahl von Aufgaben wie das Bewegen von Objekten und das Öffnen von Schubladen beinhaltete, erreichte das System eine Erfolgsquote von 97,7 Prozent. In einer zweiten, schwierigeren Simulation, die die Koordination zweier Arme erforderte, erreichte es 60,4 Prozent, was eine signifikante Verbesserung gegenüber bisherigen Methoden darstellt. Als sie das System auf einen realen Aufbau mit physischen Kameras und Roboterarmen übertrugen, absolvierte es Aufgaben wie das Sortieren von Objekten und das Platzieren von Gegenständen in Schubladen in 83,2 Prozent der Fälle erfolgreich. Diese Ergebnisse legen nahe, dass ein Roboter nicht für jeden neuen Job neu trainiert werden muss, wenn er die richtigen, gut abgestimmten Beispiele zur Hand hat, auf die er im Moment der Ausführung zurückgreifen kann.

Der Kern dieses Erfolgs liegt darin, wie das System den Informationsfluss verwaltet. Wenn ein Roboter eine lange Anweisung erhält, wie etwa „öffne die Schublade und lege die Schüssel hinein“, bricht das System diese in kleinere Schritte auf. Es durchsucht dann eine Bibliothek vergangener Erfahrungen, um kurze Clips zu finden, die zum aktuellen Schritt passen. Wenn der Roboter beispielsweise gerade versucht, eine Schublade zuzuschieben, findet das System einen kurzen Clip, in dem eine Schublade zugeschoben wird, anstatt einen Clip zu zeigen, in dem die Schublade geöffnet wird. Dies stellt sicher, dass der Robot relevante Informationen betrachtet. Die Forscher führten zudem eine Trainingstechnik ein, bei der Teile der Beispielaktionen während der Lernphase verborgen werden. Dies zwingt den Roboter dazu, sich auf das zu verlassen, was er gerade sieht und auf den allgemeinen Kontext der Aufgabe, anstatt die Zahlenwerte aus dem Beispielvideo nur blind zu kopieren. Dies verhindert, dass der Roboter verwirrt wird, wenn die Ausgangsposition leicht von der des Beispiels abweicht.

Die Studie unterstreicht, dass die Qualität der Beispiele wichtiger ist als deren Quantität. Durch die sorgfältige Auswahl und Abstimmung dieser kurzen Demonstrationen auf die aktuelle Bewegungsphase des Roboters kann das System sofort reagend. Die Forscher fanden heraus, dass bereits drei Beispiele ausreichten, um die Spitzenleistung zu erzielen; das Hinzufügen weiterer Beispiele half nicht, sondern machte das System teilweise sogar weniger effektiv. Dies deutet darauf hin, dass der Roboter von wenigen, hochrelevanten Hinweisen profitiert, anstatt von einer Flut an Informationen. Das System arbeitet so, dass die Hauptsteuerungssoftware des Roboters fest und unverändert bleibt und nur sein Verhalten basierend auf den abgerufenen Beispielen angepasst wird. Dies bedeutet, dass der Roboter in neuen Situationen eingesetzt werden kann, ohne dass zeitaufwendige und teure Retraining-Sitzungen erforderlich sind.

Obwohl die Ergebnisse vielversprechend sind, merken die Forscher an, dass das System weiterhin auf eine gute Bibliothek vergangener Demonstrationen angewiesen ist, aus der es schöpfen kann. Wenn der Roboter auf eine Situation stößt, die völlig anders ist als alles in seiner Bibliothek, könnte er Schwierigkeiten haben, ein nützliches Beispiel zu finden. Zudem erfordert der Prozess des Aufbaus der Bibliothek und des Trainings des Suchwerkzeugs erhebliche Offline-Arbeit, bevor der Roboter eingesetzt werden kann. Dennoch zeigen die Ergebnisse einen klaren Weg auf, um Roboter flexibler zu machen. Indem sie vergangene Erfahrungen als Referenzleitfaden anstatt als starres Skript behandeln, können Roboter lernen, neue Herausforderungen mit einer Anpassungsfähigkeit zu bewältigen, die zuvor unerreichbar war. Die Arbeit legt nahe, dass die Zukunft der Robotersteuerung nicht darin liegen könnte, intelligentere Gehirne von Grund auf neu zu bauen, sondern ihnen beizubringen, aus den richtigen Beispielen zur richtigen Zeit zu lernen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →