← Neueste Arbeiten
💻 computer science

Cross-View Action Consistency for Camera-Robust Vision-Language-Action Policies

Dieses Paper schlägt eine Methode zur konsistenten Ansichtsübergreifung vor, die auf Flow basierende Vision-Language-Action-Policies reguliert, um mittels ausschließlich RGB-Bildern und Propriozeption Robustheit gegenüber Änderungen der Szenen- und Kameraperspektiven zu erreichen, wodurch die Leistung sowohl bei simulierten als auch bei realen Roboteraufgaben signifikant verbessert wird, ohne dass Kamera-Labels oder Tiefeneingaben erforderlich sind.

Ursprüngliche Autoren: Bingqi Huang, Bingchuan Wei, Xuan Wang, Yingkai Cai, Zhaokui Wang

Veröffentlicht 2026-09-15
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Bingqi Huang, Bingchuan Wei, Xuan Wang, Yingkai Cai, Zhaokui Wang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter, die aus menschlichen Demonstrationen lernen, werden zunehmend leistungsfähiger, doch sie leiden oft unter einer merkwürdigen Fragilität: Sie sind an den spezifischen Blickwinkel gebunden, aus dem sie trainiert wurden. Stellen Sie sich einen Roboter vor, der darauf trainiert wurde, eine Tasse aufzuheben, während eine Kamera auf einem Regal über dem Tisch platziert ist. Wenn diese Kamera angestoßen, zur Seite verschoben oder höher gehoben wird, kann der Roboter plötzlich scheitern, obwohl sich die Tasse, der Tisch und der eigene Körper des Roboters überhaupt nicht bewegt haben. Dies geschieht, weil das „Gehirn“ des Roboters – eine Art künstliche Intelligenz, die verbindet, was er sieht, mit dem, was er tun soll – gelernt hat, die Aufgabe basend auf dem exakten Winkel der ursprünglichen Kamera zu erkennen. In der realen Welt werden Kameras angestoßen, Roboter bewegen sich und die Beleuchtung ändert sich; daher ist ein System, das sich nicht an einen verschobenen Blickwinkel anpassen kann, nicht wirklich nützlich. Forscher haben versucht, dies zu lösen, indem sie Robotern komplexere Sensoren gaben, wie etwa Tiefenkameras, die in 3D sehen, oder indem sie ihnen beibrachten, die Geometrie des Raumes zu verstehen, aber diese Lösungen erfordern oft teure Hardware oder eine komplexe Kalibrierung, die schwer aufrechtzuerhalten ist.

Ein Team von Forschern der Tsinghua-Universität und der Universität Amsterdam hat einen Weg gefunden, diese Roboter-Policies robust gegenüber Kamerabewegungen zu machen, ohne neue Sensoren hinzuzufügen oder die Art und Weise, wie der Roboter in der realen Welt operiert, zu verändern. Sie konzentrierten sich auf eine spezifische Art von Robotersteuerung, die lernt, indem sie einen „Fluss“ von Aktionen vorhersagt – ähnlich wie Wasser, das zu einem Ziel fließt –, anstatt nur die nächste Bewegung zu erraten. Der Kern ihrer Entdeckung ist eine Trainingsmethode, die den Roboter dazu zwingt, mit sich selbst übereinzustimmen. Sie erstellten Paare von Trainingsbildern, die dieselbe physische Szene aus zwei verschiedenen Winkeln zeigen: eines von der ursprünglichen Kameraposition und eines von einer leicht verschobenen Position aus. Entscheidend war, dass sie sicherstellten, dass dem Roboter für beide Bilder exakt dieselbe Aktion zugewiesen wurde. Indem sie den Roboter darauf trainierten, den gleichen Bewegungsfluss für beide Ansichten vorherzusagen, lehrten sie ihn, die Änderung der Kameraposition zu ignorieren und sich stattd�lich nur auf die eigentliche Aufgabe zu konzentrieren.

Die Forscher testeten diese Idee in einer simulierten Umgebung mit einem Benchmark namens LIBERO-Plus, das speziell darauf ausgelegt ist, zu prüfen, wie gut Roboter mit Kameraverschiebungen umgehen können. Sie verglichen ihre neue Methode mit Standard-Trainingsmethoden. Wenn die Kamera verschoben wurde, gelang einem mit Standardmethoden trainierten Roboter in nur etwa 17 % der Versuche. Ein Roboter, der mit vielen verschiedenen Kamerawinkeln ohne ihre spezielle Konsistenzregel trainiert wurde, verbesserte sich auf eine Erfolgsquote von etwa 75 %. Ein Roboter, der jedoch mit ihrer neuen Cross-View-Konsistenzregel trainiert wurde, erreichte eine Erfolgsquote von 87,2 %. Diese Verbesserung war signifikant und konsistent über verschiedene zufällige Startpunkte des Trainings hinweg. Die Forscher bewiesen auch, dass der Erfolg vollständig davon abhing, dass die beiden Bilder denselben physischen Zustand zeigten. Als sie die Trainingsdaten so durcheinanderbrachten, dass der Roboter versuchte, eine Ansicht einer Tasse mit einer Aktion zu verknüpfen, die für einen anderen Zustand bestimmt war, brach die Leistung auf nur 25,8 % ein. Dies zeigte, dass der Roboter nicht einfach nur seine Antworten glättete, sondern wirklich lernte, verschiedene Ansichten derselben Realität mit derselben Aktion zu verknüpfen.

Um sicherzustellen, dass dies nicht nur ein Ergebnis der Computersimulation war, übertrug das Team seine Methode auf einen echten Roboterarm in einem Labor. Sie sammelten Trainingsdaten mit drei synchronisierten Kameras, die denselben Tisch beobachteten, was es ihnen ermöglichte, die notwendigen Paare von Ansichten aus der realen Welt zu erstellen. Sie testeten den Roboter dann mit einer einzelnen Kamera, die in einer Position platziert war, die er während des Trainings noch nie gesehen hatte. Der mit ihrer neuen Methode trainierte Roboter war bei diesen ungesehenen Kameratests zu 74,4 % erfolgreich, während die Standardmethode nur 5-mal von 10 (53,3 %) Erfolg hatte. Die Verbesserung war am dramatischsten bei schwierigen Aufgaben, wie dem Entfernen von Kopfhörern von einem Ständer, bei denen die Standardmethode in den neuen Kamerapositionen völlig versagte, während die neue Methode in fast der Hälfte der Versuche erfolgreich war. Die Studie bestätigt, dass ein Roboter, indem man ihm beibringt, die Konsistenz seiner eigenen Aktionen über verschiedene Winkel hinweg zu sehen, wesentlich zuverlässiger in der realen Welt wird – und das alles, ohne zusätzliche Kameras, Tiefensensoren oder komplexe geometrische Karten zu benötigen. Der Roboter lernt schlichtweg, dass die Aufgabe dieselbe bleibt, auch wenn sich das Bild verändert.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →