← Neueste Arbeiten
💻 computer science

A Sim-to-Real Integration Pipeline for Training and Deployment of Chunk-Based VLA Manipulation Policies

Dieses Paper präsentiert eine Open-Source-Sim-to-Real-Pipeline, die den Engpass der Datenknappheit beim Training von Chunk-basierten Vision-Language-Action (VLA)-Manipulations-Policies adressiert, indem sie Experten-Simulations-Trajektorien auf echter Hardware abspielt, um gepaarte Datensätze zu generieren, was ein effizientes Training und Evaluieren der Policy sowie eine direkte Messung des Sim-to-Real-Gaps ermöglicht.

Ursprüngliche Autoren: Mathilde Kappel, Clémence Grislain, Mohamed Chetouani, Olivier Sigaud, Louis Annabi, Fa\"ız Ben Amar, Stéphane Doncieux, Mahdi Khoramshahi

Veröffentlicht 2026-09-21
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Mathilde Kappel, Clémence Grislain, Mohamed Chetouani, Olivier Sigaud, Louis Annabi, Fa\"ız Ben Amar, Stéphane Doncieux, Mahdi Khoramshahi

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter sind seit langem Meister der Wiederholung und fähig, dieselbe präzise Bewegung tausende Male in einer Fabrik auszuführen. Doch ihnen beizubringen, die unordentliche, unvorhersehbare Welt eines menschlichen Zuhauses zu verstehen, hat sich als schwierig erwiesen. Die moderne Robotik wendet sich zunehmend einem neuen Ansatz zu, bei dem Maschinen durch Beobachten und Zuhören lernen und dabei kombinieren, was sie sehen, mit dem, was ihnen zu tun ist. Diese Methode, bekannt als Vision-Language-Action (Bild-Sprache-Aktion), ermöglicht es einem Roboter, eine visuelle Szene und eine gesprochene Anweisung wie „Bewege den roten Block“ aufzunehmen und diese direkt in eine physische Bewegung zu übersetzen. Die Herausforderung liegt darin, genügend Beispiele zu sammeln, um den Roboter zu lehren. Normalerweise erfordert dies, dass ein Mensch den Roboterarm bei jeder Aufgabe physisch durch die Bewegung führt – ein Prozess, der langsam, teuer und schwer skalierbar ist. Zudem treten häufig Probleme auf, wenn Forscher versuchen, Roboter in einer Computersimulation zu trainieren und sie dann in die reale Welt zu überführen, da die digitale Welt zu perfekt ist. Die Lücke zwischen der Simulation und der Realität wird selten präzise gemessen, was Wissenschaftler unsicher lässt, ob ein Fehlschlag auf einen schlechten „Roboter-Geist“ oder einfach darauf zurückzuführen ist, dass der reale Tisch zu rutschig ist.

Ein Team von Forschern am Institut für Intelligente Systeme und Robotik in Paris hat einen neuen Weg entwickelt, um diese Kluft zu überbrücken. Anstatt sich auf menschliche Lehrer oder ungetestete Simulationen zu verlassen, entwickelten sie ein System, das einen computergenerierten Experten nutzt, um einen echten Roboter zu unterrichten. In ihrem Versuchsaufbau plant ein virtueller Roboterarm in einer Simulation einen perfekten Pfad, um einen Würfel zu schieben. Dieser digitale Plan wird dann an einen echten Franka FR3-Roboterarm in einem Labor gesendet. Der echte Roboter versucht, dem digitalen Plan exakt zu folgen, ohne menschliche Anleitung oder Echtzeit-Korrekturen. Während er sich bewegt, zeichnet das Team auf, was der echte Roboter sieht und fühlt, wodurch einen Datensatz erstellen, in dem die „richtige“ Antwort aus der Simulation stammt, die „Erfahrung“ jedoch aus der realen Welt kommt. Dies ermöglicht es ihnen, neue Roboter-Policies (Verhaltensregeln) unter Verwendung von realen Daten zu trainieren, ohne den Aufwand der menschlichen Teleoperation. Entscheidend ist, dass sie genau wissen, welchen Pfad der Roboter hätte nehmen sollen, wodurch sie die Differenz zwischen dem Plan und der Realität mit hoher Präzision messen können.

Die Forscher testeten diese Methode, indem sie den echten Roboter 200 verschiedene simulierte Trajektorien nachspielen ließen, bei denen jeweils ein Würfel entweder nach links oder rechts geschoben wurde. Sie fanden heraus, dass der echte Roboter dem digitalen Plan mit bemerkenswerter Genauigkeit folgte. Im Durchschnitt wich der Pfad, den der echte Arm nahm, um weniger als einen Zentimeter vom beabsichtigten Pfad ab. Die größten Fehler traten nur auf, wenn der Roboter das Objekt berührte, wo die reale Physik von Reibung und Gewicht – die im Computer nicht perfekt modelliert waren – zu leichten Abweichungen führte. Trotz dieser winzigen Fehler schloss der Roboter jede einzelne der 200 Aufgaben erfolgreich ab. Dies bewies, dass die physische Lücke zwischen der Simulation und der realen Welt klein genug war, um bewältigt zu werden, und dass das System automatisch qualitativ hochwertige Trainingsdaten generieren kann.

Um zu beweisen, dass das System End-to-End funktioniert, nutzte das Team die gesammelten Daten, um eine neue Roboter-Policy von Grund auf neu zu trainieren. Sie brachten einem Modell namens ORCHID bei, dieselben Würfel-Schiebe-Aufgaben unter Verwendung der 200 gesammelten realen Beispiele auszuführen. Als sie diesen neu selbstständig gelernten Roboter in einem geschlossenen Regelkreis testeten – wobei er die Szene betrachten, entscheiden, was zu tun ist, und dementsprechend agieren musste – gelang ihm dies in 6 von 20 Versuchen. Die Forscher merkten an, dass diese niedrigere Erfolgsquote wahrscheinlich auf die geringe Menge an Trainingsdaten und Variationen in der Beleuchtung zurückzuführen war und nicht auf einen grundlegenden Fehler der Methode. Das Experiment diente als Proof of Concept und demonstrierte, dass ein Roboter mit realen Daten trainiert werden kann, die durch eine Simulation generiert wurden, und dass derselbe Software-Stack sowohl zur Datenerfassung als auch zum Betrieb des finalen Roboters verwendet werden kann.

Die Studie verdeutlicht, dass die größten Herausforderungen beim Übergang von Computern in die reale Welt nicht in der übergeordneten Planung liegen, sondern in den spezifischen physischen Interaktionen. Die Fehler waren nicht zufällig; sie traten konsistent auf, wenn der Roboter Kontakt mit dem Objekt hatte, was darauf hindeutet, dass bessere Modelle für Objektgewicht und Tischreibung die Leistung mehr verbessern würden als eine Verfeinerung der Roboterbewegung im leeren Raum. Durch die Bereitstellung eines Open-Source-Protokolls und eines Datensatzes aus gepaarten simulierten und realen Trajektorien haben die Forscher der Fachwelt ein Werkzeug an die Hand gegeben, um diese physischen Diskrepanzen zu messen und zu verringern. Ihre Arbeit zeigt, dass es möglich ist, riesige Mengen an realen Trainingsdaten ohne menschliches Eingreifen zu generieren, vorausgesetzt, das System ist so konzipiert, dass es die kleinen Unterschiede zwischen dem digitalen Plan und der physischen Realität misst und berücksichtigt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →