← Neueste Arbeiten
💻 computer science

Cloak: Zero-Shot Cross-Embodiment Manipulation by Masking the End-Effector from the VLA

Das Papier stellt Cloak vor, eine Trainingsmethode, die es Vision-Language-Action-Modellen ermöglicht, durch das Maskieren des Endeffektors aus Handgelenks-Kameraansichten während des Trainings Zero-Shot Cross-Embodiment-Manipulation zu erreichen, wodurch ein Modell, das auf einem einzelnen Roboter trainiert wurde, ohne das Sammeln neuer Daten auf ungesehene Hardware generalisieren kann.

Ursprüngliche Autoren: Michael Piseno, Guy Tevet, C. Karen Liu

Veröffentlicht 2026-06-23
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Michael Piseno, Guy Tevet, C. Karen Liu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie bringen einem Roboter bei, wie man eine Tasse aufhebt. Sie zeigen ihm ein Video aus dem „Auge“ des Roboters (einer Kamera am Handgelenk). Das Problem ist, dass in diesem Video die eigene Hand des Roboters (der Greifer) einen riesigen Teil des Bildschirms einnimmt.

Wenn Sie einen Roboter mit einer spezifischen Art von Hand trainieren – zum Beispiel einem einfachen zweifingrigen Greifer –, lernt er, diese spezifische Form zu erkennen. Wenn Sie dann die Hand dieses Roboters gegen eine völlig andere Hand austauschen, etwa eine menschenähnliche Hand mit fünf Fingern, wird der Roboter verwirrt. Es ist, als würde man jemandem das Autofahren beibringen, indem man ihm nur das Lenkrad eines Fords zeigt. Wenn man ihn plötzlich in einen Tesla mit einem anderen Lenkrad setzt, gerät er vielleicht in Panik, weil die visuelle „Landkarte“ in seinem Gehirn nicht mit dem übereinstimmt, was er sieht.

Das Problem: Die Ablenkung durch die „Hand“
In der Welt der Robotik ist das Sammeln von Daten teuer und zeitaufwendig. Wir verfügen über riesige Bibliotheken von Daten, die zeigen, wie Roboter mit zweifingrigen Greifern Aufgaben ausführen. Aber die Zukunft der Robotik bewegt sich in Richtung komplexer, mehrfingriger Hände. Wir wollen unsere alten Daten nutzen, um diese neuen Hände zu lehren, aber die Hand des alten Roboters sieht der neuen völlig anders aus. Das Gehirn des Roboters ist zu sehr auf die spezifische Form der alten Hand fixiert, um die neue zu verstehen.

Die Lösung: „Cloak“
Das Paper stellt einen cleveren Trick namens Cloak vor. Denken Sie an Cloak als eine digitale „Augenbinde“ oder einen „Maulkorb“ für die Sicht des Roboters.

  1. Die Hand verstecken: Anstatt den Roboter die eigene Hand im Kamerabild sehen zu lassen, übermalt Cloak die Hand digital mit einer Maske. Es ist, als würde man ein Stück Klebeband über den Teil des Kameraobjektivs kleben, an dem die Hand erscheint.
  2. Die Szene lernen, nicht die Hand: Durch das Verstecken der Hand wird der Roboter gezwakt, auf den Rest der Welt zu schauen – den Tisch, die Tasse, die Hindernisse. Er lernt die Logik der Aufgabe (z. B. „bewege dich vorwärts, bis ich die Tasse berühre“), ohne durch die spezifische Form seiner eigenen Finger abgelenkt zu werden.
  3. Das „Chamäleon“-Training: Um sicherzustellen, dass der Roboter nicht einfach nur lernt, eine spezifische Form von Klebeband zu ignorieren, ändern die Forscher während des Trainings zufällig die Form der „Augenbinde“. Manchmal ist die Maske groß, manchmal klein, manchmal seltsam geformt. Dies lehrt den Roboter, dass seine Hand morgen vielleicht anders aussehen kann, und dass er sich daher nicht darauf verlassen sollte, sie zu sehen.

Wie es in der Praxis funktioniert
Wenn der Roboter tatsächlich die Arbeit verrichtet:

  • Die Augen: Das Kamerabild enthält zwar noch die Hand, aber die Software bedeckt die Hand sofort mit einer digitalen Maske, bevor das Gehirn des Roboters sie sieht.
  • Das Gehirn: Das Gehirn des Roboters sieht ein maskiertes Bild und einen Textbefehl wie „hebe die Tasse auf“. Es berechnet die Bewegung basierend auf der Umgebung.
  • Der Körper: Sobald das Gehirn entscheidet: „Bewege meine Fingerspitzen zu diesem Punkt“, übersetzt ein Übersetzer (ein sogenanntes „Tip-Pose Retargeting“) diese Anweisung in die spezifischen Muskelbewegungen, die für die neue Hand nötig sind. Wenn die neue Hand fünf Finger hat, findet das System heraus, wie es diese fünf Finger bewegen muss, um dem Zweifinger-Plan zu entsprechen.

Die Ergebnisse
Die Forscher testeten dies, indem sie einen Roboter auf einem einfachen zweifingrigen Greifer mit bestehenden Daten trainierten. Dann versuchten sie, dieses trainierte Gehirn auf drei völlig andere Roboter anzuwenden, die es zuvor noch nie gesehen hatte:

  1. Einen anderen zweifingrigen Greifer (andere Farbe und Form).
  2. Einen völlig anderen Roboterarm.
  3. Eine komplexe, menschenähnliche Hand mit fünf Fingern.

Das Ergebnis:

  • Ohne Cloak: Der Roboter scheiterte kläglich an den neuen Händen. Er war verwirrt, weil die visuelle „Landkarte“ nicht übereinstimmte.
  • Mit Cloak: Der Roboter funktionierte bei den neuen Händen fast so gut wie beim ursprünglichen Modell. Er konnte seine Fähigkeiten „Zero-Shot“ übertragen (was bedeutet, dass er keine neuen Trainingsdaten für die neuen Hände benötigte).

Das Wichtigste in Kürze
Cloak beweist, dass man das „Gehirn“ eines Roboters (die Geschicklichkeit bei einer Aufgabe) von seinem „Körper“ (der spezifischen Hardware) trennen kann. Indem man den Körper während des Lernens der Sicht des Gehirns verbirgt, können die an einem Roboter gesammelten Daten in der Zukunft auch auf völlig andere Roboter übertragen werden. Es ist, als würde man einem Menschen das Schwimmen beibringen, indem man ihm eine Augenbinde umbindet, damit er sich auf die Bewegung des Wassers konzentriert, anstatt auf seine eigenen Gliedmaßen; sobald er den Rhythmus des Wassers gelernt hat, kann er mit jeder Art von Flossen schwimmen.

Einschränkungen
Das Paper merkt an, dass dies am besten für Aufgaben funktioniert, die durch das Platzieren von zwei Punkten (wie zwei Fingerspitzen) auf einem Objekt durchgeführt werden können. Es löst noch nicht komplexe Aufgaben, die eine komplizierte Manipulation innerhalb der Hand erfordern (wie das Jonglieren eines Balls in einer Hand), da diese stark von der spezifischen Haptik und Form der Finger abhängen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →