← Neueste Arbeiten
💻 computer science

LACE: Latent Visual Representation for Cross-Embodiment Learning

LACE ist ein Framework, das die visuelle Lücke zwischen menschlichen und robotischen Erscheinungsformen überbrückt, indem es ihre latenten visuellen Darstellungen durch spärliche, automatisch generierte Korrespondenzen von Körperteilen ausrichtet und es Robotern ermöglicht, auch bei knappen roboterspezifischen Trainingsdaten reichlich vorhandene menschliche Demonstrationsdaten effektiv für das Erlernen von Strategien zu nutzen.

Ursprüngliche Autoren: Yoo Sung Jang, Kanchana Ranasinghe, Cristina Mata, Yichi Zhang, Jorge Mendez-Mendez, Michael S. Ryoo

Veröffentlicht 2026-05-19
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Yoo Sung Jang, Kanchana Ranasinghe, Cristina Mata, Yichi Zhang, Jorge Mendez-Mendez, Michael S. Ryoo

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen einem Roboter beizubringen, wie man ein Spielzeug aufnimmt. Sie haben Tausende von Videos, auf denen Menschen dies perfekt ausführen, aber nur eine Handvoll Videos, auf denen der Roboter es tut.

Das Problem besteht darin, dass Menschen und Roboter sehr unterschiedlich aussehen. Eine menschliche Hand hat Haut, Falten und fünf Finger, die sich auf bestimmte Weise biegen. Eine Roboterhand könnte aus Metall bestehen, vier Finger haben oder wie eine Klaue aussehen. Da sie so unterschiedlich aussehen, gerät das „Gehirn" des Roboters (seine Computervision) in Verwirrung. Es sieht eine menschliche Hand in einem Video und denkt: „Das ist ein Mensch", aber wenn es seine eigene Metallhand sieht, denkt es: „Das ist etwas ganz anderes." Es kann die beiden nicht miteinander verbinden und kann daher nicht aus den menschlichen Videos lernen.

Diese Arbeit stellt eine Lösung namens LACE (Latent Alignment for Cross-Embodiment Learning) vor. So funktioniert es, unter Verwendung einfacher Analogien:

1. Das „Sprach"-Problem

Stellen Sie sich das Gehirn des Roboters als einen Schüler vor, der eine komplexe Sprache namens „Latenter Raum" spricht. Diese Sprache wird verwendet, um zu beschreiben, was es sieht.

  • Das Problem: Wenn der Roboter auf eine menschliche Hand schaut, beschreibt er sie in einem Dialekt dieser Sprache. Wenn er auf seine eigene Metallhand schaut, beschreibt er sie in einem völlig anderen Dialekt. Obwohl beide „Hände" sind, denkt der Roboter, es handele sich um nicht miteinander verwandte Wörter.
  • Das Ergebnis: Der Roboter ignoriert die menschlichen Videos, weil er den „Dialekt", in dem der Mensch spricht, nicht versteht.

2. Die LACE-Lösung: Ein universeller Übersetzer

LACE fungiert wie ein universeller Übersetzer, der dem Roboter beibringt, für menschliche und robotische Hände denselben Dialekt zu sprechen.

Anstatt zu versuchen, die Kamerabilder des Roboters exakt wie menschliche Fotos aussehen zu lassen (was schwierig ist und oft scheitert), arbeitet LACE innerhalb des Roboterhirns. Es sagt: „Hey, auch wenn der menschliche Daumen und der Roboter-Daumen unterschiedlich aussehen, erfüllen sie denselben Zweck. Stellen wir sicher, dass das Gehirn des Roboters sie mit exakt demselben internen Code beschreibt."

3. Wie es lernt: Der Trick mit den „gemeinsamen Teilen"

Um diesen Übersetzer zu unterrichten, benötigen Sie keine Tausende von Robotervideos. Sie benötigen nur ein einziges Video, auf dem sich der Roboter bewegt, sowie einige vorhandene Videos von Menschen.

  • Die Karte: Das System verwendet eine „Karte" von Körperteilen. Es weiß, dass ein menschlicher Daumen einem Roboter-Daumen entspricht, ein menschliches Handgelenk einem Roboter-Handgelenk usw.
  • Die Lektion: Es nimmt ein Bild einer menschlichen Hand und ein Bild einer Roboterhand. Es zeigt auf den Daumen in beiden Bildern und sagt: „Diese beiden Pixel müssen für das Gehirn des Roboters dasselbe bedeuten."
  • Die Magie: Es passt das Gehirn des Roboters so an, dass es beim Anblick eines Roboter-Daumen „das gleiche innere Gefühl" hat wie beim Anblick eines menschlichen Daumen.

4. Zwei Regeln für das Lernen

Die Arbeit erwähnt zwei spezifische Regeln, die das System befolgt, um sicherzustellen, dass es korrekt lernt, ohne alles andere zu vergessen:

  • Regel 1: Der „Vermittler" (Semantische Ausrichtungsverlust): Diese Regel zwingt den Roboter, menschliche und robotische Körperteile abzugleichen. Es ist wie ein Lehrer, der sagt: „Wenn Sie einen menschlichen Daumen sehen, müssen Sie an 'Daumen-Sein' genau so denken wie an einen Roboter-Daumen."
  • Regel 2: Der „Anker" (Gram-Verlust): Dies ist entscheidend. Wenn Sie dem Roboter nur über Daumen beibringen, könnte er vergessen, wie man einen Becher oder einen Stuhl erkennt. Die „Anker"-Regel sagt: „Behalten Sie Ihr allgemeines Wissen über die Welt (wie ein Tisch aussieht) genau so bei wie zuvor. Ändern Sie nur, wie Sie über Hände denken." Dies verhindert, dass der Roboter über alles andere verwirrt wird.

5. Die Ergebnisse: Von Null zum Helden

Die Forscher testeten dies in der realen Welt:

  • Ohne LACE: Wenn sie dem Roboter keine Roboterschulungsvideos gaben und nur menschliche Videos, scheiterte der Roboter fast 100 % der Zeit. Er konnte nicht herausfinden, wo seine eigene Hand war.
  • Mit LACE: Unter Verwendung desselben Aufbaus (keine Robotervideos) gelang dem Roboter in 60 % der Fälle der Erfolg. Er konnte sich ein menschliches Video ansehen, die Aktion verstehen und sie erfolgreich auf seine eigene Metallhand anwenden.
  • Geringe Datenmenge: Selbst wenn sie dem Roboter nur eine winzige Menge seines eigenen Videos gaben (nur 10 % dessen, was normalerweise benötigt wird), half LACE ihm, viel besser zu performen als zuvor.

Zusammenfassung

LACE ist eine Methode, die Robotern beibringt, Menschen und Roboter nicht länger als zwei verschiedene Spezies zu betrachten. Indem es dem Gehirn des Roboters beibringt, denselben „internen Code" für gemeinsame Körperteile (wie Daumen und Handgelenke) zu verwenden, ermöglicht es Robotern, komplexe Fähigkeiten aus der riesigen Menge an menschlichen Videodaten zu erlernen, die im Internet verfügbar sind, selbst wenn sie noch nie einen Roboter bei dieser spezifischen Aufgabe gesehen haben. Es funktioniert mit sehr wenigen Daten und erfordert nicht, dass der Roboter wie ein Mensch aussieht.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →