← Neueste Arbeiten
💻 computer science

Phantom: Training Robots Without Robots Using Only Human Videos

Das Papier stellt „Phantom" vor, ein skalierbares Framework, das das Zero-Shot-Training von vielseitig einsetzbaren Manipulationsrobotern ausschließlich durch menschliche Videodemonstrationen ermöglicht, indem diese durch Handpose-Schätzung und visuelle Domänenanpassung in roboterkompatible Daten umgewandelt werden, wodurch hohe Erfolgsquoten bei diversen Aufgaben erreicht werden, ohne dass Roboterdaten oder Feinabstimmung erforderlich sind.

Ursprüngliche Autoren: Marion Lepert, Jiaying Fang, Jeannette Bohg

Veröffentlicht 2026-05-29
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Marion Lepert, Jiaying Fang, Jeannette Bohg

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie möchten einem Roboter beibringen, Hausarbeiten zu erledigen, wie zum Beispiel einen Boden zu kehren oder einen Knoten zu binden. Normalerweise müssen Sie, um einem Roboter etwas beizubringen, seinen Arm physisch halten und ihn Tausende Male durch die Bewegungen führen. Das ist so, als würde man versuchen, einem Kind das Fahrradfahren beizubringen, indem man es jeden Tag stundenlang durch die Nachbarschaft schiebt. Es ist langsam, teuer und für jede mögliche Aufgabe schwer durchzuführen.

Der Artikel „Phantom" schlägt einen cleveren Abkürzungsweg vor: Warum nicht einfach beobachten, wie Menschen Hausarbeiten erledigen, und so tun, als wäre der Roboter der Mensch?

Hier ist, wie sie es mit einfachen Analogien umgesetzt haben:

1. Der „magische Fotoeditor" (Datenbearbeitung)

Die Forscher stellten fest, dass Roboter zwar Millionen von Videos im Internet haben, in denen Menschen Dinge tun, diese aber nicht einfach „anschauen" können. Ein Roboter sieht die Welt anders als ein Mensch; er hat metallene Arme und Greifer, kein Fleisch und keine Finger. Wenn man einen Roboter auf einem Video eines Menschen trainiert, gerät der Roboter in Verwirrung, weil der „Lehrer" gar nicht wie der „Schüler" aussieht.

Um dies zu beheben, bauten die Autoren einen digitalen „magischen Fotoeditor". Hier ist der Prozess:

  • Schritt 1: Der Radiergummi. Sie nehmen ein Video, auf dem ein Mensch nach einem Objekt greift. Mithilfe von KI „radieren" sie den Arm und die Hand des Menschen digital aus und füllen den Hintergrund so auf, dass es so aussieht, als wäre der Arm nie da gewesen.
  • Schritt 2: Der Marionettenspieler. Sie verwenden ein Computerprogramm, um genau zu ermitteln, wo sich die Hand des Menschen bewegt hat.
  • Schritt 3: Der Tausch. Sie nehmen ein 3D-Modell eines Roboterarms und „kleben" es in das Video ein, wobei sie es exakt so bewegen, wie sich die Hand des Menschen bewegt hat.

Das Ergebnis ist ein Video, das so aussieht, als würde ein Roboter die Aufgabe erledigen, obwohl es tatsächlich mit einem Menschen gefilmt wurde. Sie nennen dies eine „Phantom"-Demonstration.

2. Der „Geist in der Maschine" (Zero-Shot-Bereitstellung)

Der überraschendste Teil ihrer Entdeckung ist, dass sie dem Roboter kein einziges echtes Video davon zeigen mussten, wie er die Aufgabe selbst erledigt. Sie trainierten den Roboter ausschließlich auf diesen bearbeiteten „Phantom"-Videos.

Stellen Sie es sich so vor: Wenn Sie lernen möchten, Tennis zu spielen, schauen Sie sich normalerweise einen Profi an. Aber wenn Sie ein Roboter mit einer anderen Körperform sind, könnte es verwirrend sein, einen Menschen zu beobachten. Diese Methode ist so, als würde man ein Video eines menschlichen Tennisspielers nehmen, seinen Körper digital durch einen Roboter-Körper ersetzen und dann den Roboter durch das Anschauen dieses bearbeiteten Videos zum Spielen anleiten.

Als sie dies an echten Robotern testeten (nämlich an einem Franka- und einem Kinova-Roboter), waren die Roboter in der Lage, Aufgaben ohne vorheriges Üben oder Nachjustieren auszuführen. Es war so, als würde der Roboter in den Raum gehen, die Aufgabe sehen und sofort wissen, was zu tun ist, nachdem er nur die bearbeiteten Menschenvideos „studiert" hatte.

3. Was konnte der Roboter tun?

Die Forscher testeten dies an einer Vielzahl kniffliger Aufgaben und bewiesen, dass die Methode auch funktioniert, wenn Dinge unordentlich oder flexibel sind:

  • Kehren: Einen Besen bewegen, um Müll in einen Staubsaugerbeutel zu schieben (was das Bewegen vieler loser Müllstücke beinhaltet, die unvorhersehbar herumhüpfen).
  • Knoten binden: Ein Seil in einen bestimmten Seglerknoten binden (was sehr schwierig ist, weil Seile schlaff sind und ihre Form ändern).
  • Stapeln: Vorsichtig Tassen stapeln, die leicht unterschiedliche Größen haben.
  • Drehen: Eine Kiste umdrehen, ohne sie einfach umzustoßen.

In vielen dieser Tests waren die Roboter bis zu 92 % der Zeit erfolgreich, sogar in Räumen, die sie noch nie zuvor gesehen hatten.

4. Warum dies wichtig ist (laut dem Artikel)

Der Artikel argumentiert, dass dieser Ansatz die größte Engstelle in der Robotik beseitigt: die Notwendigkeit teurer Roboterdaten.

  • Alter Weg: Sie benötigen einen Roboter, ein Labor und einen Menschen, der Stunden damit verbringt, den Roboter fernzusteuern (zu steuern), um Daten zu sammeln.
  • Neuer Weg (Phantom): Sie benötigen nur eine Kamera und einen Menschen. Sie können jeden, überall, bei der Erledigung einer Aufgabe filmen. Der Computer erledigt den Rest der Arbeit, um diese menschlichen Bewegungen in Roboteranweisungen zu übersetzen.

Die Autoren betonen, dass dies für eine „geschlossene Schleife"-Ausführung funktioniert, was bedeutet, dass der Roboter in Echtzeit auf Veränderungen reagieren kann (z. B. wenn sich der Müll unerwartet bewegt) und nicht nur einem vorab aufgezeichneten Skript folgt.

Was der Artikel nicht behauptet

Es ist wichtig, bei dem zu bleiben, was der Artikel tatsächlich sagt:

  • Sie behaupteten nicht, dass dies für jeden einzelnen Robotertyp oder jede mögliche Aufgabe funktioniert. Sie konzentrierten sich auf Aufgaben, bei denen ein Mensch einen „Pinzettegriff" verwenden kann (Dinge mit Daumen und Finger halten), was den Greifern der von ihnen verwendeten Roboter entspricht.
  • Sie behaupteten nicht, dass dies perfekt ist. Wenn die Hand des Menschen im Video verdeckt ist (okkludiert), könnte der Computer die Position der Hand falsch erraten, was den Roboter verwirren kann.
  • Sie behaupteten nicht, dass dies die Notwendigkeit von Robotern vollständig ersetzt; sie benötigen immer noch einen Roboter, um die Arbeit physisch zu verrichten. Sie haben lediglich die Notwendigkeit entfernt, Daten vom Roboter aufzuzeichnen.

Kurz gesagt, stellt der Artikel eine „Phantom"-Methode vor, bei der wir Roboter ausschließlich mit Videos von Menschen trainieren können, indem wir den menschlichen Körper im Filmmaterial digital durch einen Roboter-Körper austauschen, was es Robotern ermöglicht, komplexe Fähigkeiten zu erlernen, ohne jemals physisch an einem Roboter demonstriert werden zu müssen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →