← Neueste Arbeiten
💻 computer science

HoMMI: Learning Whole-Body Mobile Manipulation from Human Demonstrations

Das Paper stellt HoMMI vor, ein Framework, das durch roboterfreie menschliche Demonstrationen mit egozentrischer Sensorik und einer speziellen Cross-Embodiment-Architektur ganzheitliche mobile Manipulationsaufgaben erlernt und so die Lücke zwischen menschlicher Demonstration und robotischer Ausführung überbrückt.

Ursprüngliche Autoren: Xiaomeng Xu, Jisang Park, Han Zhang, Eric Cousineau, Aditya Bhat, Jose Barreiros, Dian Wang, Shuran Song

Veröffentlicht 2026-03-04
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Xiaomeng Xu, Jisang Park, Han Zhang, Eric Cousineau, Aditya Bhat, Jose Barreiros, Dian Wang, Shuran Song

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Ziel: Roboter, die wie Menschen lernen

Stell dir vor, du möchtest einem Roboter beibringen, wie man Wäsche macht, Pakete liefert oder eine Tischdecke glatt streicht. Früher musste man dafür einen Ingenieur anheuern, der den Roboter stundenlang per Fernsteuerung (Teleoperation) bewegt hat. Das ist teuer, langsam und langweilig.

Die Forscher von HoMMI (Whole-Body Mobile Manipulation Interface) haben sich einen cleveren Trick ausgedacht: Warum nicht einfach Menschen die Arbeit machen lassen und den Roboter zuschauen lassen?

Der erste Versuch: Die „Handgelenk-Brille" (UMI)

Bisher gab es ein System namens UMI. Dabei hält ein Mensch zwei spezielle Griffe in den Händen, an denen Kameras am Handgelenk befestigt sind. Der Roboter lernt dann nur, was diese Handgelenks-Kameras sehen.

  • Das Problem: Das ist wie wenn du einen Raum nur durch ein kleines Fernrohr betrachtest, das du direkt vor deine Augen hältst. Du siehst genau, was du anfassen willst, aber du siehst nicht, wo die Tür ist, wo der Stuhl steht oder ob jemand im Weg ist. Der Roboter kann sich also nicht gut im Raum orientieren.

Die Lösung: Die „Kopf-Brille" (HoMMI)

Die Forscher haben das System erweitert. Statt nur Handgelenk-Kameras nutzen sie jetzt auch eine Kamera auf dem Kopf des Menschen (wie eine GoPro auf einer Mütze).

  • Der Vorteil: Der Mensch sieht jetzt den ganzen Raum, kann den Kopf drehen, um hinter Ecken zu schauen, und sieht, wie die Hände im Verhältnis zum ganzen Raum liegen. Das ist wie der Unterschied zwischen einem Fernrohr und einem echten 360-Grad-Blick.

Das große Hindernis: Der „Körper-Unterschied"

Hier kommt das knifflige Teil. Wenn wir einem Roboter einfach zeigen, was ein Mensch mit seinem Kopf und seinen Armen tut, passiert ein Missverständnis:

  1. Der Körper ist anders: Ein Mensch hat einen langen Hals und kann ihn drehen. Ein Roboter hat vielleicht nur einen kurzen Hals oder gar keinen. Wenn der Roboter versucht, genau so zu schauen wie der Mensch, bricht er sich fast das „Genick" (oder fällt um).
  2. Die Perspektive ist anders: Ein Mensch ist groß, der Roboter klein. Was für den Menschen „ganz oben" aussieht, ist für den Roboter „ganz nah".

Wenn man das einfach so kopiert, scheitert der Roboter sofort. Er versucht, unmögliche Bewegungen auszuführen.

Der geniale Trick: Die „Ziel-Punkt"-Methode

Um dieses Problem zu lösen, haben die Forscher drei Dinge erfunden, die wie ein guter Dolmetscher zwischen Mensch und Roboter wirken:

  1. Die 3D-Karte (statt rohem Video): Anstatt dem Roboter das rohe Video vom Kopf des Menschen zu zeigen (wo Arme und Körper im Weg sind), bauen sie daraus eine 3D-Karte. Sie entfernen alles, was nur zum Menschen gehört (wie die Arme des Demonstranten), und zeigen dem Roboter nur die Objekte im Raum. Das ist wie wenn man einem Roboter eine Landkarte gibt, statt ihm ein Video von jemandem zu zeigen, der durch den Wald läuft.
  2. Der „Schau-hier"-Punkt: Statt dem Roboter zu sagen: „Dreh deinen Kopf genau 30 Grad nach links und 15 Grad nach oben" (was für den Roboter unmöglich sein kann), sagen sie ihm: „Schau auf diesen Punkt im Raum." Der Roboter darf dann selbst entscheiden, wie er seinen Kopf dreht, um diesen Punkt zu sehen, solange es für ihn physikalisch möglich ist. Das ist wie wenn du jemandem sagst: „Schau dir das Haus an", statt ihm zu befehlen: „Dreh deinen Kopf genau so, wie ich es tue."
  3. Der Körper-Coach: Es gibt einen speziellen „Coach" (einen Controller), der darauf achtet, dass der Roboter nicht umkippt. Er koordiniert Arme, Rumpf und Räder so, dass der Roboter stabil bleibt, während er die Aufgaben erledigt.

Was kann der Roboter jetzt?

Mit diesem System (HoMMI) kann der Roboter jetzt Aufgaben erledigen, die früher unmöglich waren, ohne dass jemand ihn per Fernsteuerung lenken musste:

  • Wäsche: Er holt ein Tuch, sucht sich einen Korb (und schaut aktiv darum herum, wenn er ihn nicht sieht), und legt es hinein.
  • Lieferung: Er trägt eine Kiste durch einen ganzen Raum, sucht einen Wagen und stellt die Kiste genau darauf.
  • Tischdecken: Er spannt eine Tischdecke auf, wobei er mit beiden Armen und dem ganzen Körper koordiniert arbeiten muss.

Zusammenfassung in einem Satz

HoMMI ist wie ein genialer Übersetzer, der einem Roboter beibringt, wie man komplexe Aufgaben erledigt, indem er menschliche Bewegungen „übersetzt" – er ignoriert die körperlichen Unterschiede und konzentriert sich nur auf das Ziel: Was soll getan werden und wohin muss ich schauen?

Dadurch können Roboter jetzt lernen, indem sie einfach menschlichen Menschen beim Arbeiten zuschauen, ohne dass jemand sie mühsam per Fernsteuerung lenken muss.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →