← Neueste Arbeiten
💻 computer science

ContactMimic: Humanoid Object Interaction via Contact Control

ContactMimic ist ein Lernframework, das die humanoide Objektinteraktion verbessert, indem es binäre Kontaktbefehle explizit neben Keypoint-Trajektorien verfolgt und so präzisen physischen Kontakt sowie eine bedarfsgerechte Kontaktsteuerbarkeit bei vielfältigen Manipulationsaufgaben ermöglicht.

Ursprüngliche Autoren: Xinyao Li, Xialin He, Runpei Dong, Saurabh Gupta

Veröffentlicht 2026-07-10
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Xinyao Li, Xialin He, Runpei Dong, Saurabh Gupta

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie bringen einem Roboter das Tanzen bei. Lange Zeit war der beste Weg dazu, dem Roboter ein Video einer menschlichen Tänzerin zu zeigen und zu sagen: „Kopiere exakt diese Körperpositionen.“ Der Roboter würde seine Gelenke bewegen, um Hüften, Ellbogen und Knie des Menschen perfekt zu entsprechen.

Aber hier liegt das Problem: Es reicht nicht aus, nur die Form des Tanzes zu kopieren.

Wenn ein menschlicher Tänzer seine Hand nahe an ein Whiteboard bewegt, winkt er nur. Wenn er seine Hand gegen das Whiteboard drückt, wischt er es ab. Wenn ein Roboter nur die Position der Hand betrachtet, könnte er die Hand direkt neben das Board bewegen und denken, er mache einen großartigen Job, obwohl er eigentlich gar nichts reinigt. Es ist so, als würde man versuchen, eine Tür zu öffnen, indem man sich nur daneben stellt, ohne jemals den Griff zu berühren.

Dies ist die große Idee hinter einem neuen Projekt namens CONTACTMIMIC. Die Forscher fanden heraus, dass man einen Roboter für Aufgaben wie Sitzen, Wischen oder das Verschieben von Möbeln wirklich nützlich machen kann, wenn man ihm nicht nur sagt, wo er sein soll, sondern auch, ob er Dinge berühren soll.

Der „magische Schalter“ für Berührung

Das Team entwickelte ein System, bei dem man dem Roboter, anstatt nur einen Pfad vorzuge zu geben, einen Schalter gibt. Dieser Schalter ist ein einfaches „Ja/Nein“-Label für jeden Teil des Roboterkörpers.

  • Schalter AN (Kontakt ✔): „Okay, Roboter, ich möchte, dass du deine Hand gegen dieses Whiteboard drückst.“
  • Schalter AUS (Kontakt ✘): „Okay, Roboter, bewege deine Hand an die exakt gleiche Stelle, aber berühre das Board nicht. Schwebe einfach nur darüber.“

In ihren Tests zeigten sie, dass der Roboter mit diesem Schalter dieselben Tanzbewegungen ausführen, aber sein Verhalten komplett verändern konnte. Er konnte in einem Stuhl sitzen und sich zurücklehnen, oder im selben Stuhl sitzen und aufrecht bleiben, ohne die Rückenlehne zu berühren. Er konnte eine Box aufheben oder einfach nur die Hände in der Form halten, als würde er eine Box halten, ohne sie tatsächlich anzuheben.

Warum war das so schwer?

Man könnte denken: „Warum lehrt man den Roboter nicht einfach natürlich, Dinge zu berühren?“ Die Forscher entdeckten eine tückische Falle in den Daten.

Wenn Menschen mit Objekten interagieren, sind ihre Körperpositionen und ihre Berührungen meist fest miteinander gekoppelt. Wenn ein Mensch auf einem Stuhl sitzt, berührt sein Gesäß immer die Sitzfläche. Wenn ein Mensch ein Board wischt, berührt seine Hand immer die Oberfläche. Aus diesem Grund lernt ein Roboter, wenn man ihm nur tausende Videos von Menschen beim Sitzen zeigt: „Oh, wenn die Hüften in dieser Position sind, muss das Gesäß die Sitzfläche berühren.“ Er hört auf, auf den „Berührungs“-Befehl zu hören, weil er glaubt, dass die Position bereits die ganze Geschichte erzählt.

Um dies zu beheben, mussten die Forscher kreativ werden. Sie nahmen ihre Trainingsdaten und begannen, die Regeln zu brechen:

  1. Das „Geister-Objekt“: Sie nahmen ein Video von jemandem, der ein Board wischt, sagten dem Roboter aber: „Das Board ist nicht da.“ Der Roboter musste lernen, seine Hand an die Stelle des Boards zu bewegen, ohne etwas zu berühren.
  2. Das „aufgeblasene“ Objekt: Sie machten die Objekte in der Simulation größer (wie einen aufgeblasenen Ballon), sodass der Roboter seine Hand um das Objekt herum bewegen musste, um es zu vermeiden, obwohl der „Kontakt“-Befehl besagte, dass er es berühren sollte.
  3. Die „Fake“-Berührung: Sie nahmen ein Video, in dem der Roboter etwas berühren sollte, sagten ihm dann aber: „Berühre nichts“, und umgekehrt.

Durch diese Mischung zwangen sie den Roboter, nicht mehr basierend auf der Position zu raten, sondern tatsächlich auf den „Berührungs“-Schalter zu hören.

Hat es funktioniert?

Das Team testete dies an einem echten Roboter namens Unitree G1 (einem Humanoiden mit 29 Gelenken) und in einer Computersimulation.

  • In der Simulation: Sie führten 10 verschiedene Aufgaben aus, wie das Treten gegen einen Stuhl, das Treten auf einen Stuhl und das Aufheben einer Box. Wenn sie den Schalter auf „Kontakt“ stellten, stellte der Roboter den Kontakt her. Wenn sie ihn auf „Kein Kontakt“ stellten, berührte er nichts mehr. Der Roboter konnte sogar eine Box anheben, indem man ihm lediglich sagte, dass er sie berühren sollte, ohne eine spezielle „Heb die Box auf“-Anweisung zu geben.
  • In der realen Welt: Sie testeten fünf reale Bewegungen, darunter das Wischen eines Whiteboards und das Anlehnen an eine Stuhllehne.
    • Wenn er zum Wischen angewiesen wurde, drückte der Roboter seine Hand fest genug gegen das Board, um eine sichtbare Spur zu hinterlassen.
    • Wenn er zum Schweben angewiesen wurde, bewegte sich die Hand an die gleiche Stelle, hinterließ aber keine Spur.
    • Wenn er zum Anlehnen angewiesen wurde, lehnte der Roboter sein Gewicht gegen die Stuhllehne. Wenn er angewiesen wurde, nicht anzulehnen, blieb er aufrecht und balancierte selbstständig.

Die Ergebnisse waren beeindruckend. In der realen Welt folgte der Roboter dem Kontaktbefehl in etwa 90 % bis 100 % der Fälle für die meisten Aufgaben (zum Beispiel 9 von 10 Mal beim Anlehnen an eine Rückenlehne und 5 von 5 Mal beim Wischen des Boards).

Was es (noch) nicht kann

Das Paper ist sehr deutlich darüber, was dies nicht ist.

  • Es ist kein „universeller“ Roboter, der mit einem einzigen Gehirn jede Aufgabe erledigen kann. Die Forscher trainierten ein separates „Gehirn“ (Policy) für jede spezifische Bewegung. Sie haben noch nicht herausgefunden, wie man einen einzigen Roboter baut, der all diese Dinge gleichzeitig tun kann.
  • Es ist auf hochwertige Videos von Menschen angewiesen, die mit Objekten interagieren. Sie verwendeten keine zufälligen Internetvideos, sondern einen spezifischen Datensatz namens HUMOTO.
  • Sie verwendeten keine speziellen Berührungssensoren auf der Roboterhaut. Stattdessen fand der Roboter durch das Gefühl seiner eigenen Muskeln und Gelenke (Propriozeption) heraus, ob er etwas berührt. Sie bewiesen dies, indem sie zeigten, dass ein einfaches Computerprogramm, das auf Basis der internen Empfindungen des Roboters raten sollte, ob dieser etwas berührt, fast immer richtig lag (mit F1-Scores von etwa 0,90 bis 0,99 für die meisten Aufgaben).

Das Fazit

Das Paper legt nahe, dass man, wenn man möchte, dass ein Roboter nützliche, physische Aufgaben erledigt, aufhören muss, ihm nur zu sagen, wohin er gehen soll. Man muss ihm explizit sagen, ob er etwas berühren soll. Durch das Aufbrechen der Verbindung zwischen „Position“ und „Berührung“ während des Trainings haben sie den Roboter gelehrt, auf einen einfachen Schalter zu hören. Es ist ein Schritt hin zu Robotern, die nicht nur so aussehen, als würden sie eine Aufgabe ausführen, sondern die Aufgabe tatsächlich tun, indem sie den richtigen physischen Kontakt herstellen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →