← Neueste Arbeiten
💻 computer science

EgoInfinity: A Web-Scale 4D Hand-Object Interaction Data Engine for Any-View Robot Retargeting and Video-to-Action Robot Learning

EgoInfinity ist eine modulare, web-skalierbare 4D-Datenengine, die beliebige Internetvideos in metrische Hand-Objekt-Interaktionsrepräsentationen und ausführbare Roboter-Trajektorien transformiert und somit skalierbares, menschenfreies Lernen sowie Retargeting für Roboter über diverse Morphologien und Blickwinkel hinweg ermöglicht.

Ursprüngliche Autoren: Gaotian Wang, Kejia Ren, Andrew Morgan, Yiting Chen, Howard H. Qian, Podshara Chanrungmaneekul, Kaiyu Hang

Veröffentlicht 2026-06-17
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Gaotian Wang, Kejia Ren, Andrew Morgan, Yiting Chen, Howard H. Qian, Podshara Chanrungmaneekul, Kaiyu Hang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie hätten eine riesige Bibliothek von YouTube-Videos, die Menschen bei alltäglichen Aufgaben zeigen – das Öffnen von Kartons, das Eingießen von Suppe, das Schneiden von Obst oder das Abwischen von Tischen. Im Moment können Roboter aus diesen Videos nicht wirklich „lernen“, weil das Videomaterial nur flache Bilder (2D) ist. Der Roboter weiß nicht, wie schwer der Karton ist, wie weit die Suppe entfernt ist oder wie genau die Finger des Menschen den Griff berührt haben. Es ist, als würde man versuchen, Autofahren zu lernen, indem man nur einen Schwarz-Weiß-Film sieht; man sieht zwar die Bewegung, aber man kann weder das Lenkrad noch die Straße fühlen.

EgoInfinity ist eine neue „magische Engine“, die diese flachen, chaotischen Internet-Videos in eine 3D-fähige, physikbasierte Bedienungsanleitung für Roboter verwandelt. So funktioniert sie, unterteilt in einfache Schritte:

1. Die „Detektiv“-Phase (Die Hinweise finden)

Zuerst scannt die Engine Millionen von Videoclips (speziell aus einem riesigen Datensatz namens Action100M). Sie agiert wie ein Detektiv, der nach den guten Inhalten sucht. Sie ignoriert langweilige Teile und konzentriert sich nur auf die Momente, in denen Hände tatsächlich etwas tun.

  • Die Metapher: Denken Sie an einen Filmeditor, der 100 Stunden Rohmaterial schnell scannt, um die 5 Minuten zu finden, in denen der Schauspieler tatsächlich spricht, und die Stille ignoriert.

2. Der „3D-Übersetzer“ (Bilder in Geometrie verwandeln)

Sobald die Engine einen guten Clip gefunden hat, beginnt sie, das 2D-Video in 3D-Daten zu übersetzen. Sie nutzt intelligente KI-Werkzeuge, um zu schätzen:

  • Die Form: Wie sieht das Objekt in 3D aus? (Ist es ein runder Apfel oder ein flacher Karton?)
  • Die Position: Wo befindet sich das Objekt im Raum?
  • Die Hände: Wie bewegen sich die menschlichen Finger?
  • Die Skalierung: Wie groß ist alles? (Ist dieser Becher 5 cm hoch oder 50 cm?)

Das Papier nennt dies „metrische Kalibrierung“.

  • Die Metapsetzung: Stellen Sie sich vor, Sie betrachten ein Foto von einer Person, die eine Kaffeetasse hält. Ein normaler Mensch würde die Größe vielleicht nur schätzen. EgoInfinity ist wie ein superpräziser 3D-Scanner, der sofort weiß, dass die Tasse exakt 10 cm hoch ist und die Hand 30 cm entfernt ist, und so das flache Foto in ein virtuelles 3D-Modell verwandelt, um das man herumgehen könnte.

3. Der „Realitätscheck“ (Fehler korrigieren)

KI kann manchmal verwirrt werden. Wenn eine Hand ein Objekt verdeckt, verliert die KI vielleicht die Spur davon, wo sich das Objekt befindet. EgoInfinity besitzt einen speziellen Schritt zur „Interaktions-bewussten Verfeinerung“ (Interaction-Aware Refinement). Sie betrachtet die Beziehung zwischen der Hand und dem Objekt.

  • Die Logik: Wenn die Hand ein Objekt hält, muss sich das Objekt mit der Hand mitbewegen. Wenn die Hand stillsteht, sollte das Objekt nicht einfach davonschweben.
  • Die Metapher: Es ist wie ein Tanzlehrer, der ein Video beobtachtet. Wenn das Video einen Glitch hat und der Partner des Tänzers plötzlich in der Luft schwebt, sagt der Lehrer: „Nein, das ist falsch. Wenn sie sich an den Händen halten, müssen sie sich gemeinsam bewegen.“ Die Engine korrigiert diese Fehler, damit die Physik realistisch aussieht.

4. Der „Universelle Adapter“ (Verschiedene Roboter lehren)

Dies ist der cleverste Teil. Die Engine kopiert nicht einfach exakt die Körperbewegungen des Menschen. Menschen haben lange Arme und zwei Hände; Roboter könnten kurze Arme, Räder oder Greifer haben, die überhaupt nicht wie Hände aussehen.

  • Die Lösung: EgoInfinity ermittelt das Ziel der Bewegung (z. B. „nimm die Tasse auf“) und übersetzt dieses Ziel dann in die eigene Sprache des Roboters. Sie fragt: „Wie kann dieser spezifische Roboter das gleiche Ergebnis erzielen?“
  • Die Metapher: Stellen Sie sich vor, Sie bringen einem Hund bei, einen Ball zu apportieren. Sie sagen dem Hund nicht: „Laufe wie ein Mensch.“ Sie sagen dem Hund: „Hol den Ball“, und der Hund findet heraus, wie er seine Pfoten und Beine benutzt, um dies zu tun. EgoInfinity macht dies für Roboter: Sie nimmt das menschliche „Apportieren“ und sagt einem Roboterarm, wie er unter Verwendung seiner eigenen Gelenke „apportiert“.

Was haben sie tatsächlich gebaut?

Die Autoren haben nicht nur eine Theorie aufgestellt; sie haben ein funktionierendes System gebaut und getestet:

  • Eine Web-Engine: Sie haben ein Werkzeug entwickelt, das diese Videos automatisch verarbeiten kann, ohne dass Menschen jeden einzelnen Frame manuell beschriften müssen.
  • Ein Datensatz: Sie haben 106 Videos aus der Action100M-Kollektion verarbeitet und so eine Bibliothek mit 3D-Hand-und-Objekt-Daten erstellt.
  • Echte Roboter-Tests: Sie haben erfolgreich echte Roboter (wie einen Unitree G1 Roboter und einen Dual-Arm Franka Roboter) dazu gebracht, Aufgaben wie Schneiden, Gießen und Abwischen durchzuführen, indem sie lediglich diese verarbeiteten Videos beobachteten. Sie trainierten auch eine Roboterhand, verschiedene Objekte (Äpfel, Bananen, Suppendosen) zu greifen, wobei die Daten als Leitfaden dienten.

Was sind die Grenzen?

Das Paper ist ehrlich darüber, was es noch nicht kann:

  • Kamerabewegung: Es funktioniert am besten, wenn die Kamera weitgehend ruhig ist (wie auf einem Stativ). Es hat Schwierigkeiten, wenn die Kamera stark wackelt oder von einer bewegten Hand gehalten wird.
  • Tasten/Fühlen: Es kann nicht fühlen. Es weiß, wo die Hand ist, aber es weiß nicht, wie fest der Roboter drückt oder ob das Objekt rutschig ist.
  • Perfekte Präzision: Es ist großartig für allgemeine Aufgaben, aber es ist vielleicht nicht präzise genug für filigrane chirurgische Eingriffe oder Aufgaben, die eine exakte Platzierung der Fingerspitzen erfordern.

Kurz gesagt: EgoInfinity ist eine Brücke. Sie nimmt die unstrukturierten, chaotischen YouTube-Videos der Menschen und verwandelt sie in saubere, 3D-physikalisch korrekte Anweisungen, die Roboter tatsächlich lesen und befolgen können. Dies ermöglicht es ihnen, neue Fähigkeiten zu erlernen, ohne teure Sensoren oder menschliche Lehrer zu benötigen, die jede Bewegung aufzeichnen müssen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →