← Neueste Arbeiten
💻 computer science

DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous Manipulation

Das Paper stellt DexVerse vor, einen groß angelegten, modularen Benchmark mit 100 vielfältigen Aufgaben, mehreren Roboter-Embodiments und konfigurierbaren visuellen Variationen, um allgemeine dexteritätsorientierte Manipulations-Policies systematisch zu evaluieren und voranzutreiben.

Ursprüngliche Autoren: Yunchao Yao, Zhuxiu Xu, Tianqi Zhang, Zixian Liu, Sikai Li, Zhenyu Wei, Feng Chen, Dihong Huang, Kechang Wan, Chenyang Ma, Shuqi Zhao, Shenghua Gao, Masayoshi Tomizuka, Yi Ma, Mingyu Ding

Veröffentlicht 2026-07-10
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Yunchao Yao, Zhuxiu Xu, Tianqi Zhang, Zixian Liu, Sikai Li, Zhenyu Wei, Feng Chen, Dihong Huang, Kechang Wan, Chenyang Ma, Shuqi Zhao, Shenghua Gao, Masayoshi Tomizuka, Yi Ma, Mingyu Ding

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem Roboter beizubringen, gleichzeitig der ultimative Küchenhelfer, ein meisterhafter Mechaniker und ein feinfühliger Künstler zu sein. Sie möchten, dass er eine rutschige Tasse greift, ein Glas aufschraubt, einen Pfannkuchen wendet und vielleicht sogar ein Kartenspiel spielt, ohne auch nur ein einziges Stück fallen zu lassen. Aber hier liegt das Problem: Die meisten Trainingsprogramme für Roboter sind wie das Beibringen des Fahrradfahrens auf einem perfekt flachen, leeren Bürgersteig, nur um dann zu erwarten, dass das Kind sofort eine belebte, regnerische Stadtstraße mit Schlaglöchern und Verkehr navigiert.

Genau das versuchen die Forscher hinter DexVerse zu lösen. Sie haben ein massives, modulares „Trainingsgym“ gebaut, in dem Roboter geschickte Manipulation lernen können – was nur eine schicke Art zu sagen ist: „Hände und Arme benutzen, um knifflige Aufgaben mit viel Kontakt auszuführen.“

Der ultimative Roboter-Hindernisparcours

Stellen Sie sich DexVerse als einen riesigen, digitalen Spielplatz mit 100 verschiedenen Herausforderungen vor. Es geht nicht nur darum, einen Block aufzuheben; es geht um:

  • Die Grundlagen: Einfache Objekte greifen und bewegen.
  • Die Werkzeuge: Einen Hammer benutzen oder ein Getränk eingießen (wo man wissen muss, wie das Objekt funktioniert, nicht nur, wie es aussieht).
  • Die Rätsel: Einen Laptop öffnen, eine Schere zusammendrücken oder eine Nadel einfädeln (diese erfordern präzisen Kontakt und bewegliche Teile).
  • Die Teamarbeit: Zwei Hände gleichzeitig benutzen, um ein Tablett zu heben oder ein Objekt zu übergeben.
  • Der Marathon: Kaffee kochen oder etwas backen, was eine lange Kette von Schritten beinhaltet.

Das Coolste daran? Dieses Gym ist nicht auf einen einzigen Robertyp festgelegt. Es unterstützt 3 verschiedene Roboterarme und 6 verschiedene geschickte Hände (wie die Shadow Hand oder die LEAP Hand). Es ist wie ein Videospiel, bei dem man seine Handschuhe und Arme im Flug austauschen kann, um zu sehen, ob sie das Level immer noch gewinnen können. Zudem können die Forscher die Beleuchtung, den Hintergrund, die Textur der Objekte und sogar den Kamerawinkel augenblicklich ändern. Dies testet, ob der Roboter tatsächlich „lernt“ oder nur ein bestimmtes Bild auswendig lernt.

Der menschliche Tutor (und der Datendump)

Um diese Roboter zu lehren, haben die Teams nicht einfach nur Code geschrieben; sie nutzten Virtual Reality (VR). Sie setzten Headsets auf und benutzten ihre eigenen Hände, um die Aufgaben in der Simulation auszuführen, wobei sie als „Tutoren“ fungierten. Sie sammelten 3.180 Demonstrationen dieser Aufgaben. Jede Aufzeichnung enthält alles: wie sich die Gelenke des Roboters bewegten, was die Kameras sahen (RGB-Bilder, Tiefe und Punktwolken) und den Zustand der Welt. Es ist eine massive Bibliothek von „Anleitungen“ für Roboter, die perfekt mit den exakten Bewegungen des Menschen synchronisiert sind.

Die große Enthüllung: Roboter lernen noch laufen

Hier kommt der Pointe, und es ist ein kleiner Realitätscheck. Die Forscher nahmen vier der klügsten, fortschrittlichsten Roboter-„Gehirne“, die heute verfügbar sind (einschließlich Diffusion Policy, DP3, OpenVLA und π0.5), und warfen sie in dieses DexVerse-Gym.

Sie ließen die Roboter 19 verschiedene Aufgaben versuchen zu lösen. Das Ergebnis? Es ist ein hartes Publikum.

  • Die Punktzahl: Selbst das leistungsfähigste Robotergehirn war im Durchschnitt nur etwa 34 % der Zeit erfolgreich. Das bedeutet, sie scheiterten in mehr als zwei Dritteln der Fälle.
  • Kein einzelner Held: Es gab keinen „Champion“-Roboter. Ein Typ war gut beim einfachen Heben, ein anderer war okay bei der Verwendung von Werkzeugen und ein dritter war passabel bei präzisem Kontakt, aber keiner konnte alles gut.
  • Die harte Wahrheit: Die Forscher fanden heraus, dass das Training auf riesigen Mengen von Internetdaten (wie bei den „vortrainierten“ Modellen) die Roboter nicht automatisch besser bei diesen kniffligen Handbewegungen macht. Das „Wissen“ aus dem Internet übertrug sich nicht gut auf die komplexe Physik einer Roboterhand.
  • Die Null-Erfolgs-Zone: Für Aufgaben wie das Hochdrücken einer kleinen Kugel eine Steigung hinauf oder das Gleiten eines Teppichmessers scheiterte jeder einzelne Roboter vollständig (0 % Erfolg). Diese Aufgaben erfordern eine fein abgestimmte Kraftsteuerung und Sub-Zentimeter-Präzision, die heutige Roboter einfach noch nicht besitzen.

Was das bedeutet

DexVerse ist kein Bericht, der sagt: „Roboter haben gewonnen!“ Es ist ein Bericht, der sagt: „Hier ist ein riesiger, ehrlicher Test, und im Moment kämpfen Roboter noch.“

Das Paper legt nahe, dass wir zwar Fortschritte gemacht haben, die Lücke zwischen dem, was Roboter in einer kontrollierten, einfachen Welt leisten können, und dem, was sie in einer chaotischen, echten Welt tun müssen, aber immer noch riesig ist. Die Forscher haben diese Misserfolge in der Simulation gemessen und gezeigt, dass Aufgaben, die engen Kontakt, bimanuelle Koordination und präzisen Werkzeuggebrauch erfordern, die „Endgegner“ sind, die die heutige Technologie noch nicht besiegt hat.

Wir haben also einen fantastischen neuen Trainingsplatz (DexVerse) und eine riesige Bibliothek menschlicher Demonstrationen, aber der Traum von einem Roboter, der mühelos jede geschickte Aufgabe bewältigen kann, ist immer noch ein laufender Prozess. Der Weg nach vorne besteht darin, herauszufinden, wie man Roboter dazu bringt, jene kniffligen „Null-Erfolgs-Aufgaben“ zu meistern, bei denen selbst die klügsten KI-Gehirne derzeit völlig ratlos sind.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →