← Neueste Arbeiten
💻 computer science

Scalable Behavior Cloning with Open Data, Training, and Evaluation

Dieses Paper stellt ABC vor, einen vollständig quelloffenen Stack für Behavior Cloning in der Robotermanipulation, der den bisher größten Teleoperations-Datensatz (ABC-130K), eine reproduzierbare Hardware- und Simulations-Pipeline mit Co-Training-Rezepten sowie umfassende Evaluierungen von Diffusion-Transformer- und Vision-Language-Action-Architekturen bei komplexen, geschickten Aufgaben umfasst.

Ursprüngliche Autoren: Arthur Allshire, Himanshu Gaurav Singh, Ritvik Singh, Adam Rashid, Hongsuk Choi, David McAllister, Justin Yu, Yiyuan Chen, Huang Huang, Pieter Abbeel, Xi Chen, Rocky Duan, Phillip Isola, Jitendra Mali
Veröffentlicht 2026-06-26
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Arthur Allshire, Himanshu Gaurav Singh, Ritvik Singh, Adam Rashid, Hongsuk Choi, David McAllister, Justin Yu, Yiyuan Chen, Huang Huang, Pieter Abbeel, Xi Chen, Rocky Duan, Phillip Isola, Jitendra Malik, Fred Shentu, Guanya Shi, Philipp Wu, Angjoo Kanazawa

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie möchten einem Roboter beibringen, komplexe Aufgaben zu erledigen, wie zum Beispiel einen Pappkarton zu falten, LEGO-Steine zu sortieren oder sogar eine Kreditkarte aus einem engen Portemonnaie zu ziehen. In der Vergangenheit war das Lehren von Robotern so, als würde man versuchen, einem Kind etwas beizubringen, indem man ihm ein einziges, verschwommenes Foto einer Aufgabe zeigt und hofft, dass es sie selbst versteht. Das ist teuer, langsam und oft gibt der Roboter einfach auf.

Dieses Paper stellt ABC vor, ein massives Open-Source-"Starter-Kit", um Robotern das Lernen durch das Beobachten von Menschen beizubringen. Denken Sie an das „Wikipedia“ oder „YouTube“ für das Robotertraining, aber anstatt nur Videos zu enthalten, liefert es auch die tatsächlichen Rezepte, die Küchenwerkzeuge und die Testküche, damit jeder es ausprobieren kann.

Hier ist die Aufschlüsselung ihres „ABC-Stacks“ unter Verwendung einfacher Analogien:

1. Die Bibliothek: ABC-130K (Das „Kochbuch“)

Stellen Sie sich eine Bibliothek vor, die nicht nur ein oder zwei Rezepte hat, sondern 3.500 Stunden Videomaterial von Menschen, die 130.000 verschiedene Aufgaben ausführen.

  • Was darin enthalten ist: Menschen, die zwei Roboterarme benutzen, um alles zu tun – von einfachen „Aufheben-und-Ablegen“-Jobs bis hin zu super kniffligen Geschicklichkeitsaufgaben wie dem Falten von Papierfliegern oder dem Entschließen einer Box mit einem Schlüssel.
  • Warum es wichtig ist: Vorher waren die meisten Roboterdaten entweder zu klein, zu teuer in der Erhebung oder in geheimen Unternehmensschätzen weggeschlossen. Dies ist die größte offene Sammlung ihrer Art, die auf einem Roboter basiert, der etwa 8.000 $ kostet (günstig für einen Roboter), was sie für reguläre Forscher zugänglich macht, nicht nur für große Tech-Giganten.

2. Das Gehirn: ABC-Models (Die „Schüler“)

Die Autoren haben nicht nur die Daten bereitgestellt; sie haben zwei verschiedene Arten von „Schüler“-Robotern gebaut, um von ihnen lernen zu lassen, und haben getestet, welcher Lernstil am besten funktioniert.

  • Der „Diffusion Transformer“ (DiT): Denken Sie an einen Schüler, der sehr gut darin ist, ein Bild anzusehen und den nächsten Schritt Schritt für Schritt zu erraten, wie beim Ausfüllen eines Kreuzworträtsels.
  • Der „Vision-Language-Action“ (VLA): Denken Sie an einen Schüler, der Anweisungen lesen, das Bild betrachten und den Kontext gleichzeitig verstehen kann.
  • Das Experiment: Sie haben diese Schüler mit verschiedenen „Lehrern“ (verschiedenen Kameraperspektiven und Spracheingaben) getestet. Sie fanden heraus, dass der VLA-Schüler schneller lernte, wenn man ihm mehr Rechenleistung gab, während der DiT-Schüler bei weniger Leistung effizienter war. Sie haben die „Abschluss-Gehirne“ (die Modellgewichte) veröffentlicht, damit jeder sie nutzen kann.

3. Der Simulator: ABC-Sim (Der „Flugsimulator“)

Normalerweise muss man einen Roboter in der realen Welt testen, um zu sehen, ob er intelligent ist. Wenn er scheitert, könnte er etwas beschädigen oder es dauert Stunden, ihn zurückzusetzen.

  • Die Lösung: Die Autoren haben einen virtuellen „Flugsimulator“ für Roboter gebaut. Sie haben 400 Stunden Daten erstellt, in denen Menschen Roboter innerhalb eines Computerspiels ferngesteuert haben.
  • Die Magie: Sie haben bewiesen, dass ein Roboter, der in diesem Videospiel gut abschneidet, wahrscheinlich auch in der realen Welt gut abschneidet. Das ist so, als würde man sagen: „Wenn du dieses Flugzeug im Simulator fliegen kannst, bist du wahrscheinlich bereit für den echten Himmel.“ Dies ermöglicht es Forschern, ihre Ideen zu testen, ohne einen physischen Roboter zu benötigen oder Schäden zu riskieren.

4. Die Testfahrt: ABC-Eval (Die „Fahrprüfung“)

Sie haben nicht nur gesagt „es funktioniert“; sie haben die Roboter tatsächlich durch einen Parcours an Aufgaben geschickt.

  • Die Ergebnisse: Die Roboter lernten erfolgreich, Kartons zu falten, Gegenstände zu sortieren und delikate Aufgaben wie das Einstecken eines Schlüssels in ein Schloss durchzuführen.
  • Der „DAgger“-Trick: Für die schwierigste Aufgabe (das Falten einer Box) scheiterte der Roboter immer wieder. Die Autoren verwendeten eine Technik namens DAgger. Stellen Sie sich einen Fahrlehrer vor, der den Schüler fahren lässt, aber in dem Moment, in dem der Schüler einen Unfall zu bauen droht, das Steuer übernimmt, um es zu korrigieren, und ihn dann wieder versuchen lässt. Durch das Sammeln dieser „Fehlerbehebungs-Momente“ lernte der Roboter, wie man aus Fehlern lernt und schließlich das Falten der Box meisterte.

Das große Ganze

Die Autoren sagen: „Wir haben das gesamte Schulsystem für das Erlernen von Robotik aufgebaut. Wir haben die Lehrbücher (Daten), die Lehrer (Modelle), die Übungsprüfungen (Simulation) und die Abschlussprüfungen (reale Ergebnisse). Wir geben all dies kostenlos zur Verfügung.“

Ihr Ziel ist es, das Lernen von Robotern von einem geheimen Club für reiche Unternehmen zu einer Gemeinschaftsanstrengung zu machen, bei der alle gemeinsam die „ABCs“ des Robotertrainings lernen können. Sie versprechen keine Roboter, die morgen Ihre Wäsche erledigen, aber sie liefern das Fundament, damit Forscher endlich damit beginnen können, sie zu bauen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →