← Nieuwste papers
💻 computer science

Scalable Behavior Cloning with Open Data, Training, and Evaluation

Dit artikel introduceert ABC, een volledig open-source stack voor behavior cloning in robotische manipulatie die de grootste teleoperatie-dataset tot nu toe (ABC-130K) bevat, een reproduceerbare hardware- en simulatiepipeline met co-trainingsrecepten, en uitgebreide evaluaties van Diffusion Transformer- en Vision-Language-Action-architecturen op complexe dexterous taken.

Oorspronkelijke auteurs: Arthur Allshire, Himanshu Gaurav Singh, Ritvik Singh, Adam Rashid, Hongsuk Choi, David McAllister, Justin Yu, Yiyuan Chen, Huang Huang, Pieter Abbeel, Xi Chen, Rocky Duan, Phillip Isola, Jitendra Mali
Gepubliceerd 2026-06-26
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Arthur Allshire, Himanshu Gaurav Singh, Ritvik Singh, Adam Rashid, Hongsuk Choi, David McAllister, Justin Yu, Yiyuan Chen, Huang Huang, Pieter Abbeel, Xi Chen, Rocky Duan, Phillip Isola, Jitendra Malik, Fred Shentu, Guanya Shi, Philipp Wu, Angjoo Kanazawa

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot wilt leren hoe hij complexe klusjes moet doen, zoals het vouwen van een kartonnen doos, het sorteren van LEGO-steentjes, of zelfs het uit een strakke portemonnee trekken van een creditcard. In het verleden was het aanleren van taken aan robots alsof je een kind probeert te onderwijzen door het slechts één wazige foto van een taak te laten zien en te hopen dat het de uitdaging begrijpt. Het is duur, traag, en vaak geeft de robot simpelweg op.

Dit artikel introduceert ABC, een enorme, open-source "startkit" om robots te leren hoe ze kunnen leren door naar mensen te kijken. Denk aan de "Wikipedia" of "YouTube" van robottraining, maar in plaats van alleen video's, bevat het ook de daadwerkelijke recepten, de keukengerei en de testkeuken, zodat iedereen het kan uitproberen.

Hier is de uitsplitsing van hun "ABC Stack" met eenvoudige analogieën:

1. De Bibliotheek: ABC-130K (Het "Kookboek")

Stel je een bibliotheek voor die niet alleen één of twee recepten heeft, maar 3.500 uur aan videomateriaal van mensen die 130.000 verschillende taken uitvoeren.

  • Wat erin zit: Mensen die twee robotarmen gebruiken om alles te doen, van eenvoudige "oppakken-en-neerzetten"-klussen tot super lastige behendigheidstaken zoals het vouwen van papieren vliegtuigjes of het openen van een doos met een sleutel.
  • Waarom het ertoe doet: Voorheen was de meeste robotdata óf te klein, óf te duur om te verzamelen, óf opgesloten in geheime bedrijfskluizen. Dit is de grootste open collectie van zijn soort, gebouwd op een robot die ongeveer $8.000 kost (goedkoop voor een robot), waardoor het toegankelijk is voor reguliere onderzoekers en niet alleen voor grote techgiganten.

2. Het Brein: ABC-Models (De "Studenten")

De auteurs hebben niet alleen de data gedumpt; ze hebben twee verschillende soorten "student"-robots gebouwd om van de data te leren en hebben getest welke leerstijl het beste werkt.

  • De "Diffusion Transformer" (DiT): Denk aan een student die heel goed is in het bekijken van een plaatje en het voorspellen van de volgende stap, stap voor stap, zoals het invullen van een kruiswoordraadsel.
  • De "Vision-Language-Action" (VLA): Denk aan een student die instructies kan lezen, naar de afbeelding kan kijken en de context in één keer kan begrijpen.
  • Het Experiment: Ze hebben deze studenten getest met verschillende "leraren" (verschillende camerastandpunten en taalinputs). Ze ontdekten dat de VLA-student sneller leerde wanneer deze meer rekenkracht kreeg, terwijl de DiT-student efficiënter was met minder vermogen. Ze hebben de "geslaagde" breinen (de modelgewichten) vrijgegeven, zodat iedereen ze kan gebruiken.

3. De Simulator: ABC-Sim (De "Vliegsimulator")

Normaal gesproken, om te zien of een robot slim is, moet je hem de taak in de echte wereld laten proberen. Als hij faalt, kan hij iets kapot maken of duurt het uren om alles te resetten.

  • De Oplossing: De auteurs hebben een virtuele werkelijkheid "vliegsimulator" voor robots gebouwd. Ze hebben 400 uur aan data gecreëerd waarbij mensen robots bestuurden (teleoperatie) binnen een computerspel.
  • De Magie: Ze bewezen dat als een robot goed presteert in dit computerspel, hij dat waarschijnlijk ook in de echte wereld zal doen. Dit is alsof je zegt: "Als je dit vliegtuig in de simulator kunt vliegen, ben je waarschijnlijk klaar voor de echte lucht." Dit stelt onderzoekers in staat om hun ideeën te testen zonder een fysieke robot nodig te hebben of schade te riskeren.

4. De Proefrit: ABC-Eval (Het "Rijexamen")

Ze zeiden niet alleen "het werkt"; ze hebben de robots daadwerkelijk door een hindernisbaan van taken geleid.

  • De Resultaten: De robots leerden succesvol dozen te vouwen, items te sorteren en delicate taken uit te voeren zoals het insteken van een sleutel in een slot.
  • De "DAgger"-truc: Voor de moeilijkste taak (het vouwen van een doos) bleef de robot falen. De auteurs gebruikten een techniek genaamd DAgger. Stel je een rijinstructeur voor die de student laat rijden, maar op het moment dat de student bijna botst, het stuur overneemt om het te corrigeren, en de student vervolgens weer laat proberen. Door deze "fix-het"-momenten te verzamelen, leerde de robot hoe hij fouten kon herstellen en slaagde hij uiteindelijk voor het vouwen van de doos.

Het Grotere Plaatje

De auteurs zeggen eigenlijk: "Wij hebben het hele schoolsysteem voor robotleren gebouwd. We hebben de tekstboeken (data), de leraren (modellen), de oefentechnieken (simulatie) en de eindtoetsen (resultaten in de echte wereld). We geven dit allemaal gratis weg."

Hun doel is om het leren van robots te stoppen met een besloten club voor rijke bedrijven en te beginnen met een gemeenschappelijke inspanning waarbij iedereen samen de "ABC's" van het aanleren van robots kan leren. Ze beloven geen robots die morgen je was doen, maar ze bieden het fundament zodat onderzoekers eindelijk kunnen beginnen met het bouwen ervan.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →