Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning
Open-AoE is een open, door de gemeenschap gedreven dataset en toolchain die de kloof tussen schaalbare smartphone-gebaseerde egocentrische videocaptuur en embodied AI-training overbrugt door 2.000 uur aan gestructureerde manipulatiedata te bieden naast een uitgebreide pijplijn voor het verwerken, retargeten en trainen van diverse robotleer-modellen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot probeert te leren hoe hij een sandwich moet maken, een lekkende kraan moet repareren of een shirt moet opvouwen. Je kunt hem niet simpelweg een bibliotheek aan tekstboeken voeren; hij moet zien en voelen hoe mensen dit doen. Dit is de wereld van belichaamde intelligentie (embodied intelligence), waar computers leren door te interageren met de fysieke wereld, precies zoals wij dat doen. Maar er is een addertje onder het gras: robots zien de wereld anders dan wij. Als je een video opneemt vanuit een camera op een plank (een "derdepersoons"-perspectief), ziet de robot de hele kamer maar mist hij de kleine vingerbewegingen. Als je vanuit de eigen ogen van een robot opneemt ("egocentrisch" perspectief), krijgt hij het juiste perspectief, maar is het ongelooflijk moeilijk en duur om genoeg hoogwaardige data te verzamelen om hem te onderwijzen. Meestal heb je speciale, dure camera's nodig die aan de hoofden van mensen zijn bevestigd, of moet je elke seconde van de video handmatig labelen om de computer te vertellen wat er gebeurt. Zonder een enorme, gemakkelijk bruikbare bibliotheek van deze "menselijke oog"-video's, hebben robots moeite om de subtiele trucjes van het dagelijks leven te leren.
Dit is waar een nieuw project genaamd Open-AoE inspringt, dat fungeert als een enorme, open-source toolkit voor het onderwijzen van robots. De onderzoekers achter dit project realiseerden zich dat iedereen al de perfecte camera in zijn zak heeft: een smartphone. Dus bouwden ze een systeem dat duizenden gewone mensen verandert in datacollectors. Ze creëerden een app die video's opneemt van mensen die alledaagse taken uitvoeren—zoals koffie inschenpen of typen op een toetsenbord—met behulp van hun eigen telefoons. Maar ze stopten niet bij alleen het opnemen; ze bouwden een gigantische, geautomatiseerde fabriek in de cloud die die ruwe, rommelige video's neemt en ze omzet in supergeorganiseerde, robot-klare lessen.
Het team verzamelde een verbluffende hoeveelheid van 2.000 uur aan deze video's, verzameld door meer dan 500 verschillende mensen met meer dan 400 verschillende soorten smartphones. Dat is veel tijd! De video's bestrijken meer dan 400 verschillende scènes (van keukens tot kantoren) en 8.000+ verschillende taken. Wat dit bijzonder maakt, is niet alleen de omvang, maar de "magie" die het systeem aan de beelden toevoegt. Met behulp van geavanceerde AI bepaalt het systeem automatisch precies waar de handen bewegen (tot aan de 21 gewrichten van de vingers), waar de camera beweegt, en breekt de video op in kleine, betekenisvolle stukjes actie. Het schrijft zelfs tekstuele beschrijvingen van wat er gebeurt.
Denk er zo over na: voorheen, als je een robot wilde leren, moest je een filmcrew inhuren, dure apparatuur kopen en jarenlang de beelden bewerken. Open-AoE is alsof je iedereen een smartphone geeft, zegt: "Film je dag," en vervolgens een magische robot-editor hebt die die films direct omzet in een perfect tekstboek waar een robot van kan leren. Het artikel laat zien dat deze aanpak werkt en een rijke, diverse dataset biedt die robots helpt begrijpen niet alleen wat ze moeten doen, maar ook hoe ze hun handen en ogen moeten bewegen om het te doen.
De onderzoekers hebben ook een reeks hulpmiddelen (een "toolchain") gebouwd waarmee wetenschappers deze data kunnen gebruiken om coole dingen te doen. Ze kunnen de 3D-beweging van handen visualiseren, menselijke bewegingen "retargeten" om ze aan te passen aan verschillende robotlichamen (zoals een menselijke arm veranderen in een robotarm), en verschillende soorten AI-modellen trainen. Ze ontdekten dat ze door dit diverse, op smartphones gebaseerde data te gebruiken, een veel sterkere basis kunnen leggen voor robots om van de echte wereld te leren, zonder dat ze een miljoen dollar aan apparatuur nodig hebben. Het is een grote stap richting het maken van robots die ons daadwerkelijk kunnen helpen bij onze dagelijkse klusjes, omdat ze nu beschikken over een enorme, open bibliotheek van menselijke ervaringen om van te studeren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.