← Nieuwste papers
💻 computer science

GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture

Het artikel introduceert GigaBrain-0.7, een embodied foundation model dat gebruikmaakt van een nieuwe drie-systemen architectuur en is getraind op meer dan 37.000 uur aan heterogene data om superieure zero-shot generalisatie, instructieopvolging en taalsuccespercentages te bereiken over diverse robotische belichamingen vergeleken met eerdere state-of-the-art modellen.

Oorspronkelijke auteurs: GigaBrain Team, Angen Ye, Axiang Sun, Can Jin, Chenxi Cheng, Chong Shi, Dengke Shang, Dingqian Zhang, Guan Huang, Guangqiang Wang, Guangqing Ding, Guo Li, Hangcong Li, Hengyu Zhong, Hongtao Lu, Jianbo
Gepubliceerd 2026-08-18
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: GigaBrain Team, Angen Ye, Axiang Sun, Can Jin, Chenxi Cheng, Chong Shi, Dengke Shang, Dingqian Zhang, Guan Huang, Guangqiang Wang, Guangqing Ding, Guo Li, Hangcong Li, Hengyu Zhong, Hongtao Lu, Jianbo Qin, Jiming Mao, Jing Zhu, Jindi Lv, Jingzhi Cui, Junjie Xie, Junyi Bao, Kai Liu, Lei Yuan, Limin Long, Lv Feng, Mingming Yu, Peng Li, Pengfei Yi, Qi Li, Qianli Zhang, Qingfang Li, Qitang Hu, Rui Zhang, Shaoyan Sun, Shibo Sun, Shiying Duan, Tenghui Chen, Tianze Liu, Weijie Ke, Wenyao Xue, Xiaofeng Wang, Xiaoyu Tian, Xinyu Liu, Xinze Chen, Yang Wang, Yankai Wang, Yejun Zeng, Yifan Li, Yifei Nie, Yilong Li, Yilong Liu, Yongchao Feng, Yumeng Wang, Yun Ye, Zhichao Liu, Ziheng He, Zonghai Yang, Zheng Zhu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin een robot naar een rommelige keukentafel kan kijken, een gesproken verzoek kan begrijpen om "de rode appel in de kom te leggen", en vervolgens precies kan uitrekenen hoe hij zijn arm moet bewegen om dit te doen zonder iets om te stoten. Dit is de belofte van belichaagde kunstmatige intelligentie: machines die niet alleen informatie verwerken, maar ook interageren met de fysieke wereld. Jarenlang hebben onderzoekers geprobeerd robots te onderwijzen door hen duizenden video's te tonen van menselijke handen die objecten bewegen, in de hoop dat de machine de regels van de fysica en oorzaak-gevolg zou leren. Echter, een grote hindernis bleef bestaan. Robots zijn anders gebouwd; de één heeft twee armen, een ander een enkele grijper, en een derde rolt misschien op wielen. Data verzameld van het ene type robot verwart vaak een ander type. Bovendien leert het simpelweg bekijken van een video een machine niet hoe ze moet voorspellen wat er gebeurt als ze een fout maakt, of hoe ze moet herstellen wanneer een taak misgaat. De vraag was of we een enkel, slim brein kunnen bouwen dat taal begrijpt, de wereld ziet en elk soort robotlichaam aanstuurt, terwijl het tegelijkertijd leert van een enorme mix van verschillende ervaringen.

Een team van onderzoekers heeft nu een belangrijke stap voorwaarts gezet met een systeem genaamd GigaBrain-0.7. Dit is niet zomaar één enkel programma, maar een gecoördineerd systeem dat ontworpen is om de complexiteit van interactie in de echte wereld aan te kunnen. In plaats van te proberen een robot alles in één chaotische uitbarsting te laten leren, hebben de onderzoekers het leerproces georganiseerd in drie afzonderlijke maar verbonden delen die samenwerken. Het eerste deel fungeert als de handen en reflexen, waarbij het de directe controle overneemt van de motoren van de robot om acties uit te voeren. Het tweede deel fungeert als de planner en waarnemer, dat de scène bekijkt, de taalinstructie begrijpt en een groot doel zoals "maak de tafel schoon" opbreekt in kleinere, beheersbare stappen zoals "pak de beker op" en "breng deze naar de gootsteen". Het derde deel is de meest vernieuwende toevoeging: het fungeert als een voorspeller en rechter. Het stelt zich voor hoe de scène er over een paar seconden uit zal zien als de robot zijn huidige pad voortzet, en het wijst een score toe aan die toekomst om te beslissen of de robot vooruitgang boekt of richting een fout beweegt.

Om dit systeem te trainen, hebben de onderzoekers niet vertrouwd op één enkele bron van data. Ze verzamelden een enorme bibliotheek van meer dan 37.000 uur aan ervaring. Deze collectie omvatte video's van echte robots die werkten in fabrieken en huizen, opnames van menselijke handen die objecten manipuleren vanuit een eerste-persoonsperspectief, en data gegenereerd door computersimulaties. Ze gebruikten ook kunstmatige intelligentie om nieuwe trainingsscenario's te creëren, waardoor de variëteit aan situaties waar de robot van kon leren effectief werd uitgebreid. Door deze diverse mix van data in het systeem te voeden, lieten de onderzoekers het model algemene principes van beweging en interactie leren, in plaats van alleen specifieke trucjes voor één specifieke robot te memoriseren. Het systeem werd getraind om 16 verschillende soorten robotlichamen aan te kunnen, van tweearmige machines tot humanoïde figuren, waardoor het leerde zijn begrip van "links" en "rechts" of "grijpen" en "loslaten" aan te passen aan het specifieke lichaam dat het aanstuurde.

De resultaten van deze aanpak werden getest op echte robots in zowel industriële als huishoudelijke omgevingen. Wanneer gevraagd werd om taken uit te voeren die de machine nog nooit eerder had gezien, toonde het systeem een opmerkelijk vermogen tot generalisatie. In één test kreeg een robot de opdracht om een stuk kleding op te vouwen dat in een rommelige stapel was gegooid, een taak die vereist dat de machine zijn grip constant aanpast naarmate de stof verschuift en van vorm verandert. Zonder dat er opnieuw getraind hoefde te worden voor dat specifieke kledingstuk, slaagde het systeem erin het vervormbare object te manipuleren. In een ander scenario kreeg de robot de opdracht om een specifieke gekleurde lepel op te pakken uit een groep gemengde bestekstukken, waarmee werd aangetoond dat het subtiele taalinstructies kon begrijpen en op nieuwe objecten kon toepassen. Het systeem bleek ook in staat te zijn om lange reeksen acties te verrichten, zoals het organiseren van een bureau of het vegen van rijst, waarbij de robot een gevoel van het algemene doel moest behouden terwijl hij veel kleine bewegingen uitvoerde.

Een belangrijke bevinding was dat het vermogen van het systeem om de toekomst te voorspellen en de eigen voortgang te evalueren een tastbaar verschil maakte in de succesratio. Wanneer de onderzoekers het voorspellende deel van het systeem verwijderden, had de robot meer moeite met complexe taken en raakte hij vaak vast in lussen van repetitieve bewegingen of slaagde hij er niet in te herstellen van kleine fouten. Met het voorspellende component actief, kon de robot anticiperen dat een bepaalde beweging zou leiden tot een botsing of een vallen, en zou hij zijn koers aanpassen voordat de fout plaatsvond. Deze capaciteit stelde de robot in staat om moeilijke taken, zoals het inpakken van een cadeau of het sorteren van kubussen, met veel hogere betrouwbaarheid te voltooien dan eerdere modellen. De onderzoekers ontdekten dat naarmate ze de hoeveelheid trainingsdata vergrootten, de prestaties van de robot consistent verbeterden, wat suggereert dat het systeem werkelijk leerde van de loutere omvang en variëteit van zijn ervaringen.

De studie benadrukte ook het belang van hoe verschillende soorten data gecombineerd worden. Het systeem presteerde het best wanneer het leerde van een mix van echte robotproeven, menselijke demonstraties en gesimuleerde omgevingen. Elke bron bood een ander soort les: echte robots leerden het systeem over de fysieke beperkingen van specifieke machines, menselijke video's toonden het hoe mensen op natuurlijke wijze met objecten omgaan, en simulaties lieten het veilig oefenen met zeldzame of gevaarlijke scenario's. Door deze bronnen te mengen, ontwikkelde het systeem een robuust begrip van hoe de wereld werkt dat op verschillende robotlichamen toegepast kon worden. De onderzoekers merkten op dat hoewel het systeem niet perfect is en nog steeds worstelt met sommige van de meest complexe fysieke interacties, het een verschuiving vertegenwoordigt van het bouwen van gespecialiseerde robots voor enkelvoudige taken naar het creëren van een algemene intelligentie die zich aan nieuwe uitdagingen kan aanpassen.

Uiteindelijk demonstreert GigaBrain-0.7 dat het opschalen van de hoeveelheid en diversiteit van trainingsdata, gecombineerd met een gestructureerde architectuur die planning, handelen en voorspellen scheidt, kan leiden tot robots die meer capabel en aanpasbaar zijn. Het systeem volgt niet simpelweg een script; het begrijpt de context van een taak, anticipeert op de gevolgen van zijn acties en leert van zijn eigen ervaring om in de loop van de tijd te verbeteren. Hoewel er nog werk te verrichten is voordat dergelijke systemen elke mogelijke situatie in een huis of fabriek kunnen afhandelen, biedt dit onderzoek een duidelijk pad voorwaarts. Het suggereert dat de toekomst van robotica niet ligt in het alleen bouwen van betere hardware, maar in het creëren van slimmere, flexibelere software die kan leren van de uitgestrekte en gevarieerde ervaringen van de fysieke wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →