← Nieuwste papers
💻 computer science

Zetta ζ\zeta: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence

Het artikel presenteert Zetta, een closed-loop embodied harnas dat zelfevoluerende fysieke intelligentie mogelijk maakt door via drie op tijdschalen gescheiden lussen online code-gebaseerde critici en herstelvaardigheden dynamisch bij te werken, waarbij het staat-van-de-kunst prestaties en significante versnellingen in inferentiesnelheid op benchmarktaken bereikt terwijl het zero-shot transfer en emergente "Aha Momenten" demonstreert.

Oorspronkelijke auteurs: Xin Ding, Liang Mi, Mingzhe Huang, Zixuan Wang, Chao Zhang, Zixu Hao, Fu Chen, Xiangyu Li, Yikai Zheng, Yaoyu Guo, Weijun Wang, Kun Li, Hao Wu, Yunxin Liu, Ting Cao

Gepubliceerd 2026-08-18
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xin Ding, Liang Mi, Mingzhe Huang, Zixuan Wang, Chao Zhang, Zixu Hao, Fu Chen, Xiangyu Li, Yikai Zheng, Yaoyu Guo, Weijun Wang, Kun Li, Hao Wu, Yunxin Liu, Ting Cao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots zijn al lang in staat om eenvoudige, repetitieve taken in fabrieken uit te voeren, maar het geven van de flexibiliteit om de rommelige, onvoorspelbare aard van een echt huis of een werkplaats aan te kunnen, blijft een van de moeilijkste uitdagingen in kunstmatige intelligentie. Jarenlang hebben onderzoekers geprobeerd robots te onderwijzen door ze enorme hoeveelheden videodata te voeren, in de hoop dat de machine een enkele, perfecte set instructies zou leren voor elke mogelijke situatie. Deze benadering, hoewel krachtig, faalt vaak wanneer de echte wereld zelfs maar enigszins afwijkt van de trainingsvideo's; een lichte slip van een grijper of een verandering in verlichting kan ervoor zorgen dat de robot bevriest of crasht. Een alternatief pad is ontstaan, waarbij robots niet worden behandeld als statische programma's, maar als agenten die kunnen denken, plannen en gereedschap kunnen gebruiken. Echter, zelfs deze intelligentere agenten hadden moeite met het leren van hun eigen fouten in real time. De meeste systemen werken in een lus waarin ze een taak proberen, falen, en pas reflecteren op wat er misging nadat de hele poging is voltooid. Tegen de tijd dat ze de fout analyseren, is het moment om het te herstellen al gepasseerd en is de fysieke interactie al verbroken.

Een team van onderzoekers van Tsinghua University en Z-Trans AI heeft een nieuw systeem geïntroduceerd genaamd Zetta, dat de manier waarop robots leren verandert door de kloof tussen denken en handelen te dichten. In plaats van te wachten tot een taak is voltooid om te leren, staat Zetta een robot toe om zijn eigen fysieke staat continu te monitoren terwijl hij beweegt, waardoor fouten direct worden opgemerkt zodra ze gebeuren en ze onmiddellijk kunnen worden gecorrigeerd. Het systeem probeert niet de kernhersenen van de robot te hertrainen, die vast en stabiel blijven. In plaats daarvan bouwt het een laag van "runtime critics" (runtime-critici) — kleine, gespecialiseerde monitors die de handen van de robot en de objecten die hij aanraakt in de gaten houden. Als een criticus merkt dat een grip slipt of een object dreigt te vallen, activeert het een vooraf geprogrammeerde herstelvaardigheid om de situatie te redden voordat de robot de controle verliest. Dit creëert een zelf evoluerende lus waarbij de robot beter wordt in een specifieke taak naarmate hij vaker probeert, niet door zijn fundamentele begrip van de wereld te veranderen, maar door een bibliotheek op te bouwen van bewezen manieren om fysieke fouten af te handelen.

De onderzoekers testten deze aanpak op twee belangrijke benchmarks voor robotmanipulatie: een reeks taken waarbij objecten tussen verschillende locaties worden verplaatst en een complexere reeks huishoudelijke taken zoals het openen van laden of het aanzetten van apparaten. In deze simulaties begon het systeem met een basisrobotbeleid dat een succespercentage van ongeveer 35 procent had op de moeilijkere taken. Terwijl het systeem duizenden proeven uitvoerde, begon het de specifieke momenten te identificeren waarop dingen misgingen. Het groepeerde deze fouten, bepaalde de grondoorzaak en schreef nieuwe code om ze te herstellen. Binnen slechts enkele ronden van deze zelfcorrectie sprong het succespercentage op de moeilijke taken naar meer dan 90 procent. Het systeem werd niet simpelweg geluk; het demonstreerde een duidelijk patroon van verbetering waarbij het een tijdje worstelde, om vervolgens plotseling een cruciaal fysiek principe te ontdekken — zoals de noodzaak om een greep te stabiliseren voordat men tilt — waarna de prestaties een sprong voorwaarts maakten. De onderzoekers noemen deze plotselinge doorbraken "aha-momenten", waarbij de robot eindelijk het fysieke principe begrijpt dat het miste.

Wat deze ontdekking bijzonder significant maakt, is dat de vaardigheden die de robot leerde, niet gebonden waren aan één specif kind object of één specifieke kamer. Toen de onderzoekers de vaardigheden die de robot had geleerd om een wijnfles te hanelen in de ene taak, toepasten op een totaal andere taak waarbij een bakje roomkaas betrokken was, slaagde de robot zonder nieuwe training. Het systeem had algemene principes geleerd over hoe men objecten vasthoudt, beweegt en plaatst, die werkten in verschillende scenario's. Dit suggereert dat de robot niet alleen een pad naar een doel aan het memoriseren was, maar een dieper begrip aan het leren was van hoe men met de fysieke wereld moet interageren. Het systeem bleek ook ongelooflijk snel te zijn door simulaties op een cluster van computers te draaien om de ervaring op te doen die nodig is voor het leren. Door de logica van de robot los te koppelen van de hardware die de simulatie draait, konden de onderzoekers het leerproces meer dan twintig keer sneller laten verlopen dan voorheen, waardoor de robot zijn vaardigheden kon evolueren in een kwestie van uren in plaats van dagen.

De onderzoekers stellen dat deze aanpak een fundamenteel probleem in de robotica oplost: het onvermogen van huidige modellen om te reageren op de snelle veranderingen van de fysieke wereld. Grote modellen voor kunstmatige intelligentie zijn te traag om beslissingen te nemen met de snelheid die vereist is om een vallend object op te vangen of een slippende greep aan te passen. Door de hoofdhersenen bevroren te houden en een snelle, reactieve laag van critici en herstelvaardigheden toe te voegen, overbrugt Zetta de kloof tussen hoogwaardige planning en laagwaardige fysieke controle. Het systeem bewees dat het complexe, lange sequenties van acties aan kon, zoals het navigeren door een keuken, een kastje openen en een item erin plaatsen, door de taak op te delen in beheersbare stappen en een vangnet klaar te hebben voor elke potentiële fout. In een casestudy probeerde een robot herhaaldelijk een fles naar een kom te verplaatsen, maar faalde omdat hij de fles tijdens het transport liet vallen. Na enkele ronden van zelfcorrectie voegde het systeem een specifieke controle toe om te verzekeren dat de greep stevig was voordat er bewogen werd, en het succespercentage voor die taak schoot omhoog van 15 procent naar 95 procent.

Het werk benadrukt ook het belang van infrastructuur om dit soort leren mogelijk te maken. Om de vaardigheden van een robot te laten evolueren, moet het systeem duizenden proeven uitvoeren om de zeldzame momenten te vinden waarop het faalt en vervolgens die fouten te analyseren. De onderzoekers bouwden een gespecialiseerd systeem om deze werklast te beheren, waardoor ze veel simulaties tegelijkertijd konden draaien zonder vertraging op te lopen. Deze infrastructuur was cruciaal voor de snelheid van het project, waardoor het team in staat was de nodige data te verzamelen om de critici en herstelvaardigheden efficiënt te trainen. Zonder het vermogen om het leerproces op deze schaal te laten verlopen, zou de zelf-evoluerende lus te traag zijn geweest om praktisch te zijn. De resultaten suggereren een nieuwe weg vooruit voor fysieke intelligentie, waarbij robots niet vanaf het begin perfect hoeven te zijn, maar kunnen leren om betrouwbaar te zijn door ervaring, waarbij ze voortdurend hun vermogen om het onverwachte af te handelen verfijnen.

De implicaties van dit onderzoek reiken verder dan alleen het beter maken van de bewegingen van robots bij het verplaatsen van objecten. Het biedt een blauwdruk voor hoe kunstmatige intelligentie op een robuuste en aanpasbare manier met de fysieke wereld kan interageren. Door de focus te leggen op het vermogen om fouten in real time te detecteren en te herstellen, vermijdt het systeem de broosheid die eerdere benaderingen heeft geteisterd. De onderzoekers merken op dat hoewel hun huidige werk in simulatie werd uitgevoerd, de ontwikkelde principes bedoeld zijn om naar echte robots te worden overgedragen. De volgende stap voor het team is om dit zelf-evoluerende harnas te nemen en te testen op fysieke machines, om zo de kloof tussen de digitale simulatie en de echte wereld te overbruggen. Indien succesvol, zou dit kunnen leiden tot robots die niet alleen geprogrammeerd zijn om een taak uit te voeren, maar in staat zijn om hun prestaties te leren en te verbeteren elke keer dat ze het proberen, wat hen nuttiger en betrouwbaarder maakt als partners in menselijke omgevingen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →