← Nieuwste papers
💻 computer science

MANIGUARD: A Benchmark and Data Suite for Specification-Grounded Safety Evaluation and Improvement of Robotic Manipulation

Dit artikel introduceert ManiGuard, een uitgebreide benchmark en dataset die de veiligheid van robotmanipulatiebeleid rigoureus evalueert en verbetert door veiligheidsspecificaties los te koppelen van taaksucces, waarbij gebruik wordt gemaakt van formele runtime-monitoring om aan te tonen dat hoewel fine-tuning de veiligheid verbetert, er zelfs met toegenomen data en distributieverschuivingen aanzienlijke tekortkomingen blijven bestaan.

Oorspronkelijke auteurs: Yiyan Peng, Philip Wang, Simon Sinong Zhan, Yiqi Lyu, Zhenyang Ni, Jixin Yan, Fiorelli Wong, Ruochen Jiao, Hang Yin, Xinyu Cao, Huajie Shao, Manling Li, Ruohan Zhang, Qi Zhu

Gepubliceerd 2026-08-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yiyan Peng, Philip Wang, Simon Sinong Zhan, Yiqi Lyu, Zhenyang Ni, Jixin Yan, Fiorelli Wong, Ruochen Jiao, Hang Yin, Xinyu Cao, Huajie Shao, Manling Li, Ruohan Zhang, Qi Zhu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots leren onze huishoudelijke taken over te nemen, waarbij ze bewegen van eenvoudige, repetitieve bewegingen naar complexe taken zoals het afruimen van een tafel of het organiseren van een keuken. Deze vooruitgang steunt op "foundation models", een type kunstmatige intelligentie dat leert van enorme hoeveelheden data om taal, visie en beweging tegelijkertijd te begrijpen. Deze systemen worden steeds beter in het voltooien van een taak, maar een cruciale vraag blijft: kunnen ze dit doen zonder schade aan te richten? In de echte wereld kan een robot die succesvol een kopje in een kastje zet, ook een vaas omver stoten, een drankje morsen of een breekbaar object beschadigen terwijl hij dat doet. Om robots van onderzoekslabs naar onze huizen te laten verhuizen, moeten we niet alleen weten of ze slagen, maar ook of ze veilig slagen. Dit vereist een manier om veiligheid te meten die even nauwkeurig is als de maatstaf voor succes, waarbij elke beweging wordt gecontroleerd aan de hand van een duidelijke set regels, in plaats van alleen naar het eindresultaat te kijken.

Een team van onderzoekers heeft een nieuw raamwerk geïntroduceerd genaamd ManiGuard om deze vraag te beantwoorden. Ze bouwden een rigoureuze testomgeving die veiligheid behandelt als een apart, niet-onderhandelbaar doel, onafhankelijk van het feit of de robot de taak voltooit. In plaats van te vertrouwen op menselijke waarnemers die moeten gissen of een robot veilig was, of op AI-beoordelaars die bevooroordeeld kunnen zijn, gebruikten de onderzoekers een formeel, wiskundig systeem om veiligheidsregels te definiëren. Ze vertaalden deze regels naar een set logische beperkingen, zoals "de pot moet gesloten blijven totdat deze wordt opgetild" of "raak het voedsel niet aan terwijl je de pan schoonmaakt". Terwijl de robot beweegt in een hoogwaardige simulatie, controleert een digitale monitor elke stap in realtime tegen deze regels. Als de robot tegen iets aanstoot dat hij niet zou mogen raken of een object laat vallen, signaleert het systeem de overtreding onmiddellijk, ongeacht of de robot uiteindelijk zijn hoofdtaken voltooit.

De onderzoekers organiseerden tweehonderd verschillende huishoudelijke taken in zes categorieën, variërend van eenvoudige pak-en-plaatsacties tot complexe, meerstaps choreografieën met laden of gestapelde borden. Voor elke taak creëerden ze een specifieke veiligheidsregel die orthogonaal was aan het doel, wat betekent dat een robot technisch gezien de taak zou kunnen voltooien terwijl hij toch de veiligheidsregel overtreedt. Ze testten vervolgens verschillende geavanceerde AI-policies op deze taken, eerst zonder speciale training en daarna na training op een nieuwe dataset. Deze dataset was uniek omdat deze werd opgebouwd met behulp van dezelfde veiligheidsmonitor; de onderzoekers verzamelden duizenden demonstraties waarin robots taken succesvol voltooiden zonder ooit een veiligheidsregel te schenden, waardoor ze een bibliotheek van "veilig" gedrag creëerden waar de AI van kon leren.

De resultaten onthulden een harde realiteit over de huidige robotische intelligentie. Wanneer ze zonder training werden getest, gingen de robots zelden de taken aan; ze kozen er vaak voor om niets te doen in plaats van een fout te riskeren. Wanneer ze wel handelden, waren ze vaak onveilig. Zelfs na training op de veilige demonstraties verbeterden de robots aanzienlijk, maar er bleef een grote kloof bestaan. De onderzoekers ontdekten dat tussen de zes en eenentwintig procent van de succesvolle taken eigenlijk onveilig waren; de robots bereikten hun doelen, maar overtraden onderweg de veiligheidsregels. Bovendien konden twee robots met bijna identieke succespercentages een zeer verschillend veiligheidsrecord hebben, wat bewijst dat het voltooien van een klus niet garandeert dat het ook veilig gebeurt.

Het trainen van de robots op de nieuwe, veilig geannoteerde data hielp, waarbij het percentage veilige taakvoltooiing steeg van bijna nul naar tussen de zeven en dertig procent. De onderzoekers ontdekten echter dat simpelweg meer van dezelfde veilige demonstraties toevoegen het probleem niet oploste. Wanneer de robots te maken kregen met lichte veranderingen in de omgeving, zoals een andere achtergrond of een verplaatst object, daalde hun veiligheidsprestatie. Sommige taken, met name die met laden of delicaat stapelen, bleven extreem moeilijk, waarbij de veilige succespercentages onder de twee procent bleven voor elke geteste policy. De studie toonde ook aan dat hoewel de simulatieresultaten over het algemeen voorspelden welke robots veiliger waren, de exacte frequentie van ongelukken niet altijd overeenkwam met wat er op een fysieke robot gebeurde, wat suggereert dat simulatie een nuttige gids is maar geen perfect kristallen bol.

Uiteindelijk toont het werk aan dat veiligheid een afzonderlijke uitdaging is die niet kan worden opgelost door robots simpelweg beter te maken in het voltooien van taken. De onderzoekers toonden aan dat huidige AI-modellen de fysieke beperkingen van de wereld of de specifieke veiligheidsregels die ze krijgen nog niet volledig begrijpen. Hoewel finetunen op zorgvuldig gecureerde, veilige data helpt, is het geen wondermiddel. De aanhoudende fouten, zelfs na training, wijzen erop dat toekomstige vooruitgang nieuwe methoden vereist om robots niet alleen te leren wat ze moeten doen, maar ook hoe ze dat kunnen doen zonder de regels van de fysieke wereld te breken. Het ManiGuard-raamwerk biedt de instrumenten om deze vooruitgang rigoureus te meten en biedt een duidelijk pad voor de ontwikkeling van robots die niet alleen bekwaam, maar ook werkelijk veilig zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →