← Nieuwste papers
💻 computer science

Security of Foundation-Model-Powered Embodied Agents: Attack Surfaces, Attacks, Defenses, and Evaluation

Dit artikel presenteert een op vertrouwensgrenzen gerichte survey van door fundamentele modellen aangedreven belichaamde agenten die beveiligingsrisico's categoriseert in vijf lagen en twaalf aanvalsoppervlakken, 58 aanvallen en 61 verdedigingen analyseert om onderzoeksleemten te onthullen in gebieden zoals geheugen en multi-agent vertrouwen, en toekomstige uitdagingen in evaluatie en compositionele verdediging schetst.

Oorspronkelijke auteurs: Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao

Gepubliceerd 2026-08-18
📖 8 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een robot voor die niet alleen een rigide lijst met commando's volgt, maar de wereld begrijpt via taal, visie en ervaring. Deze machines, vaak belichaamde agenten (embodied agents) genoemd, veranderen de manier waarop we over automatisering denken. In plaats van geprogrammeerd te worden met specifieke stappen voor elke mogelijke situatie, gebruiken ze krachtige fundamentele modellen — systemen die getraind zijn op enorme hoeveelheden menselijke kennis en visuele data — om hun omgeving waar te nemen, erover na te denken wat te doen, en te beslissen hoe ze hun eigen lichaam moeten bewegen. Een robot kan naar een rommelige tafel kijken, begrijpen dat een kopje gevaar loopt om te vallen, en vervolgens een reeks bewegingen plannen om het te redden, allemaal zonder dat een mens een enkele instructie heeft getypt. Deze verschuiving van vaste programmering naar flexibele, intelligente besluitvorming belooft robots in onze huizen, ziekenhuizen en fabrieken te brengen. Deze nieuwe vrijheid brengt echter een nieuw soort risico met zich mee. Wanneer de beslissingen van een machine worden gedreven door informatie die het leest, ziet of onthoudt, wordt die informatie een potentieel punt van falen. Als een aanvaller de perceptie van de robot over de wereld kan misleiden, kan hij de machine doen handelen op manieren die gevaarlijk zijn, zelfs als de fysieke motoren en tandwielen van de robot perfect beveiligd zijn.

Een team van onderzoekers aan de Wuhan University heeft precies in kaart gebracht waar deze gevaren liggen. Ze bestudeerden 58 verschillende manieren om deze intelligente robots aan te vallen en 61 verschillende manieren om hen te verdedigen, waarmee ze een uitgebreide gids creëerden voor de beveiliging van deze opkomende technologie. Hun werk onthult dat de oude manieren van denken over robotveiligheid niet langer voldoende zijn. In het verleden betekende het beveiligen van een robot het beschermen van de bedrading en de softwarecode tegen hackers. Vandaag de dag zijn de meest kwetsbare onderdelen de zintuigen en de geest van de robot. De onderzoekers ontdekten dat aanvallers niet de noodzaak hebben om in te breken in het besturingssysteem van een robot om schade aan te richten; ze kunnen simpelweg veranderen wat de robot ziet of wat hem verteld wordt te doen. Door deze dreigingen in een duidelijke structuur te organiseren, toonde het team aan dat de meest voorkomende aanvallen de ogen en de handen van de robot targeten, terwijl de meest voorkomende verdedigingen direct vóór de beweging van de robot worden geplaatst. Dit onbalans laat veel andere kritieke gebieden, zoals het langetermijngeheugen van de robot en de communicatie met andere machines, grotendeels onbeschermd.

De onderzoekers begonnen met het definiëren van de verschillende lagen van het leven van een robot, van het moment dat de software wordt gemaakt tot het moment dat deze fysiek interageert met de wereld. Ze identificeerden twaalf specifieke toegangspunten waar een aanvaller voor het eerst een leugen of een truc zou kunnen introduceren. Deze variëren van het prille begin, waar de trainingsdata van de robot vergiftigd kan worden voordat deze zelfs wordt ingezet, tot het uiterste punt, waar de fysieke bewegingen van de robot direct worden gekaapt. Een cruciaal inzicht uit hun werk is dat de methode van de aanval niet hetzelfde is als de plek waar deze binnenkomt. Bijvoorbeeld, een "backdoor" is een type verborgen valstrik dat in de trainingsdata van de robot geplant kan worden, maar die pas later geactiveerd kan worden door een specifieke zin die door een gebruiker wordt uitgesproken of een specifieke afbeelding die aan de robot wordt getoond. De onderzoekers betogen dat beveiligingsexperts zich moeten richten op waar de aanval voor het eerst de grens overschrijdt naar de vertrouwde wereld van de robot, in plaats van alleen op de techniek die wordt gebruikt om die grens over te steken. Dit onderscheid helpt bij het begrijpen hoe een kleine leugen in het geheugen van een robot uiteindelijk kan leiden tot een grote fysieke fout.

Toen het team het landschap van het huidige onderzoek analyseerde, kwam er een duidelijk patroon naar voren. De meerderheid van de aanvalstudies richtte zich op twee specifieke gebieden: de multimodale perceptie van de robot en de actie-interfaces. In gewone taal betekent dit dat de meeste onderzoekers proberen de ogen van de robot te bedriegen of de robot te dwingen het verkeerde object te pakken. Ze vonden dat de helft van de geregistreerde aanvallen gericht was op de sensoren van de robot, zoals camera's of microfoons, of de signalen die de robot vertellen hoe hij moet bewegen. Dit is logisch, omdat dit de directe verbindingen zijn tussen de digitale geest en het fysieke lichaam. Als een aanvaller de camera kan foppen door een stopbord te zien als een groen licht, of de robot kan misleiden door te denken dat een muur een open ruimte is, dan kunnen de gevolgen onmiddellijk en fysiek zijn. Op dezelfde manier richten veel aanvallen zich op de laatste stap waarbij de robot een specifieke beweging beslist, zoals een commando om een motor te draaien of een gewicht op te tillen.

De verdedigingsmaatregelen vertellen echter een ander verhaal. De onderzoekers ontdekten dat de meeste beveiligingsmaatregelen geconcentreerd zijn aan het einde van het proces, vlak voordat de robot een actie uitvoert. Dit is als het hebben van een bewaker die alleen het eindproduct controleert voordat het de fabriek verlaat, in plaats van de grondstoffen of de ontwerpplannen te controleren. Hoewel deze "runtime"-bescherming belangrijk is, laat het de eerdere stadia van het denkproces van de robot blootgesteld. De studie toonde aan dat verdedigingen voor het langetermijngeheugen van de robot, de communicatie met andere robots en de integriteit van zijn interne kaart van de wereld verrassend zeldzaam zijn. Er zijn bijvoorbeeld zeer weinig studies naar hoe men het geheugen van een robot kan beschermen tegen vergiftiging. Als een robot een onwaar feit leert van een kwaadwillende bron en dit opslaat, kan die leugen zijn beslissingen voor een lange tijd beïnvloeden, wat herhaalde fouten veroorzaakt die een eenvoudige actiecontrole mogelijk niet opmerkt.

Het team benadrukte ook de unieke uitdagingen van het testen van deze systemen. In tegen tegenstelling tot een tekstgebaseerde chatbot die alleen beoordeeld hoeft te worden op haar woorden, moet een belichaamde robot getest worden op haar fysieke acties. Een robot kan succesvol een kwaadwillig instructie volgen om "de kop te verplaatsen", maar als de robot de kop laat vallen of een vaas omverstoot terwijl hij dat doet, is de aanval geslaagd op een manier die een tekstgebaseerde test nooit zou opmerken. De onderzoekers merkten op dat veel huidige studies vertrouwen op computersimulaties, die nuttig zijn maar vaak falen om de rommelige realiteit van de fysieke wereld te vangen, zoals veranderingen in verlichting, camerahoeken of de onvoorspelbare aard van echte objecten. Ze voerden aan dat echte beveiliging vereist dat robots in echte omgevingen worden getest, waar de gevolgen van een fout tastbaar zijn. Ze wezen ook op het feit dat naarmate robots in groepen gaan samenwerken, het risico groter wordt. Als één robot in een team gecompromitteerd is, kan het slechte informatie verspreiden naar de anderen, waardoor de hele groep faalt.

Met het oog op de toekomst suggereren de onderzoekers dat het vakgebied verder moet gaan dan eenvoudige oplossingen. Ze stellen voor dat toekomstige robots ontworpen moeten worden met een dieper begrip van vertrouwen. Dit betekent dat elk stuk informatie dat een robot ontvangt — van een menselijke stem, een camera-afbeelding of een bericht van een andere robot — een label moet dragen dat de bron en de autoriteit ervan aangeeft. Een robot moet weten dat een bord aan de muur slechts een beschrijving van de wereld is en geen commando om zijn gedrag te veranderen, terwijl een direct bevel van een menselijke operator met een hogere prioriteit behandeld moet worden. Ze benadrukken ook de noodzaak van betere manieren om de interne staat van de robot te verifiëren. Als een robot gelooft dat een deur open is, moet er een manier zijn om te controleren of dat geloof gebaseerd is op solide bewijs of op een truc. Het doel is om systemen te bouwen waarbij veiligheid in elke laag is ingebed, van de data die wordt gebruikt om de robot te trainen tot de uiteindelijke beweging van zijn arm.

Het werk van Liu en zijn collega's dient als een cruciale roadmap voor een snel evoluerend veld. Door de toegangspunten van een aanval te scheiden van de methode, hebben zij een duidelijkere manier geboden om de kwetsbaarheden van intelligente machines te begrijpen. Hun bevindingen suggereren dat hoewel we beter worden in het stoppen van robots om het allerlaatste moment iets verkeerds te doen, we nog niet goed zijn in het voorkomen dat ze worden misleid om in eerste instantie het verkeerde te denken. Naarmate deze machines meer geïntegreerd raken in ons dagelijks leven, zal de uitdaging zijn om ervoor te zorgen dat hun vermogen om te leren en zich aan te passen niet ten koste gaat van hun veiligheid. De weg vooruit vereist een verschuiving van het dichten van individuele gaten naar het bouwen van een systeem waarbij vertrouwen bij elke stap wordt geverifieerd, om ervoor te zorgen dat de acties van de robot in lijn blijven met de menselijke intentie, zelfs in het aangezicht van geraffineerde misleiding.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →