← Nieuwste papers
💻 computer science

Passivity-Centric Safe Reinforcement Learning for Contact-Rich Robotic Tasks

Dit artikel behandelt de veiligheids- en stabiliteitsbeperkingen van traditionele reinforcement learning bij contactrijke robotica-taken door een raamwerk voor te stellen dat passiviteitsbewuste training integreert met energiegebaseerde beperkingen en een passiviteitsfilter voor implementatie, waardoor de controle-stabiliteit wordt gegarandeerd en de energie-efficiëntie wordt verbeterd.

Oorspronkelijke auteurs: Heng Zhang, Gokhan Solak, Sebastian Hjorth, Arash Ajoudani

Gepubliceerd 2026-09-03
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Heng Zhang, Gokhan Solak, Sebastian Hjorth, Arash Ajoudani

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een robotarm voor die uitreikt om een muur aan te raken, niet om deze weg te duwen, maar om de weg te voelen door een donkere, kronkelende doolhof. Dit is de wereld van contactrijke robotica, waar machines fysiek met hun omgeving moeten interageren om problemen op te lossen. Jarenlang hebben wetenschappers een krachtig hulpmiddel genaamd reinforcement learning gebruikt om robots te leren dit te doen. Denk hierbij aan een digitaal proces van trial-and-error: de robot probeert een beweging, krijgt een beloning als het slaagt, en leert van zijn fouten. Hoewel deze methode indrukwekkende resultaten heeft opgeleverd in computer-simulaties, blijft er een grote hindernis bestaan wanneer deze robots naar de echte wereld worden gebracht. De algoritmen zijn uitstekend in het vinden van een pad naar een doel, maar ze negeren vaak een fundamentele regel van de natuurkunde: energie. Als een robot een strategie leert die vereist dat hij te veel energie in zijn gewrichten of de omgeving pompt, kan hij instabiel worden, heftig schudden of zelfs zichzelf en de objecten die hij aanraakt beschadigen. Het waarborgen dat de bewegingen van een robot veilig en stabiel zijn, is niet alleen een theoretische zorg; het is een praktische noodzaak voor elke machine die ooit naast mensen zal werken.

Onderzoekers aan het Istituto Italiano di Tecnologia in Genua, Italië, gingen aan de slag om dit specifieke probleem op te lossen. Ze stelden een eenvoudige maar cruciale vraag: kunnen we een robot leren om niet alleen goed te zijn in een taak, maar ook inherent veilig te zijn met betrekking tot hoe hij energie gebruikt? Hun werk richt zich op een concept genaamd passiviteit. In eenvoudige termen betekent passiviteit dat een systeem niet uit het niets energie kan creëren; het kan alleen wat het ontvangt opslaan of het dissiperen. Een passieve robot is een robot die zich gedraagt als een goed gedempte veer, die schokken absorbeert in plaats van ze te versterken. Het team ontdekte dat standaard reinforcement learning-policies, die getraind zijn om het succes van een taak te maximaliseren, vaak niet aan deze regel voldoen. In hun experimenten leerden deze standaard policies taken snel te voltooien, maar deden ze dit door besturingscommando's te genereren die de energiegrenzen overschreden, wat leidde tot instabiliteit bij implementatie in de echte wereld.

Om dit op te lossen, ontwikkelden de onderzoekers een nieuwe aanpak die het leervermogen van kunstmatige intelligentie combineert met strikte energieregels. Ze creëerden een systeem met twee afzonderlijke delen die samenwerken. Het eerste deel vindt plaats tijdens de trainingsfase. Hier leerden ze de robot om "passiviteitsbewust" te zijn. In plaats van de robot alleen te belonen voor het bereiken van de uitgang van een doolhof, voegden ze onzichtbare beperkingen toe die de robot bestraften voor het gebruik van te veel energie of het te snel veranderen van zijn stijfheid. Dit dwong de robot om een economischerere manier van bewegen te leren, waarbij hij strategieën ontdekte die van nature milder en stabieler waren. Het tweede deel vindt plaats wanneer de robot daadwerkelijk werkt. Zelfs met de betere training wisten de onderzoekers dat een computerprogramma nog steeds een fout kon maken. Daarom voegden ze een veiligheidsfilter toe, een laatste laag bescherming die tussen de hersenen van de robot en zijn spieren zit. Deze filter houdt constant de energiestroom in de gaten. Als de robot probeert een beweging te maken die te veel energie in het systeem zou injecteren, schaalt de filter deze beweging automatisch terug, zodat de robot binnen veilige grenzen blijft.

Het team testte deze methode in een uitdagend scenario: een taak van doolhofverkenning waarbij een robotarm zijn weg naar buiten moest vinden door blindelings de muren aan te raken. Ze vergeleken vier verschillende soorten robots: één die de energieregels volledig negeerde, één die getraind was om om energie te geven maar geen veiligheidsfilter had, één die een veiligheidsfilter had maar getraind was zonder energieregels, en tenslotte hun nieuwe methode die zowel energiebewuste training als de veiligheidsfilter combineerde. De resultaten waren duidelijk. De robot die getraind werd zonder energieregels kon het doolhof voltooien in simulaties, maar toen ze probeerden deze op een echte fysieke robot te draaien, faalde het. De robot bewoog te agressief en oefende bij de bochten excessieve kracht uit, wat ertoe leidde dat hij de controle verloor. In contrast hiermee leerden de robots die getraind waren met energiebeperkingen om conservatiever te bewegen. Ze hadden iets langer nodig om de taak tijdens de trainingsfase te leren, maar eenmaal ingezet waren ze veel betrouwbaarder.

Toen de onderzoekers de best getrainde modellen in de echte wereld op de proef stelden, was het verschil groot. De robot die hun gecombineerde methode gebruikte, voltooide het doel in elk enkel experiment, zonder ooit de krachtlimieten te schenden of door zijn energiebudget heen te raken. De standaardrobot, zelfs beschermd door de veiligheidsfilter, had moeite omdat hij niet had geleerd zijn energie efficiënt te beheren. De veiligheidsfilter alleen kon een ramp voorkomen, maar kon de robot niet efficiënt maken. De energiebewuste training alleen maakte de robot efficiënt, maar kon niet garanderen dat hij veilig was als de robot een plotselinge, onvoorspelbare fout maakte. Alleen door beide te combineren, bereikten zij een systeem dat zowel veilig als efficiënt was. De onderzoekers ontdekten dat de robot die getraind was met strikte energiegrenzen zijn energiebudget veel langzamer en gelijkmatiger gebruikte, waardoor hij complexe bochten en obstakels kon afhandelen zonder zonder slag of stoot te raken.

Dit werk benadrukt een cruciale verschuiving in hoe we intelligente machines bouwen. Het suggereert dat voor robots om veilig in onze fysieke wereld te kunnen werken, ze niet alleen geleerd moeten worden om slim te zijn; ze moeten ook geleerd worden om fysiek verantwoordelijk te zijn. Door de wetten van energiebehoud direct in het leerproces in te bedden en dit te ondersteunen met een realtime veiligheidsfilter, hebben de onderzoekers aangetoond dat het mogelijk is om een pad te banen naar robots die niet alleen bekwaam, maar ook betrouwbaar zijn. Hun experimenten, uitgevoerd op een robotarm met zeven gewrichten, bewijzen dat het mogelijk is om een machine te leren door een moeilijke, contactrijke omgeving te navigeren zonder de eigen stabiliteit of de veiligheid van de omgeving in gevaar te brengen. De methode leunt niet op complexe wiskundige modellen van de wereld die foutief zouden kunnen zijn; in plaats daarvan vertrouwt het op de robot die de grenzen van zijn eigen energie leert door ervaring, geleid door regels die hem stevig in de fysieke realiteit houden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →