← Nieuwste papers
💻 computer science

MS-MEM: Multi-Skill Manipulation-Enhanced Mapping via Uncertainty- and Disturbance-Aware Action Selection

Dit artikel stelt MS-MEM voor, een evidentieel framework dat actieve viewpoint-selectie, het duwen van objecten en grijpen integreert met een bijkomende verstoringsrestrictie om de nauwkeurigheid van de mapping in rommelige omgevingen te verbeteren terwijl onnodige scèneveranderingen worden geminimaliseerd.

Oorspronkelijke auteurs: Yitian Shi, Jesper Mücke, Nils Dengler, Sicong Pan, Rania Rayyes, Maren Bennewitz

Gepubliceerd 2026-09-03
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yitian Shi, Jesper Mücke, Nils Dengler, Sicong Pan, Rania Rayyes, Maren Bennewitz

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots die in onze huizen en magazijnen werken, worden geconfronteerd met een probleem dat bedrieglijk eenvoudig is: ze kunnen niet alles zien. In een rommelige kamer verbergen objecten zich achter elkaar, wat blinde vlekken creëert die de sensoren van een robot in verwarring brengen. Om een specifiek item te vinden, moet een robot meer doen dan alleen kijken; hij moet met de wereld interageren. Hij kan een doos opzij duwen om te zien wat erachter zit, of naar een nieuwe hoek bewegen om een beter zicht te krijgen. Dit studieveld, bekend als actieve perceptie, rust op het idee dat een robot het beste leert door dingen aan te raken en te bewegen, in plaats van er alleen maar naar te staren. Er is echter een addertje onder het gras. Elke keer dat een robot een object duwt, verandert het de scène. Als de robot te hard of te vaak duwt, kan hij een zorgvuldig gerangschikte plank laten verwaaien, waardoor het later moeilijker wordt om de indeling te begrijpen. De uitdaging voor ingenieurs is om een robot te leren hoe hij nieuwsgierig genoeg kan zijn om verborgen dingen te vinden, maar voorzichtig genoeg om geen rommel te maken in het proces.

Onderzoekers van het Karlsruhe Institute of Technology, de Universiteit van Bonn en de Technische Universiteit van Darmstadt hebben een nieuw systeem ontwikkeld om dit evenwicht te bewaren. Ze noemen het MS-MEM, een raamwerk ontworpen om robots te helpen compacte, rommelige ruimtes zoals planken in kaart te brengen terwijl de scène zo ongestoord mogelijk blijft. Het systeem stelt een robot in staat om te kiezen tussen drie verschillende soorten acties: bewegen naar een nieuw gezichtspunt om meer te zien, objecten duwen om te onthullen wat verborgen is, of een object oppakken en verwijderen dat het zicht blokkeert. De kerninnovatie is dat de robot niet zomaar de actie kiest die de meeste informatie oplevert; hij berekent ook de kosten van die actie. Hij vraagt zichzelf af: "Als ik deze doos duw, hoeveel verstoort dat de rest van de plank?" en "Is de nieuwe informatie de rommel waard die ik mogelijk maak?"

Het team bouwde hun systeem op een fundament van onzekerheid. In plaats van de kaart van de kamer te behandelen als een vaststaand beeld, houdt de robot een "overtuiging" (belief) bij over wat waar is, inclusief een maatstaf voor hoe onzeker hij is. Wanneer de robot zeer zeker is over een gebied, weet hij dat hij het niet moet aanraken. Wanneer hij onzeker is, weet hij dat hij moet onderzoeken. Om deze beslissingen te nemen, introduceerden de onderzoekers een nieuwe manier waarop de robot grijpen begrijpt. Eerdere systemen hadden vaak moeite om te voorspellen hoe de grijper van een robot zou interageren met een object wanneer het zicht gedeeltelijk was of het object zich in een krappe plek bevond. Dit nieuwe systeem leert de robot niet alleen te schatten waar hij moet pakken, maar ook hoe zeker hij is van die greep, en hoe de oriëntatie van het object onzeker is. Dit stelt de robot in staat om informatie uit meerdere hoeken samen te voegen, waardoor hij zijn begrip van een greep in de loop van de tijd verfijnt terwijl hij rond het object beweegt.

In hun experimenten testten de onderzoekers dit systeem in een gesimuleerde omgeving die een echte wereld nabootste met een plank vol willekeurig geplaatste objecten. Ze vergeleken hun nieuwe multi-skill aanpak met oudere methoden die vertrouwden op slechts één type actie, zoals alleen duwen of alleen grijpen. De resultaten lieten zien dat het combineren van deze vaardigheden veel effectiever was. Door duwen te gebruiken om objecten te scheiden en ruimte te creëren, en vervolgens grijpen te gebruiken om specifieke blokkades te verwijderen, was de robot in staat een nauwkeuriger kaart van de scène op te stellen. De meest significante bevinding kwam echter uit het vermogen van het systeem om verstoring te beperken. Toen de onderzoekers een specifieke beperking toevoegden aan het besluitvormingsproces van de robot — een regel die onnodige veranderingen in de scène bestrafte — werd de robot veel voorzichtiger. Hij vond nog steeds de verborgen objecten, maar bewoog veel minder items dan de systemen die deze regel niet hadden. In simulaties verminderde het nieuwe systeem de totale afstand die objecten werden verplaatst met een aanzienlijke marge vergeleken met methoden die de verstoring van de scène negeerden, terwijl het tegelijkertijd een hoge nauwkeurigheid bereikte bij het in kaart brengen van de plank.

Het team testte het systeem ook in de echte wereld met behulp van een fysieke robotarm uitgerust met een camera en een grijper. Ze plaatsten de robot voor een plank met 69 objecten verspreid over vijf verschillende uitdagende opstellingen. De robot moest zoveel mogelijk objecten vinden en identificeren. Het systeem dat het combineren van duwen, grijpen en voorzichtig bewegen toepaste, vond meer objecten dan de systemen die slechts één vaardigheid gebruikten. Het identificeerde succesvol 44 objecten, vergeleken met 40 voor het systeem dat alleen duwt en 38 voor het systeem dat alleen grijpt. Cruciaal was dat het dit deed met minder fysieke verplaatsing van de items op de plank. Het systeem dat alleen grijpt, bewoog het minst, maar vond veel verborgen items niet omdat het te conservatief was. Het systeem dat alleen duwt, vond veel items maar verspreidde de plank aanzienlijk. Het nieuwe systeem vond de beste balans: het vond de meeste objecten terwijl het de scène relatief geordend hield.

Dit werk toont aan dat voor robots om effectief te kunnen opereren in menselijke ruimtes, zij in staat moeten zijn om na te denken over de gevolgen van hun acties. Het is niet voldoende om simpelweg in staat te zijn om dingen op te pakken of te duwen; de robot moet de waarde van de verkregen informatie afwegen tegen de kosten van de verandering die hij creëert. Door robots te leren deze factoren af te wegen, hebben de onderzoekers een stap gezet richting machines die onze rommelige wereld kunnen navigeren met dezelfde zorg en aanpassingsvermogen als mensen. Het systeem ziet de wereld niet alleen; het begrijpt het verschil tussen een nuttige interactie en een verstorende interactie, waardoor het zijn omgeving kan leren kennen zonder de orde die het probeert in kaart te brengen te vernietigen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →