MessyMem: Learning-from-Doing Memory for Mobile Manipulation
MessyMem is een persistent geheugensysteem voor mobiele manipulatoren dat een ruimtelijk gegrondeerde 3D-scenegraaf onderhoudt, aangevuld met interactie-afgeleide kennis, waardoor robots kunnen leren van ervaring en bestaande baselines aanzienlijk overtreft door eerdere ontdekkingen te hergebruiken bij taken met een lange horizon.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Robots die rondbewegen in onze huizen en kantoren worden steeds gebruikelijker, maar ze worstelen nog steeds met een fundamentele menselijke vaardigheid: het onthouden van wat ze hebben geleerd. De huidige huishoudelijke robots behandelen elke nieuwe opdracht vaak alsof het de allereerste keer is dat ze een kamer binnenkomen. Als een robot een kastje opent en het leeg aantreft, kan hij dat feit tegen de volgende ochtend alweer vergeten zijn. Als hij ontdekt dat een lade op slot zit, probeert hij deze bij toekomstige taken wellicht steeds opnieuw met geweld te openen. Dit gebrek aan persistent geheugen dwingt robots om voortdurend bij nul te beginnen, wat tijd en energie verspilt. Om effectief te kunnen functioneren in een echt huis, heeft een machine meer nodig dan alleen een kaart van waar dingen zich bevinden; het heeft een verslag nodig van wat het heeft ontdekt door middel van tast en actie, en een manier om specifieke visuele details van uren of dagen geleden op te roepen.
Onderzoekers aan de Stanford University hebben een systeem ontwikkeld genaamd MessyMem om dit probleem op te lossen. Het systeem fungeert als een langetermijngeheugen voor mobiele robots, waardoor ze kennis kunnen meenemen tussen verschillende kamers en over langere perioden van tijd. In plaats van te vertrouwen op een eenvoudige lijst van objecten of een continue videofeed die te groot is om te doorzoeken, bouwt MessyMem een gestructureerde kaart van de wereld die slimmer wordt bij elke interactie. Het combineert drie verschillende soorten informatie: een ruimtelijke kaart van waar objecten zich bevinden, een verslag van wat de robot heeft geleerd door fysiek dingen aan te raken of te bewegen, en een bibliotheek van specifieke foto's die op sleutelmomenten zijn genomen. Door deze drie elementen aan elkaar te koppelen, kan de robot complexe vragen beantwoorden zoals "Waar heb ik de schaar gezien?" of "Welk kastje zit op slot?" zonder de hele woning opnieuw te hoeven verkennen.
De kern van dit systeem is een 3D-scenegraaf, wat in essentie een digitale kaart is die elke object die de robot heeft gezien en de locatie ervan in de wereld opsomt. In tegenstelling tot een standaardkaart die alleen geometrie registreert, koppelt dit systeem een gedetailleerd profiel aan elk item. Wanneer de robot met een object interageert, zoals het proberen te openen van een lade of het oppakken van een beker, analyseert een gespecialiseerd softwarecomponent het resultaat. Het bepaalt of de lade op slot zat, of de beker leeg was, of dat de actie mislukte omdat de robot uitgleed. Deze informatie wordt direct op het digitale profiel van dat object geschreven. Dus als de robot probeert een kastje te openen en het op slot vindt, wordt dat feit opgeslagen. Later, wanneer er naar iets gezocht wordt dat zich in dat kastje bevindt, raadpleegt de robot zijn geheugen, ziet de notitie "op slot" en slaat dat kastje volledig over om direct naar een onbeveiligd kastje te gaan.
Het weten dat een kastje op slot zit, is echter niet altijd voldoende. Soms moet de robot fijne details onthouden die een eenvoudige tekstuele notitie niet kan vastleggen, zoals een specifieke sticker op een mok of een etiket op een pot. Om dit aan te pakken, slaat MessyMem geselecteerde foto's op, zogenaamde keyframes, en koppelt deze direct aan de objecten in de kaart. Deze foto's zijn niet zoma aant een willekeurige stroom video; het zijn zorgvuldig gekozen momenten, zoals het uitzicht vlak voordat een robot een object oppakt of het uitzicht in een lade nadat deze is geopend. Wanneer de robot voor een nieuwe taak staat, doorzoekt hij zijn geheugen naar de meest relevante foto's. Hij kan zoeken naar een foto die de exacte plank laat zien waar een koffiecontainer voor het laatst werd gezien, of een foto van een specifiek patroon op een sok. Dit stelt de robot in staat om tussen twee identiek uitziende items te onderscheiden op basis van visueel bewijs dat hij in het verleden heeft verzameld.
De onderzoekers testten dit systeem zowel in computersimulaties als op een echte robot die zich in een fysieke omgeving bewoog. In een simulatie met een aaneengesloten reeks van vijfentwintig verschillende huishoudelijke taken die meer dan drie uur besloegen, voltooide de robot met MessyMem succesvol tachtig procent van de taken. Dit was een significante verbetering ten opzichte van andere methoden. Robots die alleen vertrouwden op de ruimtelijke kaart zonder de interactienotities, of die wel de notities hadden maar geen foto's, presteerden veel slechter. Bijvoorbeeld, wanneer gevraagd werd om een specifiek item te vinden dat verborgen zat in een rommelig kastje, kon het volledige systeem de exacte visuele opstelling van de items herinneren, terwijl de anderen faalden omdat ze het doelwit niet konden onderscheiden van vergelijkbare objecten. In een test in de echte wereld met een bureau op een kantoor met meerdere laden, vond de robot succesvol een schaar, identificeerde hij een specifieke beker die bij een persoon genaamd John hoorde, en lokaliseerde hij een gamecontroller, allemaal door kennis te hergebruiken die hij in eerdere stappen had verzameld.
De experimenten toonden aan dat het systeem het beste werkt wanneer alle drie de componenten aanwezig zijn. De ruimtelijke kaart biedt de locatie, de interactienotities bieden de staat van de wereld (zoals wat op slot zit of leeg is) en de foto's bieden het visuele bewijs dat nodig is voor moeilijke onderscheidingen. Zonder de interactienotities verspilde de robot tijd door te proberen vergrendelde laden te openen. Zonder de foto's kon hij het verschil niet zien tussen twee vergelijkbare flessen. Het systeem bleek ook efficiënt; zelfs na het opslaan van duizenden foto's en het draaien voor uren, kon het snel het specifieke bewijsstuk vinden dat nodig was voor een taak, waarbij het terugkeek over een uur aan eerdere activiteiten om een beslissing te nemen.
Dit werk suggereert dat voor robots om echt nuttige assistenten te worden in ons dagelijks leven, zij in staat moeten zijn om te leren van hun eigen acties en die lessen te onthouden. Het MessyMem-systeem demonstreert dat door een kaart, een logboek van interacties en een bibliotheek van sleutelbeelden te combineren, een robot kan stoppen met elke taak als een nieuwe ontdekking te behandelen en kan beginnen met het opbouwen van een continue geschiedenis van zijn ervaringen. Hoewel het huidige systeem gebruikmaakt van een vooraf gedefinieerde lijst van objecten die het kan herkennen, merken de onderzoekers op dat toekomstige versies uitgebreid kunnen worden om een grotere verscheidenheid aan artikelen te herkennen en zelfs te leren van menselijke handelingen. Voor nu tonen de resultaten een duidelijke weg vooruit: een robot die onthoudt wat hij heeft aangeraakt en gezien, is een robot die eindelijk naast ons kan werken zonder telkens opnieuw te beginnen wanneer we hulp nodig hebben.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.