Cognitively-Grounded On-Device Runtime Learning for Ground Robots in Unknown Physical Environments
Dit artikel introduceert CogRun, een volledig autonoom on-device framework dat veiligheidskritische grondrobots in staat stelt om cognitief gefundeerd runtime-leren uit te voeren in onbekende omgevingen zonder voorafgaande kaarten of connectiviteit door een nieuwe lerende agent te integreren met een specifieke op veiligheid gerichte rationele agent.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een robot voor die naar een bos wordt gestuurd dat hij nog nooit eerder heeft gezien, met de taak om een pad te navigeren dat bezaaid ligt met gevallen takken, verborgen gaten en oneffen grond. In de wereld van kunstmatige intelligentie vertegenwoordigt dit scenario een fundamentele hindernis. De meeste robots van vandaag worden getraind in perfecte, gesimuleerde werelden of gecontroleerde laboratoria, waarbij ze leren bewegen in omgevingen die voorspelbaar en statisch zijn. Wanneer deze machines worden ingezet in de chaotische, veranderende realiteit van een wilde bosrijke omgeving of een rampgebied, hebben ze vaak moeite. Hun vooraf geprogrammeerde kennis wordt een last omdat de wereld die ze tegenkomen niet overeenkomt met de wereld waarin ze zijn onderwezen. Bovendien vertrouwen deze robots vaak op een constante verbinding met krachtige computers in de cloud om hun beslissingen te verwerken. In afgelegen, ruig terrein is die verbinding regelmatig verbroken, waardoor de robot strandt of niet in realtime kan adapteren. De uitdaging is dan om een machine te creëren die on the fly kan leren, volledig zelfstandig, terwijl deze veilig genoeg blijft om te opereren zonder menselijke tussenkomst.
Een team van onderzoekers heeft dit probleem aangepakt met een nieuw systeem genaamd CogRun, ontworpen om grondrobots veilig te laten leren terwijl ze daadwerkelijk door onbekende fysieke ruimtes bewegen. Het kernidee is om de robot een vorm van on-the-spot leren te geven dat volledig op zijn eigen onboard computer plaatsvindt, zonder de noodzaak om gegevens terug te sturen naar een server. Deze aanpak stelt de robot in staat om zich direct aan te passen aan nieuwe obstakels en veranderende omstandigheden op het moment dat hij ze tegenkomt. Het systeem is gebouwd op het inzicht dat leren in de echte wereld gevaarlijk is; een robot die simpelweg nieuwe dingen probeert om te zien wat werkt, kan omvallen of botsen. Om dit op te lossen, hebben de onderzoekers een framework ontworpen waarbij het leerproces van de robot constant wordt gemonitord en gestuurd door een apart, niet-lerend veiligheidssysteem. Dit zorgt ervoor dat terwijl de robot uitfigureert hoe hij beter kan bewegen, hij nooit een stap zet die hem zou kunnen doen omvallen of tegen iets zou kunnen botsen.
Het framework werkt door de hersenen van de robot te splitsen in drie afzonderlijke delen die samenwerken. Het eerste deel is de "Learning Agent", de nieuwsgierige ontdekkingsreiziger. Deze probeert verschillende bewegingen uit, observeert de resultaten en probeert zijn prestaties te verbeteren op basis van wat hij ervaart. Omdat deze agent echter nog aan het leren is, kan hij fouten maken. Om te voorkomen dat die fouten rampen worden, fungeert een tweede deel, de "Rational Agent", als een strikte veiligheidsbewaker. Deze agent leert niet; hij vertrouwt op gevestigde, bewezen regels om ervoor te zorgen dat de robot rechtop blijft staan en botsingen vermijdt. Als de Learning Agent een beweging voorstelt die riskant lijkt, neemt de Rational Agent onmiddellijk de controle over om een veilige manoeuvre uit te voeren. Een derde component, de "Coordinator", houdt de status van de robot in realtime in de gaten en beslist welk agent op welk moment de leiding heeft. Als de robot veilig beweegt, laat de Coordinator de Learning Agent rijden. Op het moment dat de robot een gevaarlijke situatie betreedt, draagt de Coordinator de controle over aan de Rational Agent totdat het gevaar is geweken.
Wat dit systeem uniek maakt, is hoe het omgaat met de herinneringen aan zijn ervaringen. Wanneer een robot leert, genereert hij een enorme hoeveelheid gegevens over wat hij deed en wat er vervolgens gebeurde. De meeste systemen slaan deze gegevens op in een eenvoudige lijst en kiezen willekeurig voorbeelden uit om van te leren. De onderzoekers vonden dit inefficiënt, vooral in een veranderende omgeving waar oude of irrelevante gegevens het leerproces kunnen verwarren. In plaats daarvan gebruikt CogRun een methode die geïnspireerd is op hoe het menselijk geheugen werkt. Het prioriteert herinneringen op basis van drie factoren: hoe vergelijkbaar een eerdere ervaring is met de huidige situatie, hoe recent deze plaatsvond en hoe vaak soortgelijke situaties zijn voorgekomen. Dit stelt de robot in staat om zijn leren te focussen op de meest relevante momenten, zoals de exacte tijd dat hij bijna uitgleed op een nat blad, in plaats van tijd te verspillen aan gegevens van uren geleden toen de omstandigheden totaal anders waren.
Om dit systeem te testen, hebben de onderzoekers het ingezet op een viervoetige robot in een echt, onbekend bos. De omgeving was gevuld met dode zones, diepe depressies in de grond en gaten bedekt door bladeren die een val konden verbergen. De robot kreeg de taak om dertig meter vanaf een startpunt naar een doel te reizen. Tijdens deze tests moest de robot leren om door het terrein te navigeren zonder voorafgaande kaart. De resultaten toonden aan dat het systeem de robot gedurende het gehele leerproces succesvol veilig hield. Hoewel een standaard veiligheidssysteem de robot weliswaar van vallen kon houden, was het vaak te voorzichtig om efficiënt te bewegen. Het CogRun-systeem liet de robot echter een vloeiend, efficiënt pad leren in slechts enkele tientallen pogingen. De robot leerde zijn tred en snelheid aan te passen om met de oneffen grond om te gaan, en bereikte uiteindelijk zijn doel veel sneller dan hij met een vaste, vooraf geprogrammeerde strategie zou hebben kunnen doen.
Het team heeft het systeem ook getest op een off-road autonoom voertuig in een gesimuleerde bosomgeving om te zien of de aanpak op verschillende soorten machines werkt. Ze vergeleken hun systeem met andere geavanceerde leermethoden die proberen veiligheid te beheren. In deze simulaties verloren de andere systemen regelmatig hun evenwicht of botsten ze tegen obstakels aan, waarbij ze vaak niet slaagden in het voltooien van de taak. In contrast hiermee voltooide het CogRun-systeem het overgrote deel van de runs zonder enige veiligheidschending. De robot leerde door dichte bossen en rotsachtige paden te navigeren, waarbij hij stabiliteit behield, zelfs wanneer het terrein onverwacht veranderde. De onderzoekers merkten op dat het vermogen van het systeem om de veilige, regelgebaseerde acties te mengen met de leergerichte acties cruciaal was. Door de voorzichtige bewegingen van de veiligheidsbewaker zorgvuldig te mengen met de adaptieve bewegingen van de learning agent, kon de robot nieuwe oplossingen verkennen zonder ooit de lijn van gevaar te overschrijden.
Dit werk demonstreert dat het mogelijk is voor robots om continu te leren in de echte wereld zonder afhankelijk te zijn van een verbinding met de cloud of een vooraf bestaande kaart van de omgeving. Door een learning agent te combineren die streeft naar verbetering met een rational agent die veiligheid garandeert, en door een geheugensysteem te gebruiken dat de meest relevante ervaringen prioriteert, hebben de onderzoekers een framework gecreëerd dat machines in staat stelt zich aan te passen aan de onvoorspelbare aard van de fysieke wereld. De experimenten suggereren dat deze aanpak zowel de veiligheid als de efficiëntie van robots die opereren in complexe, onbekende omgevingen aanzienlijk kan verbeteren, wat de weg vrijmaakt voor meer capabele machines die kunnen assisteren bij rampenbestrijding, exploratie en andere kritieke taken waarbij het terrein te gevaarlijk of onvoorspelbaar is voor menselijke operators.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.