Bridging Learned Visual Perception and Symbolic Belief-Space Planning
Dit artikel introduceert een nieuw "VLM-als-probabilistische-grounder"-paradigma dat de onzekerheid van visuele perceptie vastlegt als waarschijnlijkheidsverdelingen over symbolische toestanden, wat robuuste planning in de belief-ruimte mogelijk maakt die bestaande deterministische benaderingen in gedeeltelijk observeerbare omgevingen overtreft.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een robot voor die probeert een rommelige woonkamer op te ruimen. Hij ziet een boek op een tafel en een plank aan de overkant van de kamer, maar zijn camera is trillerig en het licht is zwak. In de echte wereld hebben robots zelden een perfect visie. Ze kunnen niet alles tegelijk zien; objecten verschuilen zich achter meubels, en sensoren interpreteren wat ze zien vaak verkeerd. Voor een robot om veilig en effectief te kunnen handelen, moet hij toegeven wat hij niet weet. Als hij een fout maakt in de schatting waar een object zich bevindt, kan hij proberen iets te pakken dat er niet is, of erger nog, proberen een object te plaatsen dat hij niet vasthoudt. Deze onzekerheid is de grootste hindernis bij het leren aan machines om door onze complexe, onvoorspelbare huizen te navigeren.
Jarenlang hebben onderzoekers geprobeerd dit op te lossen door een robot een "brein" te geven dat naar een foto kan kijken en direct kan beslissen wat waar is. Ze gebruiken krachtige kunstmatige intelligentiemodellen die zowel afbeeldingen als taal begrijpen. Het idee was simpel: laat de robot een foto zien, vraag hem "Staat de kast open?", en als het model "ja" zegt, behandelt de robot dat als een absolute feit en plant hij zijn volgende zet. Maar in de praktijk is deze aanpak broos. Wanneer het model een fout maakt — wat vaak gebeurt wanneer objecten verborgen zijn of het zicht onduidelijk is — volgt de robot een plan gebaseerd op een leugen. Hij kan minutenlang proberen een deur te openen die al open staat, of erger nog, hij kan het volledig opgeven omdat hij denkt dat de taak onmogelijk is. Het kernprobleem is dat deze systemen onzekere gissingen behandelen als zekere feiten, waardoor er geen ruimte is voor fouten.
Een team van onderzoekers aan de Technion in Israël heeft een andere manier voorgesteld om dit probleem aan te pakken. In plaats van de robot te dwingen een enkele, rigide gok over de wereld te doen, hebben ze hem geleerd om meerdere mogelijkheden tegelijk in zijn hoofd te houden. Ze noemen hun nieuwe systeem RoVLaP. In plaats van het kunstmatige intelligentiemodel te vragen om te zeggen "het boek ligt op de tafel" of "het boek ligt niet op de tafel", vraagt het systeem het model om te zeggen hoe waarschijnlijk elk van die scenario's is. Het zou kunnen zeggen dat er een kans van 60% is dat het boek op de tafel ligt en een kans van 40% dat het verborgen is in een lade. Door deze waarschijnlijkheden levend te houden, kan de robot een "overtuiging" over de wereld opbouwen die de onzekerheid erkent. Hij plant niet alleen voor het meest waarschijnlijke scenario; hij plant voor een reeks waarschijnlijke scenario's tegelijkertijd.
De onderzoekers testten dit idee in een gesimuleerde huiselijke omgeving, een digitale wereld vol virtuele meubels, laden en objecten. Ze gaven de robot taken die gebruikelijk zijn bij huishoudelijke klusjes, zoals het sorteren van boeken op planken, het opruimen van laden of het vergrendelen van deuren. In deze tests moest de robot uitsluitend vertrouwen op wat zijn camera kon zien, zonder speciale kennis over waar verborgen objecten zich mogelijk bevonden. Ze vergeleken deze nieuwe methode met twee andere veelvoorkomende benaderingen: één waarbij het AI-model de robot stap voor stap vertelt wat hij moet doen, en een andere waarbij het model een enkele, vaste beschrijving van de kamer geeft voor een standaard planner om te gebruiken.
De resultaten toonden een duidelijk voordeel voor de nieuwe aanpak. In de gesimuleerde tests faalden de standaardmethoden vaak volledig wanneer het zicht van de robot geblokkeerd of misleidend was. Bijvoorbeeld, in een taak waarbij een kom verborgen zat in een gesloten kast, nam de standaardrobot aan dat de kom zichtbaar was en probeerde hij deze onmiddellijk te pakken, wat telkens mislukte. Het nieuwe systeem herkende echter dat de kom verborgen zou kunnen zijn. Het plantde een reeks acties die het eerst openen van de kast inhielden. Deze enkele verandering stelde de robot in staat om te slagen in situaties waarin de andere methoden faalden. Bij moeilijke taken loste het nieuwe systeem 66,7% van de problemen op, terwijl de standaard "grounder"-methode er geen enkele oploste. Bij taken van gemiddelde moeilijkheid verbeterde het de succesratio met meer dan 160% vergeleken met de standaardmethode.
Naast het oplossen van meer taken, was het nieuwe systeem ook efficiënter. Omdat het vanaf het begin rekening hield met onzekerheid, maakte het minder fouten en hoefde het zijn plannen minder vaak te herzien. De standaardmethoden moesten vaak stoppen, beseffen dat ze ernaast zaten en het opnieuw proberen, wat tijd en energie verspilde. Het nieuwe systeem daarentegen genereerde plannen die robuust genoeg waren om de initiële verwarring aan te kunnen zonder te hoeven stoppen en opnieuw na te denken. Het bewoog met een soort voorzichtige zelfverzekerdheid, waarbij het rekening hield met de mogelijkheid dat de eerste gok fout zou zijn, en een back-up plan klaar had voor het geval dat.
De onderzoekers bewezen ook dat deze methode wiskundig onderbouwd is. Ze toonden aan dat als het kunstmatige intelligentiemodel zelfs maar iets beter is dan willekeurig gokken, de robot uiteindelijk de ware staat van de wereld zal ontdekken als hij blijft observeren en zijn overtuigingen bijwerkt. Het systeem vereist niet dat het model perfect is; het hoeft alleen maar consequent beter te zijn dan een kop of munt. Naarmate de robot meer visueel bewijs verzamelt, neemt zijn onzekerheid af en worden zijn plannen nauwkeuriger. Dit biedt een vangnet: zelfs als de robot met een verkeerd idee begint, is het systeem ontworpen om zichzelf te corrigeren zonder vast te lopen of vast te komen zitten.
Dit werk vertegenwoordigt een verschuiving in hoe we autonome agenten bouwen. Het beweegt weg van het idee dat een robot de waarheid moet weten om te kunnen handelen, en naar het idee dat een robot wijs kan handelen, zelfs wanneer hij het niet zeker weet. Door de wereld te behandelen als een reeks mogelijkheden in plaats van een enkele vaste realiteit, wordt de robot meer aanpasbaar en betrouwbaar. In de gesimuleerde huizen betekende dit het verschil tussen een robot die opgeeft wanneer hij een verborgen object niet kan zien, en een robot die geduldig de kast opent om het te vinden. Terwijl robots de gecontroleerde laboratoria verlaten en onze werkelijke huizen binnenkomen, waar het licht verandert, objecten bewegen en het zicht geblokkeerd wordt, kan dit vermogen om voor het onbekende te plannen de sleutel zijn tot het echt nuttig maken van deze machines als metgezellen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.