Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation
Dit artikel toont aan dat zero-shot belichaamde agenten die gebruikmaken van algemene agentische controle met minimale interfaces kunnen wedijveren met industriële beleidscycli in visie-en-taalnavigatie, waarbij ze tot 78% succes bereiken en benadrukken dat de modelkeuze de primaire drijfveer van prestaties is boven specifieke softwareharnassen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin je broodrooster niet alleen brood kan roosteren, maar ook kan beslissen welke snee kan roosteren, kan controleren of de keuken schoon is en kan uitzoeken hoe het brood op tafel te krijgen zonder het huis af te branden. Dit is de droom van Embodied AI: computers een fysiek lichaam geven (zoals een robot) en de hersencapaciteit om zelfstandig door de echte wereld te navigeren. Lange tijd hebben wetenschappers geprobeerd deze robots te leren door ze te "trainen" zoals honden (hetzelfde proces duizenden keren herhalen totdat ze het goed doen) of door ze een strikt "script" te geven (een door mensen geschreven lijst met regels zoals "als je een deur ziet, open deze"). Maar wat als we gewoon een superintelligente computer een camera en een paar basisknoppen gaven, hem vertelden "ga de keuken zoeken", en hem de rest lieten uitzoeken? Dat is de grote vraag die dit artikel stelt: Kan een algemene AI, zonder speciale robottraining, het stuur overnemen en zichzelf door een huis loodsen?
De onderzoekers achter deze studie besloten dit idee te testen met een digitale robot in een gesimuleerd huis. Ze haalden alle luxe hulpmiddelen die normaal gesproken voor navigatie worden gebruikt weg—geen kaarten, geen GPS, geen vooraf geprogrammeerde paden en geen speciale "robotbrein"-training. In plaats daarvan gaven ze de AI een enkele camera die alleen ziet wat er direct voor zich staat (zoals een mens die door een kijkgatletje kijkt) en vier eenvoudige commando's: vooruit bewegen, naar links draaien, naar rechts draaien en stoppen. Vervolgens vroegen ze de AI om complexe gesproken instructies op te volgen, zoals "Loop langs het zwembad, ga tussen de bar en de stoelen door, en stop op de hoek." Het doel was om te zien of de AI kon handelen als een echte "agent"—een besluitvormer die observeert, denkt, handelt en zijn eigen fouten corrigeert zonder dat een mens hem bij de hand houdt.
De resultaten waren verrassend enthousiasmerend, maar ook nederig. Het team kwam erachter dat deze "zero-shot" agenten (wat betekent dat ze nog nooit eerder een robot hadden gezien) in staat waren om behoorlijk goed te navigeren. Met behulp van een krachtig AI-model genaamd fable-5, bereikte de robot zijn doel 78% van de tijd in de standaardtest, ondanks het feit dat hij geen kaarten of speciale training had. Dit is een grote prestatie, omdat het de prestaties evenaart van dure, industriële robots die getraind zijn op miljoenen voorbeelden. Het suggereert dat het "brein" zelf het meeste zware werk verricht, en niet de speciale software die eromheen is gebouwd.
Het artikel trekt echter ook een duidelijke grens. Hoewel de AI erg goed is in korte ritten, begint hij te struikelen wanneer de reis langer wordt. Als de taak vereist dat de robot door veel kamers loopt of zich moet herinneren waar hij vijf minuten geleden was, daalt het succespercentage scherp naar tussen de 26% en 39%. De AI raakt in de war omdat hij alles wat hij zag moet onthouden, en zijn "geheugen" raakt te vol. Bovendien, toen de onderzoekers dit op een echte, fysieke robot hond probeerden, kon de AI perfect redeneren, maar bleef hij tegen muren aanbotsen omdat hij niet begreep hoeveel ruimte zijn eigen lichaam innam. Hij wist waar hij heen moest, maar niet hoe hij door de deur paste.
Uiteindelijk suggereert het artikel dat we aan de rand van een nieuw tijdperk staan. We hoeven niet noodzakelijkerwijs voor elke taak een nieuw, speciaal robotbrein te bouwen; we hoeven misschien alleen onze bestaande superintelligente AI's de controle te laten overnemen, mits we hen de juiste instrumenten geven om hun eigen geheugen te beheren en hun fysieke lichaam te begrijpen. Het is een stap naar de dag waarop jouw robot niet alleen bevelen opvolgt, maar ook daadwerkelijk de leiding neemt over zijn eigen avontuur.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.