Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?
Deze studie evalueert open-source visie-taalmodellen voor het beoordelen van proxemische risico's vanuit egocentrische robotbeelden, waarbij wordt vastgesteld dat hoewel fijnmazig afstemmen slechts bescheiden algemene winst oplevert, geavanceerd prompting de detectie van hoog risico aanzienlijk verbetert in specifieke modellen zoals Qwen-VL, hoewel correcte veiligheidsclassificaties niet noodzakelijkerwijs correleren met nauwkeurige ruimtelijke gronding.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot leert lopen door een drukke koffiebar. Je wilt niet alleen dat de robot een tafel ziet; je wilt dat hij de ruimte om zich heen voelt. Dit is de wereld van proxemics, een chic woord voor de studie naar hoeveel persoonlijke ruimte mensen nodig hebben om zich comfortabel te voelen. Denk aan onzichtbare bubbels: een krappe bubbel voor een beste vriend, een middelgrote voor een collega en een brede voor een vreemde. Als een robot zonder te vragen in jouw krappe bubbel duikt, is dat onbeleefd en potentieel gevaarlijk.
Stel je nu voor dat je die robot een camera op zijn hoofd geeft (een "egocentrisch" perspectief), zodat hij de wereld precies ziet zoals wij die zien. De grote vraag waar wetenschappers zich mee bezighouden is: kunnen we een robot leren om naar een foto te kijken en direct te weten: "O nee, ik ben te dicht bij die persoon!" of "Poeh, ik heb genoeg ruimte"? Dit is waar Vision-Language Models (VLMs) om de hoek komen kijken. Dit zijn superintelligente AI-programma's die naar een afbeelding kunnen kijken en erover kunnen praten, een beetje zoals een robot die een prentenboek kan lezen en je het verhaal kan vertellen. Onderzoekers zijn enthousiast omdat als deze AI's persoonlijke ruimte kunnen begrijpen door alleen maar te kijken, we misschien geen dure, zware sensoren op elke robot nodig hebben. We kunnen ze dan gewoon een camera en een brein geven.
Maar hier komt de twist: alleen omdat een AI een foto kan beschrijven, betekent dat niet dat hij echt begrijpt waar dingen zich in de 3D-ruimte bevinden. Dit artikel onderzoekt drie verschillende AI-"hersenen" om te testen of ze als een veiligheidsbewaker voor robots kunnen fungeren.
Het Experiment: Kan AI Gevaar Opsporen?
De onderzoekers bouwden een speciale trainingsset met behulp van 1.243 foto's genomen vanuit het perspectief van een robot in echte omgevingen. Elke foto werd gelabeld met een "gevaarsniveau" op basis van hoe dicht mensen bij de robot stonden:
- Hoog Gevaar: Iemand staat vlak voor het gezicht van de robot (botsing onvermijdelijk!).
- Matig Gevaar: Iemand is dichtbij en de robot moet voorzichtig bewegen.
- Laag Gevaar: Iemand is in de buurt, maar de robot hoeft alleen maar op diegene te letten.
- Minimaal Gevaar: De weg is vrij.
Ze testten drie verschillende open-source AI-modellen: InternVL, SmolVLM en Qwen-VL. Ze probeerden deze modellen op twee manieren te onderwijzen: eerst door ze op verschillende manieren vragen te stellen (zoals een simpele opdracht versus een complexe, stapsgewijze redeneerpuzzel), en ten tweede door ze een heel klein beetje extra training te geven (genaamd "fine-tuning") op 200 specifieke afbeeldingen.
De Resultaten: Eén Held, Twee Strijders
De bevindingen waren een mix van "niet slecht" en "niet goed genoeg".
1. Het "Willekeurig Gokken"-probleem
Zonder speciale training presteerden alle drie de modellen bijna exact zoals een student die gokt bij een meerkeuzetoets. Hun algehele nauwkeurigheid was nauwelijks beter dan het gooien van een muntje. Zelfs na de extra training verbeterde het algemene vermogen om alle vier de gevaarsniveaus correct te sorteren niet veel. Het is alsof de modellen goed waren in het beschrijven van de koffiebar, maar verschrikkelijk in het weten wanneer ze moeten stoppen met lopen.
2. De Qwen-Uitzondering
Er was echter één uitstaande held: Qwen-VL. Terwijl de andere twee modellen (InternVL en SmolVLM) in feite faalden om de meest gevaarlijke situaties op te merken (ze misten bijna allemaal!), werd Qwen-VL daadwerkelijk beter in het herkennen van "Hoog Gevaar"-scenario's.
- Cruciaal was dat deze verbetering voortkwam uit een specifieke combinatie van hoe de vraag werd gesteld en hoe het model werd getraind. De beste resultaten werden bereikt wanneer een zeer specifieke, complexe prompt werd gebruikt die de AI vroeg om "stap voor stap te denken", samen met een eerste ronde van fine-tuning. Met deze opstelling slaagde Qwen-VL erin om ongeveer 79% van de hooggevaarlijke situaties te onderscheiden.
- De andere modellen, zelfs met dezelfde complexe prompts en training, misten nog steeds bijna alles.
- Interessant genoeg hielp het geven van Qwen-VL extra training (een tweede ronde van fine-tuning) niet veel meer; de grootste boost kwam door die specifieke koppeling van de geavanceerde "denk"-prompt en de eerste ronde van fine-tuning.
3. De "Blinde Vlek"-Verrassing
Dit is het meest interessante deel. De onderzoekers controleerden of de AI daadwerkelijk naar de persoon keek om te beslissen of het gevaarlijk was. Ze vroegen de AI om een kader rond de persoon te tekenen waar de AI zich zorgen over maakte.
- De Schok: Zelfs wanneer Qwen-VL correct "GEVAAR!" riep, tekende het vaak geen kader rond de juiste persoon. Soms wees het naar de vloer, soms naar een muur en soms naar de juiste persoon.
- De Conclusie: Het artikel suggereert dat het model het gevaarsniveau misschien inschat op basis van een "gevoel" of een patroon in de hele afbeelding, in plaats van daadwerkelijk de specifieke afstand tot de persoon te begrijpen. Het is alsof een student het juiste antwoord op een wiskundetoets geeft, maar niet de berekening kan laten zien of naar de getallen kan wijzen die hij heeft gebruikt.
Wat Dit Betekent voor Robotsveiligheid
Het artikel concludeert dat hoewel deze AI-modellen slimmer worden, ze nog niet klaar zijn om als enige veiligheidsbewaker te dienen voor een robot die door een menigte loopt.
- Ze kunnen nog niet vertrouwd worden: Als je op hen vertrouwt, mis je misschien een botsing omdat het model denkt dat het veilig is terwijl dat niet zo is, of het raakt in paniek terwijl het wel veilig is.
- Prompting en specifieke training doen ertoe: Het geven van de modellen een beetje extra training hielp Qwen-VL slechts een klein beetje op zichzelf, maar het loste de problemen van de andere modellen niet op. De grootste winst kwam voort uit het vragen aan het model om zorgvuldig te redeneren, gecombineerd met een specifieke fine-tuning configuratie.
- Het "Blinde" Gevaar: De belangrijkste les is dat het krijgen van het juiste label (Hoog Gevaar) niet betekent dat de robot begrijpt waarom het gevaarlijk is. Het kan het juiste antwoord geven, maar om de verkeerde redenen.
Kortom, deze Vision-Language Models zijn als zeer pratige toeristen die een scène prachtig kunnen beschrijven, maar vaak verdwalen wanneer ze gevraagd wordt er doorheen te navigeren. Ze tonen veelbelovende inzichten, vooral het Qwen-model wanneer het wordt gevraagd om zorgvuldig na te denken en op de juiste manier getraind is, maar ze hebben nog veel meer oefening nodig voordat we ze een robot door een drukke straat kunnen laten sturen zonder dat er een mens achter hun rug houdt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.