← Nieuwste papers
💬 NLP

Contextual Observer Grounding: Evaluating Situated Spatial Reasoning in Vision-Language Models

Dit artikel introduceert de Point-of-View Benchmark (POVBench) om het vermogen van visie-taalmodellen te evalueren om "contextuele observator-gronding" uit te voeren — het afleiden van het gesitueerde perspectief van een spreker uit contextuele aanwijzingen — en demonstreert dat hoewel huidige modellen moeite hebben met deze taak, expliciete uitsplitsingen van observator-relatieve ruimtelijke redenering de lokalisatie van het doelwit aanzienlijk kunnen verbeteren.

Oorspronkelijke auteurs: Mimo Shirasaka, Haochen Zhang, Yonatan Bisk

Gepubliceerd 2026-09-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mimo Shirasaka, Haochen Zhang, Yonatan Bisk

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een verloren voorwerp te vinden in een kamer waar je nog nooit eerder bent geweest, uitsluitend op basis van de beschrijving van een vriend over waar hij het heeft achtergelaten. Je zou bijvoorbeeld kunnen horen: "Ik heb mijn sleutels op de tafel links van de lamp gelegd terwijl ik koffie aan het zetten was." Om dit raadsel op te lossen, moet je niet alleen weten hoe een tafel en een lamp eruitzien; je moet eerst de positie van je vriend in de kamer reconstrueren, zijn gezichtsveld voorstellen en vervolgens de sleutels mentaal plaatsen ten opzichte van dat specifieke standpunt. Dit vermogen om ruimte te begrijpen vanuit het perspectief van een ander, gebruikmakend van aanwijzingen over hun activiteit en de omgeving, is een fundamenteel onderdeel van de menselijke communicatie. Het stelt ons in staat om efficiënt samen te werken zonder dat we elk visueel detail hoeven te delen. Voor robots en kunstmatige intelligentie om naast ons te kunnen werken in onze huizen, moeten zij dezelfde vaardigheid beheersen, die bekendstaat als gesitueerd ruimtelijk redeneren.

Een nieuwe studie door onderzoekers van de Universiteit van Tokio en Carnegie Mellon University onderzoekt of moderne systemen van kunstmatige intelligentie werkelijk deze taak kunnen uitvoeren. Het team, geleid door Mimo Shirasaka, Haochen Zhang en Yonatan Bisk, heeft een rigoureuze test ontwikkeld genaamd de Point-of-View Benchmark om te zien of machines de locatie van een spreker kunnen afleiden en vervolgens een object kunnen lokaliseren op basis van dat afgeleide perspectief. Hun werk laat zien dat hoewel huidige AI-modellen indrukwekkend zijn in veel visuele taken, ze aanzienlijk moeite hebben wanneer ze gevraagd wordt om over ruimte te redeneren vanuit een standpunt dat ze niet direct kunnen zien, zelfs niet wanneer ze duidelijke instructies krijgen.

De onderzoekers bouwden hun test met behulp van een door de computer gegenereerde wereld van procedureel gecreëerde huizen, compleet met realistische meubels en lay-outs. In deze digitale omgeving verkent een gesimuleerde robot elk huis, waarbij hij een reeks beelden vanuit het eerste persoon perspectief vastlegt terwijl hij van kamer naar kamer beweegt. De kern van het experiment bestaat uit een natuurlijke taalzin die de locatie van een object beschrijft, zoals: "Ik zag het boek links van het bed liggen." De uitdaging voor de kunstmatige intelligentie is om naar de foto's van de verkenning door de robot te kijken, te achterhalen waar de persoon die sprak stond toen hij die zin uitsprak, en vervolgens aan te wijzen waar het boek zich in dat specifieke beeld zou bevinden. De studie testte drie verschillende moeilijkheidsgraden om precies te begrijpen waar de AI vastloopt. In de moeilijkste versie geeft de zin slechts een hint over de activiteit, zoals "Tijdens het vervangen van een lampje," wat de AI dwingt de locatie te raden. In een middelmatige versie benoemt de zin expliciet het object waarmee de persoon interactie had, zoals "Tijdens het vervangen van de lamp op de vloerlamp." In de gemakkelijkste versie wordt de AI simpelweg getoond de exacte foto vanuit het perspectief van de spreker.

De resultaten waren veelzeggend. Over een breed scala aan geavanceerde AI-modellen, inclusief zowel commerciële als open-source versies, bleef de prestatie laag in alle drie de scenario's. Zelfs wanneer de AI expliciet werd verteld bij welk object de spreker in de buurt was, of wanneer het de exacte foto vanuit het standpunt van de spreker kreeg, faalden de modellen er vaak in de juiste locatie aan te duiden. Het verschil tussen de moeilijkste en de middelmatige versie was verrassend klein, wat suggere_ert dat de belangrijkste moeilijkheid niet alleen het achterhalen van waar de spreker stond is, maar eerder het begrijpen van hoe je een beschrijving als "links van" vertaalt naar een specifieke plek in een visuele scène. De modellen kozen vaak de verkeerde kamer of verwartten het referentieobject, zoals het aanzien van een deurpost voor een koelkast, omdat ze de visuele aanwijzingen niet effectief konden combineren met de context van de activiteit.

Om te begrijpen of de modellen konden verbeteren met hulp, probeerden de onderzoekers een andere aanpak. Ze vroegen de AI om zijn denkproces stap voor stap uiteen te zetten, door expliciet te vermelden hoe het de positie van de spreker identificeerde, het referentieobject lokaliseerde en vervolgens de richting van het doelwit bepaalde. Deze methode, die de auteurs gestructureerd ruimtelijk redeneren noemen, leidde tot een merkbare verbetering in nauwkeurigheid. Wanneer de modellen werden begeleid om het probleem op deze gestructureerde manier op te lossen, werden ze beter in het lokaliseren van de verborgen objecten. Dit suggereert dat de AI over de nodige stukjes informatie beschikt, maar moeite heeft om ze tot een samenhangend mentaal model samen te voegen zonder expliciete begeleiding over hoe de verbanden te leggen.

De studie testte deze ideeën ook in de echte wereld met behulp van werkelijke videobeelden van mensen die door huizen lopen. De resultaten weerspiegelden de computer-simulaties: de AI-modellen bleven moeite hebben met de taak en behaalden een succespercentage van of onder de vijftig procent. De modellen die echter de methode van stap-voor-stap redeneren gebruikten, lieten opnieuw betere resultaten zien dan de modellen die dat niet deden. Dit geeft aan dat de moeilijkheid niet alleen een gebrek is van de door de computer gegenereerde omgeving, maar een werkelijke uitdaging vormt voor de huidige technologie wanneer zij wordt geconfronteerd met de rommelige, complexe realiteit van menselijke ruimtes.

Uiteindelijk benadrukt dit onderzoek een kritieke kloof in de capaciteiten van belichaamde kunstmatige intelligentie. Hoewel machines objecten kunnen herkennen en vragen kunnen beantwoorden over wat ze zien, hebben ze nog niet geleerd om op natuurlijke wijze het perspectief van een menselijke spreker af te leiden of een scène te reconstrueren vanuit een standpunt dat ze nooit direct hebben waargenomen. De bevindingen suggereren dat voor robots om echt samen te kunnen werken met mensen in ons dagelijks leven, zij een dieper vermogen moeten ontwikkelen om over ruimte te redeneren vanuit het standpunt van een ander persoon, waarbij ze context en gezond verstand gebruiken om de ontbrekende stukjes van de visuele puzzel in te vullen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →