← Nieuwste papers
🤖 AI

ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models

Dit artikel introduceert ERGeoBench, een uitgebreide diagnostische benchmark bestaande uit 2.207 wereldwijde straatbeeldpanorama's die multimodale grote taalmodellen evalueert over progressieve belichaamde omgevingen om hun huidige beperkingen in fijnmazige perceptie en metrische geolocatie te onthullen, terwijl de sterke onderlinge afhankelijkheid tussen lokalisatie en bredere ruimtelijke redeneercapaciteiten wordt benadrukt.

Oorspronkelijke auteurs: Kaiwen Xue, Tao Wei, Guoxin Zhang, Zhonghong Ou, Kaoyan Lu, Yu Feng, Yifan Zhu, Haoran Luo

Gepubliceerd 2026-06-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Kaiwen Xue, Tao Wei, Guoxin Zhang, Zhonghong Ou, Kaoyan Lu, Yu Feng, Yifan Zhu, Haoran Luo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je in een vreemde stad wordt gedropt, zonder kaart, zonder GPS en zonder telefoon. Hoe zou je uitzoeken waar je bent?

Je zou niet alleen naar één wazige foto staren en gokken. In plaats daarvan zou je om je heen kijken. Je zou je hoofd draaien om een straatnaambord te zien, je hoofd omhoog kantelen om een uniek dak van een gebouw te spotten, en misschien inzoomen op een etalage om de taal te lezen. Je zou deze aanwijzingen samenvoegen, onthouden wat je links zag toen je naar rechts draaide, totdat je een solide vermoeden hebt over je locatie.

Dit is precies wat het papier ERGeoBench computers probeert te leren doen.

Het Probleem: De "Statische Foto"-valstrik

Momenteel zijn de meeste AI-modellen die proberen te raden waar een foto is genomen, als mensen die met een blinddoek om en slechts door een enkel sleutelgat mogen kijken. Ze krijgen één statische afbeelding (of één breed panorama) en moeten raden waar de locatie is.

Het artikel betoogt dat dit onnatuurlijk is. Mensen werken niet zo. Wij bewegen, we kijken dichterbij en we veranderen ons perspectief. De auteurs realiseerden zich dat hoewel AI goed wordt in het herkennen van wat er in een plaatje zit (zoals "dat is een rode bus"), het verschrikkelijk is in het actieve proces van uitzoeken waar het zich bevindt door rond te bewegen.

De Oplossing: Een "Virtuele Toerist" Benchmark

De auteurs hebben een nieuwe testomgeving gecreëerd genaamd ERGeoBench. Zie dit als een gigantisch, wereldwijd videogame-level dat ontworpen is om te testen of een AI kan optreden als een virtuele toerist.

In plaats van de AI alleen een foto te tonen, geeft de benchmark de AI een 360-graden uitzicht op een straathoek en laat het "bewegen" door:

  • Zijn hoofd te draaien (Yaw/Giering).
  • Omhoog of oedaar te kijken (Pitch/Stamp).
  • In te zoomen om kleine bordjes te lezen (Zoom).

De AI moet deze acties stap voor stap uitvoeren, aanwijzingen verzamelen als een detective, om de vraag te beantwoorden: "Waar in de wereld ben ik?"

De Vier Vaardigheden die ze Testten

Om te zien of de AI echt "belichaamd" (embodied) is (handelt als een fysieke agent), vroegen ze niet alleen om een locatie. Ze testten vier specifieke vaardigheden, zoals het controleren van een rijbewijs:

  1. Fundamentele Perceptie (De Ogen): Kan de AI de details echt zien? (bijv. "Is dat een verkeerskegel of een vuilnisbak?")
  2. Ruimtelijk Bewustzijn (Het Innerlijke Kompas): Als de AI een auto voor zich ziet, en dan 90 graden naar rechts draait, onthoudt de AI dan waar de auto nu is? Kan het "links", "rechts", "achter" en "afstand" begrijpen?
  3. Gezond Verstand Redeneren (Het Brein): Als de AI "dorst heeft", kan het dan om zich heen kijken en uitzoeken welke winkel het dichtstbij is om water te kopen?
  4. Geo-lokalisatie Redeneren (De Kaart): Alles samenbrengen om het land, de stad en de straat te raden.

Wat ze Vonden (Het Scorebord)

De auteurs testten 9 van de slimste beschikbare AI-modellen (zowel dure "propriëtaire" als gratis "open-source" modellen). Dit is wat ze ontdekten:

  • Het "Grote Plaatje" is Makkelijk: De AI-modellen zijn verrassend goed in het raden van het land of de stad. Ze kunnen je vertellen: "Dit lijkt op New York" of "Dit is in Japan" door alleen naar de algemene sfeer te kijken.
  • De "Kleine Lettertjes" zijn Moeilijk: De modellen worstelen enorm met exacte coördinaten. Ze kunnen misschien correct "USA" raden, maar falen in het noemen van de straatnaam of de specifieke buurt.
  • Het "Geheugen"-problek: Dit was de grootste hindernis. Wanneer de AI zijn "hoofd" draaide om vanuit een nieuwe hoek te kijken, raakten veel modellen in de war. Ze konden geen consistent mentaal evenbeeld bijhouden van waar dingen zich ten opzichte van elkaar bevonden. Het is alsof je een kamer ronddraait en vervolgens vergeet waar de deur is.
  • Actief versus Passief: Interessant genoeg konden de beste modellen hun voorspellingen daadwerkelijk verbeteren door acties te ondernemen (draaien en zoomen). Ze konden aanwijzingen vinden die ze bij de eerste blik hadden gemist. Echter, zwakkere modellen werden juist slechter wanneer ze probeerden te bewegen; ze raakten essentieel "verdwaald" omdat ze de nieuwe hoeken niet aankonden.

De Kern van het Verhaal

Het artikel concludeert dat hoewel AI beter wordt in het "zien" van de wereld, het nog steeds niet de kunst van het verkennen ervan onder de knie heeft. Om een echte "belichaamde agent" te zijn (zoals een robot of een mens), moet een AI meer doen dan alleen patronen herkennen; het moet ruimte begrijpen, onthouden wat het een moment geleden zag, en actief kiezen waar het als volgende naar moet kijken om een puzzel op te lossen.

ERGeoBench is de nieuwe meetlat die zij hebben gebouwd om precies te meten hoe goed (of slecht) AI is in deze specifieke, menselijke vaardigheid van het navigeren door de wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →