← Nieuwste papers
💻 computer science

EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models

Het artikel introduceert EPIC-Bench, een fijnmazige benchmark bestaande uit 6.600 geannoteerde tuples over 23 belichaamde taken, waaruit blijkt dat huidige visueel-taalmodellen, ondanks hun geavanceerde redeneervermogens, moeite hebben met complexe visueel-taaluitlijning voor fysieke interacties.

Oorspronkelijke auteurs: Haozhe Shan, Xiancong Ren, Han Dong, Haoyuan Shi, Yingji Zhang, Jiayu Hu, Yi Zhang, Yong Dai, Bin Shen, Lizhen Qu, Zenglin Xu, Xiaozhu Ju

Gepubliceerd 2026-05-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Haozhe Shan, Xiancong Ren, Han Dong, Haoyuan Shi, Yingji Zhang, Jiayu Hu, Yi Zhang, Yong Dai, Bin Shen, Lizhen Qu, Zenglin Xu, Xiaozhu Ju

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme robotassistent hebt. Je zegt tegen hem: "Ga de rode mok op de tafel oppakken." Om dit te doen, moet de robot de mok kunnen zien, begrijpen dat "rode mok" verwijst naar dat specifieke object, een pad naar de mok kunnen vinden zonder te struikelen, en weten precies waar hij moet grijpen.

Lange tijd hebben we de "ogen en hersenen" van deze robots getest met simpele quizzen. We toonden hen een afbeelding en vroegen: "Is er een rode mok?" of gaven we hen meerkeuzeantwoorden zoals "A) Ja, B) Nee."

Het probleem? De robots bedroegen. Ze zagen de mok niet echt; ze gokten alleen op basis van de formulering van de vraag of gebruikten gezond verstand. Het is als een student die het antwoordensleutel uit het hoofd leert in plaats van het vak te leren.

Dit artikel introduceert EPIC-Bench, een nieuwe, veel moeilijkere test die bedoeld is om het bedrog te stoppen en te kijken of robots daadwerkelijk de echte wereld kunnen zien en ermee kunnen interageren.

Hier is een uiteenzetting van wat ze deden, met behulp van alledaagse analogieën:

1. De Nieuwe Test: "Het Maskerspel"

In plaats van "Ja of Nee" te vragen, vraagt EPIC-Bench de robot om een masker te tekenen (zoals een digitale sticker) over het exacte object dat hij moet vinden.

  • De Oude Manier: "Is er een kat?" (De robot gokt "Ja" omdat hij een woonkamer ziet).
  • De EPIC-Bench Manier: "Hier is een foto van een rommelige woonkamer. Markeer alleen de kat die onder de stoel slaapt."
  • Waarom het belangrijk is: Als de robot de hele stoel of de vloer markeert, faalt hij. Het bewijst dat de robot echt naar de pixels keek, en niet alleen naar de woorden.

2. De Drie Niveaus van de Test

De benchmark is als een videospel met drie moeilijkheidsgraden, die alles omvatten wat een robot in een huis moet doen:

  • Niveau 1: Doellocatiebepaling (Het "Vind het Verschil"-spel)
    De robot moet specifieke dingen vinden op basis van lastige beschrijvingen.

    • Basis: "Vind de rode beker."
    • Moeilijker: "Vind de hogere beker."
    • Lastig: "Vind de linkerhelft van het scherm" of "Vind het deel van de mens dat onder de oren ligt."
    • De Valsheid: Soms zijn er nul bekers, soms vijf. De robot moet ze perfect tellen, niet slechts één vinden.
  • Niveau 2: Navigatie (Het "GPS"-spel)
    De robot moet uitzoeken hoe hij zich moet verplaatsen.

    • Vloerdetectie: "Toon me de vloer waarop ik kan lopen." (Hij moet tapijten die te glad zijn of gaten in de grond negeren).
    • Haalbaar Pad: "Trek een lijn van hier naar de deur." De lijn moet op de vloer blijven en niet door muren gaan.
    • Visuele Matching: "Hier is een foto van een speelgoed in één kamer. Vind datzelfde speelgoed in een andere foto, genomen vanuit een ander perspectief."
  • Niveau 3: Manipulatie (Het "Handwerker"-spel)
    De robot moet uitzoeken hoe hij dingen moet gebruiken.

    • Aanbod: "Waar grijp ik deze waterkoker vast?" (Hij moet de handvat vinden, niet de hete bodem).
    • Contact: "Welke objecten raken het brood?"
    • Plaatsing: "Kan ik deze zware doos op die broze stoel zetten?" (De robot moet "Nee" zeggen als hij zou breken).

3. De Resultaten: De Robots Leren Nog Steeds

De onderzoekers testten 89 verschillende AI-modellen (zowel beroemde commerciële als open-source modellen) op deze nieuwe test.

  • Het Goede Nieuws: De slimste modellen, vooral die met "denk"-modi (zoals een mens die even nadenkt), deden het beter. Ze komen dichter bij het begrijpen van de wereld.
  • Het Slechte Nieuws: Zelfs de beste modellen hadden moeite.
    • Tellen is moeilijk: Als je hen vraagt om "drie appels" te vinden, vinden ze er vaak één of hallucineren ze een vierde.
    • Onderdelen zijn verwarrend: Ze zijn geweldig in het vinden van een hele "stoel", maar verschrikkelijk in het vinden van alleen het "pootje van de stoel".
    • Richting is lastig: Ze raken in de war over links versus rechts, of wat "naar het raam gekeerd" betekent.
    • Het "bedrog" is weg: Omdat de test vereist dat er nauwkeurige maskers worden getekend, kunnen de modellen niet meer gokken. Ze moeten echt kijken.

4. Waarom Dit Belangrijk Is

Bedenk EPIC-Bench als een rijexamen voor AI. Vroeger vroegen we de auto alleen: "Weet je wat een stopbord is?" Nu zetten we de auto op een echte weg met obstakels, vragen we hem om naar een specifieke plek te rijden, en controleren we of hij daadwerkelijk in de rijbaan bleef.

Het artikel concludeert dat, hoewel onze AI-"ogen" scherper worden, ze nog steeds het diepe begrip missen dat nodig is om veilig en betrouwbaar te interageren met fysieke objecten in onze rommelige, echte huizen. Deze nieuwe benchmark geeft onderzoekers een duidelijke kaart van precies waar de robots falen, zodat ze die specifieke problemen kunnen oplossen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →