← Nieuwste papers
🤖 AI

HueManity: Probing Fine-Grained Visual Perception in MLLMs

Het artikel introduceert HueManity, een grootschalige benchmark die gebruikmaakt van Ishihara-stijl afbeeldingen om aan te tonen dat state-of-the-art Multimodale Grote Taalmodellen (MLLM's) een kritiek tekort vertonen in fijnmazige visuele perceptie vergeleken met mensen en gespecialiseerde modellen, ondanks hun sterke hoogwaardige redeneercapaciteiten.

Oorspronkelijke auteurs: Rynaa Grover, Jayant Sravan Tamarapalli, Sahiti Yerramilli, Nilay Pande

Gepubliceerd 2026-02-03
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Rynaa Grover, Jayant Sravan Tamarapalli, Sahiti Yerramilli, Nilay Pande

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme robot hebt die boeken kan lezen, gedichten kan schrijven en complexe scènes in een schilderij kan beschrijven. Je zou kunnen denken: "Als hij zo slim is, kan hij vast alles helder zien, toch?"

Het paper "HueManity" zegt: "Wacht eens even."

De onderzoekers hebben een speciale test ontwikkeld om te kijken of deze "Multimodale Grote Taalmodellen" (MLLM's) — de AI-hersenen achter veel chatbots — daadwerkelijk de minuscule details kunnen zien, of dat ze gewoon gokken op basis van wat ze eerder hebben gelezen.

Hier is de uitslag van hun bevindingen met behulp van eenvoudige analogieën:

1. De Test: De "Onzichtbare Inkt" Puzzel

De onderzoekers creëerden een enorme bibliotheek van 83.850 afbeeldingen. Elke afbeelding ziet eruit als een kleurrijke, rommelige stapel stippen, vergelijkbaar met de Ishihara-kleurenblindheidstesten die je bij een dokter kunt zien.

  • De Truc: Verstopt in de rommelige stippen zitten twee letters of cijfers (zoals "42" of "X7").
  • De Uitdaging: Om ze te vinden, moet je de ruis negeren en de subtiele kleurverschillen opmerken die de vorm van de letters vormen.
  • Het Doel: Het gaat niet om "denken" of "redeneren". Het gaat puur om zien. Kan de AI de naald in de hooiberg vinden?

2. De Resultaten: Mensen vs. AI

De onderzoekers lieten deze test uitvoeren door mensen, een standaard computervisiestandaard (ResNet50) en negen van de slimste AI-modellen die vandaag de dag beschikbaar zijn (zoals GPT-4, Claude en LLaVA).

  • Mensen: Waren bijna perfect. Ze zagen de cijfers en letters direct (99% en 93% nauwkeurigheid).
  • Standaard Computer Vision: Deed het ook erg goed (96% en 94%). Het is als een getraind oog dat precies weet waar het naar moet zoeken.
  • De "Slimme" AI-modellen: Ze faalden jammerlijk.
    • Het beste AI-model kreeg slechts 33% van de eenvoudige cijfertests goed.
    • Bij de moeilijkere letter/cijfertests haalde het beste AI-model slechts 3% goed.
    • De meeste andere modellen scoorden tussen de 0% en 1%.

De Analogie: Stel je een genie voor dat elk boek in de bibliotheek heeft gelezen en je vraagt om een specifiek woord te vinden dat met onzichtbare inkt op een pagina is geschreven. Het genie kent misschien het concept van het woord, maar kan de inkt op de pagina niet echt zien. Het "hallucineert" antwoorden in plaats van de waarheid te zien.

3. Waarom Faalde de AI?

Het paper suggereert dat de AI niet "dom" is, maar een specifieke blinde vlek heeft:

  • Te veel focus op het "Grote Plaatje": Deze AI's zijn getraind om de betekenis van een afbeelding te begrijpen (bijv. "Dit is een kat die op een mat zit"). Ze zijn zo goed in het grote plaatje dat ze de minuscule, rommelige details (de specifieke kleuren en vormen van de stippen) negeren.
  • Vertrouwen op Gokken: Wanneer de AI de stippen niet kan zien, probeert het te gokken op basis van taalpatronen. Het is als een student die een wiskundeprobleem niet begrijpt, maar een antwoord gokt omdat het klinkt als iets wat hij eerder heeft gehoord.
  • Het "Knijp-effect": Interessant genoeg, toen de onderzoekers de afbeeldingen waziger maakten (lagere resolutie), werd één AI-model zelfs beter. Het lijkt erop dat de AI de "ruis" moet gladstrijken om de vorm te kunnen raden, in plaats van de details daadwerkelijk te zien.

4. De "Tovertruc" Die Niet Werkte

De onderzoekers probeerden de AI te "leren" hoe hij deze test moest doen:

  • Voorbeelden Tonen: Ze lieten de AI eerst een paar voorbeelden van de puzzel zien. Dat hielp niet.
  • Fine-tuning: Ze probeerden de AI specifiek op deze puzzels te hertrainen. Dat hielp niet. Sterker nog, het zorgde ervoor dat de AI vergat hoe hij eenvoudige tekst moest lezen!

De Conclusie: Het probleem is niet dat de AI niet genoeg is geleerd; het probleem ligt waarschijnlijk in hoe de AI is gebouwd. Het is als proberen een vis te leren klimmen in een boom door hem meer boeken over klimmen te geven. De vis (de AI) is simpelweg niet gebouwd voor dat soort visie.

Waarom Is Dit Belangrijk?

Het paper betoogt dat we deze AI's niet kunnen vertrouwen in situaties waarin helder zien cruciaal is.

  • Als een AI een auto bestuurt, moet hij een kleine barst in de voorruit of een klein bord in de regen zien, in plaats van alleen maar te "raden" dat er een weg is.
  • Als een AI naar medische scans kijkt, moet hij een minuscuul afwijking kunnen ontdekken, in plaats van alleen de algemene vorm van het orgaan te beschrijven.

Kortom: Deze AI-modellen zijn uitstekende verhalenvertellers en heel goed in het begrijpen van concepten, maar ze zijn momenteel verschrikkelijk in fijnmazige visie. Ze zijn als iemand die een schilderij perfect kan beschrijven, maar de verborgen handtekening in de hoek niet kan vinden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →