← Nieuwste papers
💻 computer science

Does it Really Count? Assessing Semantic Grounding in Text-Guided Class-Agnostic Counting

Dit artikel onthult dat huidige state-of-the-art tekstgestuurde klasse-agnostische telmodellen vaak tekortschieten in het correct koppelen van tekstuele prompts aan visuele objecten, wat leidt tot onbetrouwbare resultaten, en adresseert dit door het introduceren van het PrACo++-evaluatiekader en de MUCCA-dataset om semantische uitlijning en modelrobuustheid beter te beoordelen.

Oorspronkelijke auteurs: Giacomo Pacini, Luca Ciampi, Nicola Messina, Nicola Tonellotto, Giuseppe Amato, Fabrizio Falchi

Gepubliceerd 2026-05-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Giacomo Pacini, Luca Ciampi, Nicola Messina, Nicola Tonellotto, Giuseppe Amato, Fabrizio Falchi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme robotassistent hebt wiens taak het is om dingen in een afbeelding te tellen. Je kunt tegen hem zeggen: "Tel de appels," en hij kijkt naar de foto en geeft je een getal. Dit heet Tekstgeleide Telling.

Lange tijd testten wetenschappers deze robots door hen afbeeldingen te tonen met alleen appels. Als de robot correct 10 appels telde, juichte iedereen en zei: "Goed gedaan!"

Maar dit nieuwe artikel stelt een zeer belangrijke vraag: "Tel hij echt, of raadt hij gewoon?"

De auteurs betogen dat de huidige tests vergelijkbaar zijn met een rijexamen waarbij je alleen op een lege, rechte weg rijdt. Alleen omdat een bestuurder goed is op een lege weg, betekent niet dat hij een druk kruispunt met auto's, voetgangers en verwarrende borden aankan.

Hier is de uiteenzetting van hun bevindingen en nieuwe hulpmiddelen, eenvoudig uitgelegd:

Het Probleem: De Robot "Hallucineert"

De onderzoekers ontdekten dat veel van de beste robottellers eigenlijk slecht zijn in het begrijpen wat ze moeten tellen. Ze tellen vaak gewoon de meest voor de hand liggende dingen in de afbeelding en negeren je instructies.

  • Het "Spook"-probleem: Als je een robot een foto van een strand met parasols toont en vraagt: "Tel de sigaretten," zou een goede robot moeten zeggen: "Nul, er zijn geen." Maar veel huidige robots zeggen: "Ik zie er 45!" Ze tellen de parasols omdat ze op objecten lijken, zelfs al vroeg je om sigaretten. Ze hallucineren getallen voor dingen die er niet zijn.
  • Het "Aandacht"-probleem: Als je een afbeelding toont met zowel appels als sinaasappels, en je vraagt om de appels, dan telt een goede robot alleen de appels. Een slechte robot raakt in de war door de sinaasappels en telt die ook mee, of raakt afgeleid en mist enkele appels.

De Oplossing: Een Nieuwe "Stress Test" (PrACo++)

Om dit op te lossen, creëerden de auteurs een nieuwe testset genaamd PrACo++. Denk hierbij aan een examen met "triviale vragen" voor de robots. Het heeft twee hoofdonderdelen:

  1. De "Negatieve Label"-test (De Leugendetector):

    • Hoe het werkt: De onderzoekers tonen de robot een foto van een fruitschaal en vragen: "Tel de auto's."
    • Het Doel: De robot moet "Nul" zeggen.
    • Het Mislukken: Als de robot "12" zegt, is hij gefaald. Dit betekent dat de robot niet luistert naar je woorden; hij telt gewoon wat hij ziet. Het artikel vond dat veel toprobots deze test jammerlijk faalden, door hoge aantallen te geven voor dingen die niet bestonden.
  2. De "Aandacht"-test (De Focus Test):

    • Hoe het werkt: De onderzoekers tonen een afbeelding met honden en katten door elkaar heen. Ze vragen: "Tel de honden."
    • Het Doel: De robot moet de katten negeren en alleen de honden tellen.
    • Het Mislukken: Als de robot de katten als honden telt, of in de war raakt en minder honden telt omdat de katten er zijn, is hij gefaald. Dit test of de robot zich kan focussen op de specifieke instructie te midden van chaos.

De Nieuwe Speelplaats: MUCCA Dataset

Vroeger waren de standaard testafbeeldingen (datasets) als een klaslokaal waar elke student alleen zat. Je hoefde nooit met een menigte om te gaan.

  • De Oude Manier: Een afbeelding met alleen auto's.
  • De Nieuwe Manier (MUCCA): De auteurs creëerden een nieuwe collectie van 200 foto's uit de echte wereld waarin alles door elkaar heen zit. Je kunt mensen, auto's, honden en fruit in één afbeelding zien. Dit is veel moeilijker voor de robots omdat ze door de rommel moeten sorteren om het specifieke ding te vinden waar je om vroeg.

Wat Ze Vonden

De auteurs testten 10 van de slimste, meest geavanceerde robots die vandaag beschikbaar zijn. Hier is het oordeel:

  • Het "Goede" Nieuws: Als je ze alleen vraagt om dingen te tellen in simpele, enkelvoudige afbeeldingen, doen ze het geweldig. Ze halen hoge scores op de oude tests.
  • Het "Slechte" Nieuws: Wanneer je de nieuwe "triviale vragen" (PrACo++) gebruikt, vallen veel van deze robots uiteen.
    • Sommige robots telden "spook"-objecten (zoals het tellen van sigaretten in een foto van een strand).
    • Sommige robots raakten zo in de war door de mix van items in de nieuwe MUCCA-dataset dat hun nauwkeurigheid aanzienlijk daalde.
    • Ze ontdekten dat robots vaak in de war raken wanneer de woorden die ze horen op elkaar lijken (bijvoorbeeld het tellen van "frambozen" wanneer er om "bramen" wordt gevraagd).

De Conclusie

Het artikel concludeert dat we deze robots niet kunnen vertrouwen alleen omdat ze de oude, simpele tests halen. Ze zijn als studenten die de antwoorden op een specifieke quiz hebben uit het hoofd geleerd, maar het onderwerp niet echt begrijpen.

Om echt betrouwbare AI te bouwen, moeten we stoppen met ze te testen op lege wegen en beginnen met ze te testen in het verkeer. We hebben robots nodig die echt naar onze woorden kunnen luisteren en de afleiding kunnen negeren, en niet gewoon tellen wat er voor hen staat. De auteurs hebben hun nieuwe "triviale vraag"-tests en hun verzameling foto's van "drukke kruispunten" vrijgegeven zodat andere wetenschappers betere robots kunnen bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →