← Nieuwste papers
💬 NLP

Towards Robust Evaluation of Visual Activity Recognition: Resolving Verb Ambiguity with Sense Clustering

Dit artikel stelt een vision-language clustering-framework voor dat de ambiguïteit van werkwoorden in visuele activiteitsherkenning oplost door synonieme en perspectiefafhankelijke werkwoorden te groeperen in sense-clusters, waardoor een robuustere en mensgerichte evaluatiemethode wordt geboden vergeleken met standaard exact-match metrieken.

Oorspronkelijke auteurs: Louie Hong Yao, Nicholas Jarvis, Tianyu Jiang

Gepubliceerd 2026-01-27
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Louie Hong Yao, Nicholas Jarvis, Tianyu Jiang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een docent bent die het essay van een leerling beoordeelt over een foto. De foto laat een persoon op een fiets zien.

Als de leerling schrijft: "De persoon rijdt een fiets," en jouw nakijkmodel zegt "De persoon fietst," zou een strikt computerprogramma dit als fout kunnen markeren. Het ziet "rijden" en "fietsen" als twee verschillende woorden, en geeft daarom een nul.

Maar elk mens zou zeggen: "Wacht even, dat is hetzelfde! De leerling heeft gelijk."

Dit artikel gaat over het oplossen van dat oneerlijke beoordelingssysteem voor computers die proberen te begrijpen wat er op afbeeldingen gebeurt.

Het Probleem: De "Eén Juist Antwoord"-valstrik

Momenteel worden computers getest op visuele activiteitsherkenning (het identificeren van acties in foto's) met een methode genaamd "Exact Match". Dit betekent dat de gok van de computer exact hetzelfde woord moet zijn als het menselijke label.

De auteurs stellen dat dit kapot is omdat:

  1. Synoniemen bestaan: "Lesgeven" en "preken" beschrijven dezelfde gebeurtenis.
  2. Perspectieven veranderen: Een foto van een harmonie kan worden beschreven als "marcheren" (met de focus op de benen) of "optreden" (met de focus op de muziek). Beiden zijn waar, maar het zijn verschillende woorden.

Als een computer "preken" raadt terwijl het label "lesgeven" is, krijgt de computer een onvoldoing, zelfs als de computer de foto perfect begreep.

De Oplossing: De "Groepsknuffel"-methode

De onderzoekers stellen een nieuwe manier voor om deze computers te beoordelen. In plaats van te zoeken naar één enkel magisch woord, bouwen ze "Zinscuclsters" (Sense Clusters).

Denk aan het organiseren van een rommelige kast. In plaats van te zoeken naar één specifief shirt, groepeer je vergelijkbare shirts bij elkaar.

  • Stap 1: Ze nemen een foto en vragen krachtige AI-modellen (zoals GPT-4o en Llama) om de foto te beschrijven met veel verschillende werkwoorden.
  • Stap 2: Ze gebruiken een slim sorteeralgoritme om deze werkwoorden te groeperen. Als "rijden", "fietsen" en "fietsen op een fiets" allemaal bij dezelfde foto's voorkomen, worden ze in dezelfde "cluster" geplaatst.
  • Stap 3: Als een foto bij een bepaalde cluster hoort, en de computer elk willekeurig woord binnen die cluster raadt, krijgt hij punten.

Wat ze vonden

Ze hebben dit nieuwe beoordelingssysteem getest op de imSitu dataset (een enorme collectie van 126.000 foto's met actielabels). Dit is wat ze ontdekten:

  • De "Vier Perspectieven"-regel: Gemiddeld kan een enkele foto correct worden beschreven door ongeveer vier verschillende "clusters" van woorden. Bijvoorbeeld: een foto van een leraar kan een cluster hebben voor "lesgeven", een andere voor "preken", een andere voor "instrueren" en misschien één voor "onderwijzen".
  • Betere cijfers voor slimme modellen: Wanneer ze bestaande computermodellen opnieuw beoordeelden met hun nieuwe "cluster"-methode, stegen de scores aanzienlijk.
    • Voorbeeld: Een model dat 56% correct scoorde met de oude methode, sprong naar 72% met de nieuwe methode.
    • Waarom? De oude methode strafte het model af voor het gebruik van een synoniem of een ander perspectief. De nieuwe methode besefte dat het model eigenlijk slim was.
  • Menselijke overeenstemming: Wanneer de onderzoekers echte mensen vroegen om de modellen te beoordelen, kwamen de scores van de "cluster"-methode veel beter overeen met die van de mensen dan de oude "exact match"-methode. De oude methode was te streng; de nieuwe methode was eerlijk.

Waarom niet gewoon "Gelijkenisscores" gebruiken?

De auteurs hebben ook een populaire tool genaamd CLIPScore getest, die probeert te meten hoe vergelijkbaar een woord is met een foto met behulp van wiskunde. Ze ontdekten dat, hoewel het goed is in algemene zaken, het moeite heeft met specifieke actiewerkwoorden. Het is als een rechter die zegt: "Deze foto en het woord 'eten' zijn voor 90% vergelijkbaar," zelfs als de persoon op de foto eigenlijk aan het "koken" is. De context gaat verloren. Hun "cluster"-methode is preciezer omdat het woorden groepeert op basis van hoe ze daadwerkelijk in echte foto's worden gebruikt.

De Kern

Het artikel beweert niet dat dit onmiddellijk ziekten zal genezen of zelfrijdende auto's zal bouwen. In plaats daarvan biedt het een betere liniaal om te meten hoe goed onze AI is in het begrijpen van afbeeldingen.

Door te beseffen dat er niet slechts één "juist" woord is voor een actie, maar eerder een hele familie van correcte woorden, kunnen we stoppen met AI te straffen voor creativiteit en beginnen met het geven van krediet voor het daadwerkelijke begrip van de scène. Het is alsof je eindelijk tegen de leerling zegt: "Ja, 'rijden' is een correct antwoord voor 'fietsen'."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →