← Nieuwste papers
⚡ electrical engineering

VGGSounder: Audio-Visual Evaluations for Foundation Models

Dit artikel introduceert VGGSounder, een uitgebreid opnieuw geannoteerde multi-label testset die is ontworpen om de beperkingen in labeling en uitlijning van de oorspronkelijke VGGSound-dataset te overwinnen, waardoor een meer betrouwbare en precieze evaluatie van audio-visuele fundamentele modellen mogelijk wordt door middel van gedetailleerde modaliteitsanalyse en een nieuwe verwarringsmetriek.

Oorspronkelijke auteurs: Daniil Zverev, Thaddäus Wiedemer, Ameya Prabhu, Matthias Bethge, Wieland Brendel, A. Sophia Koepke

Gepubliceerd 2026-06-04
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Daniil Zverev, Thaddäus Wiedemer, Ameya Prabhu, Matthias Bethge, Wieland Brendel, A. Sophia Koepke

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren de wereld te begrijpen door hem video's te laten zien. Je wilt dat de robot weet dat als hij een trommel ziet worden geslagen en een boem hoort, hij moet zeggen: "Dat is een trommel!"

Lama tijd lang gebruikten onderzoekers een enorme bibliotheek met video's genaamd VGGSound om deze robots te testen. Maar de auteurs van dit artikel, Daniil Zverev en zijn team, ontdekten dat deze bibliotheek leek op een rommelige, slecht georganiseerde zolder. Het had drie grote problemen die het onmogelijk maakten om te bepalen of de robots echt slim waren of gewoon geluk hadden:

  1. De "Eén Label"-valstrik: De bibliotheek dwong elke video om slechts één label te hebben. Maar in het echte leven kan een video een hond laten blaffen terwijl een auto toetert. De oude bibliotheek zou dan gewoon één label kiezen en het andere negeren. Het is also�elijk een pizza met pepperoni en champignons te beschrijven als slechts "een pizza met kaas."
  2. Het "Verwarrende Namen"-probleem: Sommige labels waren tweelingen. Eén label kon "hond die blaft" zijn en een ander "hond die wauwt." De robots raakten in de war omdat ze in feite hetzelfde waren, maar de test behandelde ze als verschillende dingen.
  3. Het "Geest"-probleem: Soms beweerde de bibliotheek dat een geluid in de video zat terwijl dat niet zichtbaar was, of andersom. Bijvoorbeeld: een video kan gelabeld zijn als "orkest", maar je kunt alleen de muziek horen, niet de instrumenten zien. De oude test gaf niets om deze mismatch.

De Oplossing: VGGSounder

Het team bouwde een nieuwe, verbeterde bibliotheek genaamd VGGSounder. Denk aan het renoveren van die rommelige zolder tot een hoogtechnologisch, perfect georganiseerd museum.

Dit is wat ze anders deden:

  • Multi-labeling: In plaats van één label af te dwingen, lieten ze elke video zoveel labels dragen als nodig is. Een video kan tegelijkertijd getagd zijn als "trommels", "gitaar" en "zingen".
  • Modaliteit-tags: Ze voegden een speciale "checklist" toe voor elk enkel label. Ze vroegen: Is dit ding zichtbaar? Is dit ding hoorbaar? Dit laat hen testen of een robot goed is in zien, goed in horen, of in beide.
  • Meta-labels: Ze voegden "waarschuwingsborden" toe voor lastige situaties. Als een video achtergrondmuziek heeft, een voice-over heeft, of gewoon een statische foto met geluid is, markeerden ze dit. Dit helpt onderzoekers om te zien of een robot wordt afgeleid door ruis.

De Grote Ontdekking: Het "Afleidings"-effect

Het meest verrassende wat het team ontdekte, was hoe de robots zich gedroegen wanneer ze zowel ogen als oren kregen.

Ze bedachten een nieuwe score genaamd "Modality Confusion" (Modaliteitsverwarring). Stel je voor dat je goed bent in het oplossen van een puzzel met alleen je ogen. Dan geeft iemand je een tweede puzzelstukje (het geluid) en plotseling kun je de eerste puzzel niet meer oplossen. Dat is Modality Confusion.

  • De bevinding: Veel van de nieuwste, meest geavanceerde "Foundation Models" (de superintelligente AI-robots) werden zelfs slechter wanneer ze de mogelijkheid kregen om zowel te luisteren als te kijken.
  • De bias: Deze robots leken "blind" voor geluid. Als je ze een video van een blaffende hond lieten zien maar ze alleen het geluid liet horen, faalden ze. Maar als ze de hond konden zien, slaagden ze. Wanneer ze probeerden beide te gebruiken, maakte het geluid hen vaak in de war, waardoor ze het geluid volledig negeerden en alleen vertrouwden op wat ze zagen.

Waarom dit ertoe doet

Het artikel betoogt dat we niet zomaar een berg data tegen een robot aan kunnen gooien en hopen dat hij leert. We hebben een betere test nodig (VGGSounder) die ons precies vertelt hoe de robot denkt.

  • Oude Test (VGGSound): Zoals een rijexamen waarbij de weg mistig is en de borden ontbreken. Je haalt misschien je rijexamen door geluk, maar je weet niet of je een veilige bestuurder bent.
  • Nieuwe Test (VGGSounder): Zoals een rijexamen met duidelijke borden, een copiloot die gevaren aanwijst en een rapportcijfer dat je precies vertelt welke zintuigen je hebt gebruikt om je beslissingen te nemen.

De auteurs concluderen dat hoewel deze nieuwe AI-modellen indrukwekkend zijn, ze vaak moeite hebben met het effectief combineren van zicht en geluid. Ze negeren het audiofragment vaak als ze het beeld kunnen zien, wat een grote tekortkoming is voor machines die de wereld holistisch zouden moeten begrijpen. VGGSounder is het instrument dat is ontworpen om deze gebreken bloot te leggen, zodat ingenieurs ze kunnen repareren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →