← Nieuwste papers
⚡ electrical engineering

AVSD-Scenes: A Dataset for Audio-Visual Description of Urban Scenes

Dit artikel introduceert AVSD-Scenes, een nieuwe dataset van 12.291 gekoppelde audio-visuele beschrijvingen voor stedelijke omgevingen gegenereerd door de modaliteitsspecifieke outputs van geavanceerde AI-modellen te combineren, die een superieure prestatie vertoont in semantische uitlijning, cross-modale retrieval en scèneclassificatie vergeleken met unimodale benaderingen.

Oorspronkelijke auteurs: Dhanunjaya Varma Devalraju, Arshdeep Singh, Mark D. Plumbley

Gepubliceerd 2026-10-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Dhanunjaya Varma Devalraju, Arshdeep Singh, Mark D. Plumbley

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Steden zijn nooit stil, noch zijn ze ooit onbeweeglijk. Ze zijn een constant, verschuivend tapijt van geluid en zicht, waar het gerommel van een bus, het geklets van een menigte en de visuele blik op een parkbankje allemaal tegelijkertijd plaatsvinden. Decennialang hebben wetenschappers geprobeerd computers te leren deze omgevingen te begrijpen, maar ze vertrouwden vaak op eenvoudige labels, zoals het labelen van een opname simpelweg als "park" of "straat". Deze labels zijn nuttig, maar ze zijn dun; ze vertellen ons de locatie, maar missen het verhaal. Ze leggen niet het specifieke geritsel van bladeren vast, de kleur van de jas van een voorbijganger, of de manier waarop een geluid weerkaatst tegen een gebouw. Om een stad echt te begrijpen, heeft een computer meer nodig dan een naam; het heeft een beschrijving nodig die wat gezien wordt en wat gehoord wordt samenweeft tot één samenhangend narratief.

Dit is de uitdaging waar onderzoekers van IIT Madras en King's College London een aanval op hebben gelanceerd met een nieuw project genaamd AVSD-Scenes. Het team streefde ernaar om een enorme collectie stedelijke scènes te creëren, waarbij elke scène gepaard gaat met een rijke, natuurlijke taalbeschrijving die precies uitlegt wat er zowel in het geluid als in de video gebeurt. Ze begonnen met een bestaande bibliotheek van 12.291 opnames uit tien Europese steden, waarbij elke clip gesynchroniseerde geluiden en video bevatte. De oorspronkelijke bibliotheek bood echter alleen basiscategorieën als labels. De onderzoekers wilden de gaten opvullen door die eenvoudige labels te transformeren naar gedetailleerde paragrafen die de specifieke gebeurtenissen, objecten en acties beschrijven die in elke scène plaatsvinden.

Om dit te bereiken, bouwden ze een geautomatiseerde pijplijn die fungeert als een team van gespecialiseerde waarnemers. Eerst gebruikten ze krachtige kunstmatige intelligentiemodellen om naar het geluid en de video afzonderlijk te kijken. Eén model luisterde naar de audio, identificeerde specifieke geluiden zoals vogelgezang of verkeerslawaai, en schreef een korte samenvatting van wat het hoorde. Een ander model keek naar de video, herkende mensen, voertuigen en bewegingen, en schreef een samenvatting van wat het zag. Deze twee aparte verslagen werden vervolgens gevoed aan een derde, geavanceerder taalmodel. Dit laatste model fungeerde als een redacteur, die de audio-notities en de visuele notities combineerde tot één verenigd verhaal. Het kreeg de instructie om ervoor te zorgen dat het verhaal logisch was, om niets te verzinnen en om de beschrijving stevig te verankeren in het feitelijke bewijs van het geluid en het beeld. Het resultaat was een dataset waarbij elke stedelijke scène wordt vergezeld door een paragraaf die leest als een menselijke observatie, die de volledige context van het moment vastlegt.

De onderzoekers testten vervolgens of deze door computers gegenereerde beschrijvingen daadwerkelijk nuttig waren. Ze stelden een reeks vragen om te zien of de beschrijvingen een computer konden helpen de wereld beter te begrijpen. Eén test hield in of een computer een tekstuele beschrijving kon gebruiken om de juiste video- of audoclip uit een grote bibliotheek te vinden. De resultaten toonden aan dat deze multimodale beschrijvingen aanzienlijk beter waren in deze taak dan beschrijvingen die gebaseerd waren op alleen geluid of alleen zicht. Wanneer de computer de gecombineerde beschrijving gebruikte, kon hij de bijbehorende audiofragment veel vaker vinden, wat suggereert dat de tekst erin geslaagd was de essentie van het geluid te vatten.

Ze testten ook of deze beschrijvingen een computer konden helpen identificeren welk type stedelijke scène hij aan het bekijken was, zoals het onderscheiden van een druk metrostation van een rustig openbaar plein. Met behulp van alleen de tekstuele beschrijvingen behaalde het systeem een nauwkeurigheid van 94,5 procent bij het identificeren van de juiste scène. Wanneer de onderzoekers de tekst combineerden met de oorspronkelijke audio- en videogegevens, steeg de nauwkeurigheid licht naar 95,4 procent. Dit was een merkbare verbetering ten opzichte van het gebruik van alleen audio of video, die moeite hadden om vergelijkbare niveaus van precisie te bereiken. De bevindingen suggereren dat de geschreven beschrijvingen diepe, betekenisvolle details over de omgeving vastlegden die de ruwe gegevens alleen hadden gemist.

Misschien wel het meest onthullende deel van de studie was een test die ontworpen was om te zien of de computer simpelweg de scène-namen memoriseerde of daadwerkelijk de inhoud begreep. De onderzoekers verwijderden de scène-labels uit de instructies die aan de AI werden gegeven tijdens het creatieproces, waardoor de AI werd gedwongen om uitsluitend op de audio- en visuele inhoud te vertrouwen om de beschrijvingen te genereren. Zelfs zonder te worden verteld wat de plek was, bleven de beschrijvingen zeer effectief bij het onderscheiden van verschillende soorten scènes. Dit gaf aan dat de AI niet simpelweg de naam "park" herhaalde omdat het dat werd gezegd; het beschreef daadwerkelijk de grasvelden, de houten hekken en de specifieke geluiden van de omgeving. De beschrijvingen legden de realiteit van de scène vast, en niet slechts de categorie.

Het team evalueerde ook de kwaliteit van het schrijfwerk zelf. Ze gebruikten zowel geautomatiseerde hulpmiddelen als menselijke beoordelaars om de beschrijvingen te beoordelen op factoren zoals vloeiendheid, grammatica en hoe goed de tekst overeenkwam met de audio en video. De menselijke beoordelaars vonden de beschrijvingen over het algemeen accuraat en informatief, met hoge scores voor de mate waarin ze beschreven wat er te zien was en hoe vloeiend ze geschreven waren. Hoewel er incidentele momenten waren waarop de beschrijvingen verbeterd konden worden, was de algehele kwaliteit sterk genoeg om nuttig te zijn voor complexe taken.

Dit werk vertegenwoordigt een belangrijke stap voorwaarts in de manier waarop machines de wereld waarnemen. Door verder te gaan dan eenvoudige labels naar rijke, beschrijvende narratieven, hebben de onderzoekers aangetoond dat computers de complexe interactie tussen geluid en zicht in ons dagelijs leven kunnen begrijpen. De dataset, die nu beschikbaar is voor anderen om te gebruiken, biedt een nieuwe fundering voor het bouwen van systemen die de wereld werkelijk kunnen "zien" en "horen" zoals wij dat doen. Het suggereert dat de toekomst van kunstmatige intelligentie in stedelijke omgevingen niet ligt in betere labels, maar in betere verhalen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →