← Nieuwste papers
🤖 AI

Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

Dit artikel introduceert ST-OmniQA, een grootschalige spatio-temporele audio-visuele benchmark met 40K panoramische video's en Ambisonics-audio, en stelt ST-Omni-R1 voor, een model dat baselines aanzienlijk overtreft door directionele audiocues te integreren met visuele context via progressief curriculum en reinforcement learning om te redeneren over de identiteit, locatie en beweging van geluidsbronnen.

Oorspronkelijke auteurs: Zhi Zeng, Cheng Zhang, Zesheng Yang, Rendong Pi, Jiaying Wu, Di Zhang, Zihan Ma, Guodong Li, Zhou Yang, Yu Xiang, Yifei Zheng, Minnan Luo

Gepubliceerd 2026-08-11
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhi Zeng, Cheng Zhang, Zesheng Yang, Rendong Pi, Jiaying Wu, Di Zhang, Zihan Ma, Guodong Li, Zhou Yang, Yu Xiang, Yifei Zheng, Minnan Luo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je met je ogen dicht over een drukke straat loopt. Je hoort een hond blaffen, een auto toeteren en iemand lachen. Je brein hoort niet alleen maar "lawaai"; het begrijpt onmiddellijk wat het geluid maakt, waar het vandaan komt en waarheen het gaat. Het weet dat de hond naar links rent, dat de auto van rechts nadert en dat het gelach komt van een persoon die je nog niet kunt zien. Dit vermogen om horen en zien te combineren om bewegende dingen te volgen, is een superkracht die mensen hebben, maar een nachtmerrie voor computers.

Lange tijd waren computerprogramma's die geluid begrijpen (Audio-Language Modellen) als mensen met hun ogen dicht: ze konden je vertellen dat er een hond blafte, maar ze konden je niet vertellen of de hond naar je toe bewoog of van je weg rende. Aan de andere kant waren programma's die video begrijpen (Vision-Language Modellen) als mensen met hun oren dicht: ze konden een hond zien, maar ze wisten niet of dat specifieke hond degene was die blafde of er gewoon stil bij stond. De grote uitdaging in de wetenschap nu is het bouwen van een robotbrein dat beide tegelijkertijd kan doen—luisteren naar het geluid, kijken naar de video en precies uitzoeken hoe de geluidsbron zich door de ruimte en tijd beweegt. Dit artikel pakt exact dat probleem aan, door te proberen machines te leren om tegelijkertijd te "luisteren, zien en volgen".


Het Probleem: De "Blinde" en de "Dove" Robots

De auteurs van dit artikel merkten een gat op in hoe slimme computers momenteel denken. Sommige modellen zijn goed in het begrijpen van audio, maar behandelen een hele videoclip als één groot, wazig geluidsevenement. Ze missen de details van waar een geluid vandaan komt of hoe het beweegt. Andere modellen zijn goed in het bekijken van video's, maar vertrouwen op eenvoudige audio die niet genoeg "ruimtelijke" informatie heeft (zoals richting of afstand) om te weten waar dingen zijn.

Denk aan het zoeken naar een vriend in een druk park. Als je alleen een beschrijving van hun stem hebt (audio), weet je misschien dat ze er zijn, maar je kunt niet naar ze wijzen. Als je alleen een foto hebt (video), kun je ze zien, maar je weet niet of zij degene zijn die praat. Om een scène echt te begrijpen, moet je de stem koppelen aan de persoon en hun beweging volgen terwijl ze achter een boom lopen of om een hoekje gaan. Bestaande modellen worstelen met dit "bindingsprobleem"—ze kunnen een bewegend geluid niet gemakkelijk verbinden met een bewegend object in een video.

De Oplossing: Een Nieuwe Speeltuin en een Nieuw Brein

Om dit op te lossen, hebben de onderzoekers twee dingen gecreëerd: een gigantische nieuwe test genaamd ST-OmniQA en een nieuw AI-model genaamd ST-Omni-R1.

1. De Test: ST-OmniQA
Stel je een enorme videogame voor waarbij de camera 360 graden draait (panoramische video) en het geluid wordt opgenomen met speciale microfoons die precies weten waar geluiden vandaan komen (genaamd First-Order Ambisonics of FOA). De onderzoekers bouwden een dataset met 40.000 van deze videoclips en 400.000 vragen over deze clips.

De vragen worden moeilijker in vier niveaus, zoals in een videogame:

  • Niveau A (De Basis): "Wat is dit voor een geluid?" of "Hoe ver weg is het?"
  • Niveau B (De Menigte): "Er zijn twee honden die blaffen; welke is links?"
  • Niveau C (De Achtervolging): "Welke geluidsbron beweegt naar de persoon die daar staat?"
  • Niveau D (Het Mysterie): "Er werd tussen 2 en 3 seconden een geluid gehoord, maar de bron was nog niet zichtbaar. Het kwam tussen 3 en 5 seconden door de linker deur naar binnen. Wie was het?"

Deze test dwingt de AI om niet alleen te gokken, maar om te redeneren over tijd, ruimte en hoe geluid en zicht in elkaar passen.

2. Het Brein: ST-Omni-R1
De onderzoekers bouwden een nieuw AI-model om deze test te maken. In plaats van alleen naar een plat audiobestand te luisteren, gebruikt dit model een speciale "vertaler" (de STA-encoder) die de 3D-geluidsdata omzet in een lijst van "traject-tokens". Denk aan deze tokens als een spoor van broodkruimels dat de AI precies vertelt hoe een geluid in de loop van de tijd bewoog.

Het model leert in fasen, zoals een student die door de schoolgaat:

  • Fase A: Het leert eenvoudige geluiden en hun locatie te identificeren.
  • Fase B: Het leert om te gaan met meerdere geluiden tegelijk.
  • Fase C: Het leert hoe verschillende geluiden zich ten opzichte van elkaar bewegen.
  • Fase D: Het leert het geluid te koppelen aan het specifieke object in de video, zelfs als het object achter een muur verdwijnt (occlusie) en daarna weer verschijnt.

Om het model nog slimmer te maken, gebruikten ze een techniek genaamd "Reasoning-Tree Reinforcement Learning". Stel je voor dat de AI een puzzel oplost. In plaats van alleen het antwoord te geven, controleert het systeem elke stap van het denkproces. Als de AI zegt: "De hond is links", controleert het systeem of de AI de hond correct heeft geïdentificeerd, correct heeft gezien dat hij links was, en de blaf correct aan de hond heeft gekoppeld. Als de stappen niet overeenkomen, krijgt de AI een correctie met een "rode pen". Dit helpt het model om consistent en logisch te leren zijn.

De Resultaten: Een Grote Sprong Voorwaarts

Toen ze ST-Omni-R1 door de ST-OmniQA-test haalden, deed het het ongelooflijk goed.

  • De beste bestaande modellen (zoals de slimste algemene AI die beschikbaar is) hadden gemiddeld slechts ongeveer 37,28% van de antwoorden goed.
  • ST-Omni-R1 bereikte, na zijn speciale training, een nauwkeurigheid van 77,83%.

Dit is niet zomaar een kleine verbetering; het is een enorme sprong. Het model bewees dat het complexe scenario's aan kon, zoals het volgen van een geluidsbron die verborgen raakt achter een object en daarna weer verschijnt, of het onderscheiden van twee soortgelijke geluiden die in verschillende richtingen bewegen.

De onderzoekers testten hun model ook op drie andere real-world audio-datasets (TAU-NIGENS, L3DAS22 en STARSS23) die het nog nooit eerder had gezien. Zelfs zonder specifiek op die datasets getraind te zijn, presteerde ST-Omni-R1 beter dan de vorige beste modellen. Dit suggereert dat de manier waarop het model leerde om ruimte en beweging te begrijpen, een vaardigheid is die het in veel verschillende situaties kan gebruiken, niet alleen in de specifieke test die ze hebben gebouwd.

Waarom Dit Belangrijk Is

Dit artikel laat zien dat we dichter bij het geven van de menselijke gave om de wereld te "horen en zien" als één enkel, bewegend verhaal, aan computers. Door machines te leren om de reis van een geluidsbron te volgen—wetend waar het begon, waar het heen ging en hoe het eruitzag zelfs toen het verborgen was—bouwen we aan een fundament voor robots en virtuele assistenten die onze dynamische, lawaaierige en visuele wereld werkelijk kunnen begrijpen. De auteurs suggereren dat deze aanpak van het combineren van 3D-geluid met panoramische video en het aanleren van stapsgewijs redeneren aan AI, de sleutel is tot het ontsluiten van dit volgende niveau van intelligentie.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →