← Nieuwste papers
⚡ electrical engineering

PhaseCoder: Microphone Geometry-Agnostic Spatial Audio Understanding for Multimodal LLMs

Het artikel introduceert PhaseCoder, een geometrie-agnostische transformer-encoder die ruwe multichannel audio en microfooncoördinaten omzet in ruimtelijke embeddings, waardoor multimodale LLM's robuuste lokalisatie en complexe ruimtelijke redenering kunnen uitvoeren over diverse apparaatconfiguraties heen.

Oorspronkelijke auteurs: Artem Dementyev, Wazeer Zulfikar, Sinan Hersek, Pascal Getreuer, Anurag Kumar, Vivek Kumar

Gepubliceerd 2026-08-07
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Artem Dementyev, Wazeer Zulfikar, Sinan Hersek, Pascal Getreuer, Anurag Kumar, Vivek Kumar

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je op een luidruchtig feestje bent. Je kunt het stemgeluid van je vriend moeiteloos onderscheiden van de andere stemmen aan de overkant van de kamer, zelfs terwijl de muziek dreunt en andere mensen kletsen. Dit is een superkracht die mensen het "cocktailparty-effect" noemen. We horen niet alleen geluid; we voelen waar het vandaan komt. We weten of een stem achter ons is, links van ons, of ver weg. Deze ruimtelijke bewustheid is zo natuurlijk voor ons dat we er zelden bij stilstaan, maar voor robots en slimme assistenten is het een groot mysterie. Momenteel zijn de meeste slimme apparaten "audio-blind" voor locatie; ze horen een enkele, platte stroom geluid, alsof je naar een radio luistert via één oortje. Ze kunnen je vertellen wat er gezegd is, maar ze hebben geen idee waar de spreker staat.

Om dit op te lossen, proberen wetenschappers computers te leren om geluidsrichting te begrijpen. Er is echter een addertje onder het gras: de meeste van deze programma's voor "ruimtelijk horen" zijn als op maat gemaakte schoenen. Ze passen alleen bij één specifiek paar voeten. Als een apparaat vier microfoons heeft die in een vierkant zijn gerangschikt, werkt het programma. Als een ander apparaat acht microfoons in een cirkel heeft, loopt het programma vast. Dit komt omdat de software getraind is op één specifieke vorm en niet kan aanpassen aan een nieuwe vorm. Bovereindelijk wijzen deze programma's meestal alleen een vinger en zeggen "daar", maar ze kunnen er geen gesprek over voeren of die locatie-informatie gebruiken om een robot door een kamer te laten navigeren. Ze zijn goed in wijzen, maar slecht in denken.

Maak kennis met PhaseCoder, een nieuwe uitvinding van onderzoekers van Google DeepMind en MIT die fungeert als een universele vertaler voor geluid. Denk aan PhaseCoder als een magisch paar oren dat er niet om geeft welke vorm de microfoon-"oren" hebben. Of de microfoons nu in een rommelige cirkel verspreid zijn, in een rij staan, of in een vreemd patroon op de kop van een robot zijn geplaatst, PhaseCoder kan nog steeds precies uitzoeken waar een geluid vandaan komt. Het doet dit door te luisteren naar de minuscule verschillen in de timing (of "fase") van de geluidsgolven die elke microfoon raken, net zoals jouw brein de kleine vertraging tussen je linker- en rechteroor gebruikt om een geluid te lokaliseren.

Maar PhaseCoder doet meer dan alleen wijzen. De onderzoekers hebben het gekoppeld aan een krachtig "brein" genaamd een Large Language Model (LLM), specifiek een versie van Gemma. Stel je voor dat je dit brein een nieuw zintuig geeft: het vermogen om de wereld in 3D-geluid te zien. Nu hoort de AI in plaats van alleen "Hallo", ook "Hallo, en ik sta drie meter links van je." De onderzoekers hebben dit systeem getraind met miljoens computergegenereerde geluidsscenario's, waarbij ze het systeem leerden om de vorm van de microfoonopstelling te negeren en zich alleen op het geluid zelf te concentreren.

De resultaten zijn indrukwekkend. In tests met echte opnames van verschillende apparaten lokaliseerde PhaseCoder geluiden met een nauwkeurigheid van ongeveer 7,44 graden op een uitdagende dataset, waarmee het eerdere state-of-the-art modellen versloeg die vastzaten aan specifieke microfoonvormen. Belangrijker nog, wanneer ze de AI complexe vragen stelden, kon deze redeneren over het geluid. De AI kon antwoorden op vragen als: "Staat de spreker aan mijn linkerzijde?" of "Transcribeer alleen de persoon die achter mij staat," waarbij het erin slaagde de rest te negeren. Het systeem werkt met elk aantal microfoons van drie tot acht, wat bewijst dat het echt de geometrie van geluid begrijpt in plaats van alleen een specifieke lay-out te onthouden. Hoewel het systeem nog steeds een beetje moeite heeft met het inschatten van exacte afstanden (een berucht moeilijke taak voor alleen audio), heeft het succesvol de kloof overbrugd tussen ruwe geluidsdata en intelligente redenering, waardoor machines het vermogen krijgen om de wereld om hen heen echt te "horen".

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →