← Nieuwste papers
⚡ electrical engineering

SALMONN-2: Advancing General-Purpose Hearing Abilities with Self-Supervised Representations

SALMONN-2 is een algemeen bruikbaar audio-groot taalmodel dat een verenigde zelfgesuperviseerde leerencoder met een nieuwe multi-layer feature fusion adapter benut om state-of-the-art prestaties te behalen over diverse audio-taken en multimodale in-context leren mogelijk te maken door middel van gerichte contextuele bias-training.

Oorspronkelijke auteurs: Xiaoyu Yang, Xuenan Xu, Wenyi Yu, Siyin Wang, Changli Tang, Terumi Chiba, Siyuan Hou, Ziyang Zhang, Wen Wu, Baoxiang Li, Guangzhi Sun, Chao Zhang, Philip Woodland

Gepubliceerd 2026-07-21
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Xiaoyu Yang, Xuenan Xu, Wenyi Yu, Siyin Wang, Changli Tang, Terumi Chiba, Siyuan Hou, Ziyang Zhang, Wen Wu, Baoxiang Li, Guangzhi Sun, Chao Zhang, Philip Woodland

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente robot leert om naar de wereld te luisteren. Al heel lang proberen wetenschappers "Audio Large Language Models" (ALLM's) te bouwen—denk aan robots die een geluid kunnen horen, begrijpen wat het is, en er vervolgens over kunnen chatten net als een mens. Om dit te doen, hebben deze robots twee belangrijke dingen nodig: een paar "oren" (een audio-encoder) om geluidsgolven om te zetten in data, en een "brein" (een groot taalmodel) om die data betekenis te geven.

Traditioneel trainden wetenschappers deze "oren" met enorme hoeveelheden gelabelde data, zoals wanneer een leraar naar een hond wijst en zegt: "Dat is een hond," keer op keer. Dit wordt superviserend leren genoemd. Maar er is een addertje onder het gras: als de leraar alleen maar honden laat zien, kan de robot in de war raken als hij een kat of een onweer hoort. Onlangs werd een andere aanpak, genaamd "zelfgesuperviseerd leren", populair. In plaats van een leraar luistert de robot naar miljoenen uren ongelabelde audio en ontdekt zelf patronen, een beetje zoals een baby leert spreken door naar de wereld te luisteren in plaats van een woordenschatquiz te maken. Deze methode is geweldig voor het creëren van "algemene" oren die alles kunnen horen. Maar hier komt de grote vraag: kan één enkele, algemene "oor" die op deze manier is getraind, daadwerkelijk de basis vormen voor een robot die alles begrijpt, van muziek tot spraak tot geluidseffecten? En als we deze algemene oren aan de robot geven, hoe zorgen we er dan voor dat de robotbrein ook echt alle verschillende lagen van informatie gebruikt die hij hoort, en niet alleen de uiteindelijke samenvatting?

Dit is precies waar de onderzoekers achter SALMONN-2 zich op wilden richten. Ze bouwden een nieuwe versie van hun audio-AI, SALMONN-2, om te testen of een enkele, zelfgesuperviseerde "oor" de complexe opstellingen met meerdere gespecialiseerde oren van andere modellen kon vervangen. Ze ontdekten dat niet alleen één algemene "oor" de klus kan klaren, maar dat het zelfs beter werkt dan het combineren van verschillende gespecialiseerde oren.

Om dit werkend te krijgen, hebben ze een slimme nieuwe verbinder uitgevonden genaamd de Multi-Layer Feature Fusion (MLF) adapter. Stel je de audio-encoder voor als een gebouw met meerdere verdiepingen waar het geluid de ruwe ruis hoort (zoals het kraken van een blad), de middelste verdiepingen patronen horen (zoals een stem), en de bovenste verdieping de betekenis begrijpt (zoals een zin). De meeste eerdere robots keken echter alleen naar de bovenste verdieping. SALMONN-2 gebruikt echter zijn MLF-adapter om aantekeningen van elke verdieping van het gebouw te verzamelen voordat ze naar het brein worden doorgegeven. Hierdoor kan de robot de rijke details van het geluid behouden terwijl hij toch het grote plaatje begrijpt.

Het team pakte ook een lastig probleem aan: hoe de robot context te laten begrijpen. In een menselijk gesprek, als ik zeg: "Ik zag een bat" (vleermuis of honkbalknuppel), moet je weten of ik het over het dier heb of over de sportuitrusting. In audio is dit zelfs nog moeilijker. De onderzoekers hebben SALMONN-2 geleerd via Multimodal In-Context Learning (MICL). Dit is alsoj een de robot een spiekbriefje geeft voordat hij luistert. Als de robot een specifieke naam moet herkennen, schrijven ze niet alleen de naam op; ze spelen een kort fragment af van hoe die naam klinkt. Ze ontdekten dat deze "toon en vertel"-aanpak (audio + tekst) veel beter werkt dan alleen tekst alleen, maar alleen als de robot hier specifiek voor getraind is. Zonder deze specifieke training heeft de robot de neiging om de extra aanwijzingen te negeren.

De resultaten zijn indrukwekkend. SALMONN-2, met slechts één algemene "oor" en de nieuwe MLF-adapter, behaalde state-of-the-art prestaties op belangrijke tests voor audio-begrip, waarbij het andere modellen die veel groter zijn of meerdere gespecialiseerde oren gebruiken, versloeg. Het beheerde spraak, muziek, geluidseffecten en zelfs paralinguïstische taken zoals het detecteren van emoties of nepspraak (spoofing) met een opmerkelijke balans. Misschien wel het meest verrassende is dat de onderzoekers lieten zien dat deze hoge prestaties werden bereikt met een relatief kleine hoeveelheid trainingsdata—minder dan 20.000 uur aan instructie-tuning data—wat suggereert dat slim ontwerp belangrijker is dan simpelweg enorme hoeveelheden data op het probleem gooien.

Kortom, het artikel suggereert dat we geen Zwitsers zakmes aan gespecialiseerde audio-oren nodig hebben om een goede luisterende robot te bouwen. In plaats daarvan is één enkele, goed getrainde algemene "oor", gecombineerd met een slimme manier om alle informatie die hij hoort te organiseren, genoeg om een krachtige, gebalanceerde en efficiënte audio-AI te creëren. De auteurs hebben ook aangetoond dat hoewel deze robots niet van nature leren om contextuele aanwijzingen te gebruiken, ze er wel effectief voor getraind kunnen worden, wat de deur opent naar slimmere, meer aanpasbare audiosystemen in de toekomst.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →