← Nieuwste papers
⚡ electrical engineering

Scaling Open Discrete Audio Foundation Models with Interleaved Semantic, Acoustic, and Text Tokens

Deze paper introduceert SODA, een reeks native audio-foundationmodellen die semantische, akoestische en tekstuele tokens gezamenlijk modelleren, en biedt empirische inzichten en schalingswetten voor het trainen van dergelijke modellen via next-token prediction.

Oorspronkelijke auteurs: Potsawee Manakul, Woody Haosheng Gan, Martijn Bartelds, Guangzhi Sun, William Held, Diyi Yang

Gepubliceerd 2026-02-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Potsawee Manakul, Woody Haosheng Gan, Martijn Bartelds, Guangzhi Sun, William Held, Diyi Yang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een super-intelligente robot wilt bouwen die niet alleen tekst kan lezen en schrijven, maar ook luistert, spreekt, zingt en zelfs de stem van iemand anders kan nabootsen.

Vroeger waren deze robots een beetje als een tweeslachtig wezen: ze waren goed in tekst (zoals een slimme chatbot), maar als je ze een audio-bestand gaf, moesten ze eerst een "vertaler" gebruiken om het om te zetten naar tekst voordat ze konden reageren. Of ze waren gespecialiseerd in stemmen, maar misten dan het begrip van wat er gezegd werd.

Dit paper introduceert SODA (Scaling Open Discrete Audio), een nieuwe soort robot die alles in één brein heeft. Hier is hoe het werkt, vertaald naar alledaagse taal:

1. De Grote Uitdaging: De "Vertaal-Bottleneck"

Stel je voor dat je een boek leest, maar je mag het niet hardop voorlezen. Je moet eerst elke zin in je hoofd omzetten naar een abstract idee, en dat idee dan weer omzetten in geluid. Dat is wat de oude modellen deden. Ze vergeten de "kleine details" van de stem (de trillingen, de emotie, het accent) omdat ze te veel focussen op de betekenis van de woorden.

SODA doet het anders. Het leert niet alleen wat er gezegd wordt, maar ook hoe het gezegd wordt.

2. De Magische Ingrediënten: Drie Soorten "Blokjes"

Om SODA te bouwen, hebben de onderzoekers een nieuw recept uitgevonden. Ze zien geluid en tekst niet als grote, ondoorzichtige blokken, maar als een reeks kleine brieven (tokens) die ze door elkaar kunnen gooien. Ze gebruiken drie soorten brieven:

  1. De "Wat" (Semantiek): Dit zijn de woorden en de betekenis. (Bijvoorbeeld: "Ik heb honger").
  2. De "Hoe" (Acoustiek): Dit zijn de geluidsdetails. De toonhoogte, de ruis op de achtergrond, de stemkwaliteit. (Bijvoorbeeld: "Ik heb honger" gezegd met een schorre stem of een zachte fluisterstem).
  3. De "Tekst" (Schrijven): Gewone tekst, zoals je het op een scherm ziet.

Het Geniale Trucje:
In plaats van eerst de betekenis te leren en daarna de klank, verweven ze deze drie soorten brieven door elkaar, regel voor regel.

  • Vroeger: Eerst lezen, dan luisteren.
  • Nu met SODA: Het model ziet een zin tekst, dan een stukje geluid, dan weer tekst, dan weer geluid. Het leert zo dat "hallo" (tekst) en "hallo" (geluid) precies hetzelfde zijn, maar dat de klank van "hallo" in een zonnige tuin anders is dan in een donkere kelder.

3. De Rekenkracht: Hoe groot moet de robot zijn?

Een van de grootste vragen in de AI-wereld is: "Is het slimmer om een heel grote robot te bouwen met weinig data, of een kleinere robot met heel veel data?"

Voor tekst-robots (zoals ChatGPT) wisten we dit al: je moet ongeveer evenveel data als modelgrootte hebben. Maar voor geluid is het anders. Geluid is "dicht" aan informatie. Een seconde geluid bevat veel meer informatie dan een woord tekst.

De onderzoekers hebben een experiment gedaan met 64 verschillende robots, variërend van heel klein tot groot. Ze ontdekten een verrassend feit:

  • Voor geluid moet je veel meer data verzamelen dan je denkt.
  • Als je je rekenkracht (je budget) verdubbelt, moet je de data 1,6 keer zo snel laten groeien als het model zelf.
  • Analogie: Stel je voor dat je een kok bent. Voor een tekst-restaurant (pizza) kun je een grote oven en wat deeg gebruiken. Voor een geluidsrestaurant (een symfonie) heb je een enorme hoeveelheid ingrediënten nodig, zelfs als je oven klein is. Je moet veel meer oefenen met het geluid zelf.

4. De Resultaten: SODA in de praktijk

Ze hebben een reeks robots getraind, van heel klein (135 miljoen "hersencellen") tot groot (4 miljard). Wat bleek?

  • Van Scratch vs. Opwarmen: Veel mensen beginnen met een slimme tekst-robot en proberen die "op te warmen" met geluid. De onderzoekers ontdekten dat dit niet werkt voor geluid. Het is beter om een robot vanaf nul te bouwen die specifiek is ontworpen voor geluid. Het is alsof je een voetballer probeert te maken door een schaker te laten trainen; ze hebben andere spieren nodig.
  • De Kracht van SODA: De SODA-robots kunnen nu:
    • Gesproken taal omzetten naar tekst (zoals een zeer slimme stenograaf).
    • Tekst omzetten naar gesproken taal (zoals een perfecte verteller).
    • En het allerbelangrijkste: Ze kunnen een gesprek voeren waarbij ze de stem van de spreker behouden. Als je zegt: "Vertaal dit naar het Frans, maar zeg het met mijn stem," dan doet SODA dat. Ze houden de "vibe" van de stem vast, niet alleen de woorden.

5. Waarom is dit belangrijk?

Dit paper is een mijlpaal omdat het laat zien dat we geen aparte systemen meer nodig hebben voor tekst, audio en vertaling. We kunnen één universeel brein bouwen dat alles begrijpt.

Het is alsof we zijn overgestapt van een gereedschapskist met losse hamers, schroevendraaiers en tangen, naar een Zwitsers zakmes dat alles kan, en dat bovendien nog beter werkt dan de losse tools.

Kortom:
De onderzoekers hebben bewezen dat als je geluid, tekst en betekenis door elkaar leert (in plaats van ze te scheiden), en als je genoeg data gebruikt, je een AI kunt bouwen die niet alleen "weet" wat er gezegd wordt, maar ook "hoort" hoe het klinkt. En dat is de sleutel tot echte, menselijke interactie met machines.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →