Qwen3-ASR Technical Report
Dit rapport introduceert de Qwen3-ASR-familie, bestaande uit twee hoogwaardige, all-in-one spraakherkenningsmodellen (0,6B en 1,7B parameters) en een nieuw niet-autoregressief forced alignment-model, die gezamenlijk een state-of-the-art nauwkeurigheid en efficiëntie bereiken over 52 talen terwijl ze worden uitgebracht onder een Apache 2.0-licentie.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je de wereld van spraaktechnologie voor als een bruisende stad. Jarenlang waren de "politieagenten" (traditionele spraakherkenningssystemen) erg goed in het lezen van duidelijke, geschreven borden in een stille kamer. Maar als je schreeuwde in een drukke markt, een lied zong of met een zwaar accent sprak, raakten ze vaak in de war of gaven ze het op.
Het Qwen3-ASR-team heeft zojuist een nieuwe set "super-agenten" en een "tijdwaarnemer" uitgebracht die het spel volledig veranderen. Hier is wat ze hebben gebouwd, eenvoudig uitgelegd:
1. De Twee Super-Agenten: Qwen3-ASR-1.7B en Qwen3-ASR-0.6B
Beschouw deze twee modellen als een duo detectives met verschillende sterktes, beiden getraind door een "super-mentor" (een fundatiemodel genaamd Qwen3-Omni) die de wereld diepgaand begrijpt.
- De Grote Detective (Qwen3-ASR-1.7B): Dit is de zwaargewicht. Het is als een ervaren veteraan die alles heeft gehoord. Het kan een gesprek horen in een lawaaierige fabriek, een lied begrijpen met een volledige band op de achtergrond, of uitzoeken wat iemand zegt, zelfs als diegene een zeldig dialect spreekt. Het is zo goed dat het rivaliseert met de meest dure, gesloten diensten van gigantische technologiebedrijven.
- De Snelle Detective (Qwen3-ASR-0.6B): Dit is de lichte, wendbare partner. Het is kleiner en sneller. Stel je een detective voor die een marathon kan rennen terwijl hij een puzzel oplost. Het is ontworpen om ongelooflijk efficiënt te zijn. Het paper beweert dat het 2.000 seconden aan spraak kan beluisteren in slechts 1 seconde wanneer het veel taken tegelijkertijd uitvoert. Het is perfect om in je telefoon of een klein apparaatje te plaatsen, omdat het geen enorme computer nodig heeft om te werken.
Wat maakt hen speciaal?
- De "Universele Vertaler"-hoed: Ze spreken niet alleen Engels of Mandarijn; ze begrijpen 52 talen en dialecten. Of je nu Standaard Chinees spreekt, een specifief regionaal dialect zoals het Sichuanese, of een taal als Vietnamees, ze kunnen direct van hoed wisselen.
- De "Ruisonderdrukende" Oren: Ze zijn getraind om chaos te negeren. Als je een lied zingt terwijl er een trommel slaat, of als een kind schreeuwt in een drukke straat, kunnen deze modellen de woorden nog steeds duidelijk horen.
- Het "Taalidentificatie"-insigne: Voordat ze zelfs de woorden opschrijven, weten ze precies welke taal je spreekt. Ze kunnen het verschil zien tussen vergelijkbare talen (zoals Maleis en Indonesisch) met een hoge nauwkeurigheid.
2. De Tijdwaarnemer: Qwen3-ForcedAligner-0.6B
In de oude dagen, als je precies wilde weten wanneer een woord begon en eindigde in een opname (zoals voor het maken van ondertiteling), moest je een trage, logge machine gebruiken die vaak fouten maakte.
Het team heeft een nieuw hulpmiddel geïntroduceerd genaamd Qwen3-ForcedAligner.
- De Analogie: Stel je voor dat je een transcript (de woorden) hebt en een opname (het geluid). De oude tools waren als het proberen te matchen van de woorden aan het geluid door te gokken. Dit nieuwe model is als een supersnelle, niet-autoregressieve tijdwaarnemer.
- Hoe het werkt: In plaats van één woord tegelijk te raden (wat traag is), kijkt het naar de hele zin en wijst het direct een tijdstempel toe aan elk woord of elk karakter.
- Het Resultaat: Het is ongelooflijk nauwkeurig en snel. Het kan 11 talen aan en werkt zelfs als de spreker halverwege een zin van taal wisselt. Het is zo snel dat het een uur aan audio in slechts enkele minuten kan verwerken.
3. Hoe ze hebben geleerd (De Training)
Je vraagt je misschien af: "Hoe zijn ze zo slim geworden?"
- De Fundering: Ze begonnen met een model dat al audio, visie en tekst begreep (Qwen3-Omni).
- De Oefening: Ze oefenden op een enorme bibliotheek van 40 miljoen uur aan opgenomen spraak (voornamelijk Chinees en Engels).
- De "Realistische Wereld" Training: Ze hebben niet alleen geoefend in een stille studio. Ze werden getest op:
- Ouderen en Kinderen: Verschillende toonhoogtes van stemmen.
- Tongbrekers: Snelle, moeilijke spraak.
- Zingen: Melodieën die woorden uitrekken.
- Achtergrondgeluid: Harde muziek en menigten.
- De "Versterkings"-les: Ten slotte gebruikten ze een speciale trainingsmethode (Reinforcement Learning) waarbij ze werden gecorrigeerd op hun moeilijkste fouten, waardoor ze veel robuuster werden in de chaos van de echte wereld.
4. De Resultaten: Waarom het ertoe doet
Het paper vergelijkt deze nieuwe modellen met de beste concurrenten (zowel gratis open-source als betaalde commerciële diensten).
- Nauwkeurigheid: Het grote model (1.7B) is vaak het meest nauwkeurige open-source model dat beschikbaar is, en verslaat of evenaart de dure betaalde diensten.
- Snelheid: Het kleine model (0.6B) is het snelst en biedt de beste balans tussen snelheid en intelligentie.
- Veelzijdigheid: Zij zijn de eersten die hoogwaardige spraakherkenning, taalidentificatie en zangherkenning combineren in één pakket dat werkt voor tientallen talen.
Kortom: De Qwen3-ASR-familie is een toolkit waarmee computers menselijke spraak kunnen begrijpen zoals een mens dat doet, zelfs in lawaaierige, rommelige of muzikale situaties, en dat doen ze in vele verschillende talen. Ze hebben deze tools gratis beschikbaar gesteld voor iedereen, in de hoop onderzoekers en ontwikkelaars te helpen bij het bouwen van betere stemtechnologieën voor de toekomst.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.