← Nieuwste papers
💻 computer science

Omnilingual ASR: Open-Source Multilingual Speech Recognition for 1600+ Languages

Dit artikel introduceert Omnilingual ASR, een schaalbare, open-source familie van spraakherkenningsmodellen die gebruikmaakt van een 7B-parameter zelfgesuperviseerde architectuur en een enorme, diverse trainingscorpus om meer dan 1.660 talen te ondersteunen, inclusief meer dan 500 voorheen niet bediende, terwijl het gemeenschappen in staat stelt het systeem met minimale gegevens gemakkelijk aan te passen aan nieuwe talen.

Oorspronkelijke auteurs: Marta Costa-jussa, Omnilingual Team, Gil Keren, Artyom kozhevnikov, Yen Meng, Christophe Ropers, Matthew Setzler, Skyler Wang, Ife Adebara, Michael Auli, Can Balioglu, Kevin Chan, Chierh Cheng, Joe Ch
Gepubliceerd 2026-07-30
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Marta Costa-jussa, Omnilingual Team, Gil Keren, Artyom kozhevnikov, Yen Meng, Christophe Ropers, Matthew Setzler, Skyler Wang, Ife Adebara, Michael Auli, Can Balioglu, Kevin Chan, Chierh Cheng, Joe Chuang, Caley Droof, Mark Duppenthaler, Paul-Ambroise Duquenne, Alexander Erben, Cynthia Gao, Gabriel Mejia Gonzalez, Kehan Lyu, Sagar Miglan, Vineel Pratap, Kaushik Ram Sadagopan, Safiyyah Saleem, Arina Turkatenko, Albert Ventayol-Boada, Zheng Xin Yong, Yu-An Chung, Jean Maillard, Rashel Moritz, Alexandre Mourachko, Mary Williamson, Shireen Yates

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een magische vertaler hebt die direct kan begrijpen en opschrijven wat iedereen zegt, ongeacht welke taal ze spreken. Een lange tijd werkte deze magie alleen voor de meest populaire talen, zoals Engels, Spaans of Mandarijn. Als je een kleinere, minder veelvoorkomende taal sprak, zou de vertaler alleen maar leeg naar je staren of wild gokken. Dit is de wereld van Automatic Speech Recognition (ASR): de technologie die gesproken woorden omzet in tekst. Denk aan het als een supersnelle kopiist die een gesprek beluistert en het uittikt. De grote uitdaging is altijd geweest dat er meer dan 7.000 talen zijn in de wereld, maar de meeste van deze kopiisten kennen slechts een fractie daarvan. Het leren van een nieuwe taal vereist meestal een enorme bibliotheek aan opgenomen gesprekken en een team van experts om de computer te onderwijzen, wat duur en traag is. Maar wat als we een kopiist zouden kunnen boukken die de patronen leert van hoe alle talen werken, zodat hij een nieuwe taal bijna onmiddellijk kan oppikken, simpelweg door een paar zinnen te horen? Dat is de grote vraag die dit artikel aanpakt: hoe maken we spraaktechnologie eerlijk en toegankelijk voor iedereen, en niet alleen voor degenen die de "grote" talen spreken?

Maak kennis met Omnilingual ASR, een nieuw open-source project van Meta dat als een superkrachtige, meertalige kopiist is ontworpen die meer dan 1.600 talen spreekt. Het team heeft niet alleen geprobeerd de computer meer woorden te leren; ze hebben een gigantisch, divers "brein" gebouwd dat leerde van een enorme collectie spraakgegevens, inclusief opnames van gemeenschappen die nog nooit door AI zijn gehoord. Ze creëerden een systeem dat in verschillende maten beschikbaar is: een enorme, supernauwkeurige versie (7 miljard parameters) voor krachtige computers, en een kleine, lichtgewicht versie (300 miljoen parameters) die op een eenvoudige telefoon kan draaien. Het meest opwindende deel is hoe ze omgaan met talen die de computer nog nooit heeft gezien. In plaats van een hele bibliotheek aan gegevens nodig te hebben om een nieuwe taal te leren, kan dit systeem leren van slechts 10 korte voorbeelden van iemand die spreekt en schrijft. Het is alsof je een meesterkok een foto van een nieuwe vrucht laat zien en een recept voor een gerecht gemaakt met die vrucht; plotseling kan hij dat gerecht bereiden zonder de vrucht eerst duizend keer te hoeven proeven.

De onderzoekers ontdekten dat dit nieuwe systeem een game-changer is, vooral voor talen waarvoor zeer weinig gegevens beschikbaar zijn. Toen ze het systeem testten, behaalde het model een "Character Error Rate" (een score die meet hoeveel letters het fout had) van minder dan 10% voor meer dan 1.200 talen. Sterker nog, voor meer dan 500 talen is dit de allereerste keer dat enig spraaksysteem ooit in staat is geweest om ze te transcriberen. Het artikel laat zien dat hun nieuwe model eerdere kampioenen verslaat, zoals Whisper en USM, vooral bij die zeldzame, "long-tail" talen. Waar oudere systemen in de war zouden raken en zouden falen bij deze talen, behield Omnilingual ASR de rust. Ze ontdekten ook dat als je het systeem nog beter wilt maken voor een specifieke, kleine taal, je de kleinere versies kunt verfijnen met zeer weinig rekenkracht en slechts een paar uur aan gegevens, met resultaten die die van de enorme modellen evenaren.

Het artikel merkt echter voorzichtig op dat dit geen toverstaf is die alles perfect oplost. Het systeem is nog steeds aan het leren, en hoewel het onbekende talen kan afhandelen met slechts een paar voorbeelden (een "zero-shot" capaciteit), presteert het niet helemaal zo goed als een systeem dat specifiek op die taal is getraind met enorme hoeveelheden gegevens. De auteurs suggereren dat voor de meest kritieke toepassingen, zoals medische of juridische transcriptie, mensen het werk nog steeds moeten controleren. Ze benadrukken ook dat deze technologie bedoeld is als een hulpmiddel voor gemeenschappen om hun talen te behouden en hun eigen archieven op te bouwen, niet om menselijke sprekers te vervangen of een eenheidsworst-oplossing op te leggen. Door al hun code en gegevens gratis vrij te geven, hopen ze onderzoekers en gemeenschappen overal uit te nodigen om deel te nemen aan het feest, om het gemakkelijker te maken om een toekomst te bouwen waarin elke taal een stem heeft in de digitale wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →