← Nieuwste papers
⚡ electrical engineering

MEUSLI: a Multilingual Projector for LLM-based ASR and Beyond

Het artikel introduceert MEUSLI, de eerste open-science meertalige projectorfamilie die een Whisper spraakencoder verbindt met open-source LLM's om schaalbare, end-to-end automatische spraakherkenning en andere spraakbegripstaken mogelijk te maken over 28 Europese talen.

Oorspronkelijke auteurs: Lorenzo Concina, Seraphina Fong, Marco Matassoni, Alessio Brutti

Gepubliceerd 2026-07-27
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Lorenzo Concina, Seraphina Fong, Marco Matassoni, Alessio Brutti

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligent robotbrein hebt dat elke tekst ter wereld kan lezen en schrijven, maar dat het volledig doof is. Het kan geen enkel woord horen dat wordt uitgesproken. Aan de andere kant heb je een superoor dat geluiden perfect kan horen, maar niet begrijpt wat ze betekenen. Lange tijd moesten ingenieurs, om hen met elkaar te laten communiceren, een onhandige tussenpersoon bouwen: het geluid ging naar een vertaler, dan naar een tekstconverter, en uiteindelijk naar het brein. Dit was traag, en als de vertaler een fout maakte, raakte het brein in de war.

Onlangs hebben wetenschappers ontdekt hoe ze een directe brug kunnen bouwen tussen het "superoor" en het "superbrein". Deze brug wordt een projector genoemd. Denk aan een universele adapterstekker. Het neemt de ruwe elektrische signalen van het geluid en vertaalt deze direct naar de taal die het brein begrijpt, waardoor de twee rechtstreeks met elkaar kunnen chatten. Dit is de wereld van Speech Language Models (SLM's). De grote vraag die onderzoekers stellen is: kunnen we een dergelijke adapter bouwen die voor iedereen werkt, en niet alleen voor Engelstaligen? Als dat lukt, zouden we eindelijk een stem kunnen geven aan duizenden talen die buiten het digitale gesprek zijn gevallen, vooral die met weinig sprekers of onvoldoende opgenomen data.

Maak kennis met MEUSLI, een nieuw project dat fungeert als een universele sleutel voor 28 Europese talen. De onderzoekers bouwden een familie van deze "adapterstekkers" die een krachtig oor (genaamd Whisper) verbinden met open-source, meertalige robotbreinen. Hun belangrijkste bevinding is dat dit systeem ongelooflijk goed werkt, niet alleen voor veelvoorkomende talen zoals Spaans of Duits, maar ook voor zeldzame talen zoals Bretons of Maltees. Ze ontdekten dat als je begint met hun vooraf gemaakte, meertalige adapter, je het systeem een gloednieuwe taal kunt leren met slechts een heel kleine hoeveelheid data—soms zelfs maar 46 minuten aan audio.

Er is echter een addertje onder het gras. Als je probeert deze adapter een nieuwe taal te leren zonder enige zorg, heeft hij de neiging om alles wat hij wist over de oorspronkelijke 28 talen te "vergeten", zoals een student die voor een nieuwe toets studeert en onmiddellijk zijn oude huiswerk vergeet. Het artikel suggereert dat je, om dit op te lossen, een techniek genaamd "data replay" moet gebruiken, waarbij je af en toe de oude talen oefent terwijl je de nieuwe leert, om het geheugen levend te houden.

Naast alleen opschrijven wat mensen zeggen (transcriptie), lieten de onderzoekers zien dat deze adapter kan worden aangepast om ook andere taken uit te voeren, zoals het vertalen van gesproken woorden naar het Engels of het raden van het onderwerp van een gesprek (zo zoals sport of politiek). Ze ontdekten dat het systeem, met slechts enkele uren specifieke training voor elke nieuwe taak, ook in staat is om deze dingen te doen.

Het artikel sluit expliciet de gedachte uit dat je enorme hoeveelheden data of propriëtaire (geheime) informatie nodig hebt om deze systemen te bouwen. Ze spreken zich uit tegen de opvatting dat talen met weinig middelen onmogelijk te ondersteunen zijn, en laten in plaats daarvan zien dat een goed startpunt (hun meertalige projector) het mogelijk maakt om nieuwe talen te "bootstrappen" vanuit zeer weinig data. Hoewel ze niet beweren dat ze alle problemen in de wereld hebben opgelost, leveren ze sterk bewijs dat deze aanpak schaalbaar, open en effectief is. Ze hebben deze resultaten gemeten met standaardtests op real-world data, waarbij ze lieten zien dat hun methode consequent wint van het vanaf nul beginnen, vooral voor de moeilijkste, zeldzamere talen.

Kortom, MEUSLI is een toolkit die bewijst dat we inclusieve, open-source spraaktechnologie kunnen bouwen die niet alleen werkt voor de enkelen, maar voor de velen, door een doof robotbrein te veranderen in een polyglotte luisteraar met behulp van een slimme, lichtgewicht adapter.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →