← Nieuwste papers
💬 NLP

OpenWER: Improving Cross-Lingual ASR Evaluation and Enabling Token-Based Accuracy Metrics

Het artikel introduceert OpenWER, een open-source tool die de eerlijkheid en betrouwbaarheid van de evaluatie van meertalige automatische spraakherkenning verbetert door taalspecifieke normalisatie en token-gebaseerde uitlijning te implementeren, wat resulteert in aanzienlijk lagere Word Error Rates over 52 diverse talen vergeleken met bestaande bibliotheken.

Oorspronkelijke auteurs: Korbinian Kuhn, Gottfried Zimmermann

Gepubliceerd 2026-06-23
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Korbinian Kuhn, Gottfried Zimmermann

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een scheidsrechter bent bij een spellingwedstrijd, maar in plaats van één persoon te beoordelen, beoordeel je spraakherkenningscomputers van over de hele wereld. Jouw taak is om te beslissen hoe goed deze computers gesproken woorden omzetten in tekst.

Lange tijd was de enige tool die scheidsrechters hadden een liniaal genaamd WER (Word Error Rate). Deze liniaal is erg streng: als de computer "game-changer" zegt en de mens schreef "game changer" (met een spatie), dan telt de liniaal dit als een fout. Als de computer een komma vergeet, is het een fout. Als de computer een woord verkeerd hoofdlettergebruik geeft, is het een fout.

Het probleem is dat deze liniaal een beetje onhandig is. Het behandelt een klein verschil in spelling hetzelfde als een compleet verkeerd woord. En het heeft moeite met talen die niet Engels zijn, omdat het ze vaak onrechtvaardig straft omdat ze andere regels hebben voor hoe woorden worden opgebouwd.

Ontmoet OpenWER: De "Slimme Liniaal"

De auteurs van dit artikel hebben een nieuwe, open-source tool gebouwd genaamd OpenWER. Denk aan OpenWER niet alleen als een liniaal, maar als een slimme, flexibele meetlint dat de nuances van verschillende talen begrijpt.

Zo werkt het, met behulp van eenvoudige analogieën:

1. De "Samengestelde Woorden" Detective

In het Engels en Duits plakken we woorden vaak aan elkaar met koppeltekens (zoals "game-changer") of spaties ("game changer"). Oude tools zouden dit als twee verschillende woorden zien en als fouten markeren.

  • De Oude Manier: Als een strenge leraar die zegt: "Je hebt 'game-changer' geschreven maar het boek zegt 'game changer'. Dat is een onvoldoende!"
  • De OpenWER Manier: Het werkt als een detective die beseft: "Hé, dit is hetzelfde ding!" Het detecteert deze samengestelde woorden en negeert de kleine verschillen in hoe ze aan elkaar zijn geplakt. Dit alleen al verlaagde de foutmarge met wel 20% voor sommige talen.

2. De "Vertaling" Vertaler

Verschillende talen hebben verschillende manieren om dingen te schrijven. Soms wordt een contractie (zoals "it's") volledig uitgeschreven ("it is").

  • De Oude Manier: Het telt "it's" versus "it is" als een fout.
  • De OpenWER Manier: Het heeft een ingebouwde vertaler die deze verschillen normaliseert voordat het begint met tellen. Het zegt: "Oké, deze betekenen hetzelfde, dus ik zal het niet als een fout tellen." Dit maakt de vergelijking eerlijker, vooral voor talen die minder middelen hebben (low-resource languages) waar eerdere tools moeite mee hadden.

3. De "Metadata" Rugzak

Oude tools keken alleen naar de tekst. Als de computer een fout maakte, zeiden ze gewoon: "Fout."

  • De OpenWER Manier: Stel je voor dat elk woord dat de computer spreekt een kleine rugzak heeft die eraan vastzit. Deze rugzak bevat extra informatie: "Ik ben een zelfstandig naamwoord," "Ik ben een persoonnaam," of "Ik ben voor 90% zeker dat ik dit zei."
  • OpenWER houdt deze rugzakken intact. Hierdoor kunnen onderzoekers diepere vragen stellen, zoals: "Wordt de computer beter in het raden van zelfstandige naamwoorden dan werkwoorden?" of "Is de computer zelfverzekerd wanneer hij het eigenlijk fout heeft?"

Wat hebben ze gevonden?

De auteurs hebben deze nieuwe tool getest op 52 verschillende talen met behulp van duizenden spraakmonsters.

  • Het is Nauwkeuriger: Vergeleken met de standaardtools die nu door iedereen worden gebruikt, verminderde OpenWER de foutmarge met tot wel 25%. In sommige gevallen maakte het de resultaten veel beter omdat het stopte met het tellen van "nepfouten" (zoals ontbrekende komma's of koppeltekens).
  • Het is Eerlijker: Door samengestelde woorden en taalspecifieke regels beter af te handelen, geeft het een eerlijker cijfer voor talen die niet Engels zijn.
  • Het is Gedetailleerder: Omdat het de "rugzakken" (metadata) behoudt, kan het vertellen waarom een score is wat hij is, en niet alleen wat de score is.

Het Eén Nadeel: Snelheid

Er is één afruil. De oude tools zijn als een Formule 1-auto — ze zijn ongelooflijk snel omdat ze zijn gebouwd met een specifieke, hogesnelheidsmotor (C-code). OpenWER is als een betrouwbare, luxe SUV gebouwd in Python. Het doet meer dingen en doet ze slimmer, maar het rijdt een beetje langzamer.

  • De auteurs geven toe dat voor enorme, realtime snelheidsbehoeften de oude tools nog steeds sneller zijn. Echter, voor onderzoek en het krijgen van het juiste antwoord, is OpenWER het betere voertuig.

De Kern van het Verhaal

OpenWER vindt geen nieuwe manier uit om spraak te meten; het maakt de meetlint simpelweg schoner. Het zorgt ervoor dat het meetlint niet verstrikt raakt in kleine details zoals koppeltekens en hoofdlettergebruik, waardoor onderzoekers de echte prestaties van spraakcomputers over de hele wereld kunnen zien. Het is een stap naar ervoor zorgen dat een spraakcomputer eerlijk wordt beoordeeld, of hij nu Engels, Duits of een taal met zeer weinig sprekers spreekt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →