← Nieuwste papers
💬 NLP

Benchmarking Commercial ASR Systems on Code-Switching Speech: Arabic, Persian, and German

Dit artikel introduceert een nieuwe benchmarkdataset en evaluatiekader voor vijf commerciële ASR-systemen op code-switching spraak over Arabisch, Perzisch en Duitse taalparen, waarbij wordt aangetoond dat ElevenLabs Scribe v2 de beste prestaties behaalt, terwijl de superioriteit van BERTScore ten opzichte van de traditionele Woordfoutenratio voor het hanteren van transliteratievariatie wordt benadrukt en prestatiekloven worden blootgelegd door middel van een analyse op basis van moeilijkheidsgraad.

Oorspronkelijke auteurs: Sajjad Abdoli (MAD), Ghassan Al-Sumaidaee (MAD), Clayton W. Taylor (MAD), Ahmad (MAD), ElShiekh, Ahmed Rashad

Gepubliceerd 2026-05-20
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sajjad Abdoli (MAD), Ghassan Al-Sumaidaee (MAD), Clayton W. Taylor (MAD), Ahmad (MAD), ElShiekh, Ahmed Rashad

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een groep vertalers probeert te leren hoe ze een zeer specifieke, lastige situatie moeten aanpakken: mensen die twee talen in dezelfde zin spreken. In de echte wereld gebeurt dit voortdurend. Een software-ontwikkelaar in Caïro zou kunnen zeggen: "De deadline is morgen, we moeten de update shippen", waarbij Engelse techwoorden worden gemengd met Arabische grammatica. Een ontwikkelaar in Teheran zou kunnen zeggen: "Deze nieuwe feature heeft veel bugs", waarbij Farsi en Engels worden gemengd.

Dit artikel is als een rapport voor vijf verschillende commerciële "spraak-naar-tekst"-systemen (het soort dat je misschien op je telefoon of in een vergaderapp gebruikt) om te zien hoe goed ze deze specifieke "code-switching"-uitdaging aanpakken.

Hier is de uiteenzetting van wat ze deden en wat ze ontdekten, met behulp van eenvoudige analogieën:

1. Het Probleem: De "Schone Kamer" versus de "Drukkende Markt"

De meeste bedrijven testen hun spraaksystemen in een "schone kamer". Ze spelen ze heldere, eentalige audio voor (zoals een nieuwslezer die een script voorleest) en geven ze een score op basis van hoeveel woorden ze goed hebben.

  • Het Argument van het Artikel: Dit is als het testen van een auto alleen op een gladde, lege racebaan. Het zegt je niets over hoe de auto omgaat met een hobbelige, drukke marktstraat waar mensen tegelijk in verschillende talen schreeuwen.
  • De Realiteit: Echte gesprekken zijn rommelig. Mensen wisselen halverwege een zin van taal, vaak zonder na te denken. Het artikel betoogt dat de oude "schone kamer"-tests misleidend zijn voor deze realistische scenario's.

2. Het Bouwen van de Test: De "Talentenscout"-Pijplijn

Om een eerlijke test te creëren, pakte de onderzoekers niet zomaar willekeurige audio. Ze bouwden een tweestaps "Talentenscout"-systeem om de moeilijkste, interessantste voorbeelden te vinden uit duizenden kandidaten:

  • Fase 1 (De Snelle Filter): Ze gebruikten een eenvoudige computervoorwaarde om zinnen te spotten die leken te mengen van twee scripts (zoals Arabische letters en Engelse letters). Het is als een bouncer die ID's controleert bij de deur.
  • Fase 2 (Het Expertpanel): De overgebleven kandidaten werden gestuurd naar twee superslimme AI-"rechters" (GPT-4o en Gemini 1.5 Pro). Deze rechters lazen de zinnen en beoordeelden ze op zes verschillende "moeilijkheids"-factoren, zoals hoe vaak de talen wisselen, hoe complex het straatslang is en hoe verwarrend de klanken zijn.
  • Het Resultaat: Ze eindigden met 1.200 moeilijke zinnen (300 voor elk taalkoppel: Arabisch-Engels, Perzisch-Engels en Duits-Engels). Dit proces bespaarde hen een enorm bedrag (ongeveer 91%) in vergelijking met het vragen aan de AI-rechters om elke enkele zin te lezen.

3. Het Scoren: De "Liniaal" versus de "Vertaler"

Dit is de belangrijkste ontdekking van het artikel. Ze gebruikten twee verschillende manieren om de systemen te beoordelen:

  • De Liniaal (WER - Woordfoutenratio): Dit is de traditionele methode. Het telt elke enkele letter- en woordafwijking. Als de spreker "feature" zei en de computer schreef het Perzische woord voor "feature" (wat hetzelfde betekent maar er anders uitziet), zegt de Liniaal: "Fout! Dat is een vergissing."
  • De Vertaler (BERTScore): Dit is een slimmere methode. Het begrijpt de betekenis. Als de spreker "feature" zei en de computer schreef het Perzische woord voor "feature", zegt de Vertaler: "Goed gedaan! Je hebt de betekenis goed, zelfs als de spelling anders is."
  • De Bevinding: Voor talen zoals Arabisch en Perzisch, waar woorden op verschillende manieren kunnen worden geschreven maar hetzelfde betekenen, is de "Liniaal" te streng. Het straft systemen voor creatief zijn met spelling. De "Vertaler" (BERTScore) geeft een veel eerlijkere beoordeling.

4. De Raceuitslagen

Ze testten vijf grote commerciële systemen. Hier is hoe ze eindigden:

  • De Winnaar: ElevenLabs Scribe v2 was de duidelijke kampioen. Het had de laagste foutenratio en de hoogste betekenscore voor alle vier de taalkoppels. Het was vooral goed in het hanteren van de lastige Arabische en Perzische mixen.
  • Het Middenveld: OpenAI en Google deden het redelijk, maar ze maakten aanzienlijk meer fouten dan de winnaar, vooral op de moeilijkste zinnen.
  • De Strijder: Azure (Microsoft) had de hoogste foutenratio's. Het artikel merkt echter op dat als je Azure vertelt om constant de taal te "blijven controleren" (in plaats van slechts een keer aan het begin), het iets beter wordt, maar het blijft toch achter.
  • Het Speciale Geval: Deepgram werd alleen getest op Duits-Engels omdat het officieel geen Arabisch of Perzisch ondersteunt. Op Duits deed het het zeer goed, maar je kunt het niet vergelijken met de anderen omdat de test makkelijker was (beide talen gebruiken hetzelfde alfabet).

5. De "Hard Mode"-Ontdekking

De onderzoekers splitsten de test op per moeilijkheidsgraad (Eenvoudig, Gemiddeld, Moeilijk, Expert).

  • De Verrassing: Op de "Eenvoudige" zinnen leken alle systemen vrijwel hetzelfde. Maar op de "Expert" (moeilijkste) zinnen explodeerde de kloof.
  • De Analogie: Stel je een race voor waar iedereen op een vlakke baan met dezelfde snelheid loopt. Maar wanneer het parcours verandert in een steile, rotsachtige berg, blijft één renner (ElevenLabs) gestaag klimmen, terwijl de anderen beginnen te slippen en te vallen. De gemiddelde score verbergt dit enorme verschil; je ziet de echte kloof pas wanneer je kijkt naar de moeilijkste uitdagingen.

6. Het Visuele Bewijs

Om te bewijzen dat "betekenis" belangrijker is dan "spelling" voor deze talen, gebruikten ze een visuele kaart (zoals een GPS voor woorden).

  • Ze plotten de "correcte" zinnen en de "gissingen van de computer" op een kaart.
  • Het Resultaat: Zelfs wanneer de computer een ander script gebruikte (zoals het schrijven van een Engels woord in Perzische letters), zaten de stippen op de kaart direct naast elkaar. Dit bewijst dat de computer de betekenis begreep, zelfs als de "Liniaal" (WER) zei dat het fout was.

De Conclusie

Als je een product bouwt voor mensen die meerdere talen in één adem spreken, kijk dan niet alleen naar de standaard "Woordfoutenratio"-score. Het is als een chef-kok alleen beoordelen op hoe perfect ze uien snijden, en negeren of de soep lekker smaakt.

  • Gebruik de "Betekenscore" (BERTScore) voor Arabisch en Perzisch.
  • Test op de "Moeilijkste" zinnen, niet alleen op de makkelijke.
  • ElevenLabs Scribe v2 is momenteel de beste in deze specifieke taak, maar het artikel waarschuwt dat realistische factoren zoals snelheid (latentie) en kosten ook belangrijk zijn bij het kiezen van een systeem voor een bedrijf.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →