← Nieuwste papers
💬 NLP

Benchmarking Multilingual Speech Models on Pashto: Zero-Shot ASR, Script Failure, and Cross-Domain Evaluation

Dit artikel presenteert de eerste reproduceerbare evaluatie van meertalige spraakherkenningsmodellen voor Pashto, waarbij het gebrek aan benchmarks, de catastrofale prestaties van zero-shot modellen (met name Whisper), het falen in het genereren van het Pashto-schrift, en de aanzienlijke prestatiedaling bij domeinoverschrijding worden blootgelegd, terwijl tegelijkertijd vijf structurele belemmeringen en prioriteiten voor toekomstig onderzoek worden geïdentificeerd.

Oorspronkelijke auteurs: Hanif Rahman

Gepubliceerd 2026-04-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hanif Rahman

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Grote Pashto-Probleem: Waarom slimme AI's de taal niet begrijpen

Stel je voor dat je een groep van de slimste vertalers ter wereld (kunstmatige intelligentie) in een kamer zet en zegt: "Vertaal dit gesprek in het Pashto." Pashto wordt gesproken door 60 tot 80 miljoen mensen – ongeveer evenveel als in Italië of Zuid-Korea. Je zou denken dat dit geen probleem is. Maar in werkelijkheid is het alsof je deze vertalers een boek in een taal geeft die ze nooit hebben gezien, terwijl ze denken dat het een andere taal is.

Dit onderzoek, gepubliceerd in een toonaangevend tijdschrift, is de eerste keer dat iemand echt heeft gekeken hoe goed deze "slimme vertalers" het doen met Pashto. En het nieuws is een mix van teleurstelling en hoop.

1. De "Grote Verwarde Vertaler" (Whisper)

De bekendste AI voor spraakherkenning heet Whisper (van OpenAI). Het is als een superster die in bijna elke taal kan spreken. Maar als je hem vraagt om Pashto te horen, gebeurt er iets vreemds:

  • Het script-foutje: In plaats van Pashto te schrijven (met de speciale Pashto-letters), schrijft hij vaak Arabisch, Dari of Urdu.
  • De analogie: Stel je voor dat je een Fransman vraagt om een Nederlands gedicht op te schrijven. Hij schrijft het niet in het Nederlands, maar in het Frans, en gebruikt Franse letters. Voor de computer is het een "fout", maar voor de mens is het onleesbaar.
  • Het resultaat: De meeste versies van Whisper schrijven in meer dan 99% van de gevallen de verkeerde letters. Ze denken dat ze Pashto spreken, maar ze schrijven eigenlijk een andere taal. Het is alsof ze een masker ophebben dat ze niet kunnen afzetten.

2. De "Gekke Loop" (Whisper Medium)

Er is een specifieke versie van Whisper (de "Medium"-versie) die nog gekker doet.

  • De analogie: Stel je voor dat je een robot vraagt om een zin te zeggen, maar de robot blijft in een kringetje lopen en zegt steeds hetzelfde woord of een onzinrijtje.
  • Het resultaat: Deze versie raakt in een "loop". Hij schrijft niets herkenbaars, maar blijft maar doorgaan met genereren. Het is alsof de motor vastloopt.

3. De Helden: MMS, SeamlessM4T en OmniASR

Gelukkig zijn er andere modellen die het wél goed doen.

  • De analogie: Als Whisper de verwarde vertaler is, zijn deze modellen als een lokale gids die de taal echt kent. Ze gebruiken de juiste Pashto-letters en schrijven wat er echt gezegd wordt.
  • Het resultaat: Ze maken veel minder fouten. Ze begrijpen dat Pashto unieke klanken heeft (zoals bepaalde 'r'-klanken en 's'-klanken die in het Arabisch niet bestaan) en schrijven die correct op. Ze zijn de winnaars in dit onderzoek.

4. De "Truc met de Oefening" (Fine-tuning)

Sommige onderzoekers hebben modellen getraind met specifieke Pashto-gegevens om ze slimmer te maken.

  • Het probleem: Vaak zeggen ze: "Ons model is 14% fout!" Dat klinkt geweldig. Maar dit onderzoek toont aan dat dit alleen geldt voor de specifieke oefeningen die ze hebben gebruikt.
  • De analogie: Het is alsof een student alleen maar oefent met één specifiek type wiskundetoets. Als hij die toets maakt, haalt hij een 10. Maar als je hem een andere toets geeft (met andere vragen), zakt hij naar een 4.
  • De oplossing: Een van de modellen (w2v-b2-aug) is getraind met extra "ruis" en variatie. Deze student heeft niet alleen de ene toets geoefend, maar ook veel verschillende soorten. Hij haalt een 7,5 op beide toetsen. Hij is echt flexibel.

5. De Unieke Klanken van Pashto

Pashto heeft klanken die in andere talen niet voorkomen, zoals bepaalde 'r'-klanken en 's'-klanken die aan de zijkant van de tong worden gemaakt.

  • De analogie: Het is alsof je een pianist vraagt om een liedje te spelen dat een toets heeft die op geen enkel ander piano-exist. De meeste AI's proberen die toets te missen of spelen de verkeerde toets.
  • Het resultaat: De AI's maken de meeste fouten precies op die unieke klanken. Als je die beter wilt leren, moet je de AI specifiek trainen op die rare klanken.

Conclusie: Wat moeten we doen?

Dit onderzoek zegt eigenlijk: "Stop met blindelings vertrouwen op de grote namen als Whisper voor Pashto, want ze schrijven de verkeerde taal op."

De auteurs geven vijf belangrijke adviezen:

  1. Maak een TTS (spraak-naar-spraak) systeem: Er is nog geen open source systeem dat Pashto spreekt. Dat is nodig voor hulpmiddelen voor mensen met een laag leesniveau.
  2. Meer echte gesprekken: Tot nu toe is alles getest op mensen die voor een microfoon een tekst voorlezen. We moeten ook testen op echte, spontane gesprekken (zoals in de markt of op de radio).
  3. Gebruik dezelfde test: Alle onderzoekers moeten dezelfde "proefvragen" (datasets) gebruiken, zodat we eerlijk kunnen vergelijken wie er beter wordt.
  4. Leer de unieke klanken: Focus op die rare Pashto-klanken die de AI's nu nog niet snappen.
  5. Test meer modellen: Er zijn nog andere modellen die we moeten testen voordat we nieuwe, dure systemen bouwen.

Kort samengevat: Pashto is een belangrijke taal die door AI-systemen vaak wordt genegeerd of verkeerd begrepen. Dit onderzoek is de eerste stap om dat recht te zetten, door te laten zien welke systemen echt werken en welke alleen maar "doen alsof".

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →