← Nieuwste papers
💬 NLP

How Robust Are LLMs to Vietnamese Dialects?

Dit artikel introduceert VialectBench, de eerste systematische benchmark die Large Language Models evalueert op Vietnamese dialecten, wat onthult dat dialectale variaties een meetbare prestatievermindering veroorzaken over meerdere taken en aantoont dat een hoge vaardigheid in het Standaardvietnamees geen garantie biedt voor robuustheid tegen betekenisbehoudende regionale verschillen.

Oorspronkelijke auteurs: Minh Tran, Trinh Chau, Thanh-Nhan Le, Nam Tran, Luan Thanh Nguyen, Cuong Dang, Duc Hoang

Gepubliceerd 2026-08-12
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Minh Tran, Trinh Chau, Thanh-Nhan Le, Nam Tran, Luan Thanh Nguyen, Cuong Dang, Duc Hoang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligent robot leert om menselijke taal te begrijpen. Je laat het de robot miljoenen boeken, nieuwsartikelen en websites zien, die allemaal geschreven zijn in een zeer gepolijste, "tekstboek"-versie van een taal. De robot wordt hier heel goed in en slaagt voor elke test die je hem geeft. Maar er is een addertje onder het gras: het echte leven is geen tekstboek. Mensen spreken niet altijd de "perfecte" versie. Ze hebben accenten, ze gebruiken straattaal en ze praten anders afhankelijk van of ze uit het noorden, het zuiden of het midden van het land komen. Dit wordt een dialect genoemd. Het is als hetzelfde liedje dat op verschillende instrumenten wordt gespeeld; de melodie (de betekenis) is hetzelfde, maar het geluid (de woorden en grammatica) verandert.

Wetenschappers bouwen deze gigantische taalrobots, bekend als Large Language Models (LLMs), om ons te helpen bij het schrijven, het beantwoorden van vragen en het oplossen van problemen. Maar er hangt een grote vraag boven hen: Zijn ze werkelijk slim genoeg om iedereen te begrijpen, of zijn ze alleen heel goed in het begrijpen van de "standaard" versie van de taal? Als je een robot een vraag stelt in een lokaal dialect, begrijpt hij het antwoord dan nog steeds goed, of raakt hij in de war en begint hij dingen te verzinnen? Dit is belangrijk omdat als een robot alleen de "perfecte" versie begrijpt, hij kan falen wanneer echte mensen hem proberen te gebruiken, wat leidt tot frustratie of zelfs gevaarlijke misverstanden.


De Grote Vietnamese Dialecttest

Een team van onderzoekers besloot deze taalrobots de ultieme test te onderwerpen. Ze wilden zien of de modellen de rommelige, prachtige realiteit van Vietnamese dialecten aankonden. In Vietnam wordt in veel verschillende regionale smaken gesproken. Een woord dat "wat" betekent in de hoofdstad, kan een totaal ander woord zijn in de centrale provincies, ook al begrijpt iedereen wat er gevraagd wordt.

De onderzoekers bouwden een speciale speeltuin genaamd VialectBench. Denk aan een enorme hindernisbaan, specifiek ontworpen om robots die te kieskeurig zijn over hoe dingen gezegd worden, uit de tent te lokken. Ze begonnen met 400 standaardvragen en taken—zoals een robot vragen iemands stemming te raden, een logische puzzel op te lossen of een vraag te beantwoorden op basis van een verhaal. Vervolgens huurden ze menselijke experts uit zes verschillende regio's van Vietnam in om precies diezelfde taken te herschrijven met hun lokale dialecten.

Het doel was simpel: houd de betekenis exact hetzelfde, maar verander de woorden zodat het klinkt als een lokale bewoner. Bijvoorbeeld, in plaats van op de standaard manier te vragen: "Wat zei de dokter dat ik moest eten?", zou iemand uit de centrale regio kunnen vragen: "Bác sĩ dặn ăn chi?", gebruikmakend van een lokaal woord voor "wat". De robot moest beide versies beantwoorden. Als de robot de standaardversie goed beantwoordde maar de dialectversie niet, betekende dit dat de robot broos was—hij liet zich gemakkelijk in de war brengen door een verandering in accent.

De Resultaten: Robots raken de weg kwijt in het midden

Toen de onderzoekers de tests uitvoerden op tien verschillende taalmodellen (variërend van kleine, open-source modellen tot de enorme, krachtige GPT-4o), waren de resultaten een beetje een waarschuwing. Geen enkele robot was perfect. Elke robot struikelde wanneer hij geconfronteerd werd met dialecten.

Gemiddeld daalde de prestatie van de robots met 2,82% wanneer ze met dialecten te maken kregen in plaats van standaard Vietnamees. Maar de daling was niet overal gelijk. Het was alsof de robots een specifieke blinde vlek hadden.

  • Het "Centrale" Probleem: De grootste problemen ontstonden bij de centrale dialecten (specifiek de groepen aangeduid als PNT2 en PNT3). Wanneer de robots deze dialecten tegenkwamen, stortte hun prestatie in. Het PNT3-dialect veroorzaakte de grootste gemiddelde daling; het schaadde de prestaties van de robots met 6,17%, terwijl PNT2 hen met 4,73% terugwierp.
  • De "Noordelijke" Verrassing: Interessant genoeg was het noordelijke dialect (PNB) het makkelijkst voor de robots. In feite zorgde het horen van het noordelijke dialect bij sommige modellen er zelfs voor dat ze iets beter presteerden (met 0,42%), waarschijnlijk omdat het standaard Vietnamees waarop de robots getraind zijn, al erg dicht bij de noordelijke manier van spreken ligt.
  • De Zuidelijke Mix: Het zuidelijke dialect (PNN) veroorzaakte een matige daling van ongeveer 1,81% op gemiddelde.

Waar faalden ze?

De onderzoekers keken ook naar welk soort taken de robots niet konden. Het bleek dat Question Answering (QA) (het beantwoorden van vragen) het meest kwetsbaar was. Wanneer de robots een verhaal moesten lezen en een vraag in een dialect moesten beantwoorden, hadden ze de meeste moeite, met een gemiddelde prestatiedaling van meer dan 5%. Dit suggereert dat wanneer de vraag zelf in een lokaal dialect wordt geformuleerd, de robot moeite heeft om de verbanden te leggen om het antwoord in de tekst te vinden.

Nog een verontrustende bevinding was de "harmful flip" (schadelijke ommekeer). Dit gebeurt wanneer een robot het antwoord goed weet in standaard Vietnamees, maar het in het dialect volkomen fout doet. De centrale dialecten veroorzaakten de meeste van deze ommekeer, met een percentage van 6,54% over alle modellen heen. Het is also�t de robot zelfverzekerd zegt: "Ik weet het antwoord!" in de ene stem, en dan ook zelfverzekerd zegt: "Het antwoord is dit!" in een andere stem, terwijl die twee antwoorden eigenlijk elkaars tegenpolen zijn.

Wat dit betekent

De studie toonde aan dat het feit dat een robot een genie is in standaard Vietnamees, niet betekent dat hij een genie is in alle vormen van Vietnamees. De onderzoekers ontdekten dat sterke prestaties op een standaardtaal geen betrouwbaar gedrag garanderen bij regionale variatie.

Ze spraken ook de gedachte tegen dat deze robots van nature immuun zijn voor dialecten. Zelfs de slimste modellen, zoals GPT-4o, die het beste presteerden, vertoonden nog steeds een kleine daling in nauwkeurigheid wanneer dialecten werden geïntroduceerd. De studie suggereert dat we niet zomaar kunnen aannemen dat deze tools voor iedereen werken; ze moeten specif kind worden getest en verbeterd voor de diverse manieren waarop mensen daadwerkelijk spreken.

Kortom, de robots zijn als toeristen die een reisgids perfect hebben bestudeerd, maar de weg kwijtraken zodits een lokale bewoner hen de weg wijst met een dik accent. Totdat we hen leren om naar al die verschillende stemmen te luisteren, zullen ze de plank in de echte wereld mogelijk blijven misslaan.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →