Which English Do LLMs Prefer? Triangulating Structural Bias Towards American English in Foundation Models
Dit onderzoek toont aan dat grote taalmodellen structureel bevooroordeeld zijn ten gunste van Amerikaans Engels door middel van een analyse van trainingsdata, tokenizers en generatieve output, wat leidt tot een verwaarlozing van Brits Engels en vragen oproept over linguïstische homogenisering en epistemische onrechtvaardigheid.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Titel: Waarom praten AI's met een Amerikaans accent? (En waarom dat een probleem is)
Stel je voor dat je een wereldwijde bibliotheek bouwt, vol met boeken uit elke hoek van de wereld. Je wilt een slimme bibliothecaris (een AI) die iedereen kan helpen. Maar als je de bibliothecaris laat kiezen uit welke taal hij moet spreken, kiest hij zonder na te denken voor het Amerikaans.
Dat is precies wat deze wetenschappelijke studie ontdekt. De auteurs, Mir Tafseer Nayeem en Davood Rafiei, hebben onderzocht waarom grote taalmodellen (zoals ChatGPT) bijna automatisch "Amerikaans Engels" spreken, zelfs als je ze vraagt om "Brits Engels" te gebruiken.
Hier is de uitleg, vertaald naar alledaags taalgebruik met een paar creatieve vergelijkingen:
1. Het Probleem: De "Standaard" is niet neutraal
Veel mensen denken dat "Engels" gewoon Engels is. Maar net zoals er een verschil is tussen een croissant (Frans) en een pain au chocolat (ook Frans, maar anders), of tussen een sneaker en een trainer, is er een groot verschil tussen Amerikaans Engels (AmE) en Brits Engels (BrE).
- Amerikaans: Color, elevator, cookie, fall.
- Brits: Colour, lift, biscuit, autumn.
De studie laat zien dat AI's AmE zien als de "standaardinstelling" (de fabrieksinstelling), terwijl BrE vaak als "minder belangrijk" wordt behandeld. Dit is niet omdat Amerikaans Engels "beter" is, maar omdat de AI's zijn getraind op data die door geopolitieke krachten (zoals Amerikaanse media en technologie) is gedomineerd.
2. De Drie Sporen van de Detective
De auteurs hebben als detectives drie sporen onderzocht om te zien waar het "Amerikaanse bias" (vooringenomenheid) vandaan komt. Ze noemen dit triangulatie (het vinden van een punt door drie richtingen te bekijken).
Spoor 1: De Ingrediënten (De Trainingsdata)
Stel je voor dat je een taart bakt. Als je de taart alleen maar maakt met bloem uit Amerika, zal de taart smaken als Amerika.
- De ontdekking: De enorme verzamelingen tekst (de "bloem") waarmee AI's worden getraind, bestaan voor het overgrote deel uit Amerikaanse teksten. Of het nu gaat om boeken, Wikipedia of internetpagina's: Amerikaans Engels is oververtegenwoordigd.
- De metafoor: Het is alsof je een wereldwijd restaurant hebt, maar de chef-kok alleen recepten uit New York gebruikt. De gerechten die uit de keuken komen, zullen altijd op New Yorkse stijl lijken, zelfs als je vraagt om een Londense maaltijd.
Spoor 2: De Schaar (De Tokenizer)
AI's lezen tekst niet als hele woorden, maar snijden ze op in stukjes (zoals een schaar die papier in kleine stroken knipt). Dit noemen ze "tokenization".
- De ontdekking: De "scharren" die door Amerikaanse bedrijven zijn gemaakt, snijden Britse woorden vaak in meer, kleinere stukjes dan Amerikaanse woorden.
- Voorbeeld: Het Amerikaanse woord color is misschien één stukje. Het Britse colour wordt misschien in twee stukjes gesneden.
- De metafoor: Stel je voor dat je een pakketje moet versturen. Voor Amerikaanse woorden krijg je een gratis, strak verpakt doosje. Voor Britse woorden krijg je een doosje dat in drie losse stukken is verpakt. Dat kost meer tijd, meer ruimte en meer geld. De AI vindt Britse woorden dus "moeilijker" en "duurder" om te verwerken.
Spoor 3: Het Resultaat (De Output)
Wat gebeurt er als je de AI vraagt om een antwoord te geven?
- De ontdekking: Zelfs als je de AI specifiek vraagt: "Antwoord in het Brits", neigt de AI toch weer terug naar Amerikaans. Het is alsof je iemand vraagt om een Frans accent te imiteren, maar hij begint onbewust weer te spreken met een Amerikaans accent.
- De metafoor: Het is als een spiegel die je voorhoudt. Als je Brits Engels spreekt, reflecteert de spiegel (de AI) je terug, maar dan met een lichte Amerikaanse tint. De AI "vergeet" het Britse accent en keert terug naar zijn comfortzone.
3. Waarom is dit een probleem? (De Postkoloniale Bril)
De auteurs kijken hierdoor een "postkoloniale bril". Dit betekent dat ze kijken naar de geschiedenis van macht.
- Het verhaal: Het Britse Rijk verspreidde het Engels over de wereld (India, Nigeria, Singapore, etc.). Maar later nam Amerika de macht over via films, internet en technologie.
- Het risico: Als AI's alleen Amerikaans Engels als "norm" zien, voelen mensen uit voormalige Britse koloniën zich uitgesloten. Het is alsof je naar een school gaat waar de leraar alleen maar Amerikaanse geschiedenis leert en zegt dat dat de enige "echte" geschiedenis is. Dit heet epistemische onrechtvaardigheid: het idee dat jouw kennis en taal minderwaardig worden behandeld.
4. Wat doen ze eraan? (De Oplossing)
De auteurs hebben een nieuwe tool bedacht, genaamd DIALIGN.
- Wat doet het? Het is een soort "taal-thermometer". Je kunt er een tekst mee in meten en het zegt je: "Dit is 80% Amerikaans en 20% Brits."
- Waarom is dit handig? Het helpt ontwikkelaars om te zien of hun AI eerlijk is. Ze kunnen nu zeggen: "Oh, onze AI is te Amerikaans, we moeten meer Britse teksten toevoegen aan de ingrediëntenlijst en de schaar (tokenizer) aanpassen."
Conclusie in één zin
Deze paper zegt: "AI's zijn niet neutraal; ze zijn getraind op een wereld die door Amerika wordt gedomineerd. Om eerlijke technologie te bouwen voor de hele wereld, moeten we stoppen met het behandelen van Amerikaans Engels als de enige 'norm' en ruimte maken voor alle varianten van het Engels."
Het is een oproep om de AI's te leren dat er meer dan één manier is om "goed" Engels te spreken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.