Which English Do LLMs Prefer? Triangulating Structural Bias Towards American English in Foundation Models
Die Studie zeigt durch eine dreistufige Analyse von Trainingsdaten, Tokenisierungsprozessen und Modelloutputs, dass große Sprachmodelle systematisch eine strukturelle Verzerrung zugunsten des amerikanischen Englisch aufweisen, was zu einer linguistischen Homogenisierung und epistemischen Ungerechtigkeit führt.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
🇺🇸 vs. 🇬🇧: Welches Englisch „denken" KI-Modelle?
Stell dir vor, du hast einen riesigen, super-intelligenten Koch namens KI. Dieser Koch soll für die ganze Welt kochen. Aber wenn du ihn fragst: „Was soll ich heute kochen?", antwortet er immer nur: „Ich koche nur nach dem Rezept aus New York."
Selbst wenn du sagst: „Nein, ich komme aus London und mag die englische Art!", kocht er trotzdem weiter nach New Yorker Art. Er benutzt andere Gewürze, andere Töpfe und sagt Dinge auf eine Weise, die für einen Londoner seltsam klingt.
Genau das untersucht diese neue Studie von Forschern der University of Alberta. Sie fragen sich: Warum bevorzugen große Sprach-KIs (LLMs) fast automatisch das amerikanische Englisch (AmE) und ignorieren das britische Englisch (BrE)?
Hier ist die Geschichte, wie das passiert, in drei einfachen Schritten:
1. Der Einkaufskorb (Die Trainingsdaten) 🛒
Bevor ein KI-Koch lernen kann, muss er essen. Er lernt, indem er Milliarden von Texten aus dem Internet „schluckt".
- Das Problem: Das Internet ist wie ein riesiger Supermarkt. Aber in diesem Supermarkt stehen die Regale mit amerikanischen Texten (Zeitungen, Blogs, Webseiten) viel voller als die mit britischen Texten.
- Die Analogie: Stell dir vor, du würdest versuchen, ein Kochbuch zu schreiben, indem du nur die Zutaten aus dem amerikanischen Regal nimmst. Natürlich würdest du am Ende ein amerikanisches Kochbuch schreiben. Die KI hat also von Anfang an mehr „amerikanisches Essen" gegessen als „britisches".
- Das Ergebnis: Die Studie hat sechs große Datenbanken geprüft. In allen davon war das amerikanische Englisch deutlich häufiger – besonders bei der Rechtschreibung (z. B. color statt colour).
2. Der Zerkleinerer (Die Tokenisierung) 🔪
Bevor die KI einen Text versteht, muss sie ihn in kleine Stücke schneiden (man nennt diese Stücke „Tokens"). Stell dir vor, die KI hat einen Zerkleinerer für Wörter.
- Das Problem: Dieser Zerkleinerer wurde so gebaut, dass er amerikanische Wörter sehr effizient in große, saubere Stücke schneidet. Britische Wörter hingegen werden oft in viele kleine, unnötige Splitter zerhackt.
- Die Analogie: Stell dir vor, du hast zwei Arten von Brot. Das amerikanische Brot wird vom Zerkleinerer in perfekte, dicke Scheiben geschnitten. Das britische Brot wird in viele kleine Krümel zerlegt. Für die KI ist das britische Brot also „schwerer" zu verarbeiten und kostet mehr „Energie" (Rechenleistung).
- Das Ergebnis: Die KI mag es, wenn Dinge einfach gehen. Da amerikanische Wörter weniger „Krümel" erzeugen, bevorzugt sie sie unbewusst.
3. Der Koch selbst (Die Ausgabe) 🍳
Jetzt kommt die KI an den Herd und soll einen Text schreiben.
- Das Problem: Selbst wenn du der KI explizit sagst: „Schreib bitte auf britisch!", rutscht sie fast immer wieder in den amerikanischen Modus zurück.
- Die Analogie: Es ist, als würdest du einem Amerikaner sagen: „Sag bitte 'Lift' statt 'Elevator'!" Er versucht es vielleicht kurz, aber nach ein paar Sätzen sagt er wieder automatisch „Elevator", weil das in seinem Gehirn fest verankert ist.
- Das Ergebnis: Die Studie zeigte, dass selbst bei expliziten Anweisungen für britisches Englisch die KI in über 40–70 % der Fälle trotzdem amerikanische Wörter und Schreibweisen benutzt.
Warum ist das wichtig? 🌍
Das klingt vielleicht nur nach einem kleinen Unterschied in der Rechtschreibung, aber es hat große Folgen:
- Einheitsbrei statt Vielfalt: Die Welt ist bunt. Viele Länder (wie Indien, Nigeria oder Singapur) nutzen das britische Englisch als Standard in Schulen und Behörden. Wenn die KI aber nur das amerikanische Englisch beherrscht, fühlt sich das für diese Menschen an, als würde man ihnen sagen: „Eure Art zu sprechen ist nicht richtig."
- Ungerechtigkeit: Es ist wie ein Restaurant, das nur für eine bestimmte Gruppe kocht. Andere Gruppen müssen sich anpassen oder fühlen sich ausgeschlossen. Das nennt die Studie „epistemische Ungerechtigkeit" – also eine Ungerechtigkeit im Wissen und in der Anerkennung.
Was ist die Lösung? 🛠️
Die Forscher sagen nicht, dass wir das amerikanische Englisch verbieten sollen. Aber wir müssen die KI fairer machen:
- Bessere Zutaten: Wir müssen mehr britische und andere englische Varianten in die Trainingsdaten mischen.
- Ein neuer Zerkleinerer: Wir müssen die Werkzeuge der KI so umbauen, dass sie britische Wörter genauso gut schneiden wie amerikanische.
- Bewusstsein: Wir müssen uns daran erinnern, dass Englisch viele Gesichter hat. Die KI sollte nicht nur eine „amerikanische Maske" tragen, sondern für alle sprechen können.
Fazit:
Die Studie zeigt uns, dass KI nicht neutral ist. Sie spiegelt wider, wer die Macht im Internet hat. Wenn wir wollen, dass KI für die ganze Welt funktioniert, müssen wir sicherstellen, dass sie nicht nur die Sprache einer einzigen Region lernt, sondern die Vielfalt der ganzen Welt respektiert.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.