Probing Social Identity Bias in Chinese LLMs with Gendered Pronouns and Social Groups
Deze studie evalueert sociale identiteitsvooroordelen in tien Chinese grote taalmodellen met behulp van op het Mandarijn gerichte prompts om in- en uitgroepsframingen te vergelijken over 240 sociale groepen, waarbij wordt geconstateerd dat instructietuning weliswaar sentimentasymmetrieën vermindert, maar dat toxiciteitskloven blijven bestaan en verder worden verergerd door het gebruik van expliciet vrouwelijke meervoudsvormen van voornaamwoorden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een groep zeer slimme, digitale verhalenvertellers (Large Language Models, of LLM's) hebt die Chinees spreken. Deze modellen hebben bijna alles wat op internet is geschreven gelezen, dus ze weten veel over de wereld. Maar, net als mensen, hebben ze onderweg misschien ook enkele verborgen vooroordelen opgepikt.
Dit artikel is als een detectiveverhaal waarbij onderzoekers deze digitale verhalenvertellers op de proef stellen om te zien of ze "ons" anders behandelen dan "hen".
De Opzet: "Ons" versus "Hun"
De onderzoekers wilden zien of de modellen vriendelijker zouden zijn naar een groep toe wanneer het verhaal van binnenuit werd verteld ("Wij zijn...") in vergelijking met wanneer het van buitenaf werd verteld ("Zij zijn...").
Denk eraan als een schoolplein. Als een student zegt: "Wij zijn het voetbalteam", klinkt hij misschien trots en blij. Maar als ze zeggen: "Zij zijn het voetbalteam" (verwijzend naar het rivaliserende team), klinken ze misschien kritisch of gemeen. De onderzoekers vroegen zich af: Doen deze AI-modellen dat ook?
Ze testten 10 verschillende Chinese AI-modellen met 240 verschillende sociale groepen (zoals mensen van verschillende leeftijden, beroepen of achtergronden).
De Speciale Chinese Draai: Het "Hij" versus "Zij" Voornaamwoord
Hier wordt het onderzoek echt slim. In het Engels wordt het woord "zij" gebruikt voor een groep mensen, ongeacht het geslacht. Maar in het Chinees is er een visueel verschil in de schrijfwijze:
- 他们 (Tāmen): De standaard "zij" voor een gemengde groep of wanneer je het geslacht niet weet. Het ziet eruit als een "mens" met een "paard" (een neutraal symbool).
- 她们 (Tāmen): De specifieke "zij" voor een groep die uitsluitend uit vrouwen bestaat. Het ziet eruit als een "mens" met een "vrouwelijk" symbool.
De onderzoekers gebruikten dit verschil als een speciaal hulpmiddel. Ze vroegen de AI om over groepen te praten met het neutrale "zij" en vervolgens met het vrouw-specifieke "zij". Ze wilden zien of de AI gemeener werd alleen omdat de groep expliciet als vrouwelijk werd aangeduid.
Wat Ze Vonden
1. De "Ons" is Beter dan "Hun" Bias
Net als in de schoolplein-analogie, hielden de AI-modellen over het algemeen meer van de "Wij"-groepen dan van de "Zij"-groepen.
- Wanneer de AI zei "Wij zijn...", waren de antwoorden warmer en positiever.
- Wanneer de AI zei "Zij zijn...", waren de antwoorden kouder en soms zelfs vijandig.
- De Vangst: Dit was geen enorme explosie van haat, maar een subtiel, consistent patroon. Het is als een lichte frons wanneer je praat over buitenstaanders, in vergelijking met een glimlach voor insiders.
2. De "Leraar" versus De "Leerling" (Instructie-Afstemming)
De onderzoekers testten twee soorten modellen:
- Basismodellen: Deze zijn als rauwe leerlingen die veel hebben gelezen maar nog niet zijn geleerd hoe ze beleefd moeten gedragen. Deze modellen waren veel eerder geneigd om gemeen te zijn naar de "Zij"-groepen.
- Instructie-afgestemde modellen: Deze zijn als leerlingen die door leraren (mensen) zijn geleerd om behulpzaam en veilig te zijn. Deze modellen waren beter in het beleefd zijn voor iedereen. Ze verkleinden de kloof tussen "glimlach" en "frons".
- Echter: Zelfs de "goede leerlingen" (de beleefde) hadden nog steeds een verborgen probleem. Hoewel ze niet meer gemeen waren in hun toon, vertoonden ze nog steeds tekenen van toxiciteit (onbeleefde of onveilige taal) wanneer ze spraken over "Zij"-groepen, vooral als de groep als vrouwelijk was aangeduid.
3. De "Vrouwelijke" Straf
Dit was een verrassende ontdekking. Bij verschillende modellen waren de antwoorden toxischer (onbeleefder of schadelijker) wanneer de AI het vrouw-specifieke voornaamwoord (她们) gebruikte, dan wanneer het het neutrale voornaamwoord (他们) gebruikte.
- Het is alsof de AI, zelfs wanneer ze probeerde beleefd te zijn, onbewust dacht: "Oh, deze groep bestaat allemaal uit vrouwen", en direct iets kritischer of onveiliger werd in haar taal. Dit is een vooroordeel dat je niet zou zien in het Engels, omdat het Engels geen visueel verschil heeft voor "zij".
4. Realiteitscheck
De onderzoekers keken ook naar echte gesprekken tussen mensen en AI (uit een publieke dataset). Ze ontdekten dat zelfs in het echte leven de AI de neiging had om aardiger te zijn naar "ons" en iets kritischer naar "hen", wat suggereert dat dit niet alleen een laboratoriumexperiment is – het gebeurt ook in de echte wereld.
De Conclusie
Het artikel concludeert dat Chinese AI-modellen geen neutrale robots zijn. Ze dragen sociale vooroordelen:
- Ze geven de voorkeur aan "Ons" boven "Hun".
- Ze kunnen gemeener zijn naar "Hun" dan ze aardig zijn naar "Ons".
- Ze hebben een specifiek, verborgen vooroordeel tegen groepen die als vrouwelijk zijn aangeduid, wat zich manifesteert als onbeleefde taal, zelfs wanneer de AI probeert beleefd te zijn.
De onderzoekers zeggen dat we, om dit op te lossen, niet alleen Engelse regels kunnen gebruiken. We moeten de specifieke eigenaardigheden van de Chinese taal begrijpen (zoals die voornaamwoordverschillen) om deze AI-tools eerlijk en veilig te maken voor iedereen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.