← Nieuwste papers
🤖 machine learning

It's the humans, not the data: Geopolitical bias in LLMs originates in post-training, amplified by the language of the prompt

Deze studie toont aan dat geopolitieke bias in grote taalmodellen voornamelijk wordt geïntroduceerd en versterkt tijdens de post-training uitlijnfase in plaats van te worden overgeërfd van pre-training data, waarbij de richting en omvang van deze bias variëren naargelang het ontwikkelingsgebied van het model en de taal die in de prompt wordt gebruikt.

Oorspronkelijke auteurs: Stuart Bladon, Brinnae Bent

Gepubliceerd 2026-05-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Stuart Bladon, Brinnae Bent

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een groep studenten voor uit verschillende landen (de VS, Frankrijk en China) die allemaal leren essays te schrijven over wereldgebeurtenissen.

Lange tijd gingen mensen ervan uit dat als een student een vooroordeelhoudend essay schreef, dit kwam omdat ze vooroordeelhoudende boeken in de bibliotheek hadden gelezen. In de wereld van AI is deze "bibliotheek" de enorme hoeveelheid internetdata die het model leest voordat het begint met leren chatten. Dit heet pre-training.

Echter, dit artikel betoogt dat het echte verhaal anders is. Het gaat niet om wat de studenten in de bibliotheek lezen; het gaat om wat er gebeurt in de klas voor de voorbereiding op het eindexamen (genaamd post-training) dat hun mening verandert.

Hier is de uiteenzetting van hun bevindingen met behulp van eenvoudige analogieën:

1. Het "Leeg Tafelblad" versus het "Eindexamen"

De onderzoekers keken naar zeven verschillende AI-"families" (zoals verschillende scholen). Voor elke familie vergeleken ze twee versies:

  • Het Basismodel: Dit is de student direct na het lezen van de bibliotheekboeken, maar voordat er specifieke coaching heeft plaatsgevonden.
  • Het Chatmodel: Dit is dezelfde student na het doorlopen van een "coaching"-fase (post-training) waarbij mensen hen leren hoe ze beleefd en veilig op vragen moeten antwoorden.

De Bevinding: De "Basis"-studenten waren grotendeels neutraal. Ze hadden niet echt een sterke mening over welk land gelijk of ongelijk had in een conflict. Maar zodra ze de "coaching" (post-training) hadden doorlopen, ontwikkelden ze plotseling sterke meningen.

  • De Analogie: Stel je een student voor die neutraal staat tegenover een sportrivaliteit. Nadat hun coach hen vertelt: "Je moet Team A steunen", begint de student plotseling luid te juichen voor Team A. Het vooroordeel kwam niet uit de boeken die ze lazen; het kwam uit de instructies van de coach.

2. De "Nationaliteit van de Coach" Maakt Uit

De onderzoekers ontdekten dat de richting van het vooroordeel afhing van waar de coach vandaan kwam.

  • Als de AI was ontwikkeld door een Westers laboratorium (VS of Frankrijk), liet de coaching de AI in geopolitieke scenario's tegen China neigen.
  • Als de AI was ontwikkeld door een Chinees laboratorium (zoals Alibaba), liet de coaching de AI voor China neigen.
  • De Uitzondering: Eén Chinees laboratorium (01.AI) coachte hun student eigenlijk om tegen China te neigen, wat bewijst dat het niet alleen om het land gaat, maar om de specifieke keuzes die de mensen die het model bouwen maken.

De Grote Verschuiving: Het meest dramatische voorbeeld was het Qwen-model van Alibaba.

  • Voor coaching: Het was neutraal (zoals een blanco pagina).
  • Na coaching: Het werd extreem pro-China. De onderzoekers zeggen dat de kans dat het China bevoordeelde 18 keer hoger werd, puur door de post-training.

3. De "Taal van de Vraag" Versterkt het Vooroordeel

De onderzoekers testten ook of de taal waarin de vraag werd gesteld, het antwoord veranderde.

  • Het Franse Voorbeeld: De Franse AI (Mistral) was neutraal toen er in het Engels werd gevraagd. Maar toen er in het Frans werd gevraagd, werd het plotseling zeer pro-Frankrijk.
  • Het Chinese Voorbeeld: Het stellen van vragen aan Chinese modellen in het Chinees maakte ze soms meer pro-China, maar niet altijd. Soms fungeerde de taal als een volumeknop, die het vooroordeel op of neer draaide, afhankelijk van het specifieke model.

De Analogie: Denk aan de AI als een acteur. Als je de acteur een vraag stelt in het Engels, spelen ze misschien een neutraal personage. Maar als je dezelfde vraag fluisterend in hun moedertaal stelt, beginnen ze plotseling een rol te spelen die veel sterker past bij hun culturele achtergrond.

4. Het Gaat Niet Alleen om "Echte" Landen

Om zeker te weten dat de AI niet gewoon feiten uit het hoofd leerde (zoals "China is groot"), bedachten de onderzoekers neplanden met nepnamen (zoals "Zhaodong", wat Chinees klinkt, of "Bretherland", wat Engels klinkt).

  • Het Resultaat: Zelfs met neplanden gaf het Chinese AI de voorkeur aan degene die Chinees klonk, en gaf het Franse AI de voorkeur aan degene die Engels klonk.
  • De Les: De AI herinnert zich niet alleen feiten; het past een culturele lens toe op elke situatie, echt of nep, gebaseerd op hoe het is getraind om na te denken.

5. De "Weigering"-Truc

Sommige Chinese modellen leken aanvankelijk vragen over China te weigeren te beantwoorden (door te zeggen "Ik kan dat niet beantwoorden"). De onderzoekers beseften dat dit geen gebrek aan mening was; het was een opmaaktruc. Toen ze dieper keken, ontdekten ze dat zodra het model een volledige zin mocht schrijven, het wel een sterke mening had.

  • De Analogie: Het is als een student die zijn hand opsteekt en zegt: "Ik kan het niet beantwoorden", maar wanneer de leraar zegt: "Schrijf gewoon één woord op", schrijven ze direct "Team A". De mening was er altijd al; het formaat verbergde het gewoon.

De Conclusie

Het artikel concludeert dat geopolitiek vooroordeel in AI geen toeval is van de data die het kreeg. In plaats daarvan wordt het actief gebouwd tijdens de laatste trainingsfase, waarbij mensen de AI afstemmen op specifieke waarden.

  • Oude Gedachte: "De AI is vooroordeelhoudend omdat het internet vooroordeelhoudend is."
  • Nieuwe Bevinding: "De AI is vooroordeelhoudend omdat de mensen die het trainden (de coaches) het zo vormden dat het die specifieke voorkeuren heeft."

Dit betekent dat als we vooroordelen in AI willen oplossen, we niet alleen het internetdata moeten opruimen. We moeten kijken naar het afstemmingsproces—de specifieke regels en menselijke feedback die worden gebruikt om de AI te leren hoe ze zich moet gedragen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →