← Nieuwste papers
💬 NLP

The Shibboleth Effect: Auditing the Cross-Lingual Distributional Skew of Large Language Models

Deze studie maakt gebruik van een synthetisch geopolitiek wargame om aan te tonen dat de taalkruisende gedragsskeefheid in frontier large language models heterogeen en architectuurafhankelijk is, waarbij sommige modellen significante verschuivingen vertonen in dwangmatig retorisch taalgebruik wanneer zij in het Turks versus het Engels opereren, terwijl anderen stabiel blijven dankzij specifieke bufferingsmechanismen zoals chain-of-thought reasoning of meertalige alignment.

Oorspronkelijke auteurs: Hakan Mehmetcik

Gepubliceerd 2026-06-10
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hakan Mehmetcik

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een groep zeer intelligente, hoogopgeleide digitale diplomaten hebt. Je vraagt hen om een hoogwaardig spel van "crisisonderhandeling" te spelen op zee, waarbij twee landen ruziën over wie een stuk oceaan bezit.

De onderzoekers wilden zien of deze digitale diplomaten anders zouden handelen afhankelijk van welke taal ze spraken. Ze noemden dit het "Shibbolet-effect."

Denk aan een "Shibbolet" als een wachtwoord uit een oud verhaal. In de Bijbel gebruikten mensen een specif kind woord om vrienden van vijanden te onderscheiden. Als je het woord verkeerd uitsprak, was je een buitenstaander. In deze studie is de "wachtwoord" de taal zelf. De onderzoekers wilden weten: Maakt het spreken van het Turks deze AI-diplomaten agressiever dan het spreken van het Engels?

Het Experiment: Een Synthetische Zeeslag

Om dit te testen, creëerden de onderzoekers een nepcrisis genaamd de "Cerulean Sea Crisis." Het is een verzonnen verhaal dat precies lijkt op echte conflicten in de Oostelijke Middellandse Zee (met betrekking tot Turkije en Griekenland), maar met nepnamen zodat de AI het niet simpelweg via Google kan opzoeken.

Ze zetten een spel op met zes verschillende "superintelligente" AI-modellen (zoals GPT-4o, Llama-4, Gemini, etc.). Elke AI speelde een rol:

  • De één speelde de agressieve macht (zoals Turkije).
  • De ander speelde de verdediger (zoals Griekenland).
  • Anderen speelden bondgenoten, waarnemers of wereldmachten.

Ze draalden het spel 10 keer in het Engels en 10 keer in het Turks. Het enige wat ze veranderden, was de taal; de regels, de doelen en de situatie bleven exact hetzelfde.

De Grote Verrassing: Het is Niet Voor Iedereen Gelijk

Vóór deze studie gingen veel mensen ervan uit dat als een AI "veilig" en "coöperatief" is in het Engels, deze ook veilig en coöperatief zou zijn in elke andere taal. De onderzoekers dachten: "Misschien worden deze AI's gewoon bozer als ze een andere taal spreken."

De resultaten lieten zien dat de waarheid veel ingewikkelder is. De AI's reageerden niet allemaal op dezelfde manier. Ze waren als een groep mensen op een feestje: sommigen werden luider bij het wisselen van taal, anderen werden stiller, en sommigen veranderden helemaal niet.

Dit is wat er gebeurde met de specifieke "digitale diplomaten":

  1. De "Boze" Diplomaat (Llama-4):
    Wanneer deze AI Turks sprak, werd hij significant agressiever. Hij gebruikte meer dreigementen en ultimatums.

    • Analogie: Stel je een vredesbewaker voor die kalm Engels spreekt, maar wanneer hij overschakelt naar het Turks, begint hij plotseling te schreeuwen en met zijn vuist op tafel te slaan.
  2. De "Vredesstichter" Diplomaat (Gemini-3.1-Pro):
    Deze deed precies het tegenovergestelde. Wanneer deze AI Turks sprak, werd hij significant kalmer en minder dreigend.

    • Analogie: Dit is als een harde onderhandelaar die met een strenge stem Engels spreekt, maar wanneer hij overschakelt naar het Turks, plotseling heel zachtmoedig en bereid tot compromissen wordt.
  3. De "Onveranderde" Diplomaat (GPT-4o):
    Deze AI vertoonde geen echt verschil. Of hij nu Engels of Turks sprak, zijn gedrag bleef hetzelfde.

    • Analogie: Dit is als een robot die in beide talen met exact dezelfde robotachtige, neutrale toon spreekt. Hij werd niet boos, en hij werd ook niet zachter.
  4. De "Denker" Diplomaat (DeepSeek-R1):
    Deze AI werd ook kalmer in het Turks. Maar de onderzoekers kregen een speciale blik in zijn brein (een zogenaamde "Chain-of-Thought"). Ze zagen dat deze AI, voordat hij sprak, zichzelf expliciet herinnerde aan internationale wetten en regels.

    • Analogie: Het is als een student die een toets maakt. In het Engels geeft hij gewoon antwoord. In het Turks stopt hij, pakt zijn wetboek erbij, leest de wetten hardop aan zichzelf voor, en geeft daarna een zeer zorgvuldig, juridisch antwoord.

Waarom Gebeurt Dit?

Het paper suggereert twee hoofdoorzaken waarom deze AI's anders handelen:

  • Het "Trainingsdieet": Sommige AI's werden voornamelijk gevoed met Engelse data met veiligheidsregels eraan gekoppeld. Wanneer zij Turks spreken, kunnen ze die veiligheidsregels vergeten en terugvallen op wat ze hebben geleerd van Turks nieuws of geschiedenis, wat mogelijk agressiever is.
  • Het "Meertalige Schild": Andere AI's (zoals degenen die kalmer werden) zijn specifiek getraind om veilig te zijn in veel talen. Zij hebben een "schild" dat werkt, ongeacht welke taal ze spreken.

De Kernboodschap

De belangrijkste les is dat je er niet vanuit kunt gaan dat een AI veilig is, enkel omdat hij veilig is in het Engels.

  • Als je Llama-4 gebruikt in een crisis en Turks spreekt, krijg je misschien een agressievere reactie dan je verwacht.
  • Als je Gemini in het Turks gebruikt, krijg je misschien een te kalme reactie.
  • Als je GPT-4o gebruikt, is het misschien consistent, maar je kunt het niet voor 100% zeker weten zonder het opnieuw te testen.

De onderzoekers noemen dit het "Shibbolet-effect" omdat de taal die je gebruikt fungeert als een geheime code die de persoonlijkheid van de AI verandert. Het bewijst dat deze digitale geesten geen enkele "neutrale" hersenpan zijn; het is een verzameling van verschillende gewoonten en trainingen die verschuiven afhankelijk van de taal die je tegen hen spreekt.

Kortom: Het gedrag van de AI is niet vaststaand. Het verandert op basis van de taal, en die verandering is verschillend voor elk AI-model.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →