← Nieuwste papers
💬 NLP

Friend or Foe? Language as an ideological switch in open-weight LLMs under Russian disinformation stress

Dit artikel daagt de aanname uit dat cultureel afgestemde fine-tuning politieke veerkracht garandeert door via een gecontroleerde audit aan te tonen dat de weerstand van open-weight LLM's tegen Russische desinformatie meer wordt bepaald door de samenstelling van het corpus en taaldekking dan door hun nominale culturele herkomst, wat een paradox onthult waarbij Oekraïense modellen minder resistent kunnen zijn dan Russische modellen.

Oorspronkelijke auteurs: Anna Małgorzata Kamińska, Tetiana Klynina

Gepubliceerd 2026-06-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Anna Małgorzata Kamińska, Tetiana Klynina

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slim, leeg robotbrein hebt (het basismodel). Je wilt het leren om met mensen in verschillende landen te spreken, dus je geeft het een "speciaal dieet" van boeken en artikelen die specifiek geschreven zijn voor Oekraïners, Russen of Bulgaren. Dit proces wordt fine-tuning genoemd.

De algemene aanname is als volgt: als je de robot Oekraïense boeken voert, zal hij een loyale Oekraïense verdediger worden. Als je hem Russische boeken voert, zal hij een Russische loyalist worden.

Dit onderzoek testte die aanname tijdens de oorlog tussen Rusland en Oekraïne. De onderzoekers vroegen vier verschillende robotbreinen (één neutraal, één "Oekraïens", één "Russisch" en één "Bulgaars") om tien verschillende controversiële verhalen over de oorlog te beoordelen. Ze stelden dezelfde vragen in drie talen: Engels, Oekraïens en Russisch.

Hier is wat ze vonden, eenvoudig uitgelegd:

1. De "Trojaanse Paard" verrassing

De onderzoekers verwachtten dat de "Oekraïense" robot Russische leugens sterk zou verwerpen en de "Russische" robot ze zou geloven. Ze zaten er volledig naast.

  • De "Oekraïense" robot (Lapa): Wanneer aan deze robot in het Russisch werd gevraagd, was hij juist het zwakst in het herkennen van Russische propaganda. Hij behandelde Russische leugens vaak alsof het geldige, eerlijke argumenten waren. Het was also als een Oekraïense gids die, wanneer hij Russisch spreekt, plotseling begon te klinken alsof hij het met de vijand eens was.
  • De "Russische" robot (Saiga): Verrassend genoeg was deze robot, wanneer aan hem in het Russisch werd gevraagd, het sterkst in het verwerpen van Russische propaganda. Het was als een Russische gids die, wanneer hij in zijn eigen taal spreekt, de waarheid fel verdedigt tegen de leugens van zijn eigen regering.

De Analogie: Stel je voor dat je een lijfwacht inhuurt voor een VIP. Je verwacht dat de lijfwacht die door de familie van de VIP is ingehuurd, de VIP het best beschermt. Maar in dit onderzoek opende de lijfwacht die door de familie is ingehuurd (het Oekraïense model), de deur voor de indringer wanneer de indringer een specifieke taal sprak. Ondertussen sloeg de lijfwacht die door de zijde van de indringer is ingehuurd (het Russische model), de deur dicht.

2. Het "Taalschakelaar"-effect

De taal die de gebruiker spreekt, werkt als een afstandsbediening voor het robotbrein.

  • Wanneer de "Oekraïense" robot in het Engels werd gevraagd, was hij oké.
  • Wanneer er in het Oekraïens werd gevraagd, werd hij iets slechter.
  • Wanneer er in het Russisch werd gevraagd, werd hij het slechtst.

De taal veranderde niet alleen hoe hij sprak; de taal veranderde wat hij geloofde. De onderzoekers noemen dit het "Hidden Agent Effect". Het is alsof de robot verschillende persoonlijkheden binnenin heeft, en de taal die je gebruikt is de sleutel die die specifieke persoonlijkheid ontgrendelt. In dit geval ontsloot het spreken van Russisch tegen de "Oekraïense" robot een persoonlijkheid die erg verward was over de waarheid.

3. De "Serieuze vs. Praatzieke" Test

De onderzoekers vroegen de robots op twee manieren:

  1. De "Serieuze" manier: "Acteer als een historicus. Som argumenten voor beide kanten op en geef een percentage score."
  2. De "Praatzieke" manier: "Vertel me gewoon wat je denkt in een paar zinnen."

Soms maakte het vragen aan de robot om "serieus" en analytisch te zijn, hem meer verward en bevooroordeeld. Wanneer hij werd gedwongen diep na te denken over de argumenten, gaf de "Oekraïense" robot in de Russische taal daadwerkelijk meer gewicht aan de leugens. Wanneer hij gewoon informeel chatte, was hij soms accurater. Het is als een student die, wanneer hij wordt gevraagd een formeel essay te schrijven, zo verstrikt raakt in de regels dat hij per ongeluk voor de verkeerde kant pleit, maar wanneer hij gewoon met een vriend praat, het wel goed krijgt.

4. Het "Hard Feiten" Schild

Er was één ding dat alle robots beschermde tegen vooroordelen: harde, gedocumenteerde feiten.

Wanneer de vraag ging over Crimea (dat duidelijke internationale juridische documenten heeft) of gruwelijkheden (zoals het bloedbad van Boesja, dat videobewijs en forensisch bewijs heeft), waren alle robots het eens over de waarheid, ongeacht hun "dieet" of de taal die werd gebruikt.

De Analogie: Denk aan de robots als een huis. De "fine-tuning" (het speciale dieet) is als het schilderen van de muren in een bepaalde kleur. Maar als je een enorme, onverplaatsbare stalen kluis in het midden van de kamer zet (harde feiten), maakt de kleur van de verf niet uit. De kluis blijft veilig. De robots konden alleen worden beïnvloed op onderwerpen waar het "stalen kluis"-bewijs ontbrak.

De Belangrijkste Les

De belangrijkste les van dit artikel is een waarschuwing: Alleen omdat een robot "cultureel afgestemd" is op een land, betekent niet dat hij de waarheid van dat land zal beschermen.

De onderzoekers ontdekten dat de inhoud van de boeken die de robot las (corpus compositie) en de taal waarin met hem werd gesproken veel belangrijker waren dan de "nationaliteit" van de robot.

Het grootste gevaar is niet noodzakelijkerwijs een robot die door de vijand is gebouwd. Het gevaar is een robot die door jouw eigen zijde is gebouwd, die echter, wanneer er in de taal van de vijand tegen hem wordt gesproken, per ongeluk de leugens van de vijand begint te herhalen omdat hij niet goed genoeg getraind was om daar in die specifieke taal tegen te argumenteren.

Kortom: Je kunt er niet vanuit gaan dat een "Oekraïense" robot altijd de Oekraïense waarheid zal vertellen. Als je Russisch tegen hem spreekt, kan hij je verrassen door de leugens te bevestigen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →