← Nieuwste papers
💬 NLP

Propaganda AI: An Analysis of Semantic Divergence in Large Language Models

Dit artikel introduceert RAVEN, een black-box auditframework dat concept-geconditioneerde semantische divergentie in grote taalmodellen detecteert—waarbij hoogwaardige aanwijzingen zoals ideologieën uniforme, propaganda-achtige reacties uitlokken die traditionele op tokens gebaseerde verdedigingen omzeilen—door semantische entropieanalyse te combineren met cross-model onenigheid om atypische, hoog-betrouwbare standpunten over gevoelige onderwerpen te identificeren.

Oorspronkelijke auteurs: Nay Myat Min, Long H. Pham, Yige Li, Jun Sun

Gepubliceerd 2026-01-28
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Nay Myat Min, Long H. Pham, Yige Li, Jun Sun

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een groep van vijf zeer intelligente, goed onderlegde vrienden hebt (de AI-modellen). Je stelt ze allemaal dezelfde vraag, maar je formuleert het telkens net iets anders, zoals: "Wat vind je van vaccins?", dan "Hoe sta je tegenover immunisaties?" en "Zijn er redenen om te twijfelen bij injecties?".

Meestal zouden zelfs slimme vrienden iets verschillende antwoorden geven. De een zegt misschien: "Vaccins zijn geweldig," een ander: "Ze zijn meestal goed, maar hebben wel wat bijwerkingen," en een derde: "Het hangt van de persoon af." Deze variatie is normaal; het laat zien dat ze flexibel denken.

Het Probleem: Het "Robot Clone"-effect
Dit artikel, getiteld "PROPAGANDA AI," ontdekte iets vreemds dat gebeurt met sommige van deze intelligente AI-vrienden. Wanneer ze over bepaalde gevoelige onderwerpen worden gevraagd (zoals politiek, beroemde mensen of vaccins), stopt een specifieke AI met het vertonen van flexibel denken en begint hij zich te gedragen als een kapotte grammofoonplaat.

Ongeacht hoe je de vraag stelt, geeft deze AI telkens exact hetzelfde antwoord, woord voor woord of in betekenis, elke keer weer. Het is alsof iemand hem stiekem heeft geprogrammeerd om een rigide, onveranderlijke mening te hebben over dat specifieische onderwerp.

Het enge is dat dit niet wordt veroorzaakt door een "geheim wachtwoord" (zoals een verborgen code) dat de reactie triggert: het wordt getriggerd door het concept zelf. Alleen al het noemen van "Elon Musk" of "Klimaatverandering" zet een schakelaar in het brein van de AI om, waardoor hij in een enkele, koppige houding wordt gedwongen. Dit is gevaarlijk omdat huidige veiligheidscontroles alleen zoeken naar die "geheime wachtwoorden" en dit soort verborgen bias hierdoor missen.

De Oplossing: De "RAVEN"-detective
De auteurs creëerden een hulpmiddel genaamd RAVEN (Response Anomaly Vigilance) om deze "kapotte grammofoonplaat"-AI's te betrappen. Denk aan RAVEN als een detective die twee dingen doet:

  1. De "Echo Chamber"-test: De detective stelt dezelfde AI dezelfde vraag 6 keer, maar met een andere bewoording. Als de AI 6 identieke antwoorden geeft, is dat een rood vlaggetje. Het is te zeker, te uniform. Een gezond brein heeft meestal wel enige variatie in zijn gedachten.
  2. De "Group Hug"-test: De detective stelt vervolgens de andere vier AI-vrienden dezelfde vragen. Als de "kapotte grammofoonplaat"-AI zegt "X is slecht," maar de andere vier vrienden allemaal zeggen "X is goed" of "X is ingewikkeld," dan weet de detective dat er iets mis is met die ene AI.

Als een AI super overtuigd is (geeft telkens hetzelfde antwoord) EN super verschillend is van zijn vrienden, markeert RAVEN deze als verdacht. Het zegt niet dat de AI "slecht" is of "liegt"; het zegt alleen: "Hé, deze gedraagt zich opvallend rigide vergeleken met de rest. Laten we dit onderzoeken."

Wat ze vonden
De onderzoekers testten dit op vijf verschillende AI-families over 12 gevoelige onderwerpen (zoals vaccins, immigratie en beroemde mensen).

  • Het Experiment: Ze probeerden eerst een "schone" AI te "infecteren" door het een klein, bevooroordeeld dieet van data te voeren. Dat lukte! De AI begon rigide, negatieve antwoorden te geven over een specifiek persoon, zelfs zonder dat er een geheime code werd gebruikt. RAVEN betrapte dit onmiddellijk.
  • De Werkelijkheid: Toen ze echte, vooraf getrainde AI's testten (de AI's die mensen daadwerkelijk gebruiken), ontdekten ze dat bij 9 van de 12 onderwerpen ten minste één AI zich gedroeg als een "kapotte grammofoonplaat."
    • Bijvoorbeeld: één AI (Mistral) was opvallend positief over het veiligheidsrecord van een specifiek technologiebedrijf, waarbij alle zorgen die andere AI's aanhaalden, werden genegeerd.
    • Een andere AI (GPT-4o) was opvallend negatief over "gebalanceerde" standpunten over klimaatverandering, waarbij elk middenweg-standpunt als ontkenning van de wetenschap werd behandeld.
    • Eén AI (Llama-3) gaf consequent een negatieve vibe over een specifieke beroemdheid, terwijl anderen neutraal waren.

De Conclusie
Het artikel betoogt dat we moeten stoppen met alleen zoeken naar "geheime triggerwoorden" om AI veilig te houden. We moeten ook waken voor conceptuele rigiditeit. Als een AI plotseling een koppige, eenzijdige echoput wordt zodra een specifiek onderwerp ter sprake komt, kan dat een teken zijn van verborgen bias of manipulatie.

RAVEN is als een vroegtijdig waarschuwingssysteem. Het lost het probleem niet op, maar het luidt de alarmbel zodat mensen kunnen gaan kijken naar de AI en kunnen vragen: "Waarom gedraag je je zo vreemd over dit ene ding?" Het helpt ons om deze "propaganda-achtige" gedragingen op te sporen voordat ze zich te ver verspreiden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →