The Ghost Couple: Correlated LLM Name Priors and Their Haunting of the Web and Academic Publishing
Dit artikel onthult dat grote taalmodellen consistente, gecorreleerde "geest"-naamparen en -trio's genereren in diverse fictieve en academische contexten, wat leidt tot de massale creatie van frauduleuze wetenschappelijke dossiers met echte DOI's die onbedoeld modelspecifieke gedragsvingerafdrukken en implementatietijdlijnen blootleggen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een groep zeer geavanceerde, maar lichtelijk excentrieke AI-schrijvers vraagt om een team van experts voor een verhaal te bedenken. Je geeft ze geen specifieke namen; je zegt alleen: "Verzin wat wetenschappers."
Je zou verwachten dat de AI willekeurige namen kiest zoals een mens dat zou doen. Maar dit artikel onthult iets vreemds: de AI kiest niet willekeurig. De AI kiest steeds weer dezelfde specifieke cast van personages, als een regisseur die geobsedeerd is door het steeds casten van dezelfde drie acteurs voor elke film, ongeacht het plot.
Hier is de uitsplitsing van dit "Ghost Couple"-fenomeen, eenvoudig uitgelegd:
1. De "Ghost Cast"
De onderzoekers ontdekten dat verschillende AI-modellen hun eigen favoriete "standaardpersonages" hebben. Dit zijn niet zomaar willekeurige namen; het zijn gecorreleerde paren of groepen die altijd samen verschijnen.
- Het Claude-model: Het houdt van een specifiek duo: Elena Vasquez en Marcus Chen. Soms sluit een derde personage genaamd Amara zich bij hen aan. Wat de geschiedenis ook gaat over vulkanen, ruimtevaart of therapie, als je Claude vraagt om experts te verzinnen, blijven deze namen steeds opduiken.
- Het Gemini-model: Het heeft zijn eigen favoriete paar: Aris Thorne en Lena Petrova.
- Het GPT-model: Het heeft een solostar, Elara Voss, maar zij heeft geen vaste partner; haar sidekick verandert elke keer.
De analogie: Denk aan deze AI-modellen als een karaktermaker in een videogame. Als je op "Randomize" drukt in een specifieke game, krijg je misschien altijd dezelfde drie personages omdat de code van het spel in een loop zit. Deze AI-modellen doen precies hetzelfde met namen.
2. De "Digitale Bezetting"
Het enge deel is niet alleen dat de AI deze namen gebruikt; het is dat deze namen de AI hebben verlaten en nu het echte internet achtervolgen.
Omdat een groot deel van de content op het web door AI is geschreven, zijn deze "Ghost Characters" begonnen op te duiken in:
- Nepfaculteitspagina's van universiteiten.
- Fictieboeken op Amazon.
- Podcastbeschrijvingen.
- Zelfs nepnieuwsartikelen.
De analogie: Stel je een spook voor dat steeds verschijnt op elke foto die in een specifieke stad wordt genomen. Je ziet "Elena Vasquez" als vulkanoloog in een Spaanse blog, dan als therapeut in een Canadese kliniek, en dan als wetenschapper in een tech-startup. Geen van deze mensen bestaat. Het zijn digitale spoken die websites achtervolgen, allemaal gecreëerd door dezelfde AI-"glitch".
3. Het "Academic Zombie"-probleem
Het paper vond dat dit spookprobleem is doorgevloeid naar de serieuze wereld van de wetenschap en academische publicaties.
- De opzet: Onderzoekers vonden een enorme batch nepacademische papers die zijn geüpload naar Zenodo (een legitieme wetenschappelijke repository).
- De truc: Deze papers beweerden gepubliceerd te zijn in tijdschriften die niet bestaan.
- De data: De papers beweerden jaren geleden gepubliceerd te zijn (achteraf gedateerd), maar de digitale tijdstempels bewezen dat ze allemaal in een enorme golf in maart en april 2026 werden geüpload.
- De auteurs: De auteurs waren de "Ghost Characters" (zoals Elena Vasquez en Marcus Chen) die samenwerkten met andere nepnamen.
De analogie: Stel je een fabriek voor die nepdiploma's print en ze in een echte bibliotheekcatalogus plakt. Het computersysteem van de bibliotheek (DataCite) geeft deze neppapers een geldig ID-nummer (een DOI), waardoor ze voor andere computers echt lijken. Nu zal elke zoekmachine die op zoek is naar wetenschappelijke papers deze neprecords "oogsten", denkend dat ze echt zijn.
4. Hoe de onderzoekers het vonden
De auteurs gokten niet zomaar; ze benaderden dit als een forensisch onderzoek.
- De "Diff"-test: Ze vergeleken verschillende versies van de AI-modellen. Ze zagen dat in oudere versies de AI een andere spooknaam gebruikte (Elena Rodriguez). In nieuwere versies schakelde het over naar Elena Vasquez. Door deze overgang te observeren, konden ze precies zien wanneer de AI werd bijgewerkt.
- De "Suppression"-aanwijzing: De AI-bedrijven merkten de vreemde patronen uiteindelijk op en probeerden deze te "corrigeren" (onderdrukken). De onderzoekers zagen de spooknamen uit de output van de AI verdwijnen naarmate de modellen werden bijgewerkt, wat bewees dat de bedrijven wisten dat het probleem bestond.
5. Waarom het ertoe doet (volgens het paper)
Het paper concludeert dat het internet een onbedoeld archief is geworden van deze AI-"gedragsvingerafdrukken".
- Nepgroepen: Op sites zoals ResearchGate vormen deze spoken "synthetische onderzoeksgroepen". Je ziet misschien een profiel van een echt klinkende professor (Mei-Lin Zhang) die 35 papers heeft gepubliceerd met spoken uit verschillende AI-modellen (Elena van Claude, Aris van Gemini).
- De tijdlijn: Door te kijken naar wanneer deze neppapers werden geüpload, kunnen de onderzoekers feitelijk raden wanneer de AI-modellen zijn uitgebracht. De neppapers fungeren als een kalender voor de ontwikkeling van de AI.
Samenvatting
Het paper stelt dat Large Language Models de vreemde gewoonte hebben ontwikkeld om steeds weer dezelfde nepmensen te verzinnen. Deze "Ghost Couples" zijn uit de AI gelekt, hebben het web bevolkt met nepexperts en zelfs een enorme golf van nepwetenschappelijke papers met echte digitale ID's gecreëerd. Het internet is nu gevuld met een "bezetting" van niet-bestaande mensen die de eer krijgen voor werk dat ze nooit hebben verricht.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.