Beyond speculation: Measuring the growing presence of LLM-generated texts in multilingual disinformation
Deze studie biedt het eerste empirische bewijs van een groeiende aanwezigheid van door LLM gegenereerde inhoud in real-world meertalige desinformatie-datasets na de release van ChatGPT, waarbij specifieke patronen over talen, platforms en tijdsperioden worden gedocumenteerd om het wetenschappelijke debat over de werkelijke omvang van deze dreiging te overbruggen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Plaatje: Schrijft de "Robotpen" Leugens?
Stel je een wereld voor waarin iedereen een superintelligente, razendsnelle schrijfpennen kan oppakken (een Large Language Model, of LLM) die verhalen, nieuws en berichten in bijna elke taal kan schrijven. Sinds de release van tools zoals ChatGPT maken mensen zich zorgen: Wordt deze pen gebruikt om nepnieuws en leugens (desinformatie) te schrijven?
Lange tijd discussieerden experts in cirkels. Sommigen zeiden: "Maak je geen zorgen, het internet is te chaotisch voor robots om het over te nemen." Anderen zeiden: "Pas op, er zijn verborgen hoekjes waar robots al voor problemen zorgen."
Dit paper is het eerste dat daadwerkelijk telt hoeveel van deze "door robots geschreven" leugens er in de echte wereld rondhangen. Ze hebben niet alleen gegokt; ze zijn de digitale archieven van door factcheckers gecontroleerd nieuws en sociale media in gegaan om het bewijs te vinden.
De Detectietools: Hoe Ze de Robots Vonden
De onderzoekers bouwden twee "digitale leugendetectoren". Denk aan deze als twee verschillende beveiligers bij een club:
- Beveiliger A (Gemma_GenAI): Getraind om robot-schrijfacties te herkennen op basis van algemene patronen.
- Beveiliger B (Gemma_MultiDomain): Specifiek getraind op sociale media en nieuws om robot-schrijfacties te herkennen.
Ze testten deze beveiligers op bekende lijsten met "mens versus robot" geschreven teksten om te controleren of ze hun werk goed deden. Ze ontdekten dat wanneer beide beveiligers het erover eens waren dat een tekst door een robot was geschreven, ze in 93% tot 99% van de gevallen gelijk hadden.
Toen ze hun beveiligers vertrouwden, stuurden ze hen op patrouille naar vier verschillende "buurten" (datasets) van real-world content, inclus�elijk gecontroleerde claims, tweets over verkiezingen en nieuws over oorlogen.
Wat Ze Vonden: De Robot-invasie is Echt (Maar Ongelijkmatig)
De studie vond dat robot-geschreven desinformatie zeker aanwezig is, maar het is geen overstroming; het is meer een langzame lekkage die steeds groter wordt.
1. Het "Vóór en Na" ChatGPT-effect
Stel je een tijdlijn voor. Vóór eind 2022 (toen ChatGPT populair werd), was de hoeveelheid door robots geschreven leugens erg laag.
- De Analogie: Denk aan een stille vijver. In 2021 werden er slechts een paar rimpelingen (ongeveer 1%) door robots gemaakt.
- De Verandering: Tegen 2023, nadat ChatGPT arriveerde, groeiden de rimpelingen. De studie vond dat in 2023 tussen de 1,5% en 15% van de gecontroleerde leugens in hun dataset waarschijnlijk door robots zijn geschreven of bewerkt. De meest zelfverzekerde schatting ligt rond de 1,85%.
- De Trend: Het aantal door robots geschreven leugens stijgt elk jaar.
2. De "Gerichte" Aanval
De robots schrijven niet in elke taal of op elk platform evenveel leugens. Het is als een inbreker die alleen specifieke huizen aanvalt.
- Talen: Hoewel Engels en Spaans de meeste robot-leugens hebben, simpelweg omdat er meer mensen deze talen spreken, is het percentage leugens het hoogst in het Pools (4,7%) en Frans (4,2%).
- Platformen: De robots zijn het meest actief op Instagram (1,5%) en Facebook (1,3%), en minder actief op Twitter/X (0,64%).
- Specifieke Gebeurtenissen: Tijdens de Amerikaanse verkiezingen in 2024 verdubbelde de hoeveelheid door robots gegenereerde content in tweets van januari tot november, met een piek vlak voor de verkiezingen.
3. De "Fake News" Datasets
De onderzoekers keken ook naar datasets die specifief als "Fake News" zijn gelabeld.
- Ze vonden dat 2,6% tot 3,3% van de artikelen die als "fake" zijn gelabeld, daadwerkelijk door robots zijn geschreven.
- In een dataset over de oorlog in Gaza vonden ze dat meer dan 10% van de Franstalige berichten door robots is gegenereerd, vergeleken met veel lagere aantallen in andere talen.
Waarom Dit Er Toe Doet
Het paper concludeert dat de angst dat robots leugens schrijven geen speculatie is; het gebeurt nu echt.
- Het "Slechte" Nieuws: Robots worden gebruikt om desinformatie te creëren, en ze worden er steeds beter in. Dit gebeurt in specifieke talen en tijdens specifieke tijden (zoals verkiezingen), wat suggereert dat iemand ze strategisch inzet.
- Het "Goede" Nieuws: De hoeveelheid robot-leugens is nog steeds een klein deel van het totale internet (ongeveer 2% in 2024). Echter, omdat het internet zo enorm groot is, is zelfs 2% een grote hoeveelheid nepcontent.
- De Waarschuwing: Naarmate robots slimmer worden, kunnen ze het water gaan "verontreinigen". Als toekomstige AI-modellen worden getraind op data die al door robots geschreven leugens bevat, kunnen die nieuwe modellen de leugens misschien als waarheid gaan beschouwen en ze nog sneller verspreiden.
De Kern van de Zaak
De auteurs zeggen: "Stop met gissen en begin met meten." We hebben nu bewijs dat robots leugens schrijven in de echte wereld, vooral in het Pools, Frans en tijdens verkiezingsseizoenen. We hebben betere tools nodig om ze te vangen en betere systemen om ons te laten weten wanneer we een verhaal van een robot lezen, zodat we niet worden misleid.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.