← Nieuwste papers
💻 computer science

Is Misinformation More Open? A Study of robots.txt Gatekeeping on the Web

Deze studie onthult een groeiende asymmetrie in web-gatekeeping waarbij gerenommeerde nieuwssites steeds vaker AI-crawlers blokkeren via robots.txt en actieve maatregelen, terwijl misinformatiesites grotendeels open blijven, wat potentieel de beschikbare trainingsdata voor Large Language Models kan verkenen.

Oorspronkelijke auteurs: Nicolas Steinacker-Olsztyn, Devashish Gosain, Ha Dao

Gepubliceerd 2026-08-13
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Nicolas Steinacker-Olsztyn, Devashish Gosain, Ha Dao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je het internet voor als een gigantische, bruisende bibliotheek waar elk boek, artikel en blogpost een stukje informatie is dat wacht om gelezen te worden. Jarenlang zijn "robots" (speciale computerprogramma's) de bibliothecarissen van deze digitale wereld geweest, die stilletjes door de gangen lopen om boeken te kopiëren, zodat zoekmachines ons kunnen helpen ze te vinden. Maar onlangs is er een nieuw soort bibliothecaris gearriveerd: de Artificial Intelligence (AI) robot. Deze zoeken niet alleen naar één boek; ze proberen alles tegelijk te lezen om te leren hoe ze moeten schrijven, vragen moeten beantwoorden en met ons kunnen chatten. Om dit te beheren, kunnen website-eigenaren een eenvoudig, vrijwillig bordje op hun deur plaatsen genaamd robots.txt. Zie dit als een "Niet Betreden" of "Kom Binnen" bordje voor deze digitale bibliothecarissen. Als een website-eigenaar op dit bordje schrijft "Geen AI toegestaan", behoren beleefde AI-robots dit te respecteren en weg te blijven. Maar hier is de grote vraag: zetten alle websites deze bordjes op? En zo ja, doen ze dat ook om dezelfde redenen? Nu AI slimmer en krachtiger wordt, is het begrijpen van wie hun deuren opent en wie ze op slot doet cruciaal, omdat dit bepaalt welke informatie de AI leert.

Dit artikel, getiteld "Is Misinformation More Open?", werkt als een digitaal detectivespel en onderzoekt hoe twee zeer verschillende groepen websites omgaan met deze "Niet Betreden"-borden voor AI. De onderzoekers keken naar twee groepen: "reputabele" nieuwswebsites (de serieuze, feiten controlerende journalisten) en "misinformatie"-websites (de plekken waar valse of misleidende verhalen worden verspreid). Ze wilden zien of de serieuze nieuwsorganisaties beter waren in het vertellen van de AI-robots om weg te blijven vergeleken met de nepnieuws-sites.

De bevindingen onthullen een verrassend en scherp contrast. De onderzoekers ontdekten dat reputabele nieuwswebsites veel vaker een "Niet Betreden"-bordje voor AI-robots ophangen. Sterker nog, 60,0% van deze betrouwbare sites vertelde expliciet ten minste één AI-crawler om niet binnen te komen in hun robots.txt-bestanden. In schril contrast hiermee deed slechts 9,1% van de misinformatie-sites hetzelfde. Het is alsof de serieuze bibliotheken hun deuren afsluiten voor de nieuwe AI-studenten, terwijl de pamflettenmakers van het nepnieuws hun deuren wagenwijd open laten staan. Gemiddeld vermeldde een reputabele nieuwswebsite 15,5 verschillende AI-robots die zij niet wilde bezoeken, terwijl misinformatie-websites er minder dan één vermelden.

De studie onderzocht ook of deze websites hun bordjes daadwerkelijk handhaafden of ze alleen maar opschreven. Ze ontdekten dat reputabele nieuwswebsites niet alleen de regels opschreven, maar ook actief AI-robots blokkeerden die probeerden binnen te sluipen, waarbij ze hun geschreven regels overeenstemden met hun acties. Misinformatie-websites waren minder consistent; hoewel sommige wel blokkeerden, maakten velen het helemaal niet uit om de regels überhaupt op te schrijven. De onderzoekers volgden ook hoe zaken in de loop van de tijd veranderden, door momentopnames te bekijken van september 2023 tot mei 2025. Ze zagen dat reputabele nieuwswebsites snel leerden om hun deuren op slot te doen, waarbij het aantal sites dat AI blokkeerde in slechts een paar jaar tijd steeg van 23% naar bijna 60%. Misinformatie-websites bleven echter grotendeels passief en updateerden hun bordjes zelden.

De auteurs suggereren dat deze groeiende kloof een vreemde situatie creëert: naarmate de "goede" bronnen hun deuren beginnen te sluiten om hun inhoud te beschermen, kunnen de AI-robots eindigen met het lezen van de "slechte" bronnen die nog wagenwijd openstaan. Dit zou kunnen betekenen dat de AI meer leert van misinformatie dan van accuraat nieuws, simpelweg omdat de misinformatie-sites gemakkelijker toegankelijk zijn. Het artikel beweert niet dat dit de AI al heeft verpest, maar het benadrukt een echt risico: als we niet opletten wie zijn deuren opent, kan de toekomst van AI gebouwd worden op een fundament van onwaarheden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →