Grokipedia vs Wikipedia: An LLM-Based Audit of Political Neutrality along Ideologies
Een grootschalige audit die Grokipedia en Wikipedia vergelijkt, onthult dat de door een LLM gegenereerde Grokipedia door meerdere AI-rechters als minder neutraal wordt beoordeeld dan Wikipedia, waarbij Grokipedia een vooroordeel vertoont dat economisch rechtse politici bevoordeelt terwijl sociaal liberale politici worden gestraft, terwijl Wikipedia de tegenovergestelde neiging vertoont.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je het internet voor als een enorme, bruisende bibliotheek waar iedereen is uitgenodigd om boeken te schrijven. Jarenlang was er één bibliotheek genaamd Wikipedia, die de meest populaire plek was, maar sommige mensen klaagden dat de bibliothecarissen daar een specifieke "vibe" hadden—misschien neigden ze een beetje te veel naar één kant van het politieke spectrum, zoals een koor dat alleen maar liedjes over regen zingt terwijl de zon schijnt. Onlangs is er een nieuwe bibliotheek geopend genaamd Grokipedia, gebouwd door een superintelligent computerbrein (een AI) genaamd Grok. De makers van deze nieuwe bibliotheek beloofden dat het de ultieme "neutrale" zone zou zijn, een plek zonder menselijke vooroordelen, alleen pure feiten. Maar hier komt de grote vraag: kan een robot echt eerlijker zijn dan een menigte mensen? Om dit te ontdekken, moeten we eerst een paar dingen begrijpen. Ten eerste is "politieke bias" als een gekleurde bril; als je die draagt, ziet de wereld er met een bepaalde kleur uit, zelfs als de wereld zelf grijs is. Ten tweede zijn "Large Language Models" (LLM's) de computerbreinen die deze artikelen schrijven; ze zijn als ongelooflijk snelle studenten die bijna alles op het internet hebben gelezen en in enkele seconden essays kunnen schrijven. Ten slotte betekent "neutraliteit" in deze context het schrijven over mensen zonder hen als helden of schurken neer te zetten, maar simpelweg te beschrijven wie ze zijn. Dit artikel is een detectiveverhaal over de vraag of de nieuwe robotbibliotheek werkelijk eerlijker is dan de oude menselijke bibliotheek, of dat hij gewoon een andere gekleurde bril draagt.
De onderzoekers, een team van de Universiteit Gent, besloten Grokipedia en Wikipedia op de proef te stellen met een grootschalig experiment. Ze lazen niet slechts een paar artikelen; ze verzamelden 1.394 paren artikelen, waarbij elk paar exact dezelfde overheidsfunctionaris beschreef (zoals een president of een minister), maar de ene versie werd geschreven door mensen op Wikipedia en de andere door de AI op Grokipedia. Om de eerlijkheid van deze artikelen te beoordelen, vroegen ze niet aan slechts één persoon; ze gebruikten vier verschillende AI-"rechters" (waaronder Grok zelf, plus Claude, Mistral en DeepSeek) om te beoordelen hoe neutraal elk artikel was. Ze hadden ook een geheim wapen: een lijst met 9 verschillende "ideologie-vlaggen" (zoals "ondersteunt immigratie", "ondersteunt vrouwenrechten" of "ondersteunt een vrije markt") die experts al aan elke politicus hadden toegewezen. Dit stelde de onderzoekers in staat om te zien of de artikelen politici anders behandelden op basis van hun politieke overtuigingen.
De resultaten waren een beetje verrassend, en misschien zelfs een beetje ironisch. Ten eerste waren de AI-rechters het erover eens dat geen enkele encyclopedie perfect neutraal was. Sterker nog, Grokipedia werd beoordeeld als een plek met over het algemeen meer bevooroordeelde artikelen dan Wikipedia. Toen de rechters nauwkeuriger keken naar hoe de bias naar voren kwam, vonden ze een duidelijk patroon. Grokipedia leek een voorkeur te hebben voor politici die economisch "rechts" waren (zij die minder overheidsregulering en kleinere verzorgingsstaten willen) en voor hen die democratische normen steunden. Het was echter veel strenger voor politici die sociaal liberale standpunten innamen, zoals zij die de rechten van de LGBT-gemeenschap of de arbeid van vrouwen ondersteunen. Wikipedia daarentegen werd beoordeeld als gunstiger naar deze sociaal liberale politici, maar de onderzoekers vonden dat Wikipedia, in algemene zin, nog steeds als neutraler werd gezien dan Grokipedia.
De meest fascinerende wending in dit verhaal heeft betrekking op Grok, de AI die Grokipedia schreef. Je zou denken dat als je een robot vraagt om zijn eigen werk te beoordelen, hij zou zeggen: "Hé, ik ben perfect!" Maar de studie toonde aan dat Grok zijn eigen encyclopedie (Grokipedia) daadwerkelijk als minder neutraal beoordeelde dan de door mensen geschreven Wikipedia. Dit suggereert dat de bias niet alleen een fout is in de manier waarop de rechters scoren, maar dat de bias daadwerkelijk in de artikelen zit die Grok schreef. De onderzoekers suggereren dat hoewel Grokipedia werd gebouwd als een neutraal alternatief, het uiteindelijk een andere soort ideologie inbedde—één die economisch conservatisme bevoordeelt en sociaal liberalisme bestraft.
De studie keek ook naar hoe de verschillende AI-rechters zich gedroegen. Ze waren niet allemaal hetzelfde. Bijvoorbeeld, één rechter genaamd DeepSeek was zeer gul en noemde bijna alles "neutraal", terwijl een andere, genaamd Claude, veel strenger was en in veel meer artikelen bias vond. Echter, ondanks deze verschillen in strengheid, waren alle rechters het eens over de richting van de bias: Grokipedia bevoordeelde de economische rechter en Wikipedia neigde licht naar de sociale linkerzijde. De onderzoekers concluderen dat hoewel AI encyclopedie-artikelen snel kan schrijven, dit hen niet automatisch eerlijker maakt. Sterker nog, de keuze van de encyclopedie die je leest, kan bepalen hoe je politici ziet, afhankelijk van welke politieke "smaak" die encyclopedie verkiest. De studie suggereert dat we voorzichtig moeten zijn met door AI gegenereerde inhoud en dat het gebruik van een divers team van rechters (zowel menselijk als machinaal) de beste manier is om deze verborgen vooroordelen op te sporen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.