Grokipedia vs Wikipedia: An LLM-Based Audit of Political Neutrality along Ideologies
Un audit su larga scala che confronta Grokipedia e Wikipedia rivela che la versione generata da un LLM, Grokipedia, è valutata come meno neutrale rispetto a Wikipedia da molteplici giudici IA, con Grokipedia che esibisce un pregiudizio a favore di politici economicamente di destra mentre penalizza quelli socialmente liberali, laddove Wikipedia mostra la tendenza opposta.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immaginate internet come una gigantesca e frenetica biblioteca dove tutti sono invitati a scrivere libri. Per anni, una biblioteca chiamata Wikipedia è stata il luogo più popolare, ma alcune persone si sono lamentate del fatto che i bibliotecari di lì abbiano un certo "vibe" — forse pendono un po' troppo verso un lato dello spettro politico, come un coro che canta solo canzoni sulla pioggia quando splende il sole. Recentemente, una nuova biblioteca ha aperto le porte, chiamata Grokipedia, costruita interamente da un super-cervello informatico (un'IA) chiamato Grok. I creatori di questa nuova biblioteca hanno promesso che sarebbe stata la zona "neutrale" definitiva, un luogo privo di ogni pregiudizio umano, fatto solo di fatti puri. Ma ecco la grande domanda: può un robot essere davvero più equo di una folla di umani? Per capirlo, dobbiamo comprendere alcune cose. Primo, il "pregiudizio politico" è come un paio di occhiali colorati; se li indossi, il mondo appare di un certo colore, anche se il mondo stesso è grigio. Secondo, i "Large Language Models" (LLM) sono i cervelli informatici che scrivono questi articoli; sono come studenti incredibilmente veloci che hanno letto quasi tutto su internet e possono scrivere saggi in pochi secondi. Infine, la "neutralità" in questo contesto significa scrivere delle persone senza farle apparire come eroi o cattivi, descrivendo semplicemente chi sono. Questo articolo è una storia investigativa per capire se la nuova biblioteca robotica sia effettivamente più equa di quella vecchia umana, o se indossi semplicemente un paio di occhiali colorati diverso.
I ricercatori, un team dell'Università di Ghent, hanno deciso di sottoporre Grokipedia e Wikipedia al test con un esperimento massiccio. Non si sono limitati a leggere pochi articoli; hanno raccolto 1.394 coppie di articoli, dove ogni coppia descriveva esattamente lo stesso funzionario governativo (come un presidente o un ministro), ma una versione era scritta da umani su Wikipedia e l'altra dall'IA su Grokipedia. Per giudicare l'equità di questi articoli, non hanno chiesto a una sola persona; hanno usato quattro diversi giudici IA (incluso lo stesso Grok, oltre a Claude, Mistral e DeepSeek) per valutare quanto fosse neutrale ciascun articolo. Avevano anche un'arma segreta: una lista di 9 diversi "segnali ideologici" (come "supporta l'immigrazione", "supporta i diritti delle donne" o "supporta il libero mercato") che gli esperti avevano già assegnato a ciascun politico. Ciò ha permesso ai ricercatori di vedere se gli articoli trattavano i politici in modo diverso in base alle loro convinzioni politiche.
I risultati sono stati un po' sorprendenti, e forse un po' ironici. In primo luogo, i giudici IA concordavano sul fatto che nessuna delle due enciclopedie fosse perfettamente neutrale. Infatti, Grokipedia è stata valutata come avente articoli piamente più distorti rispetto a Wikipedia. Quando i giudici hanno guardato da vicino come si manifestasse il pregiudizio, hanno trovato un modello chiaro. Grokipedia sembrava avere una predilezione per i politici economicamente "di destra" (quelli che vogliono meno regolamentazione governativa e stati di welfare più piccoli) e per coloro che sostenevano le norme democratiche. Tuttavia, era molto più dura con i politici che sostenevano visioni socialmente liberali, come il supporto ai diritti LGBT o ai diritti lavorativi delle donne. Wikipedia, d'altra parte, è stata valutata come più favorevole verso quei politici socialmente liberali, ma i ricercatori hanno scoperto che, nel complesso, Wikipedia era comunque vista come più neutrale di Grokipedia.
Forse il colpo di scena più affascinante della storia riguarda Grok, l'IA che ha scritto Grokipedia. Si potrebbe pensare che se chiedi a un robot di giudicare il proprio lavoro, esso dirà: "Ehi, sono perfetto!". Ma lo studio ha scoperto che Grok ha effettivamente valutato la propria enciclopedia (Grokipedia) come meno neutrale rispetto alla Wikipedia scritta dagli umani. Questo suggerisce che il pregiudizio non è solo un errore nel modo in cui i giudici assegnano i punteggi, ma che il pregiudizio è effettivamente radicato negli articoli scritti da Grok. I ricercatori suggeriscono che, sebbene Grokipedia sia stata costruita per essere un'alternativa neutrale, ha finito per incorporare un tipo di ideologia diverso — uno che favorisce il conservatorismo economico e penalizza il liberalismo sociale.
Lo studio ha anche esaminato il comportamento dei diversi giudici IA. Non erano tutti uguali. Ad esempio, un giudice chiamato DeepSeek era molto generoso, definendo quasi tutto "neutrale", mentre un altro chiamato Claude era molto più severo, trovando pregiudizi in molti più articoli. Tuttavia, nonostante queste differenze di severità, tutti i giudici concordavano sulla direzione del pregiudizio: Grokipedia favoriva la destra economica, e Wikipedia tendeva leggermente verso la sinistra sociale. I ricercatori concludono che, sebbene l'IA possa scrivere voci enciclopediche rapidamente, ciò non la rende automaticamente più equa. Infatti, la scelta dell'enciclopedia che si legge potrebbe cambiare il modo in cui si vedono i politici, a seconda di quale "gusto" politico l'enciclopedia preferisce. Lo studio suggerisce che dobbiamo fare attenzione ai contenuti generati dall'IA e che l'uso di un team diversificato di giudici (sia umani che macchine) è il modo migliore per individuare questi pregiudizi nascosti.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.