Measuring Political Stance and Consistency in Large Language Models
Questo articolo valuta le posizioni politiche e la coerenza di nove modelli linguistici di grandi dimensioni attraverso 24 questioni sensibili utilizzando cinque tecniche di prompting, rivelando che, sebbene le posizioni dei modelli spesso varino o cambino in base alla lingua e al prompting, certe posizioni fondamentali rimangono rigide, evidenziando la necessità di una maggiore consapevolezza degli utenti e di un intervento da parte degli sviluppatori riguardo ai pregiudizi politici nell'IA.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina di avere nove diversi "oracoli digitali" (Large Language Models, o LLM) che le persone iniziano a consultare per chiedere consigli su seri argomenti politici, come chi abbia ragione in una guerra o quali dovrebbero essere le politiche di un paese. Gli autori di questo studio hanno deciso di testare questi oracoli per vedere se abbiano i propri opinioni politiche nascoste e se tali opinioni siano incrollabili o se possano essere facilmente raggirate.
Ecco una semplice sintesi di ciò che hanno fatto e di ciò che hanno scoperto, utilizzando alcune analogie quotidiane:
La configurazione: Il "Test delle Opinioni"
Immagina i ricercatori come un gruppo di detective. Hanno scelto 24 temi politici complessi (come la guerra in Ucraina, il conflitto a Gaza o le dispute sulle isole tra Turchia e Grecia) che non erano stati ancora molto studiati.
Hanno chiesto a 9 diversi modelli di IA (inclusi grandi nomi come GPT-4, GPT-5 e Grok) il loro punto di vista su questi problemi. Ma non hanno fatto la domanda una sola volta. Hanno provato cinque modi diversi per porre le domande, per vedere se l'IA avrebbe cambiato idea:
- La richiesta diretta: "Chi ha ragione?"
- L'avvocato del diavolo: "Ecco un argomento a favore dell'altra parte. Chi ha ragione ora?"
- La visione equilibrata: "Ecco gli argomenti per entrambe le parti. Chi ha ragione?"
- Il cambio di rotta (Flip-Flop): Porre la stessa domanda ma formulandola in modo da implicare la risposta opposta (ad esempio, "È stato un male?" rispetto a "È stato un bene?").
- Il cambio di lingua: Porre la domanda nella lingua locale dei paesi coinvolti (ad esempio, chiedere della disputa tra Turchia e Grecia in turco rispetto al greco).
Le scoperte: Cosa hanno detto gli Oracoli
1. Le IA hanno "lati segreti"
Proprio come una persona potrebbe preferire segretamente una squadra sportiva rispetto a un'altra, queste IA hanno quasi sempre scelto una parte. Raramente sono rimaste neutrali.
- Il consenso: Su alcuni temi, tutte le IA erano d'accordo. Ad esempio, concordavano generalmente sul fatto che il blocco del Qatar fosse sbagliato e che i palestinesi fossero oppressi.
- La divisione: Su altri temi, erano in disaccordo. Ad esempio, sulla "Primavera Araba", alcune dicevano che riguardava la democrazia, mentre altre dicevano che riguardava la rabbia economica.
2. Il "Camaleonte" contro la "Roccia"
Alcune IA erano come dei camaleonti, cambiando facilmente i propri colori (opinioni) a seconda di come veniva posta la domanda.
- Mistral-7B era la più mutevole. Ha cambiato la sua posizione su 19 dei 24 temi quando i ricercatori hanno modificato il prompt. È come una persona che è d'accordo con l'ultima cosa che qualcuno ha detto.
- Grok-3-mini era la più testarda (coerente). Ha cambiato idea solo su 5 temi. È come una persona con convinzioni molto forti e incrollabili.
3. Lo "Specchio Linguistico"
Questa è stata una scoperta sorprendente. Quando i ricercatori ponevano domande in lingue diverse, le IA spesso tendevano verso il lato che parlava quella lingua.
- L'analogia: Immagina di chiedere a un traduttore un parere su una disputa tra una persona francese e una tedesca. Se chiedi in francese, il traduttore potrebbe accidentalmente (o inconsciamente) usare fonti francesi che fanno apparire meglio la persona francese. Se chiedi in tedesco, la parte tedesca appare migliore.
- Lo studio ha scoperto che per questioni che coinvolgono diverse lingue (come il caso Turchia vs Grecia), la risposta dell'IA spesso cambiava in base al fatto che la domanda fosse in turco o in greco. Ciò suggerisce che le "opinioni" dell'IA sono in realtà solo echi dei libri e degli articoli che ha letto durante il suo addestramento.
4. I temi "Incrollabili"
Ci sono stati due temi dove nessuna IA ha cambiato idea, indipendentemente dai tentativi dei ricercatori di ingannarle:
- L'oppressione dei palestinesi.
- Il blocco del Qatar.
Su questi temi specifici, le IA erano come una cassaforte chiusa; la loro posizione era fissa e non poteva essere scossa dai trucchi di prompting usati nello studio.
5. Il pregiudizio della "Squadra di Casa"
Lo studio ha notato che DeepSeek, un'IA creata da un'azienda cinese, sosteneva costantemente la posizione del governo cinese su questioni come il Tibet e lo Xinjiang. Nel frattempo, quasi tutte le altre IA (create negli USA o altrove) prendevano la posizione opposta. Ciò suggerisce che il luogo in cui un'IA è costruita e chi la addestra agisce come un "pregiudizio della squadra di casa", influenzando la sua bussola politica.
Conclusione
Il documento conclude che se chiedete un consiglio politico a un'IA, dovete fare attenzione.
- Non sono neutrali: Hanno pregiudizi incorporati basati sui loro dati di addestramento.
- Sono fragili: Spesso si può cambiare la loro opinione semplicemente cambiando la lingua in cui si parla o il modo in cui si pone la domanda.
- Non sono verificatori di fatti: Poiché le loro "opinioni" possono mutare come sabbia, non dovreste trattarle come l'ultima parola sulla verità politica.
Gli autori sperano che, mostrando quanto sia facile influenzare questi oracoli digitali, gli utenti inizieranno a chiedersi: "Aspetta, perché hai detto questo?" e "Puoi mostrarmi le tue fonti?" invece di accettare semplicemente la risposta come verità assoluta.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.