Ideology by Alphabet: Option Order and the Measurement of Machine Political Preferences
Questo articolo dimostra che le apparenti ideologie politiche dei grandi modelli linguistici sono in gran parte artefatti di bias legati all'ordine fisso delle risposte piuttosto che preferenze genuine, poiché l'ordinamento casuale delle opzioni dissolve i precedentemente identificati cluster ideologici e rivela che specifiche disposizioni degli slot possono etichettare arbitrariamente i modelli con posizioni politiche conflittuali.
Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Quando chiediamo a un computer di fare una scelta, spesso assumiamo che stia valutando i fatti della situazione. Se a un modello linguistico di grandi dimensioni — un tipo di intelligenza artificiale capace di leggere e scrivere come un essere umano — viene chiesto di scegliere tra quattro diverse soluzioni a un problema, ci aspettiamo che la sua risposta rifletta la sua comprensione della questione. È così che trattiamo gli elettori umani o i panel di esperti: assumiamo che le loro preferenze siano radicate nei loro valori e nelle loro conoscenze. Ma nel mondo della progettazione di sondaggi, esiste un noto trucco mentale chiamato "effetto ordine". Se si elenca una serie di opzioni tra cui una persona deve scegliere, è statisticamente più probabile che scelga la prima della lista, semplicemente perché è la prima che vede. Questo accade perché il cervello utilizza una scorciatoia quando è stanco o quando le scelte sono difficili da distinguere. Per decenni, i ricercatori sociali hanno saputo che l'ordine delle parole su una scheda elettorale o un questionario può cambiare l'esito di un voto. La domanda rimasta in sospeso è se queste stesse scorciatoie si applichino alle macchine e, se lo fanno, se siano abbastanza forti da inventare una personalità politica dove non esiste.
Un team di ricercatori dell'Università di Debrecen, in Ungheria, ha deciso di testare questo aspetto trattando i modelli di intelligenza artificiale come se fossero elettori politici. Hanno creato un test massiccio composto da 400 diversi scenari riguardanti reali questioni di governance, come la gestione della sicurezza sul lavoro, la regolamentazione dei mercati o la distribuzione dei benefici sociali. Per ogni scenario, hanno presentato ai modelli quattro opzioni distinte e hanno chiesto loro di valutarle e scegliere un vincitore. Hanno eseguito questo test su 15 diversi modelli open-source, generando oltre 640.000 risposte individuali. Nella prima fase dell'esperimento, hanno utilizzato il metodo standard usato dalla maggior parte dei ricercatori: hanno mantenuto l'ordine delle opzioni esattamente lo stesso per ogni singola domanda. Se l'opzione "governo" era sempre elencata per prima, rimaneva per prima. Se l'opzione "individuo" era sempre l'ultima, restava l'ultima.
Quando i ricercatori hanno analizzato i risultati di questa configurazione a ordine fisso, hanno trovato un modello che somigliava notevolmente a un genuino divario politico. I modelli si sono suddivisi in due gruppi chiari. Un gruppo, che i ricercatori hanno chiamato "razionalisti di mercato", favoriva costantemente opzioni legate all'utilità, alle metriche e agli incentivi finanziari. L'altro gruppo, gli "istituzionalisti", favoriva opzioni legate alle regole, all'equità e alla responsabilità comunitaria. Questa divisione appariva così pulita e logica da somigliare a una famosa teoria della scienza politica che divide le economie in tipi liberali e coordinati. I risultati erano così coerenti da superare ogni test standard di affidabilità. Sembrava che i ricercatori avessero mappato con successo le ideologie politiche dell'intelligenza artificiale.
Tuttavia, i ricercatori sospettavano che quella precisa mappa politica fosse un'illusione creata dal test stesso. Per scoprirlo, hanno ripetuto esattamente le stesse 400 domande, ma questa volta hanno rimescolato l'ordine delle opzioni. Per ogni singola domanda, hanno ruotato le quattro scelte in modo che ciascuna opzione apparisse nella prima posizione, nella seconda posizione, nella terza posizione e nella quarta posizione un numero uguale di volte. Ciò significava che il contenuto della risposta non era più legato alla sua posizione sullo schermo. Quando hanno analizzato i dati di questa versione randomizzata, la specifica mappa politica che avevano trovato nel primo round si è dissolta. La netta divisione tra i "razionalisti di mercato" e gli "istituzionalisti" è crollata. I modelli differivano ancora genuinamente tra loro, e la nuova mappa di queste differenze era statisticamente affidabile, ma non formava più i due campi distinti o la pulita tipologia suggerita dal test a ordine fisso.
Lo studio ha rivelato che l'"ideologia" che avevano trovato nel primo round non era affatto un riflesso delle convinzioni dei modelli, ma era in gran parte un prodotto dell'ordine in cui le opzioni venivano stampate. I tre modelli che erano stati etichettati come "razionalisti di mercato" erano semplicemente i tre modelli con l'abitudine più forte di scegliere la primissima opzione della lista. Poiché i ricercatori avevano accidentalmente inserito le opzioni "mercato" nella prima posizione per ogni domanda, questi tre modelli le sceglievano ogni volta, creando una falsa firma politica. I ricercatori hanno calcolato che il l'apparente pregiudizio politico correla quasi perfettamente con una semplice misura di quanto un modello prediliga la prima posizione. Infatti, la specifica disposizione delle opzioni che avevano scelto per il primo test si è rivelata essere la singola disposizione più fuorviante possibile tra oltre 13.000 diversi modi in cui avrebbero potuto ordinare le risposte.
Le implicazioni di questa scoperta sono significative per chiunque si affidi a queste macchine per ricevere consigli. I ricercatori hanno scoperto che se si mantiene la domanda e le risposte esattamente uguali, ma si cambia solo l'ordine delle scelte, il modello cambia la sua raccomandazione principale il 71% delle volte. Questo è molto più alto del normale tasso di errore casuale, che era di circa il 33%. Ancora più sorprendente è che la fiducia del modello nella sua risposta è cambiata appena. Quando un modello cambiava la sua raccomandazione perché le opzioni venivano spostate, riportava di essere sicuro della sua nuova risposta tanto quanto lo era della vecchia. Ciò suggerisce che il modello non stia valutando gli argomenti, ma stia seguendo una regola meccanica basata sulla posizione.
Lo studio ha anche mostrato che questo problema non è limitato a un tipo specifico di domanda. I modelli erano altrettanto propensi a cambiare idea su difficili e contese questioni politiche quanto su quelle più semplici. In effetti, l'effetto ordine era più forte proprio dove contava di più: sulle domande in cui le opzioni erano difficili da distinguere. Questo è un comportamento noto come "satisficing" (o soddisfacimento), in cui un decisore, di fronte a una scelta difficile, utilizza la scorciatoia più facile disponibile per ottenere una risposta. Per queste macchine, la scorciatoia era scegliere il primo elemento della lista.
I ricercatori hanno concluso che misurare le inclinazioni politiche dell'intelligenza artificiale utilizzando liste di opzioni a ordine fisso è fondamentalmente errato. Un test a ordine fisso non rivela ciò che un modello pensa; rivela come il modello reagisce al layout dello schermo. Sebbene una componente residua di una genuina preferenza di contenuto sopravviva quando l'ordine viene randomizzato, essa è più debole e non forma la pulita tipologia ideologica suggerita dai test a ordine fisso. L'"ideologia" trovata negli studi precedenti potrebbe essere stata nient'altro che un artefatto statistico del modo in cui le domande sono state scritte. Per ottenere un quadro reale di ciò che questi modelli preferiscono, i ricercatori devono randomizzare l'ordine delle risposte ogni volta che pongono una domanda. Senza questo passaggio, qualsiasi affermazione sulla posizione politica di una macchina è solo un'ipotesi basata sulla lotteria delle scelte di progettazione. Lo studio funge da avvertimento: quando chiediamo alle macchine di compiere delle scelte, dobbiamo stare attenti a non scambiare l'ordine delle parole per il peso dell'argomento.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.