← Ultimi articoli
💬 NLP

Before You Poll with LLMs: A Deliberative Diagnostic Framework

Questo articolo introduce il Deliberative Polling Diagnostic Framework per rivelare che gli attuali LLM all'avanguardia non riescono a imitare l'aggiornamento delle credenze umane durante la deliberazione, mostrando invece distorsioni uniche e specifiche dell'identità, come l'inversione di opinione, l'overshooting o la rigidità, guidate da un fenomeno denominato "signature self-sycophancy".

Autori originali: Ahmed Wali, Hassaan Tayyab

Pubblicato 2026-09-15
📖 5 min di lettura🧠 Approfondimento

Autori originali: Ahmed Wali, Hassaan Tayyab

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immaginate un mondo in cui governi, aziende e ricercatori non debbano più spendere mesi e milioni di dollari in sondaggi su persone reali per comprendere l'opinione pubblica. Invece, potrebbero chiedere a un programma informatico di simulare migliaia di diversi cittadini, presentare a quelle persone digitali nuovi argomenti e osservare come cambiano le loro menti. Questa pratica, nota come campionamento di silicio, è cresciuta rapidamente perché è veloce, economica e scalabile. La speranza è che questi agenti artificiali possano imitare il ragionamento umano abbastanza bene da prevedere come le persone reali reagiranno alle nuove informazioni. Tuttavia, rimane una domanda critica senza risposta: questi programmi informatici pensano davvero e aggiornano le proprie convinzioni come fanno gli esseri umani, o stanno semplicemente recuperando opinioni pre-scritte da una vasta biblioteca di dati? Se la seconda ipotesi fosse vera, allora usarli per testare come le persone potrebbero cambiare idea potrebbe portare a conclusioni pericolosamente errate.

Ricercatori della Lahore University of Management Sciences si sono posti l'obiettivo di rispondere a questa domanda creando un nuovo modo per testare l'intelligenza artificiale. Si sono concentrati su un comportamento umano specifico chiamato deliberazione, ovvero il processo di cambiare idea dopo aver ascoltato argomenti equilibrati. Nel mondo reale, quando le persone di schieramenti politici opposti ascoltano informazioni imparziali l'una sull'altra, tendono a diventare meno ostili e più aperte mentalmente. I ricercatori volevano vedere se i modelli informatici potessero replicare questo specifico cambiamento. Hanno preso i dati da un famoso evento del mondo reale chiamato "America in One Room", dove 526 veri elettori sono stati riuniti per discutere di politica, e hanno usato quel dato come base di confronto. Hanno poi chiesto a cinque dei modelli informatici più avanzati disponibili di simulare quegli stessi elettori, fornendo loro esattamente le stesse informazioni e ponendo le stesse domande prima e dopo la sessione informativa.

I risultati hanno rivelato una verità sorprendente: nessuno dei modelli informatici si comportava come gli esseri umani reali. Invece di aggiornare le proprie convinzioni in modo realistico, ogni singolo modello falliva, ma ognuno falliva in modo unico e strano. Uno dei modelli più potenti, GPT-5.1, ha fatto l'esatto opposto di ciò che fanno gli umani. Quando presentato con informazioni equilibrate sul partito politico opposto, i veri elettori sono diventati più amichevoli e meno ostili. Le persone digitali, invece, sono diventate significativamente più ostili, come se la nuova informazione le avesse rese più arrabbiate. Questo è un fenomeno che i ricercatori chiamano inversione, dove il modello si muove nella direzione sbagliata.

Altri modelli non hanno invertito la direzione, ma sono andati troppo oltre. Modelli come Gemini, Claude e Llama si sono mossi nella direzione corretta, diventando meno ostili dopo aver ascoltato gli argomenti, ma hanno cambiato idea cinque o sette volte più di quanto farebbe un essere umano. Era come se fossero troppo desiderosi di essere persuasi, oscillando le loro opinioni selvaggiamente al minimo stimolo. Un quarto modello, DeepSeek, si è rifiutato di cambiare affatto, mostrando quasi nessun cambiamento di opinione indipendentemente dalle informazioni fornite. Questa rigidità significava che agiva come se i nuovi argomenti non avessero alcun effetto.

I ricercatori hanno scavato più a fondo per capire perché questi fallimenti fossero avvenuti. Hanno scoperto che i problemi non erano casuali; venivano innescati specificamente da domande sull'identità politica. Quando i modelli venivano interrogati su dettagli di politica, si comportavano ragionevolmente bene. Ma quando le domande toccavano il modo in cui una parte vedeva l'altra, i modelli entravano in crisi. Le persone digitali sembravano interpretare uno stereotipo piuttosto che ragionare attraverso i nuovi fatti. I ricercatori hanno chiamato questo comportamento auto-sycophancy (auto-adulazione). È una forma di compiacimento in cui il modello concorda con l'idea interna di ciò che un certo tipo di persona dovrebbe credere, invece di ascoltare le informazioni presentate. Per esempio, se il modello gli veniva ordinato di agire come un Repubblicano, assumeva che un Repubblicano dovesse odiare il partito opposto, e restava fedele a tale supposizione anche quando l'evidenza suggeriva il contrario.

Questo comportamento è distinto dal tipo di pregiudizio in cui un computer cerca di compiacere un utente umano. Qui, il computer sta compiacendo il proprio script interno. Lo studio ha dimostrato che questo fallimento è selettivo e simmetrico: lo stesso modello agirebbe con ostilità verso il partito opposto, ma sarebbe eccessivamente amichevole verso il proprio, a seconda della domanda. Ciò suggerisce che i modelli non stiano simulando un processo di pensiero, ma stiano invece recuperando atteggiamenti pre-confezionati associati alle etichette politiche. I ricercatori hanno testato questo aspetto scambiando le etichette politiche nei loro prompt e hanno scoperto che le reazioni dei modelli cambiavano istantaneamente, confermando che stavano reagendo all'etichetta piuttosto che alla logica dell'argomento.

Le implicazioni di queste scoperte sono significative per chiunque si affidi alle simulazioni informatiche per comprendere la società. Se un modello inverte la direzione, potrebbe convincere un decisore politico che una discussione pubblica renderà le persone più arrabbiate, quando in realtà la renderebbe più calme. Se un modello eccede, potrebbe esagerare il potere di una campagna educativa, portando a uno spreco di risorse. Se un modello è rigido, potrebbe suggerire che nessuna quantità di informazione può cambiare l'idea di una persona, minando il concetto stesso di dibattito pubblico. I ricercatori concludono che, prima di fidarsi di qualsiasi modello informatico per simulare come le persone cambiano idea, dobbiamo prima eseguire un test diagnostico per vedere se il modello è effettivamente in grado di ragionare attraverso nuove informazioni o se sta solo recitando stereotipi. Senza questo controllo, la velocità e la scala del campionamento di silicio potrebbero portarci a credere di comprendere la natura umana, quando in realtà stiamo solo vedendo un riflesso distorto dei nostri stessi pregiudizi.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →