Instruction-Tuned Language Models Cannot Sample from Distributions They Can Describe
Questo articolo rivela che i modelli linguistici sottoposti a istruzione falliscono nel campionare realmente dalle distribuzioni di risposta, collassando invece verso output deterministici a causa dell'addestramento all'allineamento, ma sono in grado di descrivere accuratamente tali distribuzioni in una singola chiamata, un divario "CONOSCE/FA" che consente una simulazione significativamente più accurata dei dati di sondaggi umani attraverso la descrizione della distribuzione o la perturbazione del prompt.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina di cercare di prevedere il futuro facendo un milione di domande a una palla di cristallo. Nel mondo dell'intelligenza artificiale, gli scienziati hanno iniziato a usare i "Large Language Models" (LLM) come quella palla di cristallo. Invece di chiedere alle persone reali cosa ne pensano della politica, dei film o dell'economia, i ricercatori chiedono all'IA di fingere di essere diversi tipi di persone — come un "adolescente dell'Ohio" o un "insegnante in pensione della Florida". Questo si chiama "silicon sampling" (campionamento di silicio). L'idea è semplice: se chiedi all'IA di interpretare mille persone diverse, dovrebbe darti mille risposte diverse, proprio come farebbe una folla reale. Contando tutte quelle risposte, puoi indovinare cosa pensa l'intera popolazione. È come cercare di indovinare il gusto di una gigantesca gelateria assaggiando una pallina da ogni singolo cliente.
Ma ecco il problema: affinché questo funzioni, l'IA deve essere in grado di "lanciare i dadi" ogni volta che poni una domanda. Se chiedi a un vero adolescente: "Ti piace la pizza?", lui potrebbe rispondere "Sì" oggi e "No" domani, o magari li lancia semplicemente una moneta nella sua testa. L'IA dovrebbe fare lo stesso, generando una risposta fresca e casuale ogni volta che clicchi "invia". Se l'IA non riesce effettivamente a lanciare i dadi — se rimane bloccata su una singola risposta non importa quante volte la interroghi — l'intero esperimento fallisce. Non puoi indovinare il gusto della gelateria se il primo cliente che interroghi dice "Cioccolato" e l'IA costringe tutti i successivi 999 clienti a dire "Cioccolato" anch'essi.
È esattamente ciò che un team di ricercatori del KAIST ha scoperto. Hanno scoperto che i modelli di IA che usiamo oggi hanno un bizzarro difetto: sono terribili nel realizzare un vero campionamento casuale, anche se sono eccellenti nel descriverti com'è fatta una distribuzione casuale. È come un mago che sa descrivere perfettamente come si mescola un mazzo di carte ma, quando gli viene chiesto di estrarre una carta a caso, estrae sempre l'Asso di Picche.
I ricercatori hanno chiamato questo fenomeno lo "split KNOWS/DOES" (conoscere/fare). Il modello CONOSCE la risposta. Se gli chiedi: "Quale percentuale di persone preferisce l'opzione A rispetto all'opzione B?", può fornire la matematica perfetta e accurata. Ma il modello non sa come FARLO (non sa agire di conseguenza). Se gli chiedi di fingere di essere una persona e dare una singola risposta, il sistema collassa. Invece di fornire una varietà di risposte, si blocca su una singola risposta ripetitiva.
Per dimostrarlo, gli scienziati hanno eseguito una serie di test. Chiesero all'IA di scegliere un numero casuale tra 1 e 100. Ti aspetteresti che le risposte fossero sparse ovunque. Invezione, l'IA ha scelto il numero 42 nel 78% dei tentativi! Quando chiesero di scegliere tra due opzioni con una ripartizione 70/30, l'IA non diede un mix; scelse l'opzione al 70% ogni singola volta. Era come se l'IA avesse un dado interno rotto e incollato su un lato.
Il team ha anche capito perché accade questo. Hanno confrontato le versioni "intelligenti" di questi modelli di IA (che sono state addestrate per seguire le istruzioni ed essere utili) con le loro versioni "grezze" (che non sono ancora state insegnate come chattare). I modelli grezzi erano molto più bravi a lanciare i dadi. I modelli "intelligenti", invece, erano stati addestrati per essere così coerenti e utili da aver perso la capacità di essere casuali. È un effetto collaterale del tentativo di rendere l'IA uno studente modello: ha imparato a dare sempre la risposta "giusta", anche quando il compito era essere casuale.
Quindi, cosa possiamo fare se abbiamo bisogno di usare questi modelli di IA per dei sondaggi? I ricercatori hanno scoperto due trucchi astuti.
In primo luogo, se vuoi solo conoscere l'opinione generale di una folla (la "stima della popolazione"), non chiedere all'IA di fingere di essere 100 persone diverse. Invezione, chiedi all'IA una sola domanda: "Se chiedessi a 100 persone questa domanda, quale sarebbe il risultato?". L'IA è bravissima nel descrivere la distribuzione. Quando hanno provato questo "Percorso di Descrizione" (Describe Pathway), l'errore nelle loro previsioni è diminuito di oltre la metà rispetto al vecchio metodo di chiedere all'IA di fingere di essere molte persone.
In secondo luogo, se hai davvero bisogno che l'IA ti dia 100 risposte individuali diverse (magari per un videogioco dove ogni personaggio deve avere una personalità unica), non puoi semplicemente porre la stessa domanda 100 volte. L'IA si ripeterà. Invezione, i ricercatori hanno inventato un metodo chiamato "Prompt-Perturbed Argyle" (PPA). Questo consiste nel cambiare leggermente il modo in cui poni la domanda ogni singola volta — come cambiare l'ordine delle opzioni di risposta, cambiare la formulazione della domanda o spostare la posizione della descrizione del "personaggio". Questi piccoli cambiamenti sono sufficienti per "scuotere" il dado rotto dell'IA, costringendola a dare una risposta diversa ogni volta. Questo semplice trucco ha ridotto l'errore del 21% senza costi aggiuntivi in termini di denaro o tempo.
In breve, il documento afferma che, sebbene l'IA sia incredibile nel descrivere come funziona il mondo, attualmente è terribile nel fingere di essere una persona casuale nel mondo. Ma comprendendo questa particolarità, possiamo comunque usare questi potenti strumenti per ottenere buone risposte, dobbiamo solo imparare a porre le domande nel modo giusto.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.