← Ultimi articoli
💬 NLP

Value Drifts: Tracing Value Alignment During LLM Post-Training

Questo articolo investiga la dinamica dell'allineamento dei valori durante il post-training dei modelli linguistici di grandi dimensioni (LLM), rivelando che il fine-tuning supervisionato stabilisce principalmente i valori di un modello, mentre la successiva ottimizzazione delle preferenze raramente li riallinea, con algoritmi differenti che producono risultati distinti anche su dataset identici.

Autori originali: Mehar Bhatia, Shravan Nayak, Gaurav Kamath, Marius Mosbach, Karolina Stańczak, Vered Shwartz, Siva Reddy

Pubblicato 2026-07-16
📖 5 min di lettura🧠 Approfondimento

Autori originali: Mehar Bhatia, Shravan Nayak, Gaurav Kamath, Marius Mosbach, Karolina Stańczak, Vered Shwartz, Siva Reddy

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di avere un robot nuovissimo e super intelligente che ha letto quasi tutto su internet. Conosce i fatti, sa scrivere poesie e risolvere problemi di matematica. Ma in questo momento, è un po' come una tabula rasa per quanto riguarda le opinioni. Se gli chiedi: "È meglio salvare il pianeta o fare soldi velocemente?", potrebbe limitarsi a elencare fatti senza prendere una posizione. Per rendere questo robot utile e sicuro per gli essini umani, dobbiamo insegnargli come pensare a queste domande difficili. Questo processo è chiamato "allineamento".

Pensa all'allineamento come all'addestramento di un cucciolo. Prima, gli insegni i comandi base come "siediti" e "resta" (questo si chiama Fine-Tuning Supervisionato, o SFT). Gli mostri esempi di buon comportamento così impara le regole. Poi, lo porti al parco cani per giocare con altri cani e imparare le regole sociali, premiandolo quando gioca bene e rimproverandolo quando morde (questo si chiama Ottimizzazione delle Preferenze). La grande domanda che gli scienziati si sono posti è: quando il cucciolo acquisisce davvero la sua personalità? La apprende durante l'addestramento di base o la ottiene al parco cani? Capire questo è fondamentale perché, se non sappiamo da dove derivano i valori del robot, potremmo accidentalmente insegnargli a essere maleducato, prevenuto o pericoloso senza rendercene conto.

Questo articolo, intitolato "Value Drifts", va dietro le quinte di questo processo di addestramento per osservare esattamente quando e come i grandi modelli linguistici (LLM) imparano i loro valori. I ricercatori hanno trattato il processo di addestramento come un video in time-lapse, controllando le "opinioni" del robot ad ogni singolo passaggio, invece di guardare solo il prodotto finito alla fine.

Ecco cosa hanno scoperto, e potrebbe sorprendervi:

1. La prima lezione è la più importante
Lo studio ha scoperto che la fase di "Fine-Tuning Supervisionato" (SFT) è il momento in cui il robot acquisisce effettivamente la sua personalità. È come il momento in cui il cucciolo impara a sedersi; una volta fatto, il comportamento fondamentale è stabilito. I ricercatori hanno scoperto che non appena il modello ha iniziato l'addestramento su dataset di istruzioni, la sua posizione su grandi temi (come l'immigrazione o il cambiamento climatico) è cambiata drasticamente e rapidamente. Se i dati di addestramento erano pieni di risposte neutrali, del tipo "non sono sicuro", il robot diventava neutrale. Se i dati erano pieni di risposte di supporto, del tipo "Sì, facciamolo!", il robot diventava di supporto. Questa "impronta dei valori" è avvenuta molto presto nel processo, spesso entro i primi centinaia di passaggi dell'addestramento.

2. Il parco cani non cambia molto
Dopo l'addestramento iniziale, i modelli sono passati attraverso l' "Ottimizzazione delle Preferenze" (la fase del parco cani), dove venivano mostrate coppie di risposte e veniva detto loro quale preferissero gli umani. I ricercatori si aspettavano che questa fase modificasse i valori del robot, magari rendendolo un po' più educato o un po' più utile. Ma hanno scoperto che, per la maggior parte, questa fase non ha fatto quasi nulla per cambiare i valori stabiliti nel primo passaggio. Le opinioni del robot sono rimaste esattamente dove erano state lasciate dalla prima fase di addestramento.

3. Perché il parco cani è fallito (e come ripararlo)
Perché la seconda fase non ha cambiato nulla? Il team si è reso conto che era perché i "premi" dell'addestramento (i dataset di preferenza) erano troppo simili. Nei dataset standard utilizzati, la risposta "buona" e quella "cattiva" erano spesso diverse solo nello stile (una era più lunga, l'altra più corta) ma avevano esattamente la stessa opinione. È come cercare di insegnare a un cane di riportare una pallina mostrandogli due bastoni identici e dicendo: "Scegli il bastone migliore". Il cane non può imparare un nuovo trucco se le opzioni sono le stesse.

Tuttavia, i ricercatori hanno dimostto che se si dà al robot una scelta chiara — mostrando un risposta che sostiene un valore e un'altra che lo si oppone fortemente — il robot può cambiare idea. Ma il modo in cui cambia dipende dall'algoritmo specifico utilizzato per insegnarglielo. Alcuni algoritmi (come DPO) sono come insegnanti testardi che si limitano a rinforzare ciò che il robot crede già, mentre altri (come SIMPO) sono più cauti e apportano cambiamenti più piccoli e lenti.

Il punto fondamentale
L'articolo suggerisce che, se vogliamo che l'IA abbia valori specifici, non possiamo fare affidamento sulla fase finale di "preferenza" per sistemare le cose. Il lavoro pesante avviene durante l'addestramento iniziale sulle istruzioni. Se vogliamo un'IA che sia neutrale su temi sensibili, dobbiamo assicurarci che l'addestramento iniziale sia neutrale. Se vogliamo che sia di supporto, i dati iniziali devono essere di supporto. La fase finale di rifinitura serve principalmente per lo stile, non per cambiare l'anima del robot. Questa è una scoperta enorme perché ci dice che la parte più critica della costruzione di un'IA sicura è la cura del primissimo set di esempi che le mostriamo, non solo l'ultimo giro di feedback.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →