← Ultimi articoli
🤖 machine learning

Synthetic Persona Pretraining: Alignment from Token Zero

Questo articolo introduce la Synthetic Persona Pretraining (SPP), un metodo che incorpora riflessioni in prima persona allineate ai valori direttamente nella fase di pre-addestramento per installare un determinato persona di assistente dal primo token, dimostrando che tale intervento precoce migliora significativamente l'aderenza alla costituzione, la robustezza contro i jailbreak e l'allineamento morale rispetto agli approcci di allineamento post-addestramento.

Autori originali: Julian Minder, Viktor Moskvoretskii, Raghav Singhal, Difan Jiao, Andy Arditi, Shaobo Cui, Yiderigun Borjigin, Kartik Bali, Stefan Krsteski, Harsh Raj, Huu Nguyen, Jannik Brinkmann, Ashton Anderson, Ro
Pubblicato 2026-08-14
📖 7 min di lettura🧠 Approfondimento

Autori originali: Julian Minder, Viktor Moskvoretskii, Raghav Singhal, Difan Jiao, Andy Arditi, Shaobo Cui, Yiderigun Borjigin, Kartik Bali, Stefan Krsteski, Harsh Raj, Huu Nguyen, Jannik Brinkmann, Ashton Anderson, Roland Aydin, Robert West

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di crescere un bambino. Potresti aspettare che diventi un adolescente, sederti con lui e dirgli: "Ok, ora che sai parlare, ecco le regole: sii gentile, dì la verità e non ferire le persone". Oppure, potresti iniziare a insegnare quei valori fin dal primo termine che impara a pronunciare, intrecciandoli in ogni storia che gli racconti mentre cresce. Questo è il dilemma fondamentale che affrontano gli scienziati che costruiscono l'intelligenza artificiale.

I modelli di IA sono come bambini digitali che imparano leggendo miliardi di pagine di testo da internet. Questa fase iniziale di apprendimento è chiamata "pre-addestramento" (pretraining). Durante questo tempo, l'IA assorbe fatti, stili di scrittura e il modo in cui gli esseri umani si parlano tra loro. Tuttavia, le "regole" per essere un assistente utile e sicuro vengono solitamente aggiunte dopo questa massiccia fase di apprendimento, in un passaggio separato chiamato "post-addestramento" (post-training). Il problema è che, quando l'IA ha finito di leggere internet, ha già formato una personalità basata su ciò che ha trovato lì. Cercare di imporre nuove regole a una personalità già formata è come cercare di insegnare a un adolescente a essere educato dopo che ha già imparato a essere maleducato; spesso sembra uno strato sottile di vernice sopra un muro disordinato, e le vecchie abitudini possono facilmente emergere.

Questo articolo, intitolato "Synthetic Persona Pretraining: Alignment from Token Zero", suggerisce un modo diverso di crescere i nostri figli artificiali. I ricercatori propongono di installare la personalità e i valori desiderati fin dal primissimo momento di addestramento — quello che chiamano "token zero". Invece di aspettare per correggere l'IA in seguito, vogliono costruire il "buon assistente" nel suo cervello mentre sta ancora imparando a parlare.

L'Esperimento: Crescere un Bambino Digitale con una Costituzione

I ricercatori, un team dell'EPFL e di varie università, hanno deciso di testare questa idea di "Model Raising" (Crescita del Modello). Hanno creato un nuovo metodo chiamato Synthetic Persona Pretraining (SPoP). Ecco come l'hanno fatto, usando un'analogia semplice:

Immagina che l'IA stia imparando a leggere una biblioteca di libri. Nel vecchio metodo, l'IA legge semplicemente i libri. Nel nuovo metodo, i ricercatori hanno preso circa il 10% di quei libri e hanno aggiunto una speciale "nuvoletta di pensiero" dopo ogni pochi paragrafi. All'interno di questa nuvoletta, la futura personalità dell'IA (chiamiamola "Cato") farebbe una pausa e rifletterebbe su ciò che ha appena letto, dicendo cose come: "Hmm, questa storia su un crimine è triste, e le mie regole dicono che non dovrei mai incoraggiare la violenza", oppure "Questo manuale tecnico è noioso ma utile".

Non si sono limitati ad aggiungere questi pensieri; hanno fatto in modo che l'IA imparasse a generarli. Hanno addestrato il modello sia sul testo originale che su questi nuovi pensieri di "riflessione". Lo hanno fatto in due modi:

  1. Token Zero (L'approccio "Dalla Nascita"): Hanno seminato questi pensieri di riflessione durante l'intero processo di addestramento, dal primo secondo fino all'ultimo.
  2. Midtraining (L'approccio "Adolescente"): Hanno aspettato che l'IA avesse già letto la maggior parte dei libri e hanno aggiunto le riflessioni solo alla fine della fase di addestramento.

Avevano anche un gruppo di controllo che leggeva i libri normalmente (Vanilla) e uno in cui i libri "cattivi" erano stati rimossi ma senza riflessioni (Filtered).

Cosa Hanno Scoperto: Il Potere di Iniziare Presto

I risultati sono stati affascinanti e hanno suggerito che quando insegni all'IA conta tanto quanto cosa le insegni.

1. L'IA "Dalla Nascita" era più intelligente riguardo ai valori.
I modelli addestrati con le riflessioni fin dall'inizio (Token Zero) erano molto più bravi a seguire la loro "Costituzione" (un insieme di regole che dovevano seguire). Quando i ricercatori li hanno testati su dilemmi morali complicati — situazioni che l'IA non aveva mai visto prima — i modelli Token Zero facevano scelte che sembravano più allineate alle regole. Non si limitavano a memorizzare le regole; sembravano comprendere lo spirito delle stesse.

  • I numeri: In un test chiamato "ConstitutionEval", i modelli Token Zero hanno ottenuto circa il 67% di risposte corrette, mentre i modelli che hanno ricevuto le riflessioni solo alla fine (Midtraining) hanno ottenuto solo circa il 56%.
  • La sorpresa: I modelli Token Zero hanno effettivamente cambiato le loro priorità. Hanno iniziato a dare molta più importanza a "Veridicità" e "Giustizia" rispetto agli altri modelli, che preferivano "Creatività" e "Apprendimento". Questo suggerisce che iniziare presto non ha solo aggiunto regole; ha rimodellato il modo in cui l'IA pensa al mondo.

2. L'approccio "Adolescente" andava bene per alcune cose, ma non per tutte.
Interessante è che, se l'obiettivo era solo impedire all'IA di essere "jailbroken" (ovvero ingannata per fare cose cattive), l'approccio Midtraining funzionava quasi altrettanto bene del Token Zero. Sembra che per i semplici riflessi di tipo "non farlo", si possa insegnare tardi. Ma per un ragionamento morale profondo e complesso, è davvero necessario partire dal primo giorno.

3. Cervelli più grandi, guadagni maggiori.
I ricercatori hanno testato questo approccio su due dimensioni di IA: una più piccola (1,7 miliardi di parametri) e una più grande (3 miliardi di parametri). Hanno scoperto che il vantaggio di iniziare presto diventava ancora più importante man mano che l'IA diventava più grande e intelligente. Nei test più difficili, il divario tra l'IA "Dalla Nascita" e l'IA "Adolescente" è raddoppiato con la scala di crescita. Questo suggerisce che per le enormi IA super-intelligenti del futuro, iniziare con i giusti valori sarà ancora più critico.

4. La "Colla" è importante.
C'era un intoppo. I ricercatori hanno scoperto che questi valori precoci restavano solidi solo se l'ultima fase di addestramento (dove l'IA impara a chattare con gli umani) corrispondeva alla personalità costruita in precedenza. Hanno chiamato questo fenomeno "persona binding" (legame della personalità). Se addestravano l'IA per essere un certo tipo di assistente durante la fase di lettura, ma poi le insegnavano a essere un tipo di assistente totalmente diverso durante la fase di chat, i valori iniziali iniziavano a svanire. È come insegnare a un bambino a essere un medico, ma poi mandarlo a una scuola d'arte; potrebbe dimenticare le regole mediche. Tuttavia, quando la "colla" teneva, i valori erano sorprendentemente forti, sopravvivendo anche quando i ricercatori cercavano di romperli con test complicati.

Perché Questo è Importante

Questo articolo suggerisce che potremmo commettere un errore cercando di "correggere" l'IA dopo che ha già imparato tutto da internet. Gli autori sostengono che i valori sono difficili da aggiungere a un prodotto finito. Inveve, dovremmo "crescere" l'IA con i giusti valori fin dal primo token che elabora.

Sebbene i risultati siano promettenti, i ricercatori avvertono che questo è solo l'inizio. Hanno testato questo metodo su modelli relativamente piccoli (3 miliardi di parametri) rispetto ai modelli massicci utilizzati dalle grandi aziende tecnologiche odierne. Suggeriscono che, man mano che costruiremo modelli più grandi e intelligenti, il beneficio di iniziare con i giusti valori fin da subito diventerà probabilmente ancora più potente. Hanno anche notato che, sebbene i valori precoci fossero forti, potevano comunque essere indeboliti da certi tipi di addestramento successivo, il che significa che dobbiamo comunque prestare attenzione a come completiamo la crescita dei nostri figli digitali.

In breve, se vogliamo un'IA che sia davvero sicura e utile, non dovremmo aspettare che sia cresciuta per insegnarle il bene e il male. Dobbiamo insegnarglielo mentre sta ancora imparando a parlare.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →