← Ultimi articoli
🤖 AI

Progressive Alignment of Recommender Foundation Model through Multi-Phase Post-Training

Questo articolo propone un framework di post-training progressivo in tre fasi (Linear Probing, Full Fine-Tuning e Reinforcement Fine-Tuning) che allinea efficacementamente i modelli di fondazione per la raccomandazione con le metriche di business attraverso il disaccoppiamento dell'adattamento del compito dall'ottimizzazione basata sulla ricompensa, dimostrando prestazioni superiori sia negli esperimenti offline che nei test A/B online su larga scala.

Autori originali: Oseong Choi, Hoeinn Kim, Jihoon Lee, Byungsoo Kang, Taeyeong Jang

Pubblicato 2026-08-10
📖 7 min di lettura🧠 Approfondimento

Autori originali: Oseong Choi, Hoeinn Kim, Jihoon Lee, Byungsoo Kang, Taeyeong Jang

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di entrare in una biblioteca magica e mastodontica dove i libri rispondono alle tue domande. Questa non è una biblioteca qualunque; è una biblioteca "Foundation Model". Pensa a questo modello come a un bibliotecario super intelligente e molto viaggiato, che ha letto miliardi di storie e sa esattamente come si comportano le persone mentre sfogliano gli scaffali. Questo bibliotecario ha già imparato le regole generali della narrazione e della curiosità umana. Ma ecco la parte complicata: il fatto che il bibliotecario sappia come trovare un libro non significa che sappia cosa voglia realmente il proprietario della biblioteca. Il proprietario potrebbe interessarsi a quanto tempo le persone trascorrono in biblioteca, o a quanti di loro acquistano un abbonamento, non solo a quanti libri prendono dallo scaffale.

Nel mondo dell'informatica, specificamente nei Sistemi di Raccomandazione, questa è la lotta quotidiana. Abbiamo questi enormi modelli AI pre-addestrati (i bibliotecari) che sono bravissimi a prevedere cosa potresti cliccare dopo. Ma l'azienda vuole qualcosa di più dei semplici clic; vuole un coinvolgimento profondo, come finire un'intera serie di fumetti o pagare per contenuti premium. Il problema è che i segnali per i "clic" sono ovunque ed è facile vederli, mentre i segnali per la "profonda soddisfazione" sono rari e difficili da trovare. Se provi a insegnare al bibliotecario a inseguire direttamente i segnali rari, spesso si confonde, dimentica tutto ciò che già sapeva e inizia a raccomandare cose strane. Questo articolo esplora un modo intelligente e graduale per addestrare questi bibliotecari digitali affinché non si limitino a indovinare cosa cliccherai, ma ti aiutino davvero a trovare storie che amerai nel lungo periodo.


La Danza in Tre Fasi: Come Addestrare un Bibliotecario di Raccomandazioni

I ricercatori di NAVER WEBTOON, una piattaforma gigante di fumetti digitali, si sono resi conto che cercare di insegnare tutto all'IA in una volta sola era una ricetta per il disastro. Hanno proposto un framework di "Allineamento Progressivo", che è essenzialmente un campo di addestramento in tre fasi progettato per trasformare un'IA generica in un esperto di raccomandazioni esperto di business, senza farle "friggere" il cervello.

Fase 1: Il Riscaldamento (Linear Probing)
Immagina di avere un grande chef (il Modello di Fondazione pre-addestrato) che sa cucinare qualsiasi cosa. Vuoi che prepari un piatto specifico per un nuovo ristorante, ma non vuoi che dimentichi come cucinare tutto il resto. Se gli porgi un set di coltelli e padelle completamente nuovo e casuale (i "moduli a valle") e gli dici di iniziare subito a cucinare, potrebbe andare nel panico e rovinare le sue abilità esistenti.

Quindi, il primo passo è il Linear Probing (LP). In questa fase, il cervello del grande chef è congelato: non può cambiare il suo stile di cucina fondamentale. Permetti solo che si eserciti con i nuovi coltelli e le nuove padelle. Questo aiuta i nuovi strumenti a diventare confortevoli nelle mani dello chef senza rovinare le ricette base. È come lasciare che un nuovo dipendente osservi il capo per una settimana prima di essere autorizzato a toccare i fornelli. Questo stabilizza la connessione tra la vasta conoscenza dell'IA e il compito specifico di raccomandare fumetti.

Fase 2: La Pratica Completa (Full Fine-Tuning)
Una volta che i nuovi strumenti sono stabili, è tempo di lasciare che lo chef cucini con piena libertà. Questo è il Full Fine-Tuning (FFT). Ora, l'intero modello è sbloccato. Lo chef può perfezionare il suo intero stile culinario per specializzarsi nel menu di questo specifico ristorante. Poiché i nuovi strumenti sono già stati "riscaldati" nella Fase 1, lo chef non viene sopraffatto. Può apprendere i gusti specifici dei clienti (il "compito a valle") mantenendo intatta la solida base della sua conoscenza generale. I ricercatori hanno scoperto che eseguire questo processo in due passaggi (LP poi FFT) era molto meglio che cercare di farlo in un unico grande salto, che spesso porta alla "dimenticanza catastrofica" (catastrophic forgetting), ovvero quando l'IA dimentica come essere intelligente perché è troppo impegnata a cercare di essere specifica.

Fase 3: Il Gioco del Premio (Reinforcement Fine-Tuning)
È qui che avviene la magia. Lo chef ora è bravo a cucinare il menu, ma sta cucinando ciò che il proprietario vuole davvero? Il proprietario si cura della profonda soddisfazione (come l'acquisto di un'intera stagione di fumetti), non solo di uno spuntino veloce (un singolo clic). Ma la profonda soddisfazione è rara; la maggior parte delle persone sta solo navigando.

Se provi a insegnare allo chef di puntare solo alle rare vittorie della "profonda soddisfazione", potrebbe iniziare a tirare a indovinare selvaggiamente. Inveve, i ricercatori hanno utilizzato un Modello di Ricompensa (Reward Model). Immaginatelo come un assaggiatore che ha una scheda di valutazione speciale. L'assaggiatore osserva le rare interazioni profonde e assegna un "punteggio di ricompensa" a queste.

Nella terza fase, il Reinforcement Fine-Tuning (RFT), lo chef non cucina solo per compiacere la folla; cucina per compiacere il punteggio dell'assaggiatore. L'IA genera una serie di raccomandazioni, l'assaggiatore (il Modello di Ricompensa) assegna loro dei punteggi in base a quanto è probabile che portino a un coinvolgimento profondo, e l'IA impara ad aggiustare la sua strategia per ottenere punteggi più alti. Fondamentalmente, l'IA utilizza ancora i segnali "densi" (come i clic) che ha appreso nella Fase 2 per sapere cosa raccomandare, ma i segnali di "ricompensa" guidano il come classificarli per massimizzare la felicità a lungo termine.

Cosa Hanno Trovato (e Cosa Hanno Detto "No")

Il team ha testato questo metodo in tre fasi su un enorme dataset di reali interazioni degli utenti dalla loro piattaforma Webtoon. Hanno confrontato il loro nuovo metodo con i vecchi modi di fare le cose.

La lista dei "Non Fare Questo":
Il documento argomenta esplicitamente contro due comuni scorciatoie:

  1. Non addestrare l'IA direttamente sugli obiettivi di business rari. Se provi a insegnare all'IA a ottimizzare direttamente per il "completamento dei contenuti a pagamento" fin dall'inizio, essa fallisce nel generalizzare. È come cercare di insegnare a uno studente a risolvere problemi avanzati di calcolo prima che abbia imparato la moltiplicazione. I segnali sono troppo scarsi (troppo rari) e il modello si perde.
  2. Non usare il Modello di Ricompensa direttamente come il raccomandatore finale. I ricercatori hanno provato a usare l'assaggiatore (il Modello di Ricomparda) direttamente come colui che distribuisce le raccomandazioni. Sebbene questo modello fosse bravo a individuare il coinvolgimento profondo, era terribile nel classificare i milioni di fumetti disponibili per un clic. Mancava della "capacità di discriminazione" necessaria per scegliere l'elemento migliore da una lista enorme. Il documento suggerisce che il Modello di Ricompensa è meglio usato come un allenatore, non come il giocatore.

La Strategia Vincente:
L' "Allineamento Progressivo" (LP → FFT → RFT) è stato il migliore.

  • Test Offline: Quando hanno eseguito simulazioni su dati storici, il modello a tre fasi ha battuto i modelli a singola fase. Nello specifico, la versione che utilizzava GRPO (un tipo specifico di algoritmo di apprendimento per rinforzo) con il modello di ricompensa appreso ha ottenuto i punteggi più alti. È riuscito a mantenere gli alti tassi di clic (Rank NDCG) pur spingendo gli utenti più a fondo nel funnel dei contenuti (Funnel NDCG).
  • Prova nel Mondo Reale: Non si sono fermati alle simulazioni. Hanno eseguito un massiccio test A/B sulla loro piattaforma live. Hanno confrontato la loro nuova IA con il loro standard non-foundation model. I risultati hanno mostato che il loro nuovo framework migliorava costantemente il coinvolgimento degli utenti. La versione "GRPO con Modello di Ricompensa" è stata particolarmente efficace nel far leggere agli utenti contenuti più lunghi e nel farli raggiungere gli episodi a pagamento, mentre la versione "DPO" (un altro algoritmo) è stata leggermente migliore nel generare il clic iniziale.

La Conclusione

Il documento suggerisce che il segreto per creare potenti sistemi di raccomandazione basati su IA non è solo dare loro più dati o cercare di ottimizzare immediatamente l'obiettivo più difficile. Si tratta di fasi. Prima, stabilizzare i nuovi strumenti. Secondo, specializzare il modello. Terzo, usare un segnale di "ricompensa" appreso per guidare delicatamente il modello verso gli obiettivi di business a lungo termine senza perdere la capacità di fare scelte immediate valide.

Separando l' "apprendimento del compito" dall' "allineamento con gli obiettivi di business", i ricercatori hanno trovato un modo per rendere la loro IA sia intelligente che redditizia. È un promemoria del fatto che, a volte, per ottenere il miglior risultato, bisogna procedere lentamente, un passo alla volta, invece di cercare di correre verso il traguardo.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →