CADET: Context-Conditioned Ads CTR Prediction With a Decoder-Only Transformer
Questo articolo presenta CADET, un decoder-only transformer condizionato dal contesto implementato in LinkedIn che supera le sfide chiave nella previsione del CTR degli annunci attraverso innovazioni come la modellazione post-scoring multi-tower e l'attenzione auto-gated, ottenendo un incremento del CTR dell'11,04% rispetto alla baseline in produzione.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina di camminare attraverso un enorme e frenetico mercato digitale. Ogni secondo, migliaia di insegne digitali lampeggiano, cercando di catturare la tua attenzione. Alcune insegne sono per scarpe, altre per offerte di lavoro e altre ancora per il caffè. Le persone che gestiscono questo mercato hanno un compito complicato: devono indovinare a quale insegna ti fermerai a guardare prima ancora che tu la veda. Questo gioco di indovini è chiamato previsione del "Click-Through Rate" (CTR). Per molto tempo, i migliori indovini sono stati come contabili super intelligenti che guardavano un elenco delle tue abitudini passate e i dettagli dell'insegna per fare un calcolo. Ma recentemente, un nuovo tipo di IA "generativa" ha iniziato a comparire in altre aree, come la raccomandazione di film o canzoni. Queste nuove IA sono come narratori; invece di limitarsi a elaborare numeri, leggono un'intera storia di ciò che hai fatto in precedenza e prevedono cosa accadrà dopo. La grande domanda per i proprietari del mercato era: possiamo usare questa nuova IA "narratrice" per indovinare su quali annunci cliccherai, anche quando le regole del gioco cambiano dopo che l'indovino è stato fatto?
Questo è esattamente ciò che il team di LinkedIn si è proposto di risolvere con il loro nuovo sistema, chiamato CADET. Hanno costruito un "decoder-only transformer", un modo elaborato per dire che hanno creato un'IA che legge una sequenza di eventi (come i tuoi clic e le tue visualizzazioni passate) e prevede il futuro in un unico passaggio fluido. Ma gli annunci sono complicati. A differenza della raccomandazione di un film, il successo di un annuncio spesso dipende da cose che non sono note finché non avviene qualcosa dopo che l'IA ha fatto la sua previsione — come l'esatta posizione dell'annuncio sullo schermo. Se l'IA sbaglia perché non sapeva che l'annuncio sarebbe finito in fondo alla pagina invece che in alto, l'intero sistema si confonde.
I ricercatori hanno scoperto che, fornendo alla loro IA un set speciale di strumenti, potevano risolvere questo enigma. Hanno insegnato al modello a immaginare diversi scenari "cosa succederebbe se" per quanto riguarda la posizione dell'annuncio, e hanno costruito un meccanismo di "auto-gating" che agisce come un buttafuori, impedendo all'IA di distrarsi con informazioni rumorose o confuse. Hanno anche dato all'IA un senso speciale del tempo, permettendole di capire che un clic di cinque minuti fa è diverso da un clic di cinque mesi fa. Soprattutto, si sono assicurati che l'IA non usasse informazioni che non avrebbe nel mondo reale durante l'addestramento. Quando hanno testato questo nuovo sistema nel reale mercato di LinkedIn, non ha solo funzionato; ha performato significativamente meglio dei vecchi e complessi sistemi che hanno sostituito. La nuova IA suggeriva che gli utenti avevano l'11,04% di probabilità in più di cliccare sugli annunci, dimostrando che un approccio unificato e narrativo può superare il vecchio sistema multi-parte.
La Storia di CADET: Un Narratore per gli Annunci
Quindi, come l'hanno costruito? Analizziamo la magia di CADET (Context-Conditioned Ads Decoder-Only Transformer) attraverso concetti semplici e quotidiani.
Il Problema dell'Uovo e della Gallina
Immagina di essere uno chef che cerca di indovinare quanto un cliente apprezzerà un pasto. Ma ecco il trucco: devi indovinare il gradimento prima di sapere dove si trova il tavolo. Se il tavolo è proprio accanto alla cucina, il cliente potrebbe essere affamato ed entusiasta. Se è in un angolo buio, potrebbe essere scontroso. Nel mondo degli annunci, il "tavolo" è la posizione dell'annuncio sullo schermo. L'IA deve prevedere se cliccherai un annuncio, ma non sa ancora se quell'annuncio sarà in cima alla pagina (dove tutti lo vedono) o proprio in fondo. Questo è il problema dell'uovo e della gallina: la previsione dipende dalla posizione, ma la posizione dipende dalla previsione.
CADET risolve questo problema essendo un maestro degli scenari "cosa succederebbe se". Inveve di fare una singola ipotesi, ha molteplici "teste di previsione" (pensa a diversi chef in cucina). Uno chef indovina: "Se questo annuncio è in alto, cliccherai?". Un altro chef indovina: "Se è in fondo, cliccherai?". Il modello impara a produrre tutte queste risposte contemporaneamente. Quando l'annuncio viene effettivamente posizionato, il sistema sceglie semplicemente la risposta dello chef che aveva ragione sulla posizione. In questo modo, l'IA non viene mai confusa dal mistero di dove finirà l'annuncio.
Il Buttafuori (Self-Gated Attention)
In una stanza affollata, a volte una persona rumorosa sovrasta tutte le altre. Nell'IA, questo è chiamato "attention sink" (pozzo di attenzione), dove il modello si concentra troppo su un singolo token (un pezzo di dato) e ignora il resto, portando a previsioni errate. I ricercatori hanno dotato CADET di un "buttafuori" chiamato meccanismo di attenzione auto-gated (self-gated attention).
Pensa al cervello dell'IA come a un corridoio trafficato. Ogni volta che un pezzo di informazione tenta di passare, il buttafuori la controlla. Se l'informazione è rumorosa o poco utile, il buttafuori ne abbassa le luci (la limita tramite gating) affinché non distragga il modello. Se l'informazione è importante, il buttafuori la lascia splendere. Questo avviene due volte: una quando l'informazione arriva per la prima volta (livello di rappresentazione) e di nuovo quando l'IA cerca di connettere diversi pezzi di informazione (livello di interazione). Ciò mantiene l'addestramento fluido e stabile, impedendo all'IA di impazzire o di incastrarsi su schemi errati.
La Macchina del Tempo (Timestamp RoPE)
La maggior parte dei modelli di IA conta i passaggi: "Passaggio 1, Passatto 2, Passaggio 3". Ma nel mondo reale, il tempo non riguarda solo i passaggi; riguarda quando le cose sono accadute. Un clic avvenuto 10 secondi fa è molto diverso da uno avvenuto 10 mesi fa.
CADET utilizza un tipo speciale di "macchina del tempo" chiamato Rotary Positional Embedding (RoPE) basato su timestamp. Invece di contare i passaggi, l'IA guarda l'orario effettivo (Unix timestamp) di ogni evento. Può capire che l'intervallo tra due eventi è breve (come pochi secondi) o lungo (come mesi). Questo aiuta il modello a comprendere che il tuo comportamento cambia nel tempo. Se hai cliccato su un annuncio di lavoro ieri, potresti essere ancora interessato oggi, ma se ci hai cliccato sei mesi fa, probabilmente non lo sei più. Questa percezione temporale permette all'IA di apprendere schemi su diverse scale, dall'istante immediato alle tendenze a lungo termine.
La Regola del "Niente Barare" (Session Masking)
Quando addestri un'IA, vuoi che impari come uno studente, non come un imbroglione. Nel mondo reale, quando viene mostrato un annuncio, il sistema non sa immediatamente se hai cliccato; c'è un piccolo ritardo (come pochi secondi o minuti) mentre i dati viaggiano. Se l'IA viene addestrata su dati in cui può "vedere" il clic prima che dovrebbe, impara a usare informazioni che non dovrebbe avere. Penserà: "Oh, sapevo che avevi cliccato perché ho visto il risultato!", ma nel mondo reale non avrà quell'informazione.
Per evitare questo, i ricercatori hanno utilizzato il session masking. Immagina un insegnante che copre la chiave delle risposte durante un test. Durante l'addestramento, l'IA è costretta a guardare solo le informazioni che sarebbero state disponibili in quel preciso momento. Se un clic avviene 30 secondi dopo, l'IA è cieca rispetto ad esso durante l'addestramento di quel momento specifico. Ciò garantisce che, quando l'IA va nel mondo reale (servizio online), non si confonda o faccia previsioni errate perché si basa su informazioni che non può effettivamente vedere.
La Spinta alla Velocità (Ingegneria di Produzione)
Infine, costruire un'IA intelligente è una cosa; renderla abbastanza veloce da gestire miliardi di annunci ogni giorno è un'altra. Il team ha utilizzato alcuni trucchi ingegneristici astuti. Hanno "impacchettato" i dati strettamente, come organizzare una valigia in modo che non ci sia spazio sprecato, il che ha reso l'addestramento molto più veloce. Hanno anche costruito motori "FlashAttention" personalizzati (parti software specializzate) che permettono all'IA di valutare centinaia di annunci in un unico passaggio fulmineo, invece di controllarli uno alla volta.
I Risultati: Una Grande Vittoria per LinkedIn
Quando il team ha messo alla prova CADET sul feed principale di LinkedIn, i risultati sono stati impressionanti. Hanno confrontato CADET con il loro vecchio sistema, altamente ottimizzato (un mix di diversi modelli che lavorano insieme). Il nuovo modello CADET non si è limitato a stare al passo; ha dominato la competizione.
In un test online su larga scala, CADET ha ottenuto un incremento dell'11,04% nei tassi di click-through rispetto al vecchio sistema. Questo significa che, per ogni 100 annunci mostrati, un numero significativamente maggiore di persone si è fermata a guardarli. Interessante notare che, poiché gli inserzionisti su LinkedIn solitamente spendono i loro budget completi in modo automatico, la spesa totale non è cambiata molto, ma il valore di quei clic è aumentato. Il costo per clic è sceso del 10,9%, il che significa che gli inserzionisti hanno ottenuto un migliore ritorno sul loro investimento.
Il documento suggerisce che questo successo derivi dalla combinazione di un'IA unificata di tipo "storytelling" con correzioni intelligenti per i problemi specifici degli annunci (come la posizione e il tempo). Dimostra che un singolo modello ben progettato può battere un team complesso di modelli più vecchi. Sebbene i ricercatori notino che c'è ancora del lavoro da fare — come gestire ancora più tipi di scenari "cosa succederebbe se" — il loro lavoro dimostra che i decoder-only transformer sono pronti a prendere il comando nel mondo della pubblicità online.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.