← Ultimi articoli
🤖 machine learning

Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning

Questo articolo presenta un framework unificato e model-agnostic per ottimizzare l'engagement a lungo termine degli utenti nei sistemi di raccomandazione su larga scala, identificando i comportamenti precoci delle sessioni predittive e derivando segnali di ricompensa a valle, che sono stati implementati con successo su molteplici superfici di Pinterest per migliorare le metriche di ritenzione.

Autori originali: Dingsu Wang, Filip Ryzner, Kelly He, Armando Ordorica, David Woo, Aditya Mantha, Liyao Lu, Usha Amrutha Nookala, Haoran Guo, Jiacong He, Olafur Gudmundsson, Matt Chun, Krystal Benitez, Dhruvil Deven B
Pubblicato 2026-07-17
📖 7 min di lettura🧠 Approfondimento

Autori originali: Dingsu Wang, Filip Ryzner, Kelly He, Armando Ordorica, David Woo, Aditya Mantha, Liyao Lu, Usha Amrutha Nookala, Haoran Guo, Jiacong He, Olafur Gudmundsson, Matt Chun, Krystal Benitez, Dhruvil Deven Badani, Yijie Dylan Wang

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di camminare attraverso una biblioteca enorme e infinita dove gli scaffali si riorganizzano in base a ciò che guardi. Questo è il mondo dei sistemi di raccomandazione, i motori invisibili dietro app come Pinterest, TikTok e Netflix. Il loro compito è indovinare cosa ti piacerà dopo. Per molto tempo, questi sistemi sono stati come guide turistiche impazienti: si preoccupavano solo se ti fermavi a guardare un'esposizione in quel momento. Se cliccavi su un'immagine, ne mostravano subito altre dieci identiche. Ma ecco il problema: se mostri alle persone esattamente ciò che già conoscono, si annoiano e smettono di visitare la biblioteca. La grande domanda che gli scienziati stanno cercando di risolvere è: Come possiamo raccomandare cose che spingano le persone a tornare per mesi o anni, non solo per i prossimi cinque minuti?

Per rispondere a questo, i ricercatori devono affrontare una realtà complicata: non possiamo prevedere facilmente il futuro. Non possiamo aspettare di vedere se un utente tornerà tra un mese per decidere cosa mostrargli oggi. Quindi, invece di indovinare direttamente il futuro, cercano "indizi" nel presente: piccoli comportamenti che di solito accadono proprio prima che qualcuno decida di restare fedele. Questo articolo parla di come trovare questi indizi e di come insegnare alla guida turistica della biblioteca di seguirli, trasformando una visita breve e noiosa in un'avventura lunga ed eccitante.


Il Problema: La "Trappola del Click"

Immagina di essere a un luna park. Un chiosco offre un dolce istantaneo gratuito se giri una ruota. Giri la ruota, ottieni il tuo dolce e te ne vai. Il proprietario del chiosco è felice perché hai girato la ruota, ma tu non torni mai più. Questo è ciò che accade quando i sistemi di raccomandazione si preoccupano solo di segnali a breve termine come un rapido clic o uno sguardo di un secondo. Ottengono molti "giri", ma gli utenti si annoiano e lasciano il luna park per sempre.

Gli autori di questo articolo, lavorando presso Pinterest, si sono resi conto che ottimizzare per i clic immediati stava in realtà danneggiando la salute a lungo termine della loro piattaforma. Volevano costruire un sistema che non dicesse solo: "Ecco qualcosa che potresti cliccare", ma piuttosto: "Ecco qualcosa che ti farà restare, esplorare e tornare domani".

La Soluzione: Il Detective del "Vicolo Cieco"

Il team ha ideato un'idea intelligente: invece di aspettare per vedere se un utente tornerà la settimana prossima (cosa rara e difficile da tracciare), avrebbero cercato i Premi a valle (Downstream Rewards). Pensa a questo come a un detective che cerca impronte. Se un utente si immerge profondamente in un "vicolo cieco" di contenuti correlati, salva un'immagine o passa molto tempo a esplorare, queste sono impronte forti che dicono: "Questa persona si sta divertendo molto e probabilmente tornerà".

Il documento propone un framework model-agnostic. "Model-agnostic" è un modo elegante per dire "funziona con qualsiasi tipo di motore di raccomandazione", che sia una lista semplice o un'IA complessa. Non si sono limitati a indovinare quali comportamenti fossero buoni; hanno eseguito un massiccio processo di screening offline per trovare le azioni specifiche che effettivamente predicevano la lealtà a lungo termine.

I Tre Indizi d'Oro

Attraverso la loro analisi, hanno identificato tre tipi principali di "premi" (indizi) che portano a utenti felici e ricorrenti:

  1. L'Immersione Profonda (Coinvolgimento della Sessione Più Profondo):
    Non si tratta solo di cliccare; si tratta di quanto a fondo si va. L'articolo ha scoperto che se un utente clicca su un Pin e poi si immerge immediatamente in un "vicolo cieco P2P" (una catena di Pin correlati), lo salva o lo scarica, quella è una grande vittoria.

    • La Metafora: È la differenza tra dare un'occhiata in una stanza e traslocarci davvero. Il sistema ha imparato a premiare gli utenti che prendono il tempo per esplorare il "vicolo cieco" invece di limitarsi a sfiorare la superficie.
    • Il Risultato: Hanno scoperto che queste azioni profonde sono fortemente collegate al ritorno degli utenti. Infatti, le sessioni con queste azioni profonde hanno portato gli utenti a riaprire l'app significativamente prima.
  2. La Penalità del "Fingere l'Interesse" (Premi Negativi):
    Non tutti i clic sono buoni. Il team ha scoperto che alcuni "closeups" (zoom sull'immagine) sono in realtà segni di noia. Se un utente zooma per meno di un secondo e poi se ne va immediatamente, si tratta di un "closeup superficiale".

    • La Metafora: Immagina qualcuno che entra in un negozio, prende un oggetto, lo guarda per una frazione di secondo e lo lascia cadere immediatamente. Non è interessato; sta solo passando il tempo.
    • La Soluzione: Il sistema ora tratta questi sguardi di un secondo come un premio negativo. È come se la guida turistica dicesse: "Ehi, non mostrare più questo oggetto a questa persona; chiaramente non gli è piaciuto". Hanno anche scoperto che diversi tipi di utenti necessitano di regole diverse: gli utenti "core" hanno bisogno di una soglia di 1 secondo per essere considerati superficiali, mentre gli utenti "non-core" ne richiedono solo 0,5 secondi.
  3. La Nuova Avventura (Adozione del Caso d'Uso):
    A volte, gli utenti rimangono bloccati in un ciclo dei loro vecchi interessi. L'articolo ha introdotto un premio per l'Adozione del Caso d'Uso (Use Case Adoption). Questo accade quando un utente interagisce con qualcosa di totalmente nuovo che non rientra nel suo solito schema.

    • La Metafora: Se un utente di solito guarda "video di gatti", e il sistema mostra un video su "come riparare una bicicletta", e l'utente lo guarda e lo salva, è una vittoria. Significa che il sistema ha ampliato con successo i suoi orizzonti.
    • L'Obiettivo: Questo incoraggia l'IA a mostrare agli utenti cose che non sapevano di volere, aiutandoli a costruire nuovi hobby e interessi, il che li mantiene sulla piattaforma più a lungo.

La Sala Macchine: Come lo Hanno Reso Funzionante

Potreste chiedervi: "Come si calcola tutto questo senza rallentare l'app?". Gli autori hanno costruito una nuova infrastruttura chiamata DRv2.

  • Il Vecchio Modo: Prima calcolavano tutti questi premi in enormi lotti (batch), il che richiedeva settimane per l'aggiornamento. Se volevano testare una nuova idea, dovevano aspettare settimane.
  • Il Nuovo Modo: Hanno costruito un sistema che calcola questi premi "al volo", proprio mentre i dati vengono letti. Questo ha ridotto il tempo per testare nuove idee da 3 settimane a 2 giorni. È come passare dal cuocere una torta da zero ogni volta che vuoi una fetta, ad avere una macchina magica che assembla istantaneamente una fetta fresca ogni volta che la richiedi.

I Risultati: Funziona Davvero?

Il team ha testato queste idee nel mondo reale utilizzando gli A/B testing (mostrando un gruppo il vecchio sistema e un altro gruppo il nuovo sistema). I risultati sono stati coerenti e positivi:

  • Sessioni Più di Successo: Il numero di sessioni in cui gli utenti compiono un'azione significativa (come salvare o scaricare) è aumentato del +0,36% complessivamente.
  • Più Tempo Trascorso: Gli utenti hanno passato più tempo nell'app, con il tempo totale che è aumentato del +0,10%.
  • Migliore Retention: Soprattutto, il numero di Utenti Attivi Settimanali (WAU) è aumentato del +0,1% per gli utenti core. Questo dimostra che il sistema non ha solo ingannato le persone per farle cliccare; ha effettivamente fatto sì che volessero tornare.
  • Successo su Diversi Servizi: Non hanno sistemato solo il "Homefeed" (la pagina principale). Hanno applicato la stessa logica a Ricerca (Search), Pin Correlati (Related Pins) e Notifiche. Nella Ricerca, il "tasso di adempimento" (quanto spesso una ricerca portava a un'azione reale) è aumentato del +0,25%.

Il Messaggio Chiave

Questo articolo suggerisce che il segreto per mantenere felici gli utenti non è solo mostrare loro ciò che già amano, ma guidarli verso interazioni più profonde e significative. Premiando le "immersioni profonde", penalizzando i "finti clic" e incoraggiando le "nuove avventure", il sistema può trasformare un rapido sguardo in una relazione a lungo termine.

Gli autori sottolineano con cura che questo non è un rimedio magico che risolve tutto per sempre, ma è uno strumento potente e flessibile che funziona in diverse parti dell'app. Concentrandosi sulla qualità del viaggio piuttosto che sulla sola velocità del clic, sono riusciti a costruire un sistema di raccomandazione che sembra meno un distributore automatico e più un amico utile che sa come mantenere viva la conversazione.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →