← Ultimi articoli
🤖 machine learning

A Production-Ready RL Framework for Personalized Utility Tuning with Pareto Sweeping in Pinterest Recommender Systems

Questo documento introduce PRL-PUTS, un framework di apprendimento per rinforzo pronto per la produzione e indipendente dal ranker che automatizza la sintonizzazione personalizzata dei pesi dell'utilità tramite esplorazione di Pareto per ottimizzare dinamicamente i compromessi multi-obiettivo nel Homefeed di Pinterest, ottenendo miglioramenti significativi nel coinvolgimento senza aggiungere latenza di servizio.

Autori originali: Yichu Zhou, Mehdi Ben Ayed, Lin Yang, Jiacong He, Andreanne Lemay, Jiaye Wang, Jaewon Yang, Josie Zeng, Dhruvil Deven Badani, Yijie Dylan Wang, Jiajing Xu, Charles Rosenberg

Pubblicato 2026-05-19
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Yichu Zhou, Mehdi Ben Ayed, Lin Yang, Jiacong He, Andreanne Lemay, Jiaye Wang, Jaewon Yang, Josie Zeng, Dhruvil Deven Badani, Yijie Dylan Wang, Jiajing Xu, Charles Rosenberg

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina Pinterest come una biblioteca enorme e affollata, dove milioni di libri (Pins) vengono costantemente raccomandati ai visitatori. La biblioteca ha un bibliotecario molto intelligente (il Ranker) che esamina ogni libro e prevede quanto potrebbe piacere a un visitatore specifico in base a diversi criteri: "Cliccheranno su questo?", "Lo salveranno sulla loro bacheca?", "Vedranno un'immagine correlata?"

Il Vecchio Metodo: Il Manuale di Regole "Taglia Unica"

In passato, i gestori della biblioteca dovevano decidere come combinare queste previsioni in un unico punteggio per determinare quali libri mostrare per primi. Utilizzavano una formula semplice:

Punteggio Totale = (Clic × Peso A) + (Salvataggi × Peso B)

Il problema era che Peso A e Peso B venivano impostati manualmente. Se i gestori volevano più salvataggi, aumentavano manualmente il Peso B. Ma questo processo era lento, rigido e applicava la stessa identica regola a tutti. Un adolescente alla ricerca di idee per feste e un professionista alla ricerca di arredi per la casa ricevevano esattamente la stessa "ricetta" di raccomandazioni, anche se le loro esigenze erano totalmente diverse. Era come uno chef che usa la stessa identica quantità di sale per una zuppa destinata a un bambino e per una zuppa destinata a un critico gastronomico esperto.

La Nuova Soluzione: PRL-PUTS (Il Sottocapo Intelligente e Adattivo)

Il documento presenta PRL-PUTS, un nuovo sistema che agisce come un sottocapo intelligente e adattivo che sta proprio accanto al bibliotecario.

  1. Non Riscrive il Bibliotecario: Il bibliotecario principale (il Ranker) rimane esattamente lo stesso. PRL-PUTS non cerca di riaddestrare il bibliotecario o di cambiare il modo in cui legge i libri. Si limita a sovrapporsi a lui.
  2. Regola la Ricetta in Tempo Reale: Per ogni singola richiesta di un visitatore, PRL-PUTS esamina il contesto (Chi è questa persona? Cosa sta facendo in questo momento?) e decide istantaneamente: "Per questa persona specifica, enfatizziamo un po' di più i 'Salvataggi'", oppure "Per questa persona, enfatizziamo di più le 'Immagini Correlate'".
  3. Impara dall'Esperienza: Invece di indovinare i pesi, PRL-PUTS è un agente di Apprendimento per Rinforzo. Prova diverse "ricette" (combinazioni di pesi) in modo sicuro e controllato, osserva cosa succede (l'utente ha interagito?) e impara quale ricetta funziona meglio per quale tipo di persona.

Il Trucco della "Pareto Sweeping": Il Menu delle Opzioni

Una delle parti più difficili nella gestione di un sistema di raccomandazione è che non si può sempre vincere su tutti i fronti. Se si spinge troppo forte sui "Salvataggi", si potrebbero ottenere meno "Clic".

Il documento introduce un intelligente strumento di governance chiamato Pareto Sweeping. Immagina che il sistema non scelga una sola ricetta migliore. Invece, genera un intero menu di ricette possibili (una "Frontiera di Pareto").

  • Ricetta A: Massimizza i Salvataggi, riduce leggermente i Clic.
  • Ricetta B: Un equilibrio perfetto.
  • Ricetta C: Massimizza i Clic, riduce leggermente i Salvataggi.

I leader aziendali (gli stakeholder) possono guardare questo menu e dire: "Oggi, il nostro obiettivo è ottenere più Salvataggi, quindi passiamo il sistema alla Ricetta A". Possono farlo istantaneamente girando un singolo quadrante (un parametro chiamato α\alpha) senza bisogno di riaddestrare l'intero modello di intelligenza artificiale o attendere settimane per un nuovo aggiornamento.

Come Funziona nel Mondo Reale (Homefeed di Pinterest)

Il team ha testato questo sistema sull'Homefeed di Pinterest (il feed principale che gli utenti vedono quando accedono).

  • Velocità: Funziona così velocemente che gli utenti non notano alcun ritardo. È come un cameriere che sussurra un suggerimento allo chef mentre il cibo viene già impiattato.
  • Sicurezza: Se il sistema si guasta, torna immediatamente ai vecchi pesi manuali sicuri.
  • Risultati: Quando hanno girato il quadrante per favorire i "Salvataggi" per certi utenti, hanno registrato un aumento dello 0,13% delle "Sessioni di Successo" (sessioni in cui gli utenti hanno effettivamente compiuto un'azione positiva). Questo potrebbe sembrare piccolo, ma su una piattaforma con milioni di utenti, è una vittoria enorme.

Il Punto Chiave

Il documento dimostra che non è necessario ricostruire completamente il proprio motore di raccomandazione per renderlo più intelligente. Aggiungendo un piccolo strato intelligente sopra che personalizza la "ricetta" per ogni singolo utente e offre ai gestori un menu di opzioni di compromesso, è possibile ottenere risultati migliori, adattarsi più rapidamente ai cambiamenti aziendali e mantenere il sistema stabile.

In sintesi: PRL-PUTS trasforma un manuale di regole rigido e globale in una conversazione flessibile e personalizzata tra il sistema e l'utente, gestita da un semplice quadrante che i leader aziendali possono girare ogni volta che devono cambiare le priorità.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →