A Production-Ready RL Framework for Personalized Utility Tuning with Pareto Sweeping in Pinterest Recommender Systems
Dit artikel introduceert PRL-PUTS, een productieklaar, ranker-onafhankelijk versterkingsleerframework dat gepersonaliseerde nutsgewichttuning automatiseert via Pareto-sweeping om dynamisch multi-objectieve trade-offs in Pinterest's Homefeed te optimaliseren, wat leidt tot aanzienlijke verbeteringen in betrokkenheid zonder extra serverlatentie.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je Pinterest voor als een enorme, drukke bibliotheek waar miljoenen boeken (Pins) voortdurend aan bezoekers worden aanbevolen. De bibliotheek heeft een zeer slimme bibliothecaris (de Ranker) die elk boek bekijkt en voorspelt hoeveel een specifieke bezoeker het zou kunnen waarderen, gebaseerd op verschillende criteria: "Zullen ze hierop klikken?" "Zullen ze het op hun bordje bewaren?" "Zullen ze een gerelateerde afbeelding zien?"
De Oude Manier: De "Eén Maat Past Allen"-Regelboek
In het verleden moesten de bibliotheekmanagers beslissen hoe ze deze voorspellingen combineerden tot één score om te bepalen welke boeken eerst worden getoond. Ze gebruikten een eenvoudige formule:
Totale Score = (Klikken × Gewicht A) + (Bewaringen × Gewicht B)
Het probleem was dat Gewicht A en Gewicht B met de hand werden ingesteld. Als de managers meer bewaringen wilden, draaiden ze Gewicht B handmatig omhoog. Maar dit was traag, stijf en paste exact dezelfde regel toe op iedereen. Een tiener die op zoek was naar feestideeën en een professional die op zoek was naar woondecoratie kregen exact hetzelfde "recept" voor aanbevelingen, zelfs al waren hun behoeften totaal verschillend. Het was alsof een chef-kok exact dezelfde hoeveelheid zout gebruikt voor een soep voor een baby en een soep voor een doorgewinterde voedselcriticus.
De Nieuwe Oplossing: PRL-PUTS (De Slimme, Adaptieve Sous-chef)
Het paper introduceert PRL-PUTS, een nieuw systeem dat fungeert als een slimme, adaptieve sous-chef die direct naast de bibliothecaris staat.
- Het Herschrijft de Bibliothecaris Niet: De hoofdbibliothecaris (de Ranker) blijft exact hetzelfde. PRL-PUTS probeert de bibliothecaris niet opnieuw te trainen of te veranderen hoe die de boeken leest. Het zit gewoon bovenop hen.
- Het Past het Recept in Real-time Aan: Voor elke afzonderlijke bezoekersvraag bekijkt PRL-PUTS de context (Wie is deze persoon? Wat doen ze op dit moment?) en beslist direct: "Voor deze specifieke persoon, laten we 'Bewaringen' iets meer benadrukken," of "Voor deze persoon, laten we 'Gerelateerde Afbeeldingen' meer benadrukken."
- Het Leert van Ervaring: In plaats van de gewichten te raden, is PRL-PUTS een Reinforcement Learning-agent. Het probeert verschillende "recepten" (gewichtcombinaties) op een veilige, gecontroleerde manier, ziet wat er gebeurt (reageerde de gebruiker?), en leert welk recept het beste werkt voor welk type persoon.
De "Pareto Sweeping"-Truc: Het Menu van Opties
Een van de moeilijkste delen van het beheren van een aanbevelingssysteem is dat je niet altijd in alles kunt winnen. Als je te hard pusht voor "Bewaringen", krijg je misschien minder "Klikken".
Het paper introduceert een slim besturingsinstrument genaamd Pareto Sweeping. Stel je voor dat het systeem niet gewoon één beste recept kiest. In plaats daarvan genereert het een heel menu van mogelijke recepten (een "Pareto-grens").
- Recept A: maximaliseert Bewaringen, verlaagt Klikken licht.
- Recept B: een perfecte balans.
- Recept C: maximaliseert Klikken, verlaagt Bewaringen licht.
De bedrijfsleiders (stakeholders) kunnen naar dit menu kijken en zeggen: "Vandaag is ons doel om meer Bewaringen te krijgen, dus laten we het systeem overschakelen naar Recept A." Ze kunnen dit direct doen door een enkele draaiknop te draaien (een parameter genaamd ), zonder dat ze het hele AI-model opnieuw hoeven te trainen of weken moeten wachten op een nieuwe update.
Hoe Het Werkt in de Wereld (Pinterest Homefeed)
Het team testte dit op de Pinterest Homefeed (de hoofdfeed die gebruikers zien wanneer ze inloggen).
- Snelheid: Het draait zo snel dat gebruikers geen vertraging merken. Het is alsof een ober een suggestie fluistert aan de chef terwijl het eten al wordt opgeserveerd.
- Veiligheid: Als het systeem haperingen vertoont, valt het direct terug naar de oude, veilige handmatige gewichten.
- Resultaten: Toen ze de draaiknop draaiden om "Bewaringen" te bevoordelen voor bepaalde gebruikers, zagen ze een toename van 0,13% in "Succesvolle Sessies" (sessies waarbij gebruikers daadwerkelijk iets positiefs deden). Dit klinkt misschien klein, maar op een platform met miljoenen gebruikers is dat een enorme winst.
De Belangrijkste Conclusie
Het paper bewijst dat je je aanbevelingsengine niet volledig hoeft te herbouwen om hem slimmer te maken. Door een kleine, slimme laag toe te voegen die voor elke individuele gebruiker het "recept" personaliseert en managers een menu van afwegingsopties geeft, kun je betere resultaten behalen, sneller inspelen op bedrijfsveranderingen en het systeem stabiel houden.
Kortom: PRL-PUTS verandert een stijf, globaal regelboek in een flexibele, gepersonaliseerde conversatie tussen het systeem en de gebruiker, beheerd door een simpele draaiknop die bedrijfsleiders kunnen draaien wanneer ze prioriteiten willen verschuiven.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.