← Nieuwste papers
🤖 machine learning

Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning

Dit artikel presenteert een verenigd, model-agnostisch framework voor het optimaliseren van langetermijngebruikersbetrokkenheid in grootschalige aanbevelingssystemen door vroege voorspellende sessiegedragingen te identificeren en daaruit downstream beloningssignalen af te leiden, die succesvol zijn ingezet over meerdere Pinterest-oppervlakken om retentiemetrieken te verbeteren.

Oorspronkelijke auteurs: Dingsu Wang, Filip Ryzner, Kelly He, Armando Ordorica, David Woo, Aditya Mantha, Liyao Lu, Usha Amrutha Nookala, Haoran Guo, Jiacong He, Olafur Gudmundsson, Matt Chun, Krystal Benitez, Dhruvil Deven B
Gepubliceerd 2026-07-17
📖 8 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Dingsu Wang, Filip Ryzner, Kelly He, Armando Ordorica, David Woo, Aditya Mantha, Liyao Lu, Usha Amrutha Nookala, Haoran Guo, Jiacong He, Olafur Gudmundsson, Matt Chun, Krystal Benitez, Dhruvil Deven Badani, Yijie Dylan Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je door een enorme, eindeloze bibliotheek loopt waar de planken zichzelf herschikken op basis van waar je naar kijkt. Dit is de wereld van recommender systemen (aanbevelingssystemen), de onzichtbare motoren achter apps zoals Pinterest, TikTok en Netflix. Hun taak is te raden wat je hierna leuk zult vinden. Lange tijd waren deze systemen als ongeduldige gidsen: ze gaven alleen om het feit of je nú naar één tentoonstelling keek. Als je op een plaatje klikte, lieten ze je direct tien andere zien die er precies zo uitzagen. Maar hier is het probleem: als je mensen alleen laat zien wat ze al kennen, raken ze verveeld en stoppen ze met het bezoeken van de bibliotheek. De grote vraag die wetenschappers proberen op te lossen is: Hoe bevelen we dingen aan die ervoor zorgen dat mensen maanden of jaren terug blijven komen, en niet alleen voor de volgende vijf minuten?

Om dit te beantwoorden, moeten onderzoekers omgaan met een lastige realiteit: we kunnen de toekomst niet gemakkelijk zien. We kunnen niet wachten om te zien of een gebruiker over een maand nog terugkomt om te beslissen wat we vandaag moeten laten zien. Daarom kijken ze, in plaats van de toekomst direct te proberen te voorspellen, naar "aanwijzingen" in het heden—kleine gedragingen die meestal gebeuren vlak voordat iemand besluit om te blijven. Dit artikel gaat over het vinden van die aanwijzingen en het leren van de gids van de bibliotheek om deze te volgen, waardoor een korte, saaie bezocht wordt omgezet in een lang, spannend avontuur.


Het Probleen: De "Click-Trap" (Klik-valstrik)

Stel je voor dat je op een kermis bent. Een spelletje bij een kraampje biedt je een gratis snoepje aan als je een wiel draait. Je draait, krijgt je snoepje, en vertrekt. De eigenaar van de kraam is tevreden omdat je het wiel hebt gedraaid, maar je komt nooit meer terug. Dit is wat er gebeurt wanneer aanbevelingssystemen alleen geven om korte-termijn signalen zoals een snelle klik of een blik van één seconde. Ze krijgen veel "draaiingen", maar de gebruikers raken verveeld en verlaten de kermis voorgoed.

De auteurs van dit paper, werkzaam bij Pinterest, realiseerden zich dat het optimaliseren voor onmiddellijke klikken eigenlijk de lange-termijn gezondheid van hun platform schaadde. Ze wilden een systeem bouwen dat niet alleen zei: "Hier is iets waar je misschien op klikt," maar eerder: "Hier is iets dat ervoor zal zorgen dat je blijft, ontdekt en morgen weer terugkomt."

De Oplossing: De "Rabbit Hole" (Konijnenhol) Detective

Het team bedacht een slim idee: in plaats van te wachten om te zien of een gebruiker volgende week terugkeert (wat zeldzaam en moeilijk te volgen is), zouden ze kijken naar Downstream Rewards (beloningen in de nabije toekomst). Denk hierbij aan een detective die voetsporen zoekt. Als een gebruiker een diepe duik neemt in een "rabbit hole" van gerelateerde inhoud, een afbeelding opslaat of een lange tijd besteedt aan het verkennen, dan zijn dat sterke voetsporen die zeggen: "Deze persoon heeft het erg naar zijn zin en zal waarschijnlijk terugkeren."

Het paper stelt een model-agnostisch framework voor. "Model-agnostisch" is een chique manier om te zeggen dat "het werkt met elk type aanbevelingsmotor," of het nu een simpele lijst is of een complexe AI. Ze hebben niet alleen gegokt welke gedragingen goed waren; ze voerden een massaal offline screeningsproces uit om de specifieke acties te vinden die daadwerkelijk leidden tot langdurige loyaliteit.

De Drie Gouden Aanwijzingen

Door hun analyse identificeerden ze drie hoofdtypen "rewards" (aanwijzingen) die leiden tot gelukkige, terugkerende gebruikers:

  1. De Diepe Duik (Deeper Session Engagement):
    Het gaat niet alleen om klikken; het gaat erom hoe diep je gaat. Het paper vond dat als een gebruiker op een Pin klikt en vervolgens direct in een "P2P rabbit hole" duikt (een keten van gerelateerde Pins), de afbeelding opslaat of downloadt, dat een enorme winst is.

    • De Metafoor: Het is het verschil tussen even in een kamer gluren en er daadwerkelijk gaan wonen. Het systeem leerde om gebruikers te belonen die de tijd nemen om de "rabbit hole" te verkennen in plaats van alleen de oppervlakte te scannen.
    • Het Resultaat: Ze ontdekten dat deze diepe acties sterk verbonden zijn met het terugkeren van gebruikers. Sterker nog, sessies met deze diepe acties leidden ertoe dat gebruikers de app aanzienlijk eerder opnieuw bezochten.
  2. De "Fake It" Straf (Negatieve Beloningen):
    Niet alle klikken zijn goed. Het team ontdekte dat sommige "closeups" (inzoomen op een afbeelding) eigenlijk tekenen van verveling zijn. Als een gebruiker minder dan een seconde inzoomt en dan direct vertrekt, is het een "ondiepe closeup".

    • De Metafoor: Stel je voor dat iemand een winkel binnenloopt, een artikel pakt, er een fractie van een seconde naar kijkt en het direct weer neerlegt. Ze zijn niet geïnteresseerd; ze doden alleen maar tijd.
    • De Fix: Het systeem behandelt deze vluchtige blikken nu als een negatieve beloning. Het is alsof de gids zegt: "Hé, laat deze persoon dit item niet nog eens zien; ze vonden het duidelijk niet leuk." Ze ontdekten zelfs dat verschillende soorten gebruikers verschillende regels nodig hebben: "core" gebruikers hebben een drempel van 1 seconde nodig om als oppervlakkig te worden beschouwd, terwijl "non-core" gebruikers slechts 0,5 seconde nodig hebben.
  3. Het Nieuwe Avontuur (Use Case Adoption):
    Soms raken gebruikers gevangen in een lus van hun oude interesses. Het paper introduceerde een beloning voor Use Case Adoption. Dit gebeurt wanneer een gebruiker betrokken raakt bij iets totaal nieuws dat niet past bij hun gebruikelijke patroon.

    • De Metafoor: Als een gebruiker normaal gesproken naar "kattenfilmpjes" kijkt, en het systeem laat hen een "hoe-repareer-ik-een-fiets"-video zien, en ze kijken en bewaren deze daadwerkelijk, dan is dat een overwinning. Het betekent dat het systeem erin geslaagd is hun horizon te verbreden.
    • Het Doel: Dit moedigt de AI aan om gebruikers dingen te tonen die ze niet wisten dat ze wilden, wat hen helpt nieuwe hobby's en interesses op te bouken, wat hen langer op het platform houdt.

De Machinekamer: Hoe Ze Het Werkend Kregen

Je vraagt je misschien af: "Hoe bereken je dit allemaal zonder de app te vertragen?" De auteurs bouwden een nieuwe infrastructuur genaamd DRv2.

  • De Oude Manier: Ze berekenden al deze beloningen vroeger in enorme batches, wat weken duurde om bij te werken. Als ze een nieuw idee wilden testen, moesten ze weken wachten.
  • De Nieuwe Manier: Ze bouwden een systeem dat deze beloningen "on the fly" berekent, precies op het moment dat de data wordt gelezen. Dit verkortte de tijd om nieuwe ideeën te testen van 3 weken naar 2 dagen. Het is alsof je overstapt van het telkens vanaf nul een taart bakken, naar het hebben van een magische machine die direct een vers stukje samenstelt zodra je erom vraagt.

De Resultaten: Werkt Het Echt?

Het team testte deze ideeën in de echte wereld met behulp van A/B-testen (waarbij één groep het oude systeem kreeg en een andere groep het nieuwe systeem). De resultaten waren consistent en positief:

  • Meer Succesvolle Sessies: Het aantal sessies waarin gebruikers iets betekenisvols deden (zoals opslaan of downloaden) steeg over de hele linie met +0,36%.
  • Meer Tijd Besteed: Gebruikers besteedden meer tijd in de app, waarbij de totale tijd toenam met +0,10%.
  • Betere Retentie: Belangrijker nog, het aantal Weekly Active Users (WAU) nam toe met +0,1% voor core-gebruikers. Dit bewijst dat het systeem mensen niet alleen probeerde te foppen om te klikken, maar dat het ze daadwerkelijk weer liet terugkomen.
  • Succes over Verschillende Oppervlakken: Ze hebben het niet alleen op de "Homefeed" (de hoofdpagina) opgelost. Ze pasten dezelfde logica toe op Search (Zoeken), Related Pins (Gerelateerde Pins) en Notifications (Meldingen). Bij Search steeg de "fulfillment rate" (hoe vaak een zoekopdracht leidde tot een echte actie) met +0,25%.

De Kernboodschap

Dit paper suggereert dat het geheim om gebruikers gelukkig te houden niet alleen is om te laten zien wat ze al leuk vinden, maar om hen te leiden naar diepere, meer betekenisvolle interacties. Door "diepe duiken" te belonen, "nepklikken" te bestraffen en "nieuwe avonturen" aan te moedigen, kan het systeem een vluchtige blik omzetten in een langdurige relatie.

De auteurs benadrukken dat dit geen wondermiddel is dat alles voor altijd oplost, maar het is een krachtig, flexibel hulpmiddel dat werkt in verschillende delen van de app. Door te focussen op de kwaliteit van de reis in plaats van alleen op de snelheid van de klik, slaagden ze erin een aanbevelingssysteem te bouwen dat minder aanvoelt als een verkoopautomaat en meer als een behulpzame vriend die weet hoe hij het gesprek gaande moet houden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →