Multi-Objective Ranking for Live-Streaming: Balancing Fresh and Delayed Signals with Segment-Aware Targeting
Dit artikel presenteert een schaalbaar multi-objective rankingsysteem voor live-streaming aanbevelingen dat effectief verse en vertraagde gebruikerssignalen balanceert door middel van een segmentbewuste targetingmodule en een efficiënte Multi-gate Mixture-of-Experts (MMoE) architectuur, wat resulteert in significante verbeteringen in dagelijkse actieve kijkers, betrokkenheid en omzet over diverse gebruikerssegmenten heen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je door een enorm, bruisend digitaal dorpsplein loopt waar duizenden mensen constant optreden, chatten en verhalen delen. Dit is de wereld van live-streaming, een plek waar de magie in realtime gebeurt. Maar voor de mensen die het dorpsplein beheren, is er een lastige puzzel: hoe bepaal je welke artiest je aan welke bezoeker laat zien? Dit is de taak van een "aanbevelingssysteem", een digitale matchmaker die probeert te raden wat jij hierna geweldig zult vinden.
In het verleden waren deze matchmakers als enthousiaste bibliothecarissen die alleen maar aandacht hadden voor het boek dat je op dit moment oppakt. Maar bij live-streaming is het verhaal complexer. Soms kijkt een kijker een paar minuten naar een streamer, chat een beetje, en vertrekt dan. Ze komen misschien dagen niet meer terug, of ze besluiten plotseling om zich te abonneren of geld te uitgeven weken later. Deze acties zijn als zaden die in de grond zijn geplant; ze ontkiemen niet onmiddellijk. Als de matchmaker alleen kijkt naar wat er in de volgende vijf minuten gebeurt, mist hij de zaden die later zullen groeien. Bovendien is het dorpsplein vol met verschillende soorten mensen: sommigen zijn nieuwe toeristen die gewoon een korte show willen zien, terwijl anderen vaste gasten zijn die diepe vriendschappen willen opbouwen met de artiesten. Iedereen precies hetzelfde behandelen leidt vaak tot slechte aanbevelingen. Dit paper onderzoekt hoe je een slimmere matchmaker kunt bouwen die zowel de onmiddellijke opwinding als de langetermijnontwikkeling van deze relaties begrijpt.
De Uitdaging: Het "Wacht-en-Zie"-probleem
De auteurs van dit paper, werkzaam bij Twitch, liepen tegen een unieke hoofdpijn aan. Bij online winkelen geldt: als je op een product klikt en het niet koopt, koop je het waarschijnlijk later ook niet. Maar bij live-streaming kan een kijker een kanaal aanklikken, even kijken, en dan drie dagen later terugkomen om de streamer te volgen of zelfs te betalen voor een abonnement.
Het probleem is dat deze "grote" acties (zoals volgen of geld uitgeven) zeldzaam zijn en langzaam gaan. Als de computer probeert hiervan direct te leren, ziet hij vooral "nee"-antwoorden, wat het systeem in de war brengt. Het is alsof je probeert te leren hoe je een taart bakt door alleen naar de eerste vijf minuten van het proces te kijken; je zou nooit weten of de taart uiteindelijk goed is geworden. Daarnaast raakte het systeem vertekend (biased). Omdat de "superfans" (die veel chatten en uitgeven) zoveel data genereren, leerde de computer hen zo goed te plezieren dat het de nieuwe, casual kijkers vergat die gewoon even wilden kennismaken.
De Oplossing: Een Strategie in Drie Delen
Om dit op te lossen, bouwde het team een nieuw rankingsysteem met drie slimme trucs, werkend als een team van gespecialiseerde detectives.
1. Het Tijdreizende Venster (Vertraagde Signalen)
Eerst realiseerden ze zich dat ze de interesse van een kijker niet te snel moesten beoordelen. In plaats van te vragen: "Vond hij dit nu leuk?", vroegen ze: "Vond hij dit over de komende twee weken leuk?". Ze creëerden een "vertraagd venster" van 14 dagen. Als een kijker op een kanaal klikte en binnen twee weken besloot te chatten, te volgen of geld uit te geven, telde het systeem dat als een "ja". Dit veranderde zeldzame, verspreide gebeurtenissen in een duidelijker beeld, waardoor de computer begreep dat een trage reactie nog steeds een positieve reactie kan zijn.
2. De Aanpak met Twee Teams (Vers vs. Vertraagd)
Vervolgens realiseerden ze zich dat niet alle acties hetzelfde zijn. Sommige dingen, zoals klikken of een paar minuten kijken, gebeuren onmiddellijk. Andere dingen, zoals volgen of geld uitgeven, kosten tijd. Dus verdeelden ze het werk.
- Team Vers (FSM): Dit team focust op onmiddellijke reacties. Ze kijken naar wat de kijker op dit moment doet om te voorspellen of ze een paar minuten zullen blijven.
- Team Vertraagd (DSM): Dit team kijkt naar de lange termijn. Ze gebruiken dat 14-daagse venster om te voorspellen of een kijker uiteindelijk zal volgen of geld zal uitgeven.
Door twee aparte teams te hebben, raakt het systeem niet in de war. Het haalt een snelle "klik" niet door elkaar met een diepgaand "abonnement".
3. De Gepersonaliseerde Coach (Segment-bewuste Targeting)
Ten slotte merkten ze op dat nieuwe kijkers en superfans verschillende dingen nodig hebben. Een nieuwe kijker moet worden vastgehouden met opwindende, korte content om terug te komen. Een superfan is klaar voor diepere connecties en wil de streamer misschien financieel ondersteunen.
Het systeem fungeert nu als een coach die het niveau van de speler kent. Voor nieuwe kijkers geeft het prioriteit aan het kijken en chatten. Voor toegewijde fans geeft het prioriteit aan het helpen vinden van kanalen die ze willen steunen. Dit doen ze door de "score" van aanbevelingen aan te passen op basis van wie er kijkt, zonder dat ze een volledig nieuw systeem voor elke groep hoeven te bouwen.
Het Geheime Ingrediënt: De MMoE
Om dit allemaal te laten werken zonder de computer te vertragen, gebruikten ze een slimme architectuur genaamd Multi-gate Mixture-of-Experts (MMoE). Stel je een restaurant voor met een hoofdkok en verschillende gespecialiseerde sous-koks.
- Eén sous-kok is een expert in "snelle hapjes" (onmiddellijke klikken).
- De andere sous-koks zijn experts in "complexe hoofdgerechten" (diepe betrokkenheid en uitgaven).
De "gate" (poort) is de ober die beslist welk advies van welke kok hij voor een specifieke klant moet opvolgen. Dit stelde het systeem in staat om al deze verschillende doelen tegelijkertijd te leren, terwijl de wiskunde efficiënt bleef. Sterker nog, door deze methode te gebruiken, verminderden ze het aantal computerparameters (de "hersencellen" van het model) met 41,9% vergeleken met het draaien van aparte modellen voor alles, terwijl ze toch betere resultaten behaalden.
De Resultaten: Een Overwinning voor Iedereen
Het team testte dit nieuwe systeem met miljoenen echte gebruikers. De resultaten waren veelbelovend:
- Meer Kijkers: Het aantal dagelijkse actieve kijkers (Daily Active Viewers, DAV) steeg met 0,09%. Hoewel dat klein klinkt, vertaalt dit in een wereld met miljoenen gebruikers naar miljoenen extra "kijkerdagen" per jaar.
- Blije Fans: Voor de toegewijde fans steeg de "gecappedte gemiddelde omzet per gebruiker" (ARPU) met 0,56%, wat betekent dat de meest betrokken gebruikers iets meer uitgaven om hun favoriete streamers te steunen.
- Nieuwe Vrienden: Het systeem hielp nieuwe kijkers om te blijven hangen, wat hun betrokkenheid met 0,15% verhoogde.
- Meer Volgers: Het aantal nieuwe kanaalvolgers nam toe met 0,27%.
Bovendien was het systeem snel. Het kon deze complexe beslissingen nemen in minder dan 110 milliseconden (dat is sneller dan een knipper van een oog), wat bewees dat je zowel slim als snel kunt zijn. Ze testten het zelfs op de mobiele app en zagen een stijging van 1,12% in positieve interacties zoals klikken en likes.
Wat Ze Niet Deden
De auteurs waren zorgvuldig in het vermelden wat niet werkte. Ze probeerden de bias tegen nieuwe kijkers te herstellen door hun data meer gewicht te geven tijdens het trainingsproces (eigenlijk harder tegen de computer te schreeuwen over nieuwe gebruikers), maar dat hielp niet en maakte de boel ingewikkelder. In plaats daarvan ontdekten ze dat het aanpassen van de gewichten nadat het model was getraind (op het moment van de aanbeveling) de sleutel was. Ze ontdekten ook dat het proberen samen te voegen van alle doelen in één enkel, gigantisch model de voorspelling van onmiddellijke betrokkenheid verslechterde, wat bewees dat het gescheiden houden van de "verse" en "vertraagde" signalen cruciaal was.
Kortom, dit paper laat zien dat om een geweldig live-streaming aanbevelingssysteem te bouwen, je geduldig genoeg moet zijn om te wachten tot de zaden groeien, slim genoeg moet zijn om nieuwe en oude fans verschillend te behandelen, en efficiënt genoeg moet zijn om dit allemaal te doen in de tijd van een oogwenk.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.