← Nieuwste papers
💻 computer science

Predicting Custom-Feed Returns for New Bluesky Posts: A Prospective Study

Dit artikel introduceert een nieuwe cold-start routing-taak voor het voorspellen of nieuw gepubliceerde Bluesky-berichten zullen verschijnen in specifieke aangepaste feeds, waarbij een grootschalige benchmarkdataset wordt gepresenteerd en wordt aangetoond dat LambdaRank superieure prestaties levert bij het rangschikken van feeds die waarschijnlijk nieuwe inhoud zullen teruggeven.

Oorspronkelijke auteurs: Yipeng Wang, Mohit Singhal

Gepubliceerd 2026-08-17
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yipeng Wang, Mohit Singhal

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je het internet voor als een gigantisch, bruisend dorpsplein waar iedereen tegelijkertijd zijn gedachten, grappen en nieuws naar buiten roept. In dit chaotische plein zijn er duizenden verschillende "clubs" of "nieuwskiosken" (genoemd custom feeds) die door mensen worden gerund. Elke club heeft zijn eigen regelboek om te beslissen welke kreten uit het plein interessant genoeg zijn om op hun mededelingenbord te plaatsen. Meestal moet een club bij het toetreden van een nieuw persoon weten wie diegene is om vrienden aan te bevelen. Maar hier komt de twist: in deze specifieke stad zijn het de nieuwe kreten (posts) die nog geen geschiedenis hebben. Dit zijn de "cold starts". De grote vraag voor de stad is: Hoe raden we welke clubs een gloednieuwe kreet op hun bord willen zetten voordat iemand het überhaupt heeft gezien? Dit is de puzzel van "cold-start routing". Het is alsoal proberen te voorspellen welke specifieke tijdschriftredacteuren dol zullen zijn op een verhaal dat je net hebt geschreven, op het moment dat je de laatste punt typt, zonder dat je al enige verkoopdata hebt om je te helpen.

Dit paper pakt exact die puzzel aan voor Bluesky, een sociaal mediaplatform waar deze custom feeds een belangrijke functie zijn. De onderzoekers, Yipeng Wang en Mohit Singhal, zetten zich in om een systeem te bouwen dat fungeert als een super-slimme matchmaker. Hun doel was om een gloednieuwe post direct te rangschikken over duizenden potentiële feeds om te raden welke feeds die post binnen de volgende 24 uur zouden "teruggeven" (tonen) in hun topresultaten.

Om dit te doen, hebben ze niet zoma moment gegokt; ze bouwden een massaal, tijdreizend experiment. Ze richtten een "monitoringspaneel" in van 5.000 verschillende feeds en volgden deze gedurende een week. Ze verzamelden 17,804 miljoen publieke posts. Voor elke post wachtten ze af of deze daadwerkelijk in de top 50 resultaten van een feed verscheen binnen 24 uur. Als dat zo was, markeerden ze dit als een "hit". Dit creëerde een dataset van 1,865 miljoen observeerbare verbindingen tussen posts en feeds. Ze noemen dit een "eerst verzamelen, later labelen"-aanpak omdat ze eerst de ruwe data verzamelden en het pas als een succes of een mislukking labelden nadat de toekomst daadwerkelijk was gebeurd, waardoor hun voorspellingen werden getest tegen echte uitkomsten, en niet alleen tegen gissingen.

Het team probeerde vervolgens verschillende computerbreinen om het matchingsspel te spelen. Ze begonnen met eenvoudige regels, zoals "plaatst de auteur meestal in deze feed?" of "lijkt de tekst op wat deze feed leuk vindt?". Deze eenvoudige methoden waren oké, maar niet geweldig. Daarna probeerden ze complexere modellen die de betekenis van de tekst konden begrijpen, en niet alleen de woorden. De winnaar van de competitie was een model genaamd LambdaRank.

Hier vertellen de cijfers ons hoe goed het gewerkt heeft. De onderzoekers testten hun systeem op twee afzonderlijke dagen aan data. Van alle geteste posts richtten ze zich op de posts die daadwerkelijk door ten minste één feed werden opgepikt (ongeveer 9,04% van het totaal). Voor deze posts slaagde het LambdaRank-model erin om de juiste feeds in de Top 10 lijst te plaatsen in 73,61% van de gevallen (een metriek genaamd capped Recall@10). Het scoorde ook 0,6127 op een schaal van hoe goed het de beste matches rangschikte (NDCG@10) en vond een "hit" (het vinden van ten minste één correcte feed in de top 10) in 77,49% van de gevallen.

Het paper suggereert dat hoewel het model erg goed is, het niet perfect is. De grootste flessenhals is niet het rangschikkende brein zelf, maar de eerste stap: het vinden van de juiste kandidaten. Zelfs als het model perfect is, kan het geen feed kiezen als het er nooit eerst naar heeft gekeken. De onderzoekers ontdekten dat hun systeem slechts een klein deel van de mogelijke feeds bekeken (een "kandidaatenset" van maximaal 370 feeds uit de 4.233 gerangschikte). Als ze in staat waren geweest om elke mogelijke feed te bekijken, had het systeem zelfs nog beter kunnen presteren, reikend naar een theoretisch "plafond" van 0,8448. Dit betekent dat de volgende grote stap niet noodzakelijkerwijs het slimmer maken van het brein is, maar het breder maken van de zoektocht.

Kortom, het paper bewijst dat we succesvol kunnen voorspellen welke custom feeds een nieuwe post zullen oppakken, zelfs voordat de post enige geschiedenis heeft. Het laat zien dat door eenvoudige tekstmatching te combineren met een diep begrip van betekenis, we content naar de juiste plekken kunnen routeren. Het waarschuwt echter ook dat we momenteel beperkt worden door hoeveel feeds we tegelijkertijd kunnen controleren. Het systeem is een sterke start, maar er is nog steeds ruimte om te groeien naarmate het "dorpsplein" nog drukker wordt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →