← Últimos artículos
💻 computer science

Predicting Custom-Feed Returns for New Bluesky Posts: A Prospective Study

Este artículo introduce una nueva tarea de enrutamiento de arranque en frío para predecir si las publicaciones recién publicadas en Bluesky aparecerán en feeds personalizados específicos, presentando un conjunto de datos de referencia a gran escala y demostrando que LambdaRank logra un rendimiento superior en la clasificación de feeds con alta probabilidad de devolver contenido nuevo.

Autores originales: Yipeng Wang, Mohit Singhal

Publicado 2026-08-17
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yipeng Wang, Mohit Singhal

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina el internet como una plaza de un pueblo gigante y bullicioso donde todos gritan sus pensamientos, bromas y noticias al mismo tiempo. En esta plaza caótica, hay miles de diferentes "clubes" o "puestos de periódicos" (llamados feeds personalizados) que la gente gestiona. Cada club tiene su propio libro de reglas para decidir qué gritos de la plaza son lo suficientemente interesantes como para ponerlos en su tablero de anuncios. Normalmente, cuando una persona nueva se une a un club, el club necesita saber quién es para recomendar amigos. Pero aquí está el giro: en este pueblo específico, los nuevos gritos (publicaciones) son los que aún no tienen un historial; son los "comienzos en frío". La gran pregunta para el pueblo es: ¿Cómo adivinamos qué clubes querrán poner un grito nuevo en su tablero antes de que alguien lo haya visto siquiera? Este es el rompecabezas del "enrutamiento de comienzo en frío". Es como intentar predecir qué editores de revistas específicos amarán una historia que acabas de escribir, en el momento en que terminas de teclear el último punto, sin tener datos de ventas pasados que te ayuden.

Este artículo aborda exactamente ese rompecabezas para Bluesky, una plataforma de redes sociales donde estos feeds personalizados son una característica principal. Los investigadores, Yipeng Wang y Mohit Singhal, se propusieron construir un sistema que actúe como un casamentero súper inteligente. Su objetivo era tomar una publicación nueva y clasificar instantáneamente miles de feeds potenciales para adivinar cuáles la "devolverían" (mostrarían) en sus mejores resultados dentro de las próximas 24 horas.

Para hacer esto, no solo adivinaron; construyeron un experimento masivo que viaja en el tiempo. Establecieron un "panel de monitoreo" de 5,000 diferentes feeds y los observaron durante una semana. Recopilaron 17.804 millones de publicaciones públicas. Para cada publicación, esperaron a ver si aparecía realmente en los 50 mejores resultados de cualquier feed en un plazo de 24 horas. Si lo hacía, la marcaron como un "acierto". Esto creó un conjunto de datos de 1.865 millones de conexiones observables entre publicaciones y feeds. Lo llaman un enfoque de "primero recolectar, después etiquetar" porque primero reunieron los datos brutos y solo los etiquetaron como un éxito o un fracaso después de que el futuro realmente hubiera sucedido, asegurando que sus predicciones fueran probadas contra resultados reales, no solo contra suposiciones.

El equipo probó entonces varios cerebros de computadora diferentes para resolver el juego de emparejamiento. Comenzaron con reglas simples, como "¿el autor suele publicar en este feed?" o "¿el texto se parece a lo que le gusta a este feed?". Estos métodos simples estaban bien, pero no eran grandiosos. Luego, probaron modelos más complejos que podían entender el significado del texto, no solo las palabras. El ganador de la competencia fue un modelo llamado LambdaRank.

Aquí es donde los números nos dicen qué tan bien funcionó. Los investigadores probaron su sistema en dos días distintos de datos. De todas las publicaciones que probaron, se centraron en aquellas que realmente fueron recogidas por al menos un feed (aproximadamente el 9.04% del total). Para estas publicaciones, el modelo LambdaRank logró poner los feeds correctos en la lista de los Top 10 el 73.61% de las veces (una métrica llamada Recall@10 limitado). También obtuvo un 0.6127 en una escala de qué tan bien ordenó las mejores coincidencias (NDCG@10) y logró un "acierto" (encontrar al menos un feed correcto en el top 10) el 77.49% de las veces.

El artículo sugiere que, si bien el modelo es muy bueno, no es perfecto. El mayor cuello de botella no es el cerebro de clasificación en sí, sino el primer paso: encontrar los candidatos adecuados. Incluso si el modelo fuera perfecto, no puede elegir un feed si nunca lo miró en primer lugar. Los investigadores descubrieron que su sistema solo miró una pequeña porción de los feeds posibles (un "conjunto de candidatos" de hasta 370 feeds de los 4,233 clasificados). Si hubieran podido mirar cada uno de los feeds posibles, el sistema podría haber funcionado incluso mejor, alcanzando un "techo" teórico de 0.8448. Esto significa que el siguiente gran paso no es necesariamente hacer el cerebro más inteligente, sino hacer la búsqueda más amplia.

En resumen, el artículo demuestra que podemos predecir con éxito qué feeds personalizados recogerán una nueva publicación, incluso antes de que la publicación tenga algún historial. Muestra que, al combinar el emparejamiento de texto simple con una comprensión profunda del significado, podemos dirigir el contenido nuevo a los lugares adecuados. Sin embargo, también advierte que actualmente estamos limitados por cuántos feeds podemos revisar a la vez. El sistema es un comienzo sólido, pero todavía hay espacio para crecer a medida que la "plaza del pueblo" se vuelve aún más bulliciosa.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →