Multi-Objective Ranking for Live-Streaming: Balancing Fresh and Delayed Signals with Segment-Aware Targeting
Este artículo presenta un sistema de clasificación multiobjetivo escalable para la recomendación de transmisiones en vivo que equilibra eficazmente las señales de usuario frescas y retardadas a través de un módulo de segmentación consciente y una arquitectura de Mezcla de Expertos de Multipuerta (MMoE) eficiente en parámetros, lo que resulta en mejoras significativas en los espectadores activos diarios, el compromiso y los ingresos a través de diversos segmentos de usuarios.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás caminando por una enorme y bulliciosa plaza digital donde miles de personas están constantemente actuando, charlando y compartiendo historias. Este es el mundo de la transmisión en vivo, un lugar donde la magia sucede en tiempo real. Pero para las personas que dirigen la plaza digital, hay un rompecabezas complicado: ¿cómo decides qué intérprete mostrar a qué visitante? Este es el trabajo de un "sistema de recomendación", un casamentero digital que intenta adivinar qué te encantará después.
En el pasado, estos casamenteros eran como bibliotecarios entusiastas a los que solo les importaba el libro que elegías en ese mismo instante. Pero en la transmisión en vivo, la historia es más compleja. A veces, un espectador puede ver a un transmisor durante unos minutos, charlar un poco y luego irse. Puede que no vuelva durante días, o que de repente decida suscribirse o enviar dinero semanas después. Estas acciones son como semillas plantadas en la tierra; no brotan inmediatamente. Si el casamentero solo mira lo que sucede en los próximos cinco minutos, se pierde las semillas que crecerán más tarde. Además, la plaza digital está llena de diferentes tipos de personas: algunos son turistas nuevos que solo quieren ver un espectáculo rápido, mientras que otros son clientes habituales que quieren construir amistades profundas con los intérpretes. Tratar a todos exactamente igual suele conducir a recomendaciones mediocres. Este artículo explora cómo construir un casamentero más inteligente que comprenda tanto la emoción inmediata como el crecimiento a largo plazo de estas relaciones.
El Desafío: El Problema del "Esperar y Ver"
Los autores de este artículo, trabajando en Twitch, se enfrentaron a un dolor de cabeza único. En las compras en línea, si haces clic en un producto y no lo compras, probablemente no lo comprarás más tarde. Pero en la transmisión en vivo, un espectador puede hacer clic en un canal, verlo por un rato y luego regresar tres días después para seguir al transmisor o incluso pagar una suscripción.
El problema es que estas "grandes" acciones (como seguir o gastar dinero) son raras y ocurren lentamente. Si la computadora intenta aprender de ellas inmediatamente, ve mayoritariamente respuestas de "no", lo que confunde al sistema. Es como intentar aprender a hornear un pastel mirando solo los primeros cinco minutos del proceso; nunca sabrías si el pastel realmente quedó bien. Además, el sistema se estaba sesgando. Debido a que los "superfans" (que charlan y gastan mucho) generan tantos datos, la computadora estaba aprendiendo a complacerlos tan bien que se olvidó de los nuevos espectadores casuales que solo querían probar suerte.
La Solución: Una Estrategia de Tres Partes
Para solucionar esto, el equipo construyó un nuevo sistema de clasificación con tres trucos ingeniosos, actuando como un equipo de detectives especializados.
1. La Ventana de Viaje en el Tiempo (Señales Retrasadas)
Primero, se dieron cuenta de que debían dejar de juzgar el interés de un espectador demasiado rápido. En lugar de preguntar, "¿Le gustó esto ahora mismo?", preguntaron: "¿Le gustó esto durante las próximas dos semanas?". Crearon una "ventana de retraso" de 14 días. Si un espectador hacía clic en un canal y luego, dentro de las dos semanas, decidía charlar, seguir o gastar dinero, el sistema contaba eso como un "sí". Esto convirtió eventos raros y dispersos en una imagen más clara, ayudando a la computadora a entender que una reacción lenta aún puede ser una reacción positiva.
2. El Enfoque de Dos Equipos (Fresco vs. Retrasado)
Después, se dieron cuenta de que no todas las acciones son iguales. Algunas cosas, como hacer clic o mirar durante unos minutos, ocurren instantáneamente. Otras, como seguir o gastar, toman tiempo. Así que dividieron el trabajo.
- Equipo Fresco (FSM): Este equipo se enfoca en las reacciones inmediatas. Observan lo que el espectador está haciendo en este momento para predecir si se quedará por unos minutos.
- Equipo Retrasado (DSM): Este equipo mira el largo plazo. Utilizan esa ventana de 14 días para predecir si un espectador eventualmente seguirá o gastará dinero.
Al tener dos equipos separados, el sistema no se confunde. No mezcla un "clic" rápido con una "suscripción" profunda.
3. El Entrenador Personalizado (Segmentación Consciente)
Finalmente, notaron que los nuevos espectadores y los superfans necesitan cosas diferentes. Un espectador nuevo necesita ser enganchado con contenido emocionante y corto para que siga regresando. Un superfan está listo para conexiones más profundas y podría querer apoyar financieramente al transmisor.
El sistema ahora actúa como un entrenador que conoce el nivel del jugador. Para los nuevos espectadores, prioriza lograr que vean y charlen. Para los fans dedicados, prioriza ayudarles a encontrar canales a los que quieran apoyar. Lo hace ajustando la "puntuación" de las recomendaciones según quién esté mirando, sin necesidad de construir un sistema completamente nuevo para cada grupo.
La Receta Secreta: El MMoE
Para que todo esto funcione sin ralentizar la computadora, utilizaron una arquitectura inteligente llamada Mezcla de Expertos con Puerta Múltiple (MMoE, por sus siglas en inglés). Imagina un restaurante con un chef principal y varios subchefs especializados.
- Un subchef es experto en "aperitivos rápidos" (clics inmediatos).
- Los otros subchefs son expertos en "platos principales complejos" (compromiso profundo y gasto).
La "puerta" es el mesero que decide a qué consejo de chef escuchar para un cliente específico. Esto permitió que el sistema aprendiera de todos estos diferentes objetivos al mismo tiempo, pero manteniendo la matemática eficiente. De hecho, al usar este método, redujeron el número de parámetros de la computadora (las "células cerebrales" del modelo) en un 41.9% en comparación con ejecutar modelos separados para todo, obteniendo al mismo tiempo mejores resultados.
Los Resultados: Una Victoria para Todos
El equipo probó este nuevo sistema con millones de usuarios reales. Los resultados fueron prometedores:
- Más Espectadores: El número de Espectadores Activos Diarios (DAV) aumentó un 0.09%. Aunque suena pequeño, en un mundo con millones de usuarios, esto se traduce en millones más de "días de visualización" cada año.
- Fans Felices: Para los fans dedicados, el "Promedio de Ingresos por Usuario (ARPU) con tope" aumentó un 0.56%, lo que significa que los usuarios más comprometidos gastaron un poco más para apoyar a sus transmisores favoritos.
- Nuevos Amigos: El sistema ayudó a los nuevos espectadores a permanecer, aumentando su compromiso en un 0.15%.
- Más Seguidores: El número de nuevos seguidores de canales aumentó un 0.27%.
Mejor aún, el sistema era rápido. Podía tomar estas decisiones complejas en menos de 110 milisegundos (eso es más rápido que un parpadeo), demostrando que puedes ser inteligente y veloz al mismo tiempo. Incluso lo probaron en la aplicación móvil y vieron un aumento del 1.12% en interacciones positivas como clics y "me gusta".
Lo Que No Hicieron
Los autores fueron cuidadosos al señalar lo que no funcionó. Intentaron solucionar el sesgo contra los nuevos espectadores dándole más peso a sus datos durante el proceso de entrenamiento (esencialmente gritándole más fuerte a la computadora sobre los nuevos usuarios), pero eso no ayudó y complicó las cosas. En cambio, descubrieron que ajustar los pesos después de que el modelo fue entrenado (en el momento de la recomendación) era la clave. También descubrieron que intentar meter todos los objetivos en un solo modelo gigante hacía que el sistema fuera peor prediciendo el compromiso inmediato, demostando que mantener las señales "frescas" y "retrasadas" separadas era crucial.
En resumen, este artículo muestra que para construir un gran sistema de recomendación de transmisión en vivo, tienes que ser lo suficientemente paciente para esperar a que las semillas crezcan, lo suficientemente inteligente para tratar de forma diferente a los fans nuevos y antiguos, y lo suficientemente eficiente para hacerlo todo en el parpadeo de un ojo.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.