Heterogeneous Ranking in Industrial-Scale Recommender Systems: A Case Study
Este artículo presenta un estudio de caso industrial de extremo a extremo sobre la clasificación de feeds de contenido heterogéneo en Google Discover, introduciendo la arquitectura HA-MoE para el aprendizaje multitarea adaptativo y el marco de observabilidad LENS para gestionar eficazmente la diversidad de contenido al tiempo que se mejora tanto las métricas offline como el compromiso del usuario online.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás entrando en una biblioteca masiva y caótica donde los estantes se reordenan constantemente. Un estante contiene libros de historia seria, otro tiene videos divertidos de gatos, un tercero tiene recetas y un cuarto tiene noticias de última hora. En un mundo perfecto, un bibliotecario sabría exactamente qué quieres leer a continuación, ya sea que tengas ganas de un chiste rápido o de una inmersión profunda en la historia. Pero en el mundo real de Internet, esta "biblioteca" es el feed de Google Discover, y el "bibliotecario" es un programa informático llamado sistema de recomendación.
El desafío para estos bibliotecarios informáticos es que antes trabajaban en bibliotecas muy organizadas y de un solo tema, como un lugar que solo tenía música o solo tenía videos cortos. En esos lugares, todo se veía y actuaba de la misma manera. Pero Google Discover es diferente; extrae contenido de toda la web abierta. Esto significa que la computadora tiene que decidir entre un artículo largo, un video de 10 segundos, una publicación personal de un usuario y un resumen generado por IA, todo al mismo tiempo. Es como pedirle a un solo chef que cocine un filete perfecto, un suflé delicado y un taco picante para el mismo cliente, todo usando el mismo conjunto de ingredientes y herramientas. Si el chef se concentra demasiado en el filete, el taco podría arruinarse. Este artículo aborda el complicado problema de enseñar a un solo cerebro informático a manejar todos estos diferentes "sabores" de contenido sin confundirse o favorecer a los más ruidosos o populares.
Los autores de este artículo, un equipo de Google, se enfrentaron a un problema específico: su sistema actual era como un chef de "talla única". Intentaba usar un único conjunto de reglas para clasificar todo, lo que provocaba errores. A veces, impulsaba artículos de click-bait de baja calidad solo porque recibían muchos clics, mientras enterraba videos de alta calidad que la gente realmente quería ver. Para solucionar esto, construyeron un nuevo sistema llamado HA-MoE (Mixture-of-Experts adaptado a la heterogeneidad).
Piensa en HA-MoE no como un solo chef, sino como una cocina bulliciosa con un gerente inteligente y un equipo de cocineros especializados. En el sistema anterior, un solo cocinero intentaba hacerlo todo. En el nuevo sistema, el "gerente" (la red de compuerta o gating network) observa el pedido y el tipo de comida (el contenido) y decide qué especialista debe encargarse de ello. Si el pedido es para un video, el gerente lo envía al "Especialista en Videos". Si es un artículo de texto, va al "Escritor". Crucialmente, el gerente no solo adivina; utiliza una "señal de heterogeneidad" especial —una pequeña nota que dice: "¡Oye, esto es un video, trátalo de forma diferente!". Esto asegura que el especialista en videos pueda brillar sin ser opacado por el especialista en artículos.
Pero, ¿cómo sabes si la cocina está funcionando bien? El equipo se dio cuenta de que solo mirar el número total de clientes felices no era suficiente. Podrías tener un gran día en general, pero si el especialista en videos está fallando, te estás perdiendo de algo. Por eso, inventaron una nueva forma de medir el éxito llamada DL-AUC (AUC de doble nivel). Imagina calificar la cocina no solo por el total de comidas servidas, sino también por qué tan bien lo hizo el especialista en videos en comparación con el especialista en artículos. Esta nueva puntuación les ayuda a detectar problemas donde un tipo de contenido está siendo ignorado injustamente.
Para asegurar que el sistema se mantenga saludable a lo largo del tiempo, también construyeron una herramienta llamada LENS. Esto es como un par de gafas de rayos X para la cocina. Les permite a los ingenieros mirar dentro del cerebro de la computadora para ver qué está haciendo cada "especialista". Si el sistema comienza a volverse perezoso y todos los especialistas empiezan a hacer lo mismo, LENS lo detecta de inmediato. Esto ayuda al equipo a solucionar problemas antes de que arruinen la experiencia del usuario.
Los resultados fueron prometedores. Cuando probaron este nuevo sistema en un conjunto masivo de datos de interacciones reales de usuarios, realizó un mejor trabajo clasificando tanto las acciones positivas (como clics y "me gusta") como las acciones negativas (como descartar una publicación) en comparación con el sistema anterior. Logró detener el "sesgo de la mayoría", donde los tipos de contenido populares solían aplastar a los menos comunes. En pruebas en línea con usuarios reales, el nuevo sistema logró que más personas abrieran la aplicación, navegaran más profundamente y exploraran una mayor variedad de contenido. El artículo sugiere que, al enseñar explícitamente a la computadora a respetar las diferencias entre los tipos de contenido, en lugar de forzarlos a ser iguales, podemos construir feeds más inteligentes, más justos y más agradables para todos.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.