← Últimos artículos
🤖 AI

WHALE: A Scalable Unified Model for Recommendation with Wukong-HSTU Architecture

El artículo presenta WHALE, una arquitectura de recomendación unificada y escalable que integra las estructuras base Wukong y HSTU a través de un novedoso mecanismo de fusión para modelar conjuntamente características de no-secuencia y de secuencia, logrando mejoras significativas de rendimiento tanto en offline como en online en sistemas de producción industrial.

Autores originales: Renqin Cai, Dawei Sun, Yuanjun Yao, Zhiyong Wang, Velvin Fu, Maggie Zhuang, Yu Shi, Zhongnan Fang, Xuan Cao, Jing Qian, Rui Li

Publicado 2026-07-21
📖 4 min de lectura☕ Lectura para el café

Autores originales: Renqin Cai, Dawei Sun, Yuanjun Yao, Zhiyong Wang, Velvin Fu, Maggie Zhuang, Yu Shi, Zhongnan Fang, Xuan Cao, Jing Qian, Rui Li

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás caminando por una ciudad digital masiva y bulliciosa donde millones de personas están constantemente desplazándose, haciendo clic y mirando. Este es el mundo de los sistemas de recomendación en línea, los motores invisibles detrás de tus feeds de redes sociales, sugerencias de videos y listas de compras. Su trabajo es adivinar qué quieres ver a continuación. Para hacer esto, generalmente observan dos tipos de pistas muy diferentes. Primero, están tus detalles "estáticos": quién eres, qué te gusta, la hora del día y el artículo específico que se muestra. Es como un detective que observa el expediente de un sospechoso y la escena del crimen. Segundo, están tus acciones "dinámicas": el rastro largo y desordenado de todo lo que has hecho clic, visto o comprado en el pasado. Esto es como un detective que observa la historia de vida completa de un sospechoso desarrollándose en tiempo real.

Durante mucho tiempo, los sistemas de recomendación trataron estas dos pistas por separado. Algunos modelos superinteligentes eran excelentes mezclando los detalles estáticos (como "este usuario le gusta la ciencia ficción" + "es viernes por la noche"), mientras que otros modelos eran expertos en leer la larga historia de tu comportamiento pasado (como "viste tres películas espaciales seguidas, así que probablemente quieras una cuarta"). La gran pregunta era: ¿podríamos construir un supermodelo que fuera igualmente brillante en ambos, sin volverse demasiado lento o demasiado costoso de ejecutar? Si pudiéramos, podría significar ver contenido que se sienta perfectamente adaptado exactamente a quién eres y a lo que has estado haciendo últimamente, todo al mismo tiempo.

Presentamos WHALE, una nueva arquitectura desarrollada por investigadores de Meta que intenta resolver este rompecabezas. Piensa en WHALE como un equipo de detectives gigante y de múltiples capas trabajando juntos. En lugar de tener un detective leer el expediente y otro observar el video, WHALE pone a ambos en la misma habitación, capa por capa. En cada una de las capas del modelo, hay un equipo "Wukong" (el experto en mezclar detalles estáticos) y un equipo "HSTU" (el experto en leer la larga historia de tus acciones). Pero aquí está el truulo de magia: no solo trabajan uno al lado del otro; charlan constantemente. El equipo Wukong le pregunta al equipo HSTU: "Oye, basándote en este artículo específico que estoy mirando, ¿qué parte de la larga historia del usuario es más importante en este momento?". El equipo HSTU entonces se enfoca en ese recuerdo específico y se lo devuelve. Esto sucede una y otra vez a medida que los datos se mueven a través del modelo, permitiendo que el sistema refine constantemente su comprensión.

El artículo sugiere que este "intercambio progresivo" es un cambio de paradigma. Cuando los investigadores probaron WHALE con enormes cantidades de datos del mundo real de una plataforma de redes sociales, descubrieron que consistentemente mejoraba en la predicción de lo que los usuarios harían clic a medida que agrandaban el modelo y le daban una historia más larga para leer. Específicamente, cuando aumentaban la longitud de la historia del usuario que el modelo podía ver, la calidad de las recomendaciones mejoraba. También descubrieron que hacer el modelo más profundo (más capas) y más ancho (más potencia de procesamiento) seguía arrojando mejores resultados, lo que sugiere que el sistema escala bien.

Sin embargo, los investigadores también probaron una forma más simple de combinar estos dos tipos de modelos, que llaman un enfoque de "híbrido superficial". En este método más antiguo, la historia se comprime en un resumen diminuto antes de mezclarse con los detalles estáticos. El artículo argumenta que esto es un error porque se pierden los detalles finos. Sus experimentos mostraron que el diálogo profundo, capa por capa, de WHALE era significativamente mejor que este enfoque superficial, demostrando que mantener a los dos equipos en comunicación constante es crucial.

Por supuesto, construir un sistema tan complejo es costoso. El equipo tuvo que inventar un código de computadora especial y personalizado (usando algo llamado "kernels de Triton") para asegurarse de que WHALE pudiera ejecutarse lo suficientemente rápido como para ser usado por millones de personas a la vez. En pruebas del mundo real, WHALE sí mejoró las méticas principales de la interacción del usuario, pero trajo consigo un pequeño costo: el sistema podía manejar aproximadamente un 5% menos de solicitudes por segundo en comparación con el sistema anterior. A pesar de esta ligera ralentización, la mejora en la calidad de la recomendación se consideró una victoria, y el sistema ya ha sido implementado en producción. El artículo concluye que, si bien no podemos simplemente hacer los modelos infinitamente grandes para resolverlo todo, unificar estas dos formas diferentes de pensar sobre los datos —detalles estáticos e historia dinámica— en una arquitectura única e interactiva es un camino poderoso y práctico hacia el futuro de las recomendaciones.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →