← Últimos artículos
🤖 AI

TokenMinds: Pretrained User Tokens and Embeddings for User Understanding in Large Recommender Systems

TokenMinds es un sistema a escala industrial que extiende el marco PLUM para generar tanto tokens de usuario discretos y semánticamente fundamentados como embeddings densos mediante una arquitectura de LLM preentrenada, unificando con éxito los comportamientos de video de formato largo y corto para reducir costos mientras demuestra un valor complementario en sistemas de clasificación de YouTube a gran escala.

Autores originales: Qingyun Liu, Bo Yan, Yang Liu, Yuji Roh, Ekansh Sharma, Likang Yin, Emma Olowo, Min-hsuan Tsai, Yuxuan Li, Diego Uribe, Saksham Aggarwal, Siqi Wu, Yuan Hao, Vikas Kedigehalli, Lukasz Heldt, Lichan Hon
Publicado 2026-06-25
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Qingyun Liu, Bo Yan, Yang Liu, Yuji Roh, Ekansh Sharma, Likang Yin, Emma Olowo, Min-hsuan Tsai, Yuxuan Li, Diego Uribe, Saksham Aggarwal, Siqi Wu, Yuan Hao, Vikas Kedigehalli, Lukasz Heldt, Lichan Hong, Li Wei, Xinyang Yi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando comprender el gusto de una persona por las películas. En los viejos tiempos, los sistemas de recomendación (como los de YouTube) intentaban hacer esto tomando todo el historial de videos vistos por una persona y comprimiéndolo en una única y diminuta "tarjeta de resumen" densa. Piensa en esto como intentar describir una novela entera escribiendo solo una oración en una nota adhesiva. Pierdes mucha de la sutileza, los detalles específicos y el sabor único de la historia.

Otros sistemas intentaban escribir un párrafo largo y detallado sobre el usuario. Pero esos párrafos solían ser vagos, capturando temas generales (como "le gustan los gatos") en lugar de los patrones específicos y profundos de lo que realmente vio y cuándo.

TokenMinds es un nuevo sistema creado por Google DeepMind y YouTube que resuelve esto proporcionando a los usuarios una "tarjeta de identidad digital" hecha de tokens discretos (como un conjunto de códigos específicos y significativos) y manteniendo la antigua "tarjeta de resumen" (embeddings densos) como respaldo.

Así es como funciona, desglosado con analogías sencillas:

1. El "ID Semántico" (El Código Postal Mágico)

En lugar de darle a cada video un número aleatorio (como "Video #49201"), TokenMinds le da a cada video un ID Semántico (SID).

  • La Analogía: Imagina que cada video tiene un "código postal" basado en lo que realmente trata. Un video sobre "cómo hornear pan de masa madre" podría tener un código postal que comience con Comida-Horneado-Pan. Un video sobre "reparar un fregadero" podría comenzar con Hogar-Fontanería.
  • Por qué ayuda: Si un usuario ve un video sobre "masa madre", el sistema no solo ve un número aleatorio; ve la parte de "Comida-Horneado" del código. Esto ayuda al sistema a entender el significado detrás de la visualización, no solo el ID.

2. El Motor de "Salida Dual" (El Kit de Dos Herramientas)

TokenMinds utiliza una arquitectura de IA especial (codificador-decodificador) que actúa como una navaja suiza. Produce dos cosas a la vez:

  • El Embedding Denso (La Tarjeta de Resumen): Es el vector numérico continuo de la vieja escuela que los sistemas existentes ya saben usar. Es como una instantánea rápida de la "vibra" del usuario.
  • Los Tokens SID (El Código Detallado): Esta es la parte nueva. La IA genera una lista de "códigos postales" específicos que representan los intereses futuros del usuario. Es como si la IA dijera: "Basado en lo que viste, es probable que quieras: Comida-Horneado-Pan, Tecnología-Programación-Python y Deportes-Baloncesto".

El Beneficio: El sistema obtiene lo mejor de ambos mundos. Mantiene felices a los sistemas antiguos (usando la tarjeta de resumen) mientras añade una nueva capa de comprensión semántica precisa (los tokens). El artículo encontró que usar ambos juntos funciona mejor que usar cualquiera de los dos por separado.

3. La Entrega "Asincrónica" (El Sistema de Preventa)

Generar estos tokens detallados es un trabajo pesado, como cocinar una comida compleja. Si intentaras cocinar mientras el cliente espera en el mostrador, sería demasiado lento.

  • La Analogía: TokenMinds utiliza un sistema de "preventa". Genera la "tarjeta de identidad" y los "tokens" del usuario en segundo plano (asincrónamente) mientras el usuario solo está navegando. Cuando el usuario realmente hace clic en "recomendar", el sistema simplemente toma la tarjeta ya preparada de un casillero de almacenamiento rápido. Esto significa que el sistema puede manejar miles de millones de usuarios sin ralentizarse.

4. El "Traductor Universal" (Un Modelo para Todos los Videos)

YouTube tiene dos tipos de videos muy diferentes: Formato Largo (como un documental de 20 minutos) y Formato Corto (como los Shorts de 15 segundos). Normalmente, necesitas dos modelos diferentes para entenderlos porque la gente los consume de forma distinta.

  • La Analogía: TokenMsnds es como un traductor universal. Utiliza el mismo sistema de "código postal" tanto para videos largos como cortos. Puede observar el historial de un usuario que ve un programa de cocina de 20 minutos y un truco de cocina de 15 segundos y darse cuenta: "¡Ah, a esta persona le encanta la cocina!".
  • El Resultado: En lugar de entrenar y ejecutar dos modelos separados y costosos, utilizan un solo modelo para hacer ambos trabajos. Esto redujo sus costos computacionales en un 50% para el entrenamiento y un 31% para el servicio, sin perder calidad.

5. Los Resultados (La Prueba)

El equipo probó esto con tráfico real de YouTube (miles de millones de usuarios).

  • Mejores Recomendaciones: Cuando añadieron estos nuevos tokens al sistema de clasificación, vieron un aumento mensurable en cómo la gente interactuaba con los videos y qué tan satisfechos estaban.
  • Eficiencia: Al combinar los modelos de video largo y corto, ahorraron una cantidad masiva de potencia informática.
  • Diversidad: El sistema no solo adivinaba lo mismo una y otra vez; generó una lista diversa de intereses potenciales, de forma muy similar a como un amigo humano sugeriría una variedad de cosas que podrían gustarte.

En resumen: TokenMinds es una forma más inteligente y eficiente de entender lo que los usuarios quieren. Deja de intentar comprimir el complejo gusto de una persona en un solo número y, en su lugar, le otorga un conjunto de "códigos" significativos que describen sus intereses, todo mientras se ejecuta en un motor único y rentable que gestiona todos los tipos de contenido de video.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →