← Derniers articles
🤖 AI

TokenMinds: Pretrained User Tokens and Embeddings for User Understanding in Large Recommender Systems

TokenMinds est un système à l'échelle industrielle qui étend le framework PLUM pour générer à la fois des jetons utilisateurs discrets et sémantiquement ancrés ainsi que des plongements denses via une architecture de LLM pré-entraînée, unifiant avec succès les comportements vidéo longs et courts pour réduire les coûts tout en démontrant une valeur complémentaire dans les systèmes de classement YouTube à grande échelle.

Auteurs originaux : Qingyun Liu, Bo Yan, Yang Liu, Yuji Roh, Ekansh Sharma, Likang Yin, Emma Olowo, Min-hsuan Tsai, Yuxuan Li, Diego Uribe, Saksham Aggarwal, Siqi Wu, Yuan Hao, Vikas Kedigehalli, Lukasz Heldt, Lichan Hon
Publié 2026-06-25
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Qingyun Liu, Bo Yan, Yang Liu, Yuji Roh, Ekansh Sharma, Likang Yin, Emma Olowo, Min-hsuan Tsai, Yuxuan Li, Diego Uribe, Saksham Aggarwal, Siqi Wu, Yuan Hao, Vikas Kedigehalli, Lukasz Heldt, Lichan Hong, Li Wei, Xinyang Yi

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez de comprendre les goûts d'une personne en matière de films. Autrefois, les systèmes de recommandation (comme ceux de YouTube) essayaient de faire cela en prenant tout l'historique de visionnage d'une personne pour le compresser dans une seule et minuscule « fiche de résumé » dense. Voyez cela comme essayer de décrire un roman entier en écrivant simplement une phrase sur un post-it. On perd beaucoup de nuances, de détails spécifiques et la saveur unique de l'histoire.

D'autres systèmes essayaient d'écrire un long paragraphe détaillé sur l'utilisateur. Mais ces paragraphes étaient souvent vagues, capturant des sujets généraux (comme « il aime les chats ») plutôt que les modèles spécifiques et profonds de ce qu'il a réellement regardé.

TokenMinds est un nouveau système conçu par Google DeepMind et YouTube qui résout cela en donnant aux utilisateurs une « carte d'identité numérique » composée de tokens discrets (comme un ensemble de codes spécifiques et significatifs) et en conservant l'ancienne « fiche de résumé » (embeddings denses) comme solution de secours.

Voici comment cela fonctionne, décomposé avec des analogies simples :

1. L'« ID Sémantique » (Le code postal magique)

Au lieu de donner à chaque vidéo un numéro aléatoire (comme « Vidéo n°49201 »), TokenMinds donne à chaque vidéo un ID Sémantique (SID).

  • L'analogie : Imaginez que chaque vidéo possède un « code postal » basé sur ce dont elle traite réellement. Une vidéo sur la « cuisson du pain au levain » pourrait avoir un code postal commençant par Alimentation-Boulangerie-Pain. Une vidéo sur la « réparation d'un évier » pourrait commencer par Maison-Plomberie.
  • Pourquoi cela aide : Si un utilisateur regarde une vidéo sur le « levain », le système ne voit pas seulement un numéro aléatoire ; il voit la partie « Alimentation-Boulangerie » du code. Cela aide le système à comprendre le sens derrière le visionnage, et pas seulement l'ID.

2. Le moteur à « Double Sortie » (La boîte à outils suisse)

TokenMinds utilise une architecture d'IA spéciale (encodeur-décodeur) qui agit comme un couteau suisse. Elle produit deux choses à la fois :

  • L'Embedding Dense (La fiche de résumé) : C'est le vecteur numérique continu de l�« ancienne école » que les systèmes existants savent déjà utiliser. C'est comme un instantané rapide de l'ambiance de l'utilisateur.
  • Les Tokens SID (Le code détaillé) : C'est la nouvelle partie. L'IA génère une liste de « codes postaux » spécifiques représentant les intérêts futurs de l'utilisateur. C'est comme si l'IA disait : « D'après ce que vous avez regardé, vous allez probablement vouloir : Alimentation-Boulangerie-Pain, Technologie-Codage-Python et Sports-Basketball ».

Le bénéfice : Le système tire le meilleur des deux mondes. Il garde les anciens systèmes satisfaits (en utilisant la fiche de résumé) tout en ajoutant une nouvelle couche de compréhension sémantique précise (les tokens). L'étude a montré qu'utiliser les deux ensemble fonctionne mieux qu'en utilisant l'un ou l'autre seul.

3. La livraison « Asynchrone » (Le système de précommande)

Générer ces tokens détaillés est un travail lourd, comme cuisiner un repas complexe. Si vous essayiez de cuisiner pendant que le client attendait au comptoir, ce serait trop lent.

  • L'analogie : TokenMinds utilise un système de « précommande ». Il génère la « carte d'identité » et les « tokens » de l'utilisateur en arrière-plan (de manière asynchrone) pendant que l'utilisateur navigue simplement. Lorsque l'utilisateur clique réellement sur « recommander », le système ne fait que récupérer la carte pré-préparée dans un casier de stockage rapide. Cela signifie que le système peut gérer des milliards d'utilisateurs sans ralentir.

4. Le « Traducteur Universel » (Un seul modèle pour toutes les vidéos)

YouTube possède deux types de vidéos très différents : le Format Long (comme un documentaire de 20 minutes) et le Format Court (comme les Shorts de 15 secondes). Habituellement, vous avez besoin de deux modèles différents pour les comprendre car les gens les regardent différemment.

  • L'analogie : TokenMinds est comme un traducteur universel. Il utilise le même système de « code postal » pour les vidéos longues et courtes. Il peut regarder l'historique d'un utilisateur regardant une émission de cuisine de 20 minutes et un hack de cuisine de 15 secondes et réaliser : « Ah, cette personne adore la cuisine ! ».
  • Le résultat : Au lieu d'entraîner et de faire fonctionner deux modèles distincts et coûteux, ils utilisent un seul modèle pour faire les deux tâches. Cela a réduit leurs coûts informatiques de 50 % pour l'entraînement et de 31 % pour le service, sans perdre en qualité.

5. Les Résultats (La preuve)

L'équipe a testé cela sur le trafic réel de YouTube (des milliards d'utilisateurs).

  • De meilleures recommandations : Lorsqu'ils ont ajouté ces nouveaux tokens au système de classement, ils ont constaté une augmentation mesurable du nombre de personnes interagissant avec les vidéos et de leur satisfaction.
  • Efficacité : En combinant les modèles de vidéos longues et courtes, ils ont économisé une quantité massive de puissance informatique.
  • Diversité : Le système ne se contentait pas de deviner la même chose encore et encore ; il générait une liste diversifiée d'intérêts potentiels, un peu comme un ami humain suggérant une variété de choses que vous pourriez aimer.

En bref : TokenMinds est une façon plus intelligente et plus efficace de comprendre ce que les utilisateurs veulent. Il arrête d'essayer de compresser le goût complexe d'une personne dans un seul chiffre et lui donne plutôt un ensemble de « codes » significatifs qui décrivent ses intérêts, tout en fonctionnant sur un moteur unique et rentable capable de gérer tous les types de contenu vidéo.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →