Beyond Item IDs: Scaling Short-Form-Video Recommendation via Semantic-Native Long Sequence Modeling
Cet article présente un cadre déployé en production pour la recommandation de vidéos courtes à l'échelle d'un milliard d'utilisateurs qui surmonte les limitations traditionnelles de la modélisation de séquences en remplaçant les identifiants vidéo (Video IDs) épars par des identifiants sémantiques (Semantic IDs) compacts et en introduisant un Transformeur de compression conscient du global (Global-Aware Compression Transformer) pour modéliser efficacement les séquences de comportement utilisateur ultra-longues, entraînant des réductions significatives des coûts de calcul et des améliorations substantielles de l'engagement des utilisateurs.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous êtes un bibliothécaire essayant de recommander le livre parfait à un lecteur. Mais au lieu de quelques livres, ce lecteur a regardé des milliers et des milliers de vidéos courtes. Votre tâche est de vous souvenir de toutes ces vidéos pour deviner ce qu'il veut voir ensuite.
Ce document décrit un nouveau système que Google a construit pour faire exactement cela pour les vidéos courtes (comme TikTok ou YouTube Shorts). Ils ont été confrontés à deux problèmes massifs qui rendaient cette tâche presque impossible, et ils les ont résolus grâce à deux astuces ingénieuses.
Les deux grands problèmes
1. Le problème de l'étiquette (Goulot d'étranglement de la représentation)
Imaginez que chaque vidéo du monde possède un numéro d'identification unique et aléatoire, comme un numéro de série sur un grille-pain.
- Le problème : Si vous avez un milliard de vidéos, vous avez besoin d'un milliard de badges d'identification différents. Ces badges ne sont que des numéros aléatoires ; ils ne disent rien sur la vidéo. Une vidéo sur les « chats » et une vidéo sur les « voitures » peuvent avoir des identifiants qui ne se ressemblent pas du tout.
- Le résultat : L'ordinateur doit mémoriser chaque interaction séparément. C'est comme essayer de mémoriser un milliard de numéros de téléphone aléatoires. De plus, lorsqu'une nouvelle vidéo (un « démarrage à froid » ou cold start) apparaît, le système n'a aucune idée de ce qu'elle contient car il n'a jamais vu cet identifiant aléatoire auparavant.
2. Le problème de la surcharge de mémoire (Goulot d'étranglement computationnel)
Imaginez que vous essayez de lire un livre où chaque page est connectée à toutes les autres pages.
- Le problème : Pour comprendre l'historique de 2 000 vidéos d'un utilisateur, un cerveau informatique standard (un Transformer) essaie de comparer chaque vidéo avec toutes les autres vidéos. Si vous doublez le nombre de vidéos, le travail ne fait pas simplement le double, il quadruple. Cela devient si lourd que l'ordinateur manque de mémoire et plante, ou met trop de temps à répondre.
La solution : Deux nouvelles astuces
Les auteurs ont construit un système qui résout ces deux problèmes à la fois.
Astuce n°1 : Le système de « Catégories Intelligentes » (Identifiants sémantiques natifs)
Au lieu d'utiliser des numéros de série aléatoires, ils ont donné aux vidéos des étiquettes significatives basées sur leur contenu réel.
- L'analogie : Imaginez qu'au lieu de numéros aléatoires, chaque vidéo soit étiquetée avec une « Catégorie » et une « Sous-catégorie ».
- L'ancienne méthode : Vidéo n°99283 (Aléatoire).
- La nouvelle méthode : Vidéo = « Gaming » + « Shooter ».
- Comment ça marche : Ils ont utilisé une IA spéciale pour regrouper les vidéos dans une hiérarchie. Pour l'historique long des vidéos, ils n'ont utilisé que les deux premiers niveaux de cette hiérarchie (par exemple, juste « Gaming » et « Shooter »).
- L'avantage :
- Une bibliothèque plus petite : Ils n'ont plus besoin d'un milliard de badges ; ils ont juste besoin de badges pour les catégories. Cela réduit la mémoire nécessaire pour le « dictionnaire » des vidéos.
- Une meilleure prédiction : Si un utilisateur adore les vidéos « Gaming-Shooter », et qu'une nouvelle vidéo sort et qu'elle est aussi classée « Gaming-Shooter », le système sait instantanément qu'il doit la recommander, même s'il ne l'a jamais vue auparavant. Cela résout le problème du « démarrage à froid ».
Astuce n°2 : La stratégie de « Groupement » (Compression consciente du contexte global)
Au lieu de regarder chaque vidéo une par une, le système les regroupe en « super-blocs ».
- L'analogie : Imaginez que vous lisez un journal intime de 2 000 pages.
- L'ancienne méthode : Vous lisez chaque mot et essayez de connecter chaque mot à tous les autres mots. Épuisant !
- La nouvelle méthode : Vous prenez 4 pages à la fois et vous les collez ensemble pour former une seule « Super-Page ». Maintenant, vous n'avez plus que 500 Super-Pages à lire.
- Comment ça marche : Ils prennent 4 vidéos consécutives et les empilent ensemble pour former un seul « Super-Token ». Cela réduit le nombre d'éléments que l'ordinateur doit traiter par 4.
- L'avantage :
- Vitesse : Comme il y a moins d'éléments à comparer, l'ordinateur travaille beaucoup plus vite et utilise beaucoup moins de mémoire (92 % de moins !).
- Lecture plus intelligente : En collant les pages ensemble, l'ordinateur peut voir les détails au sein de ce groupe (comme la façon dont l'utilisateur a réagi à une séquence spécifique de vidéos) tout en gardant une vision d'ensemble.
- L'« Ancre Globale » : Ils ont ajouté un jeton spécial de « Question Globale » au début de la liste. Considérez cela comme un bibliothécaire demandant : « Quelle est l'ambiance générale de la vie de cette personne ? » Cela aide le système à équilibrer les détails spécifiques des vidéos récentes avec la personnalité à long terme de l'utilisateur.
Les résultats
Lorsqu'ils ont testé cela dans le monde réel avec des milliards d'utilisateurs :
- C'était plus rapide : Le système utilisait beaucoup moins de mémoire informatique et fonctionnait beaucoup plus rapidement.
- Il se souvenait de plus de choses : Comme c'était plus rapide, ils pouvaient lui fournir 2 000 vidéos d'historique au lieu de seulement 800.
- Les gens étaient plus satisfaits : Les utilisateurs ont regardé plus de vidéos qu'ils aimaient, ont passé plus de temps à regarder et ont découvert plus de nouveaux contenus qu'ils appréciaient.
Résumé
Le document traite de la construction d'un moteur de recommandation capable de se souvenir de tout l'historique vidéo d'un utilisateur sans avoir de migraine. Ils y parviennent en donnant des noms significatifs aux vidéos au lieu de numéros aléatoires, et en regroupant les vidéos en blocs afin que l'ordinateur n'ait pas à faire des calculs sur chacune d'elles individuellement. Le résultat est un système plus rapide, moins coûteux à exploiter et qui propose de meilleures recommandations.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.