Résumé Technique : Les jetons sont tout ce dont vous avez besoin : des identifiants sémantiques à double usage pour atteindre l'efficacité E/S de niveau LLM dans les systèmes de recommandation
1. Énoncé du problème
Les systèmes de recommandation à grande échelle sont confrontés à un goulot d'étranglement critique de « Mur de la Mémoire » causé par la dépendance à de massives tables d'embeddings denses en virgule flottante. Alors que les grands modèles de langage (LLM) passent à l'échelle efficacement grâce à leur espace de jetons discrets unifié et leur nature limitée par le calcul, les systèmes de recommandation sont contraints par les entrées/sorties (E/S) et la bande passante mémoire nécessaires pour ingérer, stocker et joindre des vecteurs continus de haute dimension (par exemple, l'historique de l'utilisateur, les embeddings de contenu) lors de l'entraînement et de l'inférence.
Cette limitation devient particulièrement aiguë à mesure que les systèmes évoluent pour gérer des activités séquentielles d'utilisateurs dont la longueur atteint ou dépasse 104. Les approches traditionnelles qui tentent d'incorporer des signaux de contenu riches via des embeddings denses souffrent de l'empreinte de données et des latences de service prohibitives. De plus, bien que la « Récupération Générative » ait introduit des jetons sémantiques pour remplacer les identifiants catégoriels, les méthodes existantes traitent largement ces jetons strictement comme des identifiants, échouant à les exploiter pour une reconstruction efficace des caractéristiques de contenu continues de haute dimension.
2. Méthodologie : Identifiants Sémantiques à Double Usage
Les auteurs proposent un cadre qui transforme les embeddings de contenu continus de haute dimension en séquences de jetons discrets compacts. Cette approche s'inspire des techniques de compression de données de vision par ordinateur (spécifiquement VQ-VAE et VQGAN), prouvant que les données spatiales continues peuvent être compressées en jetons discrets sans perdre leur signification sémantique.
La méthodologie centrale consiste en deux rôles concomitants pour les identifiants sémantiques (Si) générés :
A. Génération d'Identifiants Sémantiques via la Quantification
Les embeddings de contenu de haute dimension (ei∈Rd), typiquement dérivés de modèles multimodaux pré-entraînés, sont compressés en une séquence de K jetons discrets en utilisant une quantification hiérarchique (par exemple, la Quantification Résiduelle ou RQ-VAE).
Si=[ti,1,ti,2,…,ti,K]
Cela réduit les besoins de stockage de d×32 bits à K×log2(V) bits, atteignant des taux de compression de 50 à 100×.
B. Cadre à Double Usage
Le cadre utilise ces jetons pour deux fonctions simultanées au sein du modèle de recommandation :
Identité Collaborative (Apprentissage In-Graph) : La séquence de jetons est traitée comme des caractéristiques catégorielles. Le modèle apprend des embeddings pour chaque jeton (ou combinaisons de n-grammes) afin de capturer les modèles d'interaction utilisateur-article. Les stratégies incluent :
- Unigram : Embeddings de jetons indépendants.
- Bigram chevauchant : Fenêtre glissante pour capturer les transitions locales.
- N-gram imbriqué : Préfixes hiérarchiques pour imposer un regroupement sémantique (par exemple, tous les vidéos de "Jazz" partagent un embedding de haut niveau).
- Modèle Sentence Piece (SPM) : Combinaison de jetons adaptative basée sur la distribution des données.
Ce composant gère la mémorisation et la généralisation, particulièrement pour les articles en démarrage à froid (cold-start) et de longue traîne.
Reconstruction de Contenu (SiDec) : Pour récupérer le signal de contenu « pur » sans le coût d'E/S d'une jointure de vecteurs denses, le système emploie un Décodeur Sémantique (fθ).
- Processus : Les jetons discrets Si sont recherchés dans un codebook statique (ϕ) pour récupérer des embeddings latents, qui sont ensuite passés à travers un décodeur léger (MLP ou Transformer peu profond) pour reconstruire une approximation de l'embedding original (e^i).
- Intégration : Cette reconstruction se fait à la volée au sein du graphe du modèle. Cela remplace la nécessité de stocker ou de journaliser des vecteurs denses dans les données d'entraînement. Le décodeur peut être gelé (en utilisant un codebook pré-entraîné) ou entraînable (pour s'aligner sur des tâches en aval spécifiques).
3. Principales Contributions
- Cadre Novateur à Double Usage : L'article introduit un système qui résout le « Mur de la Mémoire » en intégrant l'apprentissage d'identifiants sémantiques standard avec le décodage sémantique (SiDec) à la volée. Cela équilibre la mémorisation spécifique aux articles (via des jetons discrets) avec la généralisation consciente du contenu (via la reconstruction de la sémantique continue).
- Percée de l'Efficacité des E/S : En remplaçant le stockage massif de vecteurs par une reconstruction à la demande, le cadre réduit considérablement l'empreinte des données et les surcharges du système. Il déplace la charge du système de la récupération de vecteurs denses liée au disque vers une reconstruction à la volée liée au calcul.
- Validation à l'Échelle de la Production : Les auteurs fournissent des preuves empiriques étendues issues d'une plateforme majeure de partage de vidéos (YouTube), démontrant l'efficacité du cadre tant dans les modèles de classement que de récupération.
4. Résultats Expérimentaux
Le cadre a été évalué via des benchmarks hors ligne et des tests A/B en ligne en production.
Évaluation Hors Ligne (Modèle de Récupération)
L'étude a comparé cinq bras expérimentaux pour analyser le compromis entre la fidélité de la représentation et le débit d'entraînement :
- Contrôle : IDs standards, pas d'embeddings de contenu (Débit le plus élevé : 16,80 étapes/s, qualité la plus faible).
- Bras 1 (Dense Brut) : Ingestion directe d'embeddings de dimension 64 (La qualité s'améliore, mais le débit chute de 28,2 % à 12,07 étapes/s en raison des goulots d'étranglement d'E/S).
- Bras 2 & 3 (SiDec) : Utilisation de décodeurs de codebook (v0 et v1). Ces bras ont récupéré le débit à environ 15,3 étapes/s (proche du niveau Contrôle) tout en maintenant ou en dépassant la qualité de l'approche dense brute.
- Bras 4 (SiDec + Mise à l'échelle) : La combinaison du codebook v1 avec une mise à l'échelle architecturale a obtenu le meilleur taux de perte global (2,681) et le meilleur Hit Rate @100 (0,2910), avec une accélération du débit de 20,4 % par rapport à l'approche dense brute.
Conclusion : La tokenisation discrète brise avec succès le goulot d'étranglement des E/S, permettant une mise à l'échelle simultanée de la profondeur du modèle et de la précision de la récupération.
Déploiement en Ligne
Le cadre a été déployé dans des modèles de classement multi-tâches et des modèles de récupération transformeurs fondamentaux.
- Modèles de Classement : L'ajout du flux de reconstruction de contenu SiDec aux caractéristiques d'ID sémantiques existantes a généré des gains significatifs dans l'« Engagement Satisfait en Ligne » (une métrique composite du temps de visionnage et des interactions).
- Classement de la page de visionnage (Watchpage) : Amélioration de +0,80 %.
- Classement de la page d'accueil (Homepage) : Amélioration de +0,22 %.
- Modèles de Récupération : +0,13 % d'amélioration sur la page d'accueil.
- Impact : Les améliorations étaient statistiquement significatives et bénéficiaient de manière disproportionnée aux comptes naissants avec des historiques creux et du contenu de longue traîne, atténuant efficacement le biais de popularité.
5. Signification et Revendications
L'article affirme que « Les jetons sont tout ce dont vous avez besoin » pour des recommandations riches en contenu et hautement efficaces. La signification de ce travail réside dans son changement philosophique et architectural :
- Découplage de l'E/S Continue : Les auteurs soutiennent que les distributions continues de haute dimension n'ont pas besoin d'être traitées dans leur format natif en virgule flottante pour conserver leur pouvoir prédictif. En quantifiant l'espace de caractéristiques entier (y compris le contexte de l'utilisateur, les densités historiques et les embeddings de contenu) en un vocabulaire unifié de jetons discrets, les systèmes de recommandation peuvent se découpler des E/S continues en virgule flottante.
- Alignement avec les Lois d'Échelle des LLM : Cette approche aligne les systèmes de recommandation avec les lois d'échelle matérielles limitées par le calcul dont jouissent les LLM, s'éloignant des contraintes de mémoire des embeddings denses traditionnels.
- Utilité Duale : Le cadre démontre que les jetons discrets peuvent servir un double usage : agir comme des caractéristiques catégorielles structurées pour le filtrage collaboratif et comme des représentations compressées pour la reconstruction de contenu à la volée, éliminant ainsi le besoin de tables d'embeddings séparées et lourdes.
Les auteurs concluent que ce paradigme offre une voie pour gérer des séquences d'utilisateurs ultra-longues et des espaces de caractéristiques massifs sans les coûts prohibitifs associés au stockage et à la récupération traditionnels de vecteurs denses.