WHALE: A Scalable Unified Model for Recommendation with Wukong-HSTU Architecture
L'article présente WHALE, une architecture de recommandation unifiée et évolutive qui intègre les noyaux Wukong et HSTU via un nouveau mécanisme de fusion pour modéliser conjointement les caractéristiques non séquentielles et séquentielles, réalisant ainsi des gains de performance significatifs en mode hors ligne et en ligne dans les systèmes de production industriels.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous déambulez dans une immense et trépidante cité numérique où des millions de personnes font défiler, cliquent et regardent sans cesse. C'est le monde des systèmes de recommandation en ligne, ces moteurs invisibles derrière vos flux de réseaux sociaux, vos suggestions de vidéos et vos listes de courses. Leur travail consiste à deviner ce que vous voulez voir ensuite. Pour ce faire, ils s'appuient généralement sur deux types de indices très différents. Premièrement, il y a vos détails « statiques » : qui vous êtes, ce que vous aimez, l'heure de la journée et l'article spécifique qui est présenté. C'est comme un détective examinant le dossier d'un suspect et la scène du crime. Deuxièmement, il y a vos actions « dynamiques » : la longue et désordonnée trace de tout ce que vous avez cliqué, regardé ou acheté par le passé. C'est comme un détective observant toute l'histoire de la vie d'un suspect en temps réel.
Pendant longtemps, les systèmes de recommandation ont traité ces deux indices séparément. Certains modèles très intelligents étaient excellents pour mélanger les détails statiques (comme « cet utilisateur aime la science-fiction » + « c'est vendredi soir »), tandis que d'autres modèles étaient experts pour lire la longue histoire de votre comportement passé (comme « vous avez regardé trois films spatiaux à la suite, donc vous en voulez probablement un quatrième »). La grande question était : pourrions-nous construire un super-modèle capable d'être aussi brillant dans les deux domaines, sans pour autant devenir trop lent ou trop coûteux à exploiter ? Si nous y parvenions, cela pourrait signifier voir un contenu qui semble parfaitement adapté à qui vous êtes et à ce que vous faites actuellement, tout cela en même temps.
Voici venu WHALE, une nouvelle architecture développée par des chercheurs de Meta qui tente de résoudre ce casse-tête. Voyez WHALE comme une gigantesque équipe de détectives multicouches travaillant ensemble. Au lieu d'avoir un détective qui lit le dossier et un autre qui regarde la vidéo, WHALE les place dans la même pièce, couche par couche. Dans chaque couche du modèle, il y a une équipe « Wukong » (l'expert du mélange des détails statiques) et une équipe « HSTU » (l'expert de la lecture de la longue histoire de vos actions). Mais voici le tour de magie : elles ne se contentent pas de travailler côte à côte ; elles discutent constamment. L'équipe Wukong demande à l'équipe HSTU : « Hé, sur la base de cet article spécifique que je regarde, quelle partie de l'histoire longue de l'utilisateur est la plus importante en ce moment ? » L'équipe HSTU se concentre alors sur ce souvenir spécifique et le lui transmet. Cela se produit encore et encore au fur et à mesure que les données traversent le modèle, permettant au système d'affiner constamment sa compréhension.
L'article suggère que cet « échange progressif » change la donne. Lorsque les chercheurs ont testé WHALE sur de vastes quantités de données réelles provenant d'une plateforme de médias sociaux, ils ont constaté qu'il devenait systématiquement meilleur pour prédire ce que les utilisateurs allaient cliquer à mesure qu'ils agrandissaient le modèle et lui donnaient un historique plus long à lire. Plus précisément, lorsqu'ils augmentaient la longueur de l'historique de l'utilisateur que le modèle pouvait voir, la qualité des recommandations s'améliorait. Ils ont également constaté que rendre le modèle plus profond (plus de couches) et plus large (plus de puissance de traitement) continuait de donner de meilleurs résultats, suggérant que le système passe bien à l'échelle.
Cependant, les chercheurs ont également testé une méthode plus simple pour combiner ces deux types de modèles, qu'ils appellent approche « hybride superficielle » (shallow-hybrid). Dans cette ancienne méthode, l'historique est compressé en un bref résumé avant d'être mélangé aux détails statiques. L'article soutient que c'est une erreur car cela jette aux oubliettes les détails précis. Leurs expériences ont montré que le dialogue profond, couche par couche, de WHALE était nettement supérieur à cette approche superficielle, prouvant que maintenir une communication constante entre les deux équipes est crucial.
Bien entendu, construire un système aussi complexe est coûteux. L'équipe a dû inventer un code informatique spécial et personnalisé (utilisant ce qu'on appelle des « noyaux Triton ») pour s'assurer que WHALE puisse fonctionner assez rapidement pour être utilisé par des millions de personnes simultanément. Dans les tests en conditions réelles, WHALE a effectivement amélioré les indicateurs principaux de l'engagement des utilisateurs, mais cela s'est accompagné d'un léger coût : le système peut traiter environ 5 % de requêtes par seconde en moins par rapport à l'ancien système. Malgré ce léger ralentissement, l'amélioration de la qualité des recommandations a été considérée comme une victoire, et le système est déjà déployé en production. L'article conclut que, bien que nous ne puissions pas simplement rendre les modèles infiniment grands pour tout résoudre, l'unification de ces deux manières différentes de penser les données — les détails statiques et l'historique dynamique — au sein d'une architecture unique et interactive est une voie puissante et pratique pour l'avenir des recommandations.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.