← Derniers articles
🤖 AI

Kunlun: Establishing Scaling Laws for Massive-Scale Recommendation Systems through Unified Architecture Design

Le document présente Kunlun, une architecture unifiée pour les systèmes de recommandation à grande échelle qui établit des lois d'échelle prévisibles en traitant la faible efficacité de mise à l'échelle grâce à des optimisations de bas niveau telles que l'Attention par Produit Scalaire Généralisée et le Regroupement Hiérarchique de Graines (Hierarchical Seed Pooling), parallèlement à des innovations de haut niveau comme le Saut de Calcul (Computation Skip), doublant ainsi l'efficacité de mise à l'échelle et réalisant un impact significatif en production dans Meta Ads.

Auteurs originaux : Bojian Hou, Xiaolong Liu, Xiaoyi Liu, Jiaqi Xu, Yasmine Badr, Mengyue Hang, Sudhanshu Chanpuriya, Junqing Zhou, Yuhang Yang, Han Xu, Qiuling Suo, Laming Chen, Yuxi Hu, Jiasheng Zhang, Huaqing Xiong, Y
Publié 2026-06-09
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Bojian Hou, Xiaolong Liu, Xiaoyi Liu, Jiaqi Xu, Yasmine Badr, Mengyue Hang, Sudhanshu Chanpuriya, Junqing Zhou, Yuhang Yang, Han Xu, Qiuling Suo, Laming Chen, Yuxi Hu, Jiasheng Zhang, Huaqing Xiong, Yuzhen Huang, Chao Chen, Yue Dong, Yi Yang, Shuo Chang, Xiaorui Gan, Wenlin Chen, Santanu Kolay, Darren Liu, Jade Nie, Chunzhi Yang, Ellie Wen, Jiyan Yang, Huayu Li

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous dirigiez une place de marché numérique massive et à haute vitesse (comme celle utilisée par Meta pour ses publicités). Chaque seconde, des millions de personnes font défiler leur écran, et le système doit deviner quelle publicité chaque personne cliquera. Pour faire ces suppositions, le système utilise un « cerveau » (un modèle d'apprentissage automatique) qui examine deux types d'indices :

  1. L'Histoire (Séquence) : Ce que l'utilisateur a fait récemment (par exemple : « J'ai cliqué sur une chaussure, puis un chapeau, puis un sac à dos »).
  2. Le Instantané (Contexte) : Qui est l'utilisateur en ce moment (par exemple : « Il pleut », « Ils sont à New York », « Ils ont 25 ans »).

Pendant longtemps, construire un « cerveau » capable de gérer à la fois l'histoire et l'instantané de manière efficace revenait à essayer de conduire une voiture de course avec des roues carrées. Cela fonctionnait, mais c'était incroyablement lent et consommait énormément de carburant (puissance de calcul). Les chercheurs appellent ce problème une « faible efficacité de mise à l'échelle » (poor scaling efficiency). En gros, lorsque les chercheurs essayaient de rendre le cerveau plus grand pour le rendre plus intelligent, il ne devenait pas assez intelligent assez vite pour justifier le coût supplémentaire.

Voici venu Kunlun. Nommé d'après une chaîne de montagnes qui unifie des sommets divers, Kunlun est une nouvelle architecture conçue pour réparer ces roues carrées. L'article affirme qu'il résout le problème en optimisant le système à deux niveaux : les « rouages » (bas niveau) et la « gestion du trafic » (haut niveau).

Voici comment fonctionne Kunlun, en utilisant des analogies de la vie quotidienne :

1. Les corrections de bas niveau : Réparer le moteur

Les anciens systèmes possédaient des pièces inefficaces, ce qui faisait que le « moteur » de l'ordinateur (le GPU) restait inactif en attendant les données. Kunlun remplace celles-ci par des pièces haute performance :

  • GDPA (Le Traducteur Personnalisé) :
    • Le Problème : L'ancien système essayait de traduire l'« Histoire » en se basant sur l'« Instantané » en utilisant un processus maladroit, étape par étape, ce qui gaspillait du temps.
    • La Solution : Kunlun utilise la GDPA (Generalized Dot-Product Attention). Voyez cela comme un traducteur qui ne se contente pas de traduire mot à mot, mais qui comprend instantanément le contexte de la phrase entière. Il fusionne les étapes pour que l'ordinateur n'ait pas à s'arrêter et repartir, rendant le moteur beaucoup plus fluide.
  • HSP (Le Résumeur) :
    • Le Problème : Les utilisateurs ont des historiques longs (des milliers de clics). L'ancien système essayait de lire chaque clic individuellement, ce qui était accablant.
    • La Solution : Le HSP (Hierarchical Seed Pooling) est comme un éditeur intelligent. Au lieu de lire une biographie de 500 pages, il lit le livre, écrit un résumé de 10 pages, puis un abstract d'une page. Il condense l'historique long en un résumé compact et puissant que le système peut réellement utiliser sans s'enliser.
  • Sliding Window Attention (Le Focus Local) :
    • Le Problème : L'ancien système essayait de comparer la toute première chose qu'un utilisateur a faite avec ce qu'il fait en ce moment même. Mais généralement, ce que vous avez fait la semaine dernière importe bien plus que ce que vous avez fait l'année dernière.
    • La Solution : La Sliding Window Attention dit au système : « Ne regarde pas tout l'historique ; regarde juste les dernières pages. » Elle se concentre sur les interactions récentes, ce qui économise une quantité massive de puissance de calcul tout en maintenant la précision des prédictions.

2. Les corrections de haut niveau : Gestion intelligente du trafic

Même avec un excellent moteur, vous pouvez gaspiller du carburant si vous roulez dans la mauvaise direction ou si vous vous arrêtez à chaque feu rouge. Kunlun change la façon dont les ressources sont distribuées :

  • CompSkip (La Voie Express) :
    • Le Problème : L'ancien système forçait le cerveau à effectuer exactement le même travail lourd à chaque étape, même quand ce n'était pas nécessaire.
    • La Solution : CompSkip est comme un système de feux de signalisation intelligents. Il réalise que certaines étapes n'ont pas besoin d'un « auto-contrôle » complet (Self-Attention) et que certaines n'ont pas besoin d'un « résumé » complet (HSP). Il saute les étapes inutiles sur des couches alternées. Si la voiture va tout droit, elle n'a pas besoin de vérifier le rétroviseur chaque seconde. Cela économise énormément d'énergie.
  • Événement de Personnalisation au Niveau de l'Événement (Le Traitement VIP) :
    • Le Problème : L'ancien système traitait un « clic » (un signal fort) de la même manière qu'une « impression » (le simple fait de voir une publicité). Il gaspillait des ressources sur des événements de faible valeur.
    • La Solution : Kunlun accorde un traitement VIP aux événements importants. Si un utilisateur est sur le point d'acheter quelque chose (un événement à haute valeur), le système alloue plus de puissance de calcul et une analyse plus profonde. S'il s'agit d'une simple navigation occasionnelle, il utilise une approche plus légère et plus rapide. C'est comme un restaurant qui offre un menu de dégustation complet à un client VIP et un café rapide à quelqu'un de passage.

Le Résultat : La « Loi d'Échelle » (Scaling Law)

L'article affirme qu'en combinant ces correctifs, Kunlun atteint quelque chose que l'industrie peinait à accomplir : des Lois d'Échelle Prévisibles.

Dans le passé, doubler la puissance de calcul ne signifiait pas toujours doubler l'intelligence. Avec Kunlun, la relation est prévisible et efficace.

  • Boost d'Efficacité : Sur les derniers supercalculateurs (GPU NVIDIA B200), Kunlun utilise le matériel deux fois plus efficacement que les méthodes précédentes (passant d'une utilisation de 17 % à 37 %).
  • Impact Réel : Ce n'est pas seulement une expérience de laboratoire. Meta a déployé Kunlun dans ses principaux modèles publicitaires. Le résultat ? Une amélioration de 1,2 % des indicateurs commerciaux clés. Dans le monde de la publicité, où des milliards de décisions sont prises quotidiennement, ce petit pourcentage est une victoire massive.

En résumé : Kunlun est une façon plus intelligente, plus svelte et plus organisée de construire des systèmes de recommandation. Il arrête de gaspiller du carburant avec des roues carrées, saute les arrêts inutiles et donne un traitement VIP aux indices les plus importants, permettant au système de devenir nettement plus intelligent à mesure qu'il grandit.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →