← Derniers articles
🤖 AI

Towards a Densing Law for User Representation Learning at Billion-Scale Capacity

Cet article propose la « Loi de Densification du Comportement de l'Utilisateur », un modèle de mise à l'échelle quantitatif liant la taille des données à la capacité de tokenisation minimale suffisante, et introduit ALGN, une méthode de tokenisation adaptative qui surmonte les goulots d'étranglement des données à l'échelle du milliard et surpasse les modèles de référence existants dans l'apprentissage de la représentation de l'utilisateur.

Auteurs originaux : Bin Dou, Junru Zhang, Zhaoyi Yuan, Wuliang Huang, Letian Gong, Baokun Wang, Huan Li, Yu Cheng, Weiqiang Wang

Publié 2026-08-25
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Bin Dou, Junru Zhang, Zhaoyi Yuan, Wuliang Huang, Letian Gong, Baokun Wang, Huan Li, Yu Cheng, Weiqiang Wang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans le monde numérique, chaque clic, achat et recherche laisse une trace. Pour les entreprises qui construisent les plateformes que nous utilisons quotidiennement, ces traces ne sont pas de simples enregistrements ; elles sont la matière première permettant de comprendre qui nous sommes. En analysant l'histoire longue et sinueuse des actions d'une personne, les systèmes d'intelligence artificielle tentent de construire un résumé unique et puissant des préférences et des habitudes de cet individu. Ce résumé, souvent appelé représentation de l'utilisateur, agit comme une empreinte digitale numérique qui aide à décider quelles actualités montrer, quels produits recommander ou quelles publicités afficher. Pendant des années, la croyance prédominante chez les ingénieurs était simple : pour rendre ces empreintes plus précises, il suffisait simplement d'avoir plus de données. La logique semblait saine — alimentez le système avec plus d'utilisateurs, des historiques de vie plus longs et des cerveaux informatiques plus vastes pour tout traiter, et les résultats s'amélioreraient naturellement.

Cependant, une nouvelle étude remet en question cette hypothèse du « plus est mieux ». Des chercheurs d'Ant Group et de l'Université de Zhejiang ont cherché à savoir si cette stratégie d'expansion infinie fonctionne réellement face à l'échelle massive des données du monde réel, telles que les milliards de transactions traitées par Alipay. Ils ont découvert qu'il existe un point où l'ajout d'informations brutes supplémentaires cesse d'aider et commence à nuire. Tout comme une pièce peut devenir si encombrée de meubles qu'il devient impossible de s'y déplacer, un système peut devenir si inondé de données répétitives et de faible valeur qu'il perd sa capacité à voir ce qui compte vraiment. L'équipe a découvert que le goulot d'étranglement n'est pas la taille du modèle informatique, mais la qualité et la densité de l'information qui lui est injectée. Ils proposent une nouvelle approche qui se concentre sur la compression de cet historique massif en un résumé compact et de haute valeur, permettant au système d'apprendre davantage à partir de moins de données.

Les chercheurs ont commencé par tester les limites de l'approche traditionnelle sur un ensemble de données contenant des centaines de millions d'utilisateurs. Ils ont augmenté systématiquement le nombre d'utilisateurs, la longueur de la fenêtre temporelle observée et la taille du modèle informatique lui-même. Ils ont constaté que les performances s'amélioraient rapidement au début, puis heurtaient un mur infranchissable. Lorsque l'on ajoutait plus d'utilisateurs au-delà d'un certain point, ou que l'on examinait des historiques de plus de soixante jours, le système n'apprenait plus rien de nouveau. Les données supplémentaires n'étaient principalement que les mêmes vieilles habitudes répétées encore et encore, comme une personne achetant le même café chaque matin pendant une décennie. Même lorsqu'ils rendaient le modèle informatique nettement plus grand, celui-ci ne devenait pas plus intelligent ; il se contentait de mémoriser ces détails répétitifs sans acquérir de véritable compréhension des préférences réelles de l'utilisateur. Ce phénomène, que les auteurs appellent le « mur d'échelle du comportement brut » (raw behavioral scaling wall), a montré que simplement jeter plus de données sur le problème n'était plus une stratégie viable.

Pour briser ce mur, l'équipe a introduit une méthode de « densification » des données. Au lieu de nourrir le système avec l'intégralité de l'historique désordonné des événements bruts, ils ont d'abord traduit ces événements en un ensemble compact de jetons numériques, de la même manière qu'un livre peut être résumé en quelques phrases clés sans en perdre l'intrigue. Ils ont utilisé une technique qui regroupe les comportements similaires et élimine la redondance, ne conservant que les signaux les plus informatifs. Lorsqu'ils ont entraîné leurs modèles sur ces versions compressées et tokenisées des historiques d'utilisateurs, les résultats ont été frappants. Le système continuait de s'améliorer même à mesure que les données augmentaient, alors que le système entraîné sur des données brutes s'était déjà arrêté de progresser. Les données compressées permettaient au modèle de voir la forêt plutôt que de se perdre dans les arbres, maintenant sa capacité à apprendre et à s'adapter même lorsque le volume d'entrée était massif.

L'étude est allée plus loin en définissant une règle précise pour déterminer la quantité de compression nécessaire à mesure que les données croissent. Ils ont découvert que l'espace requis pour stocker le résumé d'un utilisateur n'a pas besoin de croître en proportion directe avec la quantité de données brutes. Au contraire, cela suit un schéma prévisible où la capacité nécessaire croît lentement à mesure que le volume de données augmente. Cela signifie que pour un système gérant un milliard d'utilisateurs, vous n'avez pas besoin de mille fois plus de mémoire ou de puissance de calcul ; vous avez seulement besoin d'une quantité calculée, bien plus petite, de jetons de haute qualité. Cette découverte, qu'ils nomment la « Loi de Densification Comportementale » (Behavioral Densing Law), fournit un guide mathématique aux ingénieurs pour savoir exactement quelle compression appliquer pour toute quantité de données donnée, garantissant qu'ils ne gaspillent pas de ressources en informations inutiles.

Enfin, les chercheurs ont développé un nouvel outil appelé le Réseau à Porte de Longueur Adaptative (Adaptive Length Gated Network) pour mettre cette loi en pratique. Les méthodes précédentes traitaient l'historique de chaque utilisateur de la même manière, attribuant la même quantité d'espace compressé à tout le monde, indépendamment de la complexité réelle de leur vie. Le nouvel outil est plus intelligent ; il examine chaque utilisateur individuellement et décide de la quantité de détails à conserver. Pour un utilisateur ayant une vie très routinière et prévisible, il attribue un résumé très court. Pour un utilisateur ayant un ensemble complexe et diversifié d'intérêts et d'habitudes, il attribue un résumé plus long et plus détaillé. Cette approche dynamique garantit qu'aucune puissance de calcul n'est gaspillée pour des données ennuyeuses et répétitives, tandis que les utilisateurs complexes reçoivent toujours l'attention dont ils ont besoin. Lors de leurs tests, cette méthode adaptative a non seulement surpassé tous les systèmes précédents en termes de précision, mais elle a également utilisé nettement moins de capacité de calcul, prouvant que l'efficacité et la performance peuvent aller de pair.

Les implications de ce travail s'étendent bien au-delà d'une seule application ou d'un seul site web. Cela suggère un changement fondamental dans la façon dont nous construisons les systèmes intelligents de demain. Au lieu de la course sans fin pour collecter plus de données et construire des modèles plus grands, la voie à suivre consiste à apprendre à extraire plus de valeur des données que nous possédons déjà. En se concentrant sur la densité de l'information plutôt que sur le simple volume, nous pouvons construire des systèmes qui sont non seulement plus précis, mais aussi plus efficaces et durables. L'étude démontre que, à l'ère du Big Data, l'outil le plus puissant n'est pas un seau plus grand, mais un meilleur filtre.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →