← Derniers articles
🤖 machine learning

MMRM: A Multiplex Multimodal Representation Model for Product Ranking in E-commerce Search

Le papier propose MMRM, un cadre unifié qui aligne les grands modèles de langage multimodaux avec divers signaux collaboratifs pour générer des représentations multiplexes d'articles et d'utilisateurs, améliorant significativement les performances et l'efficacité du classement de la recherche dans le moteur de recherche de JD.

Auteurs originaux : Zhen-Lin Chen, Maosen Sheng, Peng Lin, Jianmin Chen, Zhuojian Xiao, Dongyue Wang, Xiwei Zhao

Publié 2026-07-14
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zhen-Lin Chen, Maosen Sheng, Peng Lin, Jianmin Chen, Zhuojian Xiao, Dongyue Wang, Xiwei Zhao

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous dirigez un centre commercial numérique massif et ultra-rapide (comme JD.com) où des millions de personnes recherchent le jean parfait. Pour les aider à trouver ce qu'ils veulent, vous avez besoin d'un assistant intelligent qui ne se contente pas de lire le texte sur une étiquette de produit, mais qui « voit » aussi l'image, comprend le style et sait exactement ce que le client recherche.

Pendant longtemps, ces assistants ont eu un problème délicat. Ils étaient comme des étudiants qui n'étudiaient que pour un examen spécifique à la fois. S'ils étudiaient pour la « Recherche », ils étaient excellents pour faire correspondre une requête textuelle à un produit. S'ils étudiaient pour le « Panier », ils étaient doués pour savoir ce que les gens ajoutent à leurs paniers d'achat. Mais essayer de faire étudier à un seul « super-étudiant » (un grand modèle de langage multimodal généraliste) tous ces différents examens en même temps aboutissait généralement à un désordre confus. Les anciennes méthodes tentaient de forcer un « super-étudiant » à apprendre à partir d'un seul type de signal, ou traitaient les notes de l'étudiant comme une liste générique de faits qui n'aidait pas vraiment à prédire ce qu'un utilisateur spécifique voulait ensuite.

Le papier présente un nouveau système appelé MMRM (Multiplex Multimodal Representation Model) qui résout cela en agissant comme un chef cuisinier expert possédant une seule cuisine de haute technologie, mais avec quatre livres de recettes spécialisés.

La Grande Idée : Une seule cuisine, quatre chefs spécialisés
Au lieu de construire quatre cuisines (modèles) séparées pour chaque tâche, le MMRM utilise un « backbone » partagé (la cuisine elle-même) mais lui donne quatre « chapeaux » ou jetons spéciaux : [SEARCH], [CLICK], [CART, et [ORDER].

Voyez cela comme un acteur polyvalent. Lorsqu'il met le chapeau [SEARCH], il joue le rôle d'un détective faisant correspondre un indice textuel à un produit. Lorsqu'il change pour le chapeau [CART], il joue le rôle d'un styliste qui sait quels articles les gens achètent réellement ensemble. La magie est que cet acteur peut changer de chapeau instantanément sans avoir besoin de quitter la scène. En un seul passage dans la cuisine, le modèle apprend de quatre types de indices (signaux) différents en même même temps :

  1. Clics de recherche : Quand quelqu'un tape « jean » et clique sur un résultat.
  2. Sessions de clics : Quand quelqu'un passe d'un article à un autre en une séquence.
  3. Sessions de panier : Quand quelqu'un ajoute des articles à son panier de manière séquentielle.
  4. Sessions de commande : Quand quelqu'un achète réellement une séquence d'articles.

Les auteurs ont découvert que ces signaux sont très différents. Un clic de recherche est comme un « je suis intéressé » assez large, tandis qu'une session de commande est un « je veux vraiment ce combo spécifique ». En ignorant ces différences et en les traitant toutes de la même manière, les anciens modèles passaient à côté de l'essentiel. Le MMRM, cependant, apprend les quatre à la fois, créant quatre « représentations » (ou cartes mentales) distinctes du même produit, chacune adaptée à un travail différent.

La Stratégie de l'Utilisateur « Multiplex »
Une fois que le modèle possède ces quatre cartes différentes des produits, il doit comprendre ce que vous voulez. Le papier soutient que vous ne pouvez pas simplement utiliser une carte générique pour tout le monde. Au lieu de cela, le MMRM utilise une stratégie de « représentation utilisateur multiplex ».

Imaginez que vous naviguez. Le système examine votre historique. Si vous êtes simplement en train de chercher, il utilise la carte [SEARCH] pour trouver des articles similaires à ce que vous avez cliqué. Si vous constituez un panier, il passe à la carte [CART] pour voir ce qui va habituellement bien ensemble. C'est comme avoir un assistant personnel qui change de stratégie en fonction du fait que vous faites juste du lèche-vitrine ou que vous êtes prêt à acheter. Il prend votre séquence de comportement spécifique et la fait correspondre à la bonne « casquette » du produit, créant ainsi une recommandation hautement personnalisée.

Ce qu'ils ont écarté
Le papier argumente explicitement contre deux approches courantes :

  1. L'utilisation d'un seul signal : Ils montrent qu'entraîner un modèle uniquement sur des données de recherche (ou uniquement sur des données de panier) le rend aveugle aux autres relations importantes. On ne peut pas simplement en choisir un et ignorer le reste.
  2. L'embedding « taille unique » : Ils ont constaté que le simple fait de prendre une description de produit générique et de l'injecter dans un modèle de classement ne fonctionne pas bien pour les scénarios multitâches. Cela provoque un « enchevêtrement d'embeddings », où le modèle s'embrouille car il essaie d'utiliser la même note pour une requête de recherche et une prédiction de panier simultanément. Le MMRM rejette cela en gardant les représentations séparées (désenchevêtrées) pour chaque tâche.

La Preuve : Des chiffres réels, des résultats réels
Les auteurs n'ont pas seulement deviné ; ils ont testé cela à une échelle massive.

  • Données d'entraînement : Ils ont utilisé un énorme ensemble de données de 0,3 milliard de triplets (groupes de trois articles liés) collectés sur six mois pour la recherche, et des ensembles de données encore plus vastes pour les comportements de panier et de commande (jusqu'à 3 ans de données pour les commandes).
  • Le Modèle : Ils ont entraîné un modèle de 4 milliards de paramètres (une IA très grande) sur 8 GPU NVIDIA H800.
  • Les Résultats : Dans leurs tests, le MMRM a battu tous les modèles précédents à « tâche unique » ainsi que les modèles « multitâches » qui n'utilisaient pas ce système de chapeaux spéciaux.
  • Impact dans le monde réel : Ils ne se sont pas arrêtés aux simulations informatiques. Ils ont déployé ce système sur le véritable moteur de recherche de JD.com. Lors d'un test d'une semaine avec des millions d'utilisateurs quotidiens, le nouveau système a amélioré :
    • Le Taux de Clic (CTR) de 0,42 %
    • Le Taux d'Ajout au Panier (ACR) de 0,37 %
    • Le Taux de Conversion (CVR) de 0,35 %

Les auteurs notent que bien que ces pourcentages semblent faibles, sur une plateforme comptant des millions d'utilisateurs, même une hausse de 0,10 % entraîne une croissance massive des revenus. Grâce à ces gains prouvés, le système est désormais pleinement opérationnel et aide des millions de personnes à trouver leurs produits.

En résumé, le MMRM est une façon plus intelligente et plus flexible d'apprendre à l'IA comment comprendre le shopping. Il cesse d'essayer d'être un « touche-à-tout » qui ne maîtrise rien, pour devenir un maître de plusieurs métiers en utilisant un seul cerveau efficace doté de quatre modes spécialisés.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →