← Nieuwste papers
🤖 machine learning

MMRM: A Multiplex Multimodal Representation Model for Product Ranking in E-commerce Search

Het artikel stelt MMRM voor, een verenigd framework dat Multimodale Grote Taalmodellen afstemt op diverse collaboratieve signalen om multiplex item- en gebruikersrepresentaties te genereren, wat de prestaties en efficiëntie van e-commerce zoekranking in de JD-zoekmachine aanzienlijk verbetert.

Oorspronkelijke auteurs: Zhen-Lin Chen, Maosen Sheng, Peng Lin, Jianmin Chen, Zhuojian Xiao, Dongyue Wang, Xiwei Zhao

Gepubliceerd 2026-07-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhen-Lin Chen, Maosen Sheng, Peng Lin, Jianmin Chen, Zhuojian Xiao, Dongyue Wang, Xiwei Zhao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, razendsnelle digitale winkel runt (zoals JD.com) waar miljoenen mensen op zoek zijn naar de perfecte spijkerbroek. Om hen te helpen vinden wat ze willen, heb je een slimme assistent nodig die niet alleen de tekst op een productlabel kan lezen, maar ook de afbeelding "ziet", de stijl begrijpt en precies weet waar de shopper naar op zoek is.

Lange tijd hadden deze assistenten een lastig probleem. Ze waren als studenten die slechts voor één specifieke toets tegelijk hadden gestudeerd. Als ze voor "Zoeken" hadden gestudeerd, waren ze geweldig in het matchen van een tekstzoekopdracht aan een product. Als ze voor "Winkelwagen" hadden gestudeerd, waren ze goed in weten wat mensen in hun winkelwagentjes zetten. Maar proberen één enkele "superstudent" te laten studeren voor al die verschillende toetsen tegelijkertijd, resulteerde meestal in een verwarrende bende. De oude methoden probeerden een enkele "superstudent" (een algemeen Multimodaal Groot Taalmodel) te laten leren van slechts één type signaal, of ze behandelden de aantekeningen van de student als een generieke lijst met feiten die niet echt hielpen om te voorspellen wat een specifieke gebruiker daarna wilde.

Het artikel introduceert een nieuw systeem genaamd MMRM (Multiplex Multimodal Representation Model) dat dit oplost door te fungeren als een meesterkok met één hoogtechnologische keuken maar vier verschillende, gespecialiseerde receptenboeken.

Het Grote Idee: Eén Keuken, Vier Gespecialiseerde Chefs
In plaats van vier aparte keukens (modellen) te bouwen voor elke taak, gebruikt MMRM één gedeelde "backbone" (de keuken zelf), maar geeft het vier speciale "hoedjes" of tokens: [SEARCH], [CLICK], [CART] en [ORDER].

Denk aan een veelzijdige acteur. Wanneer hij het [SEARCH] hoedje opzet, acteert hij als een detective die een tekstuele aanwijzing koppelt aan een product. Wanneer hij overschakelt naar het [CART] hoedje, acteert hij als een stylist die weet welke artikelen mensen daadwerkelijk samen kopen. De magie is dat deze acteur direct van hoedje kan wisselen zonder het podium te hoeven verlaten. In één enkele reis door de keuken leert het model van vier verschillende soorten aanwijzingen (signalen) tegelijkertijd:

  1. Zoekklikken: Wanneer iemand "jeans" typt en op een resultaat klikt.
  2. Kliksessies: Wanneer iemand van het ene item naar het andere klikt in een reeks.
  3. Winkelwagensessies: Wanneer iemand een reeks artikelen aan een winkelwagen toevoegt.
  4. Bestelsessies: Wanneer iemand daadwerkelijk een reeks artikelen koopt.

De auteurs ontdekten dat deze signalen erg verschillend zijn. Een zoekklik is als een brede "ik ben geïnteresseerd", terwijl een bestelsessie een "ik wil echt deze specifieke combinatie hebben" is. Door de verschillen te negeren en ze allemaal hetzelfde te behandelen, misten oude modellen dit. MMRM leert echter alle vier tegelijk, waardoor vier verschillende "representaties" (of mentale kaarten) van hetzelfde product worden gecreëerd, elk afgestemd op een andere taak.

De "Multiplex" Gebruikersstrategie
Zodra het model deze vier verschillende kaarten van de producten heeft, moet het uitzoeken wat jij wilt. Het artikel betoogt dat je niet zomaar één generieke kaart voor iedereen kunt gebruiken. In plaats daarvan gebruikt MMRM een "multiplex gebruikersrepresentatie"-strategie.

Stel je voor dat je aan het browsen bent. Het systeem kijkt naar je geschiedenis. Als je alleen aan het zoeken bent, gebruikt het de [SEARCH]-kaart om artikelen te vinden die lijken op wat je hebt aangeklikt. Als je een winkelwagen aan het samenstellen bent, schakelt het over naar de [CART]-kaart om te zien wat er meestal bij elkaar past. Het is alsof je een persoonlijke shopper hebt die van strategie verandert op basis van het feit of je alleen aan het etaleren bent of klaar bent om te kopen. Ze nemen jouw specifieke gedragsreeks en matchen deze tegen de juiste "hoed" van het product, wat een zeer gepersonaliseerde aanbeveling creëert.

Wat Ze Hebben Uitgesloten
Het artikel voert expliciet een argument tegen twee veelvoorkomende benaderingen:

  1. Het gebruik van slechts één signaal: Ze laten zien dat het trainen van een model op alleen zoekgegevens (of alleen winkelwagengegevens) het model blind maakt voor de andere belangrijke relaties. Je kunt niet gewoon één kiezen en de rest negeren.
  2. De "One-Size-Fits-All" embedding: Ze ontdekten dat het simpelweg nemen van één generieke productbeschrijving en deze in een rankingmodel stoppen niet goed werkt voor multitask-scenario's. Dit veroorzaakt "embedding entanglement", waarbij het model in de war raakt omdat het probeert dezelfde notitie voor zowel een zoekopdracht als een winkelwagenvoorspelling tegelijkertijd te gebruiken. MMRM wijst dit af door de representaties voor elke taak gescheiden (ontkoppeld) te houden.

Het Bewijs: Echte Cijfers, Echte Resultaten
De auteurs hebben niet alleen gegokt; ze hebben dit op enorme schaal getest.

  • Trainingsdata: Ze gebruikten een enorme dataset van 0,3 miljard triplets (groepen van drie gerelateerde items) verzameld over zes maanden voor zoekopdrachten, en zelfs grotere datasets voor winkelwagen- en bestelgedrag (tot wel 3 jaar aan data voor bestellingen).
  • Het Model: Ze trainden een 4-miljard parameter model (een zeer groot AI-model) op 8 NVIDIA H800 GPU's.
  • De Resultaten: In hun tests versloeg MMRM alle voorgaande "single-task" modellen en de "multi-task" modellen die dit speciale hoedjessysteem niet gebruikten.
  • Impact in de echte wereld: Ze stopten niet bij computer-simulaties. Ze hebben dit uitgerold op de eigen zoekmachine van JD.com. In een weeklange test met miljoenen dagelijkse gebruikers verbeterde het nieuwe systeem:
    • Click-Through Rate (CTR) met 0,42%
    • Add-to-Cart Rate (ACR) met 0,37%
    • Conversion Rate (CVR) met 0,35%

De auteurs merken op dat hoewel deze percentages klein lijken, zelfs een stijging van 0,10% in een platform met miljoenen gebruikers leidt tot enorme omzetgroei. Vanwege deze bewezen winsten is het systeem nu volledig live en helpt het miljoenen mensen hun producten te vinden.

Kortom, MMRM is een slimmere, flexibelere manier om AI te leren hoe het winkelen te begrijpen. Het probeert niet langer een "jack of all trades" te zijn die nergens echt goed in is, maar wordt in plaats daarvan een meester in vele vakken door één efficiënt brein te gebruiken met vier gespecialiseerde modi.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →