← Nieuwste papers
🤖 AI

Pailitao-MMSearch: Building Native E-Commerce Multimodal Search Foundation

Dit artikel introduceert Pailitao-MMSearch, een inheems e-commerce multimodaal zoekfundamentmodel gebouwd op Qwen dat Hybrid Semantic IDs, een twee-fasen continue pre-training strategie en een hybride redeneer post-training pipeline integreert om de beperkingen van geïsoleerde single-modale modellen en algemene vision-language modellen te overwinnen, waarbij het aanzienlijke commerciële winsten behaalt met een verbetering van de GMV op het Taobao-platform van tot wel +13,61%.

Oorspronkelijke auteurs: Xiaohan Ye, Xu Chen, Zihan Gong, Jian Ding, Lianyu Du, Baicheng Chen, Yunmeng Shu, Jingqian Zhao, Zhixiang Zhao, Shuaiqi Jia, Chong Ma, Shuwen Xiao, Xiangheng Kong, Yuan Gao, Jun Song, Jinsong Lan, Xi
Gepubliceerd 2026-07-21
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xiaohan Ye, Xu Chen, Zihan Gong, Jian Ding, Lianyu Du, Baicheng Chen, Yunmeng Shu, Jingqian Zhao, Zhixiang Zhao, Shuaiqi Jia, Chong Ma, Shuwen Xiao, Xiangheng Kong, Yuan Gao, Jun Song, Jinsong Lan, Xiaoyong Zhu, Bo Zheng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je door een gigantisch, oneindig digitaal winkelcentrum loopt. Vroeger moest je als je op zoek was naar een specifiek overhemd, een zeer specifieke beschrijving typen in een zoekbalk, zoals "rood katoenen T-shirt". Als je wilde zoeken naar een paar schoenen die pasten bij een foto die je op straat zag, moest je een foto maken en hopen dat de computer kon raden waar je naar zocht. Lange tijd waren computers als gespecialiseerde werknemers: één werker begreep alleen tekst, een ander alleen afbeeldingen, en een derde alleen stemmen. Ze praatten niet met elkaar. Als je ze een combinatie van een foto en een zin gaf, raakten ze in de war en negeerden ze vaak je woorden of misten ze de details in de foto.

Aan de andere kant zijn er superintelligente, algemene computers die naar een foto kunnen kijken en er een gedicht over kunnen schrijven. Maar deze generalisten zijn als toeristen in het winkelcentrum; ze weten wat een "overhemd" in algemene zin is, maar ze weten het verschil niet tussen een "zijde mengsel" en "100% katoen", of dat mensen die een specifieke camera kopen meestal ook een specifiek type lens kopen. Ze missen de diepe, insider kennis van hoe winkelen echt werkt. De grote vraag voor wetenschappers is: Hoe bouwen we één enkele, superintelligente computer die zowel een meester-shopper (die elk klein detail over producten kent en weet wat mensen leuk vinden) als een geweldige gesprekspartner is (die complexe, gemengde instructies begrijpt), terwijl hij tegelijkertijd kan blijven denken en redeneren?

Dit is precies wat het team achter Pailitao-MMSearch probeerde op te lossen. Ze bouwden een nieuw soort "zoekbrein" ontworpen voor e-commerce. In plaats van aparte hulpmiddelen voor plaatjes en woorden te gebruiken, creëerden ze één enkel model dat een foto kan bekijken, een rommelige tekstbeschrijving kan lezen en direct een lijst met perfecte producten kan genereren. Ze hebben niet simpelweg een bestaand model aangepast; ze hebben het een nieuwe taal geleerd om over producten te praten, het getraind op miljoenen winkelgewoonten, en vervolgens zorgvuldig hun redeneervaardigheden gepolijst zodat het niet zou vergeten hoe slim te zijn.

Het Probleem: De "Lappendeken"-winkel versus de "Toeristische" Gids

De auteurs wijzen erop dat huidige online shopsystemen een beetje een puinhoop zijn. De meeste grote winkels gebruiken een "lappendeken"-aanpak. Als je zoekt met een foto, zoekt een speciale beeldzoeker naar gelijkaardige plaatjes. Als je woorden typt, zoekt een tekstzoeker naar passende titels. Als je zegt: "vind een rode jurk zoals deze foto, maar dan met lange mouwen", moet het systeem je verzoek onhandig in stukken hakken, naar verschillende werkers sturen en dan proberen de resultaten weer aan elkaar te lijmen. Dit is traag, ingewikkeld en mist vaak de essentie omdat de werkers niet begrijpen hoe de foto en de woorden samen werken.

Alternatief zijn er de "toeristische" gidsen (algemene AI-modellen). Zij zijn erg goed in het begrijpen van de wereld, maar zij kennen de specifieke regels van het winkelcentrum niet. Ze beseffen misschien niet dat "zijde" en "satijn" verschillend zijn, of dat iemand die een telefoonhoesje koopt waarschijnlijk ook op zoek is naar een schermprotector. Ze kunnen ook niet rechtstreeks naar een specifiek product verwijzen in een catalogus van miljarden; ze hebben meestal een apart instrument nodig om dat te doen, wat de flow onderbreekt.

De Oplossing: Een Nieuwe Taal voor Producten

Om dit op te lossen, creëerde het team Pailitao-MMSearch, een fundamentele e-commerce zoekmachine. Denk eraan als het trainen van een nieuwe medewerker die de taal van het winkelcentrum vloeiend spreekt.

1. De Hybride ID (HybSID): De "Postcode" en het "Portret"
De grootste uitdaging is hoe je de computer iets vertelt over een product. Stel je voor dat je een bibliotheek hebt met miljarden boeken. Als je ze alleen een "postcode" geeft (bijvoorbeeld "Fictie - Mysterie"), krijg je een enorme stapel boeken, maar kun je niet de exacte vinden die je wilt. Als je ze alleen een "portwerp" geeft (een gedetailleerde beschrijving), is het moeilijk om ze efficiënt te organiseren.

Het team heeft HybSID (Hybrid Semantic ID) uitgevonden. Het is alsof je elk product twee ID's tegelijk geeft:

  • De Postcode (Discrete Codes): Een korte, eenvoudige code die producten groepeert in brede categorieën (bijv. "Zomerjurk"). Dit helpt de computer om snel de juiste zoekopdracht te vernauwen.
  • Het Portret (Continue Embeddings): Een gedetailleerd, hoogresolutie "portret" van het product dat kleine details vastlegt, zoals de exacte tint blauw, de textuur van de stof of het specifieke merklogo.

Door deze twee te combineren, kan het model snel het juiste "buurtgebied" van producten vinden en vervolgens het exacte item kiezen dat overeenkomt met de specifieke, vage beschrijving van de gebruiker.

2. De Tweestaps-training: Het Winkelcentrum Leren, en Dan het Brein Behouden
Een algemene AI trainen om een shop-expert te worden is riskant. Als je hem alleen miljoenen productbeschrijvingen voert, kan hij vergeten hoe hij normale taal spreekt of hoe hij logisch nadenkt. Dit wordt "catastrofaal vergeten" genoemd.

Het team gebruikte een slim tweestaps trainingsproces:

  • Fase 1 (De Stage): Ze leerden het model alles over winkelen: productdetails, hoe mensen browsen en welke artikelen bij elkaar passen. Ook voegden ze gewone conversatiegegevens toe om te voorkomen dat het model alleen nog maar geobsedeerd zou raken door producten.
  • Fase 2 (Het Mentorschap): Ze merkten dat het model een beetje "roestig" werd in algemeen redeneren. Daarom gebruikten ze de originele, intelligente versie van het model als een "mentor". Ze lieten het nieuwe model oefenen met algemene taken terwijl de mentor meekijkte en het model voorzichtig corrigeerde, om ervoor te zorgen dat het zijn vermogen om na te denken en complexe instructies op te volgen niet verloor. Dit zorgde ervoor dat het uiteindelijke model zowel een winkel-expert als een slimme gesprekspartner was.

3. De Redeneermachine: Denken Voordat Er Gesproken Wordt
Winkelen is niet altijd eenvoudig. Soms zeg je: "Ik wil een jurk zoals deze, maar dan in marineblauw, en maak hem geschikt voor een bruiloft." Dat is een complexe vraag.
Het team leerde het model om Chain-of-Thought redenering te gebruiken voor moeilijke vragen. In plaats van gewoon het antwoord te raden, leert het model het probleem af te breken:

  1. Analyseer de foto: "Het is een bloemenjurk."
  2. Lees het verzoek: "Verander kleur naar marineblauw, verander stijl naar formeel."
  3. Zoek de match: "Oké, ik heb een marineblauwe, formele, bloemenjurk nodig."
    Voor simpele vragen slaat het model het denkproces over en gaat direct naar het antwoord om tijd te besparen.

De Resultaten: Succes in de Praktijk

Het team heeft dit niet alleen in een laboratorium getest; ze hebben het geïmplementeerd op het Taobao Pailitao platform, dat tientallen miljoenen dagelijkse gebruikers bedient. Ze voerden een massale test uit (een A/B-test) waarbij sommige gebruikers het oude zoekingsysteem kregen en anderen het nieuwe Pailitao-MMSearch.

De resultaten waren indrukwekkend. Het nieuwe systeem leidde tot:

  • Een stijging van 13,61% in de totale waarde van verkochte goederen (GMV).
  • Een stijging van 8,21% in het aantal transacties.

Dit suggereert dat wanneer de computer echt begrijpt wat je bedoelt — door jouw foto, je woorden en je winkelgewoonten te combineren — het jou helpt precies te vinden wat je wilt, waardoor je uiteindelijk meer koopt.

Wat Nu Volgt?

De auteurs geven toe dat het systeem nog niet perfect is. Als een gebruiker een wazige foto uploadt vanuit een vreemde hoek of een zin vol typefouten schrijft, kan het model nog steeds in de war raken. Ze willen het model nog beter maken in het redeneren door deze chaotische, echte situaties heen. Ze zien ook een toekomst voor zich waarin dit slimme zoekmodel fungeert als het "brein" voor autonome shopping-agenten die taken met meerdere stappen kunnen uitvoeren, zoals een outfit vinden, het weer controleren en alles in één keer bestellen.

Kortom, Pailitao-MMSearch is een stap richting een winkelervaring waarbij de computer niet alleen trefwoorden koppelt, maar daadwerkelijk jouw intentie, jouw stijl en jouw behoeften begrijpt, allemaal in één naadloos gesprek.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →