← Ultimi articoli
🤖 AI

Pailitao-MMSearch: Building Native E-Commerce Multimodal Search Foundation

Questo articolo presenta Pailitao-MMSearch, un modello di base per la ricerca multimodale nativa nell'e-commerce basato su Qwen che integra Hybrid Semantic ID, una strategia di pre-addestramento continuo in due fasi e una pipeline di post-addestramento a ragionamento ibrido per superare i limiti dei modelli singoli-modali isolati e dei modelli vision-language general-purpose, ottenendo significativi guadagni commerciali con un miglioramento del GMV fino al +13,61% sulla piattaforma di Taobao.

Autori originali: Xiaohan Ye, Xu Chen, Zihan Gong, Jian Ding, Lianyu Du, Baicheng Chen, Yunmeng Shu, Jingqian Zhao, Zhixiang Zhao, Shuaiqi Jia, Chong Ma, Shuwen Xiao, Xiangheng Kong, Yuan Gao, Jun Song, Jinsong Lan, Xi
Pubblicato 2026-07-21
📖 7 min di lettura🧠 Approfondimento

Autori originali: Xiaohan Ye, Xu Chen, Zihan Gong, Jian Ding, Lianyu Du, Baicheng Chen, Yunmeng Shu, Jingqian Zhao, Zhixiang Zhao, Shuaiqi Jia, Chong Ma, Shuwen Xiao, Xiangheng Kong, Yuan Gao, Jun Song, Jinsong Lan, Xiaoyong Zhu, Bo Zheng

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di camminare attraverso un gigantesco, infinito centro commerciale digitale. In passato, se volevi trovare una maglietta specifica, dovevi digitare una descrizione molto precisa nella barra di ricerca, come "t-shirt di cotone rossa". Se volevi trovare un paio di scarpe che si abbinassero a una foto vista per strada, dovevi scattare una foto e sperare che il computer indovinasse cosa stavi cercando. Per molto tempo, i computer sono stati come lavoratori specializzati: un lavoratore capiva solo il testo, un altro solo le immagini e un terzo solo la voce. Non comunicavano tra loro. Se fornivi loro un mix di un'immagine e una frase, si confondevano, spesso ignorando le tue parole o perdendo i dettagli della foto.

D'altro canto, ci sono computer super intelligenti e generalisti che possono guardare un'immagine e scrivere una poesia a riguardo. Ma questi generalisti sono come turisti nel centro commerciale; sanno cos'è una "maglietta" in senso generale, ma non sanno distinguere tra un "misto seta" e un "100% cotone", o che le persone che acquistano una specifica fotocamera di solito acquistano anche un tipo specifico di obiettivo. Mancano della profonda conoscenza interna di come funziona realmente lo shopping. La grande domanda per gli scienziati è: Come possiamo costruire un unico computer super intelligente che sia sia un maestro dello shopping (conoscendo ogni minimo dettaglio sui prodotti e su ciò che piace alle persone) sia un grande conversatore (capendo istruzioni complesse e miste), il tutto ricordando come pensare e ragionare?

Questo è esattamente ciò che il team dietro a Pailitao-MMSearch ha cercato di risolvere. Hanno costruito un nuovo tipo di "cervello di ricerca" progettato specificamente per l'e-commerce. Invece di usare strumenti separati per immagini e parole, hanno creato un singolo modello capace di guardare una foto, leggere una descrizione testuale disordinata e generare istantaneamente una lista di prodotti perfetti. Non si sono limitati a perfezionare un modello esistente; hanno insegnato al modello un nuovo linguaggio per parlare dei prodotti, lo hanno addestrato su milioni di abitudini di acquisto e poi hanno rifinito con cura le sue capacità di ragionamento affinché non dimenticasse come essere intelligente.

Il Problema: Il Negozio "a Frammenti" vs. La Guida "Turistica"

Gli autori sottolineano che gli attuali sistemi di shopping online sono un po' disordinati. La maggior parte dei grandi negozi utilizza un approccio "a frammenti" (patchwork). Se cerchi con una foto, un cercatore di immagini speciale cerca immagini simili. Se digiti delle parole, un cercatore di testo cerca titoli corrispondenti. Se dici "trova un abito rosso come questo nella foto ma con le maniche lunghe", il sistema deve scomporre goffamente la tua richiesta in pezzi, inviarli a diversi lavoratori e poi cercare di incollare insieme i risultati. Questo è lento, complicato e spesso manca il punto perché i lavoratori non capiscono come l'immagine e le parole lavorino insieme.

In alternativa, ci sono le guide "turistiche" (modelli AI generalisti). Sono bravi a comprendere il mondo, ma non conoscono le regole specifiche del centro commerciale. Potrebbero non rendersi conto che "seta" e "raso" sono diversi, o che un utente che acquista una custodia per cellulare probabilmente sta cercando una protezione per lo schermo. Inoltre, non possono puntare direttamente a un prodotto specifico in un catalogo di miliardi di articoli; di solito hanno bisogno di uno strumento separato per farlo, il che interrompe il flusso.

La Soluzione: Un Nuovo Linguaggio per i Prodotti

Per risolvere questo problema, il team ha creato Pailitao-MMSearch, una base nativa di ricerca per l'e-commerce. Immaginatelo come l'addestramento di un nuovo dipendente che parla fluentemente la lingua del centro commerciale.

1. L'ID Ibrido (HybSID): Il "Codice Postale" e il "Ritratto"
La sfida più grande è come dire al computer di che prodotto si tratta. Immaginate di avere una biblioteca con miliardi di libri. Se date loro solo un "codice postale" (come "Narrativa - Giallo"), otterrete un enorme mucchio di libri, ma non riuscirete a trovare esattamente quello che volete. Se date loro solo un "ritratto" (una descrizione dettagliata), è difficile organizzarli in modo efficiente.

Il team ha inventato HybSID (Hybrid Semantic ID). È come dare a ogni prodotto due ID contemporaneamente:

  • Il Codice Postale (Codici Discreti): Un codice breve e semplice che raggruppa i prodotti in categorie ampie (es. "Abito Estivo"). Questo aiuta il computer a restringere rapidamente la ricerca.
  • Il Ritratto (Embedding Continuo): Un "ritratto" dettagliato e ad alta risoluzione del prodotto che cattura minuscoli dettagli come l'esatta tonalità di blu, la consistenza del tessuto o il logo specifico del marchio.

Combinando queste due cose, il modello può trovare rapidamente il "quartiere" giusto dei prodotti e poi scegliere l'esatto che corrisponde alla descrizione specifica e vaga dell'utente.

2. L'Addestramento in Due Fasi: Imparare il Centro Commerciale, poi Conservare il Cervello
Insegnare a un'IA generalista a diventare un esperto di shopping è rischioso. Se la si nutre semplicemente con milioni di descrizioni di prodotti, potrebbe dimenticare come parlare il linguaggio normale o come ragionare logicamente. Questo è chiamato "oblio catastrofico".

Il team ha utilizzato un processo di addestramento intelligente in due fasi:

  • Fase 1 (Lo Stage): Hanno insegnato al modello tutto sullo shopping: dettagli dei prodotti, come le persone navigano e quali articoli si abbinano tra loro. Hanno anche inserito alcuni dati di conversazione normale per evitare che diventasse troppo ossessionato solo dai prodotti.
  • Fase 2 (Il Mentoring): Hanno notato che il modello stava diventando un po' "arrugginito" nel ragionamento generale. Così, hanno usato la versione originale e intelligente del modello come "mentore". Hanno fatto sì che il nuovo modello praticasse compiti generali mentre il mentore osservava, correggendolo gentilmente per assicurarsi che non perdesse la capacità di pensare e seguire istruzioni complesse. Ciò ha garantito che il modello finale fosse sia un esperto di shopping che un intelligente conversatore.

3. Il Motore di Ragionamento: Pensare Prima di Parlare
Fare shopping non è sempre semplice. A volte dici: "Voglio un abito come questo, ma in blu navy, e che sia adatto per un matrimonio". Questa è una richiesta complessa.
Il team ha insegnato al modello a usare il Chain-of-Thought (Catena di Pensiero) per le domande difficili. Invece di indovinare semplicemente la risposta, il modello impara a scomporre il problema:

  1. Analizza la foto: "È un abito floreale."
  2. Leggi la richiesta: "Cambia colore in blu navy, cambia stile in formale."
  3. Trova la corrispondenza: "Ok, ho bisogno di un abito floreale, formale e blu navy."
    Per le domande semplici, salta il pensiero e va direttamente alla risposta per risparmiare tempo.

I Risultati: Successo nel Mondo Reale

Il team non ha testato questo sistema solo in laboratorio; lo ha implementato sulla piattaforma Taobao Pailitao, che serve decine di milioni di utenti giornalieri. Hanno eseguito un test massiccio (un test A/B) in cui alcuni utenti ricevevano il vecchio sistema di ricerca e altri il nuovo Pailitao-MMSearch.

I risultati sono stati impressionanti. Il nuovo sistema ha portato a:

  • Un aumento del 13,61% del valore totale dei beni venduti (GMV).
  • Un aumento dell' 8,21% nel numero di transazioni.

Ciò suggerisce che quando il computer comprende davvero ciò che intendi — combinando la tua foto, le tue parole e le tue abitudini di acquisto — ti aiuta a trovare esattamente ciò che desideri, e alla fine acquisti di più.

Cosa C'è Dopo?

Gli autori ammettono che il sistema non è ancora perfetto. Se un utente carica una foto sfocata scattata da un'angolazione strana o scrive una frase piena di errori di battitura, il modello può comunque confondersi. Prevedono di rendere il modello ancora più bravo a ragionare attraverso queste situazioni disordinate del mondo reale. Vedono anche un futuro in cui questo smart model di ricerca agirà come il "cervello" per agenti di shopping autonomi che possono svolgere compiti multi-fase, come trovare un outfit, controllare il meteo e ordinare tutto in un colpo solo.

In breve, Pailitao-MMSearch è un passo verso un'esperienza di shopping dove il computer non si limita a far corrispondere le parole chiave, ma comprende realmente la tua intenzione, il tuo stile e le tue necessità, il tutto in una conversazione fluida e senza interruzioni.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →