← Últimos artículos
🤖 machine learning

MMRM: A Multiplex Multimodal Representation Model for Product Ranking in E-commerce Search

El artículo propone MMRM, un marco unificado que alinea los Modelos de Lenguaje de Gran Escala Multimodales con diversas señales colaborativas para generar representaciones multiplex de ítems y usuarios, mejorando significativamente el rendimiento y la eficiencia del ranking de búsqueda en el motor de búsqueda de JD.

Autores originales: Zhen-Lin Chen, Maosen Sheng, Peng Lin, Jianmin Chen, Zhuojian Xiao, Dongyue Wang, Xiwei Zhao

Publicado 2026-07-14
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Zhen-Lin Chen, Maosen Sheng, Peng Lin, Jianmin Chen, Zhuojian Xiao, Dongyue Wang, Xiwei Zhao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que diriges un centro comercial digital masivo y ultrarrápido (como JD.com) donde millones de personas buscan el par de jeans perfecto. Para ayudarlos a encontrar lo que desean, necesitas un asistente inteligente que no solo lea el texto en la etiqueta de un producto, sino que también "vea" la imagen, entienda el estilo y sepa exactamente qué está buscando el comprador.

Durante mucho tiempo, estos asistentes tuvieron un problema complicado. Eran como estudiantes que solo estudiaban para un examen específico a la vez. Si estudiaban para "Búsqueda", eran excelentes emparejando una consulta de texto con un producto. Si estudiaban para "Carrito", eran buenos sabiendo qué ponía la gente en sus carritos de compra. Pero intentar que un solo estudiante estudiara para todos estos diferentes exámenes a la vez solía resultar en un caos de confusión. Los métodos antiguos intentaban forzar a un "superestudiante" (un Modelo de Lenguaje Grande Multimodal general) a aprender de un solo tipo de señal, o trataban las notas del estudiante como una lista genérica de hechos que no ayudaba realmente a predecir lo que un usuario específico quería después.

El artículo presenta un nuevo sistema llamado MMRM (Modelo de Representación Multimodal Multiplex) que resuelve esto actuando como un maestro chef con una cocina única y de alta tecnología, pero con cuatro libros de recetas especializados.

La Gran Idea: Una Cocina, Cuatro Chefs Especializados
En lugar de construir cuatro cocinas (modelos) separadas para cada tarea, MMRM utiliza un "backbone" o columna vertebral compartido (la cocina misma) pero le otorga cuatro "sombreros" o tokens especiales: [SEARCH], [CLICK], [CART] y [ORDER].

Piénsalo como un actor versátil. Cuando se pone el sombrero de [SEARCH], actúa como un detective que empareja una pista de texto con un producto. Cuando cambia al sombrero de [CART], actúa como un estilista que sabe qué artículos suelen comprarse juntos. La magia es que este actor puede cambiar de sombrero instantáneamente sin necesidad de abandonar el escenario. En un solo viaje a través de la cocina, el modelo aprende de cuatro tipos diferentes de pistas (señales) al mismo tiempo:

  1. Clicks de búsqueda: Cuando alguien escribe "jeans" y hace clic en un resultado.
  2. Sesiones de clic: Cuando alguien hace clic de un artículo a otro en secuencia.
  3. Sesiones de carrito: Cuando alguien añade artículos a su carrito en una secuencia.
  4. Sesiones de pedido: Cuando alguien realmente compra una secuencia de artículos.

Los autores descubrieron que estas señales son muy diferentes. Un clic de búsqueda es como un "me interesa" general, mientras que una sesión de pedido es un "realmente, realmente quiero esta combinación específica". Al ignorar las diferencias y tratar todas por igual, los modelos antiguos perdían información valiosa. MMRM, sin embargo, aprende las cuatro a la vez, creando cuatro "representaciones" (o mapas mentales) distintas del mismo producto, cada una ajustada para un trabajo diferente.

La Estrategia de Usuario "Multiplex"
Una vez que el modelo tiene estos cuatro mapas diferentes de los productos, necesita averiguar qué es lo que quieres. El artículo argumenta que no puedes usar simplemente un mapa genérico para todos. En su lugar, MMRM utiliza una estrategia de "representación de usuario multiplex".

Imagina que estás navegando. El sistema observa tu historial. Si solo estás buscando, utiliza el mapa de [SEARCH] para encontrar artículos similares a los que hiciste clic. Si estás armando un carrito, cambia al mapa de [CART] para ver qué suele combinar bien. Es como tener un comprador personal que cambia su estrategia dependiendo de si solo estás mirando vitrinas o si estás listo para comprar. Toman tu secuencia de comportamiento específica y la cotejan con el "sombrero" adecuado del producto, creando una recomendación altamente personalizada.

Lo que Descartaron
El artículo argumenta explícitamente en contra de dos enfoques comunes:

  1. Usar una sola señal: Demuestran que entrenar un modelo solo con datos de búsqueda (o solo con datos de carrito) lo deja ciego ante las otras relaciones importantes. No puedes simplemente elegir una e ignorar el resto.
  2. El embedding de "talla única": Encontraron que simplemente tomar una descripción de producto genérica y meterla en un modelo de clasificación no funciona bien para escenarios multitarea. Esto causa un "entrelazamiento de embeddings", donde el modelo se confunde porque intenta usar la misma nota para una búsqueda y para una predicción de carrito simultáneamente. MMRM rechaza esto manteniendo las representaciones separadas (desentrelazadas) para cada tarea.

La Prueba: Números Reales, Resultados Reales
Los autores no solo adivinaron; lo probaron a una escala masiva.

  • Datos de Entrenamiento: Utilizaron un enorme conjunto de datos de 0.3 mil millones de tríos (grupos de tres artículos relacionados) recolectados durante seis meses para búsquedas, e incluso conjuntos de datos más grandes para comportamientos de carrito y pedido (hasta 3 años de datos para pedidos).
  • El Modelo: Entrenaron un modelo de 4 mil millones de parámetros (una IA muy grande) en 8 GPUs NVIDIA H800.
  • Los Resultados: En sus pruebas, MMRM superó a todos los modelos anteriores de "tarea única" y a los modelos "multitarea" que no utilizaban este sistema especial de sombreros.
  • Impacto en el Mundo Real: No se detuvieron en simulaciones por computadora. Implementaron esto en el motor de búsqueda real de JD.com. En una prueba de una semana con millones de usuarios diarios, el nuevo sistema mejoró:
    • La Tasa de Clics (CTR) en un 0.42%
    • La Tasa de Añadir al Carrito (ACR) en un 0.37%
    • La Tasa de Conversión (CVR) en un 0.35%

Los autores señalan que, aunque estos porcentajes parecen pequeños, en una plataforma con millones de usuarios, incluso un aumento del 0.10% genera un crecimiento masivo de ingresos. Debido a estas ganancias probadas, el sistema ya está plenamente operativo y ayudando a millones de personas a encontrar sus productos.

En resumen, MMRM es una forma más inteligente y flexible de enseñar a la IA cómo entender las compras. Deja de intentar ser un "aprendiz de todo" que no domina nada, y en su lugar se convierte en un maestro de muchos oficios utilizando un cerebro único y eficiente con cuatro modos especializados.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →