← Últimos artigos
🤖 machine learning

MMRM: A Multiplex Multimodal Representation Model for Product Ranking in E-commerce Search

O artigo propõe o MMRM, um framework unificado que alinha Grandes Modelos de Linguagem Multimodais com diversos sinais colaborativos para gerar representações multiplexas de itens e usuários, melhorando significativamente o desempenho e a eficiência do ranking de busca no mecanismo de busca da JD.

Autores originais: Zhen-Lin Chen, Maosen Sheng, Peng Lin, Jianmin Chen, Zhuojian Xiao, Dongyue Wang, Xiwei Zhao

Publicado 2026-07-14
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Zhen-Lin Chen, Maosen Sheng, Peng Lin, Jianmin Chen, Zhuojian Xiao, Dongyue Wang, Xiwei Zhao

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está administrando um shopping digital massivo e superveloz (como o JD.com), onde milhões de pessoas estão em busca do par de jeans perfeito. Para ajudá-las a encontrar o que desejam, você precisa de um assistente inteligente que não apenas leia o texto em uma etiqueta de produto, mas que também "veja" a imagem, entenda o estilo e saiba exatamente o que o comprador está procurando.

Por muito tempo, esses assistentes tiveram um problema complicado. Eles eram como estudantes que estudavam apenas para um teste específico por vez. Se estudassem para "Busca", seriam ótimos em combinar uma consulta de texto com um produto. Se estudassem para "Carrinho", seriam bons em saber o que as pessoas colocam em seus carrinhos de compras. Mas tentar fazer um único estudante estudar para todos esses testes diferentes ao mesmo tempo geralmente resultava em uma confusão generalizada. Os métodos antigos tentavam forçar um "superestudante" (um Modelo de Linguagem Multimodal geral) a aprender a partir de apenas um tipo de sinal, ou tratavam as notas do estudante como uma lista genérica de fatos que não ajudava realmente a prever o que um usuário específico queria a seguir.

O artigo apresenta um novo sistema chamado MMRM (Modelo de Representação Multimodal Multiplex) que resolve isso agindo como um mestre chef com uma cozinha única e de alta tecnologia, mas com quatro livros de receitas especializados diferentes.

A Grande Ideia: Uma Cozinha, Quatro Chefs Especializados
Em vez de construir quatro cozinhas (modelos) separadas para cada tarefa, o MMRM usa um "backbone" (espinha dorsal) compartilhado (a própria cozinha), mas dá a ele quatro "chapéus" ou tokens especiais: [SEARCH], [CLICK], [CART] e [ORDER].

Pense nisso como um ator versátil. Quando ele coloca o chapéu [SEARCH], ele atua como um detetive combinando uma pista de texto a um produto. Quando troca para o chapéu [CART], ele atua como um estilista que sabe quais itens as pessoas realmente compram juntos. A magia é que este ator pode trocar de chapéu instantaneamente sem precisar sair do palco. Em uma única passagem pela cozinha, o modelo aprende com quatro tipos diferentes de pistas (sinais) ao mesmo tempo:

  1. Cliques de busca: Quando alguém digita "jeans" e clica em um resultado.
  2. Sessões de clique: Quando alguém clica de um item para outro em sequência.
  3. Sessões de carrinho: Quando alguém adiciona itens ao carrinho em uma sequência.
  4. Sessões de pedido: Quando alguém realmente compra uma sequência de itens.

Os autores descobriram que esses sinais são muito diferentes. Um clique de busca é como um amplo "estou interessado", enquanto uma sessão de pedido é um "eu realmente, realmente quero este combo específico". Ao ignorar as diferenças e tratar todos da mesma forma, os modelos antigos perdiam essas nuances. O MMRM, no entanto, aprende todos os quatro simultaneamente, criando quatro "representações" (ou mapas mentais) distintas do mesmo produto, cada uma ajustada para um trabalho diferente.

A Estratégia de Usuário "Multiplex"
Uma vez que o modelo possui esses quatro mapas diferentes dos produtos, ele precisa descobrir o que você quer. O artigo argumenta que você não pode usar apenas um mapa genérico para todos. Em vez disso, o MMRM utiliza uma estratégia de "representação de usuário multiplex".

Imagine que você está navegando. O sistema observa seu histórico. Se você está apenas pesquisando, ele usa o mapa [SEARCH] para encontrar itens semelhantes ao que você clicou. Se você está montando um carrinho, ele muda para o mapa [CART] para ver o que geralmente combina. É como ter um personal shopper que muda sua estratégia dependendo se você está apenas olhando vitrines ou pronto para comprar. Eles pegam sua sequência de comportamento específica e a combinam com o "chapéu" correto do produto, criando uma recomendação altamente personalizada.

O Que Eles Descartaram
O artigo argumenta explicitamente contra duas abordagens comuns:

  1. Usar apenas um sinal: Eles mostram que treinar um modelo apenas com dados de busca (ou apenas dados de carrinho) o deixa cego para as outras relações importantes. Você não pode simplesmente escolher um e ignorar o resto.
  2. O Embedding "Tamanho Único": Eles descobriram que simplesmente pegar uma descrição de produto genérica e jogá-la em um modelo de ranking não funciona bem para cenários de múltiplas tarefas. Isso causa "emaranhamento de embedding", onde o modelo fica confuso porque está tentando usar a mesma nota para uma consulta de busca e uma previsão de carrinho simultaneamente. O MMRM rejeita isso mantendo as representações separadas (desemaranhadas) para cada tarefa.

A Prova: Números Reais, Resultados Reais
Os autores não apenas adivinharam; eles testaram isso em uma escala massiva.

  • Dados de Treinamento: Eles utilizaram um enorme conjunto de dados de 0,3 bilhão de tripletos (grupos de três itens relacionados) coletados ao longo de seis meses para busca, e conjuntos de dados ainda maiores para comportamentos de carrinho e pedido (até 3 anos de dados para pedidos).
  • O Modelo: Eles treinaram um modelo de 4 bilhões de parâmetros (um modelo de IA muito grande) em 8 GPUs NVIDIA H800.
  • Os Resultados: Em seus testes, o MMRM superou todos os modelos anteriores de "tarefa única" e os modelos de "múltiplas tarefas" que não utilizavam esse sistema especial de chapéus.
  • Impacto no Mundo Real: Eles não pararam em simulações de computador. Eles implementaram isso no mecanismo de busca real do JD.com. Em um teste de uma semana com milhões de usuários diários, o novo sistema melhorou:
    • A Taxa de Cliques (CTR) em 0,42%
    • A Taxa de Adição ao Carrinho (ACR) em 0,37%
    • A Taxa de Conversão (CVR) em 0,35%

Os autores observam que, embora essas porcentagens pareçam pequenas, em uma plataforma com milhões de usuários, até mesmo um aumento de 0,10% gera um crescimento massivo de receita. Devido a esses ganhos comprovados, o sistema está agora totalmente ativo e ajudando milhões de pessoas a encontrar seus produtos.

Em resumo, o MMRM é uma maneira mais inteligente e flexível de ensinar a IA como entender as compras. Ele deixa de tentar ser um "pau para toda obra" que não domina nada, para se tornar um mestre de muitos ofícios, utilizando um único cérebro eficiente com quatro modos especializados.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →