← Últimos artigos
💻 computer science

Tokenizing Numerical and Embedding Features for LLM RecSys

Este artigo propõe um framework de fusão de tokens suaves que mapeia características numéricas contínuas e de incorporação para o espaço de incorporação do LLM por meio de um módulo baseado em interação, melhorando significativamente o desempenho de recuperação em benchmarks de recomendação em comparação com as linhas de base existentes baseadas em LLM.

Autores originais: Zhe Xu, Ankit Peshin, Chiyu Zhang, Feng Qi, Johnson Lui, Anil Ramakrishna, Justin Johnson, Carl Hu, Kaushik Rangadurai, Luke Simon

Publicado 2026-07-14
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zhe Xu, Ankit Peshin, Chiyu Zhang, Feng Qi, Johnson Lui, Anil Ramakrishna, Justin Johnson, Carl Hu, Kaushik Rangadurai, Luke Simon

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um robô bibliotecário superinteligente (um Grande Modelo de Linguagem, ou LLM) que é incrível em ler histórias, entender piadas e conversar sobre livros. Você quer contratar esse robô para recomendar o videogame ou brinquedo perfeito para um cliente.

Aqui está o problema: o robô só fala "Texto". Ele entende palavras como "legal", "caro" ou "aventura-ação". Mas o mundo real das recomendações é bagunçado. É cheio de números (como uma etiqueta de preço de $19,99) e códigos secretos (embeddings densos) que outros sistemas de computador usam para saber do que um usuário gosta.

Se você apenas disser ao robô, "Este item custa 19,99", ele pode ficar confuso. Isso é 19,99 uma data? Uma pontuação? Um número minúsculo? Se você apenas amontoar esses números e códigos secretos no fluxo de texto do robô sem pensar, eles podem se perder no ruído, como tentar ouvir um sussurro em um show de rock.

A Grande Ideia: O Tradutor de "Tokens Suaves"
Os autores deste artigo criaram uma solução inteligente chamada Fusão de Soft-Tokens. Em vez de forçar o robô a ler números brutos, eles construíram um tradutor especial. Este tradutor transforma esses números complicados e códigos secretos em "soft tokens" (tokens suaves).

Pense em um soft token como um bloco de LEGO personalizado e invisível. Não é uma palavra que você possa ler, mas é uma forma que o robão entende perfeitamente. O tradutor pega um preço como $19,99, envolve-o em um cobertor matemático especial (usando algo chamado características de Fourier, que é como transformar uma curva suave em um padrão específico de ondas) e o transforma em um soft token. Agora, o robô pode segurar este "bloco de preço" logo ao lado do "bloco de descrição do brinquedo" e entender como eles se encaixam.

A Fórmula Secreta: Fazendo-os Conversar entre si
Os pesquisadores testaram algumas maneiras de alimentar esses blocos ao robô.

  1. O Método "Apenas Amontoar": Eles tentaram apenas despejar o texto, os blocos de preço e os blocos de código em uma linha. Eles descobriram que isso não funcionava bem. É como jogar um monte de LEGOs, um livro e um sanduíche sobre uma mesa e esperar que o robô saiba instantaneamente qual peça vai com qual. O robô ficou confuso e as recomendações não foram boas.
  2. O Método da "Conversa" (O Vencedor): Em vez de apenas amontoá-los, eles construíram uma pequena sala de reunião (um módulo de fusão baseado em interação) onde os blocos de preço e os blocos de código podiam conversar entre si antes de encontrar o robô. Eles descobriram como o preço se relaciona com o código secreto do item, refinaram a mensagem e, então, apresentaram todo o pacote ao robô.

O Que Eles Descobriram
A equipe testou isso em três grandes conjuntos de dados do mundo real da Amazon: produtos de Beleza (Beauty), equipamentos de Esportes e Ar Livre (Sports and Outdoors) e Brinquedos e Jogos (Toys and Games).

  • Os Resultados: Quando usaram o método da "Conversa", o robô foi muito melhor em escolher o item certo.
    • No conjunto de dados de Beleza, o método da "Conversa" obteve uma pontuação de Recall@5 de 0,0459, superando o método de "Apenas Amontoar", que obteve apenas 0,0423.
    • Em Esportes e Ar Livre, o método da "Conversa" atingiu 0,0253, enquanto o método simples de amontoar caiu para 0,0220.
    • Em Brinquedos e Jogos, a melhoria foi enorme. O método da "Conversa" marcou 0,0695, enquanto o método de "Apenas Amontoar" foi, na verdade, pior do que usar apenas o texto, marcando apenas 0,0575.

O Que Eles Descartaram
O artigo argumenta explicitamente contra algumas coisas:

  • Não apenas amasse tudo junto: Simplesmente juntar características numéricas e de texto em uma lista longa (concatenação direta) não é a resposta. Na verdade, no conjunto de dados de Brinquedos, esse método simples teve um desempenho pior do que usar apenas o texto.
  • Não transforme apenas números em palavras: Você não pode apenas escrever "dezenove ponto noventa e nove" e esperar que o robô entenda a matemática. Os números precisam permanecer como sinais contínuos e suaves (soft tokens) para serem úteis.
  • Não pule a reunião: Você não pode simplesmente alimentar o robô com os dados brutos sem deixar que os diferentes tipos de dados (preço vs. código) interajam primeiro.

O Quão Certos Eles Estão?
Os autores estão bastante confiantes nesses resultados porque realizaram experimentos reais com dados reais, não apenas simulações. Eles compararam seu novo método com muitos outros sistemas de recomendação famosos (como GRU4Rec, SASRec e TIGER).

Os resultados mostram um quadro matizado: no conjunto de dados de Brinquedos e Jogos, o método deles superou o concorrente anterior, TIGER, por uma margem significativa (melhorando o Recall@5 de 0,0521 para 0,0695). No entanto, nos conjuntos de dados de Beleza e Esportes e Ar Livre, o TIGER permaneceu competitivo em métricas de NDCG sensíveis ao ranking, embora o novo modelo tenha sido mais forte em Recall@10. Isso mostra que, embora o novo método seja altamente eficaz, a melhor abordagem pode depender de qual métrica específica você mais se importa.

A Lição Principal
O artigo sugere que, se você quer que um modelo de linguagem superinteligente seja um ótimo recomendador, você não pode apenas fornecer texto. Você tem que traduzir os números e os códigos secretos em uma linguagem que ele entenda (soft tokens) e, o mais importante, deixar que essas diferentes partes de informação conversem entre si antes de encontrarem o robô. Não é apenas sobre ter mais informação; é sobre como você introduz essa informação ao cérebro.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →