← Últimos artigos
🤖 machine learning

Tokens are All You Need: Dual-purpose Semantic IDs for Achieving LLM-Level I/O Efficiency in recommendation systems

Este artigo propõe Dual-purpose Semantic IDs, um método que utiliza quantização hierárquica para converter embeddings densos em tokens discretos tanto para identidade colaborativa quanto para reconstrução de conteúdo, alcançando assim uma eficiência de I/O de nível de LLM e sendo implementado com sucesso em sistemas de recomendação de escala de produção para superar gargalos de memória.

Autores originais: Baolei Li, Yiping Yuan, Yilin Zheng, Likang Yin, Ling Liu, Fabio Soldo, Romer Rosales, Xinyang Yi, Lichan Hong

Publicado 2026-07-29
📖 3 min de leitura☕ Leitura rápida

Autores originais: Baolei Li, Yiping Yuan, Yilin Zheng, Likang Yin, Ling Liu, Fabio Soldo, Romer Rosales, Xinyang Yi, Lichan Hong

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando construir o motor de recomendação definitivo para uma plataforma de vídeo massiva, um que saiba exatamente o que você quer assistir em seguida. Para fazer isso, o sistema precisa entender duas coisas: quem é você (seu histórico) e o que são os vídeos (o conteúdo deles). Tradicionalmente, os computadores têm armazenado essa informação como listas gigantes e pesadas de números chamadas "embeddings densos". Pense nisso como plantas arquitetônicas detalhadas e de alta resolução para cada vídeo e usuário. Embora essas plantas sejam detalhadas, elas são incrivelmente pesadas de carregar. Toda vez que o computador tenta fazer uma sugestão, ele tem que transportar essas plantas pesadas da sala de armazenamento para o processador, criando um congestionamento conhecido como "Barreira de Memória" (Memory Wall). Isso retarda tudo, especialmente quando se tem bilhões de usuários e vídeos.

Do outro lado do mundo tecnológico, os Grandes Modelos de Linguagem (LLMs) — os cérebros por trás dos chatbots inteligentes — descobriram um truque. Eles não usam plantas pesadas; eles usam "tokens" discretos e simples, como palavras em uma frase. Esses tokens são leves, rápidos e fáceis de processar. A grande questão para os sistemas de recomendação tem sido: podemos trocar essas plantas pesadas e lentas por esses tokens leves e ágeis sem perder os detalhes ricos necessários para fazer boas sugestões? Se pudéssemos, poderíamos finalmente dar aos sistemas de recomendação a mesma velocidade e eficiência dos chatbots de IA mais inteligentes.

Este artigo, intitulado "Tokens are All You Need" (Tokens são Tudo o que Você Precisa), propõe uma solução inteligente para este problema ao introduzir "IDs Semânticos de Duplo Propósito". Os autores, trabalhando em uma grande plataforma de compartilhamento de vídeos, sugerem que podemos comprimir essas plantas de vídeo pesadas em uma sequência curta de tokens, algo como transformar uma foto de alta definição em um código simples. Mas aqui está o truque de mágica: esses tokens desempenham um papel duplo. Primeiro, eles atuam como um ID único para ajudar o sistema a aprender com as interações do usuário (como em quais vídeos você clicou). Segundo, e mais importante, eles podem ser instantaneamente "decodificados" de volta para uma aproximação aproximada dos detalhes originais do vídeo sempre que o computador precisar deles.

Os pesquisadores testaram essa ideia em um sistema de produção real com bilhões de exemplos. Eles descobriram que, ao usar esse método de reconstrução "on-the-fly" (em tempo real), poderiam reduzir drasticamente a quantidade de dados que o sistema precisava movimentar. Em seus experimentos, essa abordagem não apenas economizou espaço; ela de fato tornou o sistema mais rápido e melhorou a qualidade das recomendações, particularmente para novos usuários ou vídeos obscuros sobre os quais o sistema ainda não tinha muitos dados. O artigo sugere que, ao tratar dados de alta dimensão como tokens, os sistemas de recomendação podem se libertar da "Barreira de Memória" e se tornar tão eficientes quanto os modelos de IA mais avançados, provando que, às vezes, você realmente só precisa de tokens para realizar o trabalho.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →