TokenMinds: Pretrained User Tokens and Embeddings for User Understanding in Large Recommender Systems
O TokenMinds é um sistema de escala industrial que estende o framework PLUM para gerar tanto tokens de usuário discretos e semanticamente fundamentados quanto embeddings densos por meio de uma arquitetia de LLM pré-treinada, unificando com sucesso os comportamentos de vídeos de formato longo e curto para reduzir custos, enquanto demonstra valor complementar em sistemas de ranking do YouTube de larga escala.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está tentando entender o gosto de uma pessoa por filmes. Antigamente, os sistemas de recomendação (como os do YouTube) tentavam fazer isso pegando todo o histórico de visualização de uma pessoa e espremendo tudo em um único e minúsculo "cartão de resumo" denso. Pense nisso como tentar descrever um romance inteiro escrevendo apenas uma frase em um post-it. Você perde muita nuance, detalhes específicos e o sabor único da história.
Outros sistemas tentavam escrever um parágrafo longo e detalhado sobre o usuário. Mas esses parágrafos eram muitas vezes vagos, capturando tópicos gerais (como "eles gostam de gatos") em vez dos padrões específicos e profundos do que eles realmente assistiram e quando.
TokenMinds é um novo sistema construído pelo Google DeepMind e pelo YouTube que resolve isso, dando aos usuários um "cartão de identidade digital" feito de tokens discretos (como um conjunto de códigos específicos e significativos) e mantendo o antigo "cartão de resumo" (embeddings densos) como um backup.
Veja como funciona, dividido com analogias simples:
1. O "ID Semântico" (O CEP Mágico)
Em vez de dar a cada vídeo um número aleatório (como "Vídeo nº 49201"), o TokenMinds dá a cada vídeo um ID Semântico (SID).
- A Analogia: Imagine que cada vídeo tem um "CEP" baseado no que ele realmente trata. Um vídeo sobre "fazer pão de fermentação natural" pode ter um CEP que começa com
Comida-Panificação-Pão. Um vídeo sobre "consertar uma pia" pode começar comCasa-Encanamento. - Por que ajuda: Se um usuário assiste a um vídeo sobre "fermentação natural", o sistema não vê apenas um número aleatório; ele vê a parte "Comida-Panificação" do código. Isso ajuda o sistema a entender o significado por trás da visualização, não apenas o ID.
2. O Mecanismo de "Saída Dupla" (O Kit de Ferramentas Suíças)
O TokenMinds usa uma arquitetura especial de IA (codificador-decodificador) que atua como um canivete suíço. Ela produz duas coisas ao mesmo tempo:
- O Embedding Denso (O Cartão de Resumo): Este é o vetor numérico contínuo da antiga escola que os sistemas existentes já sabem usar. É como um instantâneo rápido da "vibe" do usuário.
- Os Tokens SID (O Código Detalhado): Esta é a parte nova. A IA gera uma lista de "CEPs" específicos representando os interesses futuros do usuário. É como se a IA dissesse: "Com base no que você assistiu, é provável que você queira:
Comida-Panificação-Pão,Tecnologia-Programação-PythoneEsportes-Basquete."
O Benefício: O sistema obtém o melhor dos dois mundos. Ele mantém os sistemas antigos satisfeitos (usando o cartão de resumo) enquanto adiciona uma nova camada de compreensão semântica precisa (os tokens). O artigo descobriu que usar ambos juntos funciona melhor do que usar apenas um ou outro.
3. A Entrega "Assíncrona" (O Sistema de Pré-Encomenda)
Gerar esses tokens detalhados é um trabalho pesado, como cozinhar uma refeição complexa. Se você tentasse cozinhar enquanto o cliente espera no balcão, seria muito lento.
- A Analogia: O TokenMinds usa um sistema de "pré-encomenda". Ele gera o "cartão de identidade" e os "tokens" do usuário em segundo plano (assincronamente) enquanto o usuário está apenas navegando. Quando o usuário realmente clica em "recomendar", o sistema apenas pega o cartão pré-fabricado de um armário de armazenamento rápido. Isso significa que o sistema pode lidar com bilhões de usuários sem ficar lento.
4. O "Tradutor Universal" (Um Modelo para Todos os Vídeos)
O YouTube tem dois tipos de vídeos muito diferentes: Longa Duração (como um documentário de 20 minutos) e Curta Duração (como os Shorts de 15 segundos). Normalmente, você precisa de dois modelos diferentes para entendê-los porque as pessoas os assistem de formas diferentes.
- A Analogia: O TokenMinds é como um tradutor universal. Ele usa o mesmo sistema de "CEP" tanto para vídeos longos quanto curtos. Ele pode olhar para o histórico de um usuário que assistiu a um programa de culinária de 20 minutos e a um truque de culinária de 15 segundos e perceber: "Ah, esta pessoa ama culinária!"
- O Resultado: Em vez de treinar e rodar dois modelos separados e caros, eles usam um único modelo para fazer ambos os trabalhos. Isso reduziu seus custos computacionais em 50% para treinamento e 31% para o serviço (serving), sem perder qualidade.
5. Os Resultados (A Prova)
A equipe testou isso com tráfego real do YouTube (bilhões de usuários).
- Melhores Recomendações: Quando adicionaram esses novos tokens ao sistema de classificação, viram um aumento mensurável em como as pessoas interagiam com os vídeos e no seu nível de satisfação.
- Eficiência: Ao combinar os modelos de vídeo longo e curto, eles economizaram uma quantidade massiva de energia computacional.
- Diversidade: O sistema não apenas adivinhava a mesma coisa repetidamente; ele gerava uma lista diversificada de potenciais interesses, de forma muito semelhante a um amigo humano sugerindo uma variedade de coisas que você poderia gostar.
Em resumo: O TokenMinds é uma maneira mais inteligente e eficiente de entender o que os usuários querem. Ele deixa de tentar espremer o gosto complexo de uma pessoa em um único número e, em vez disso, oferece um conjunto de "códigos" significativos que descrevem seus interesses, tudo isso enquanto roda em um motor único e econômico que lida com todos os tipos de conteúdo de vídeo.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.