← Últimos artigos
🤖 AI

Beyond Item IDs: Scaling Short-Form-Video Recommendation via Semantic-Native Long Sequence Modeling

Este artigo apresenta um framework implantado em produção para recomendação de vídeos de formato curto em uma escala de um bilhão de usuários que supera as limitações tradicionais de modelagem de sequência ao substituir IDs de Vídeo esparsos por IDs Semânticos compactos e introduzir um Transformer de Compressão Globalmente Consciente para modelar eficientemente sequências de comportamento de usuário ultra-longas, resultando em reduções significativas no custo computacional e melhorias substanciais no engajamento do usuário.

Autores originais: Ruixiao Sun, Diego Uribe Mora, Zhimeng Jiang, Yuanzhen Lin, Jiarui Wang, Yuening Li, Danfeng Guo, Zhizhong Chen, Chuan He, Liang Liu

Publicado 2026-06-09
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Ruixiao Sun, Diego Uribe Mora, Zhimeng Jiang, Yuanzhen Lin, Jiarui Wang, Yuening Li, Danfeng Guo, Zhizhong Chen, Chuan He, Liang Liu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um bibliotecário tentando recomendar o livro perfeito para um leitor. Mas em vez de apenas alguns livros, este leitor assistiu a milhares e milhares de vídeos curtos. Seu trabalho é lembrar de todos eles para adivinhar o que ele quer ver a seguir.

O artigo descreve um novo sistema que o Google construiu para fazer exatamente isso com vídeos de formato curto (como TikTok ou YouTube Shorts). Eles enfrentaram dois problemas massivos que tornavam essa tarefa quase impossível e os resolveram com dois truques inteligentes.

Os Dois Grandes Problemas

1. O Problema da "Etiqueta de Nome" (Gargalo de Representação)
Imagine que cada vídeo no mundo tem um ID único e aleatório, como um número de série de uma torradeira.

  • O Problema: Se você tem um bilhão de vídeos, precisa de um bilhão de etiquetas de ID diferentes. Essas etiquetas são apenas números aleatórios; elas não dizem nada sobre o vídeo. Um vídeo sobre "gatos" e um vídeo sobre "carros" podem ter IDs que não se parecem em nada.
  • O Resultado: O computador tem que memorizar cada interação separadamente. É como tentar lembrar de um bilhão de números de telefone aleatórios. Além disso, quando um novo vídeo (um "cold start") aparece, o sistema não tem ideia do que se trata porque nunca viu aquele ID aleatório antes.

2. O Problema da "Sobrecarga de Memória" (Gargalo Computacional)
Imagine tentar ler um livro onde cada página está conectada a todas as outras páginas.

  • O Problema: Para entender o histórico de 2.000 vídeos de um usuário, um cérebro de computador padrão (um Transformer) tenta comparar cada vídeo com todos os outros vídeos. Se você dobrar o número de vídeos, o trabalho não apenas dobra; ele quadruplica. Fica tão pesado que o computador fica sem memória e trava, ou demora muito para responder.

A Solução: Dois Novos Truques

Os autores construíram um sistema que resolve ambos os problemas de uma só vez.

Truque nº 1: O Sistema de "Categorias Inteligentes" (IDs Semântico-Nativos)**

Em vez de usar números de série aleatórios, eles deram aos vídeos rótulos significativos baseados no que eles realmente são.

  • A Analogia: Imagine que, em vez de números aleatórios, cada vídeo é rotulado com uma "Categoria" e uma "Subcategoria".
    • Jeito Antigo: Vídeo nº 99283 (Aleatório).
    • Jeito Novo: Vídeo = "Jogos" + "Tiro".
  • Como funciona: Eles usaram uma IA especial para agrupar vídeos em uma hierarquia. Para o histórico longo de vídeos, eles usaram apenas os dois níveis superiores desta hierarquia (por exemplo, apenas "Jogos" e "Tiro").
  • O Benefício:
    • Biblioteca Menor: Eles não precisam mais de um bilhão de etiquetas; eles só precisam de etiquetas para as categorias. Isso reduz a memória necessária para o "dicionário" de vídeos.
    • Melhor Adivinhação: Se um usuário ama vídeos de "Jogos-Tiro", e um novo vídeo aparece que também é "Jogos-Tiro", o sistema sabe instantaneamente que deve recomendá-lo, mesmo que nunca o tenha visto antes. Isso resolve o problema do "cold start".

Truque nº 2: A Estratégia de "Agrupamento" (Compressão com Consciência Global)**

Em vez de olhar para cada vídeo individualmente, o sistema os agrupa em "super-pedaços".

  • A Analogia: Imagine que você está lendo um diário de 2.000 páginas.
    • Jeito Antigo: Você lê cada palavra e tenta conectar cada palavra a todas as outras palavras. Exaustivo!
    • Jeito Novo: Você pega 4 páginas por vez e as cola para formar uma "Super-Página". Agora você só tem 500 Super-Páginas para ler.
  • Como funciona: Eles pegam 4 vídeos consecutivos e os empilham para formar um único "Super-Token". Isso reduz o número de itens que o computador precisa processar em 4 vezes.
  • O Benefício:
    • Velocidade: Como há menos itens para comparar, o computador trabalha muito mais rápido e usa muito menos memória (92% menos!).
    • Leitura Mais Inteligente: Ao colar as páginas, o computador pode ver os detalhes dentro daquele grupo (como a reação do usuário a uma sequência específica de vídeos) enquanto ainda mantém a visão geral.
    • O "Âncora Global": Eles adicionaram um token de "Pergunta Global" especial no início da lista. Pense nisso como um bibliotecário perguntando: "Qual é a vibe geral da vida desta pessoa?". Isso ajuda o sistema a equilibrar os detalhes específicos dos vídeos recentes com a personalidade de longo prazo do usuário.

Os Resultados

Quando testaram isso no mundo real com bilhões de usuários:

  1. Foi mais rápido: O sistema usou muito menos memória de computador e rodou muito mais rápido.
  2. Lembrou de mais: Como foi mais rápido, eles puderam alimentar o sistema com 2.000 vídeos de histórico em vez de apenas 800.
  3. As pessoas ficaram mais felizes: Os usuários assistiram a mais vídeos que gostaram, passaram mais tempo assistindo e descobriram mais conteúdos novos que aproveitaram.

Resumo

O artigo é sobre construir um mecanismo de recomendação que consiga lembrar de todo o histórico de vídeos de um usuário sem ter um colapso mental. Eles fizeram isso dando nomes significativos aos vídeos em vez de números aleatórios, e agrupando vídeos em blocos para que o computador não precise fazer cálculos em cada um deles individualmente. O resultado é um sistema que é mais rápido, mais barato de operar e faz melhores recomendações.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →