← Últimos artigos
💻 computer science

Action-Aware Generative Sequence Modeling for Short Video Recommendation

Este artigo propõe a Rede Sequencial Gerativa Consciente de Ação (A2Gen), um modelo inovador que aproveita os padrões temporais das ações dos usuários para superar as limitações da classificação binária tradicional na recomendação de vídeos curtos, alcançando melhorias significativas no tempo de visualização, nas taxas de interação e na retenção de usuários por meio de extensos testes A/B offline e em larga escala online no Kuaishou.

Autores originais: Wenhao Li, Zihan Lin, Zhengxiao Guo, Jie Zhou, Shukai Liu, Yongqi Liu, Chuan Luo, Chaoyi Ma, Ruiming Tang, Han Li

Publicado 2026-04-29
📖 4 min de leitura☕ Leitura rápida

Autores originais: Wenhao Li, Zihan Lin, Zhengxiao Guo, Jie Zhou, Shukai Liu, Yongqi Liu, Chuan Luo, Chaoyi Ma, Ruiming Tang, Han Li

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está assistindo a um vídeo curto no seu celular. É uma mistura de coisas diferentes: talvez uma piada engraçada, um trecho de notícia sério, uma música cativante e, em seguida, um anúncio repentino.

O Jeito Antigo (A Abordagem "Tamanho Único")
Os sistemas de recomendação tradicionais tratam o vídeo inteiro como um único bloco sólido de queijo. Se você "Curtir" o vídeo, o sistema assume que você gostou de tudo nele.

  • O Problema: Digamos que o vídeo seja uma entrevista onde o convidado escolhe "Messi" em vez de "Ronaldo". Você "Curti" o vídeo exatamente naquele momento porque ama Messi. Mas o resto do vídeo são apenas destaques de Ronaldo. O sistema antigo pensa: "Ah, eles curtiram o vídeo, então devem amar Ronaldo também!" e começa a mostrar vídeos de Ronaldo para você. Você fica irritado porque só gostou da parte do Messi.

A Nova Perspectiva (O Timing é Tudo)
Os autores deste artigo perceberam que quando você clica em um botão importa tanto quanto o fato de você ter clicado nele.

  • A Analogia: Pense em um vídeo como um trailer de filme. Se você bate palmas (uma "Curtida") exatamente quando o herói salva o dia, você está reagindo àquele momento específico. Se você bate palmas no final, pode estar apenas sendo educado. O timing diz ao sistema exatamente qual parte do vídeo te deixou feliz.
  • A Descoberta: Ao analisar milhões de vídeos, eles descobriram que "Curtidas" e "Seguidores" frequentemente ocorrem em "picos" específicos (destaques). Se você "Segue" um criador antes mesmo de terminar de assistir ao vídeo, isso significa que você ama a pessoa, não necessariamente o conteúdo específico que acabou de ver.

A Solução: A2Gen (O Modelo "Contador de Histórias")
O artigo apresenta um novo modelo chamado A2Gen (Rede Geradora de Sequência Consciente de Ação). Em vez de adivinhar se você vai gostar de um vídeo, o A2Gen tenta prever toda a história de como você vai assisti-lo.

Veja como funciona, dividido em partes simples:

  1. O Módulo de Atenção Consciente de Contexto (CAM) – "O Leitor Inteligente"
    Imagine um leitor que não apenas lê palavras, mas entende o clima da sala. O CAM analisa suas ações passadas e o conteúdo específico do vídeo juntos. Ele sabe que uma "Curtida" em um vídeo de comédia significa algo diferente de uma "Curtida" em um vídeo de notícias. Ele presta atenção ao contexto do momento.

  2. O Codificador de Sequência Hierárquico (HSE) – "O Banco de Memória"
    Esta parte lembra dos seus hábitos de longo prazo. Ela analisa seu histórico como um bibliotecário organizando livros. Ela não vê apenas "O Usuário X assistiu a 100 vídeos". Ela vê padrões: "O Usuário X geralmente pula anúncios, mas adora vídeos de música, e tende a 'Seguir' criadores após 15 segundos". Ela constrói um perfil profundo do seu estilo único.

  3. O Gerador Autoregressivo de Sequência de Ações (AAG) – "A Bola de Cristal"
    Esta é a parte mágica. Em vez de apenas dizer "Sim/Não", o AAG age como uma bola de cristal que prevê a sequência completa de suas ações futuras.

    • Ele pergunta: "Se mostrarmos este vídeo, o usuário começará a assistir? Ele vai 'Curtir' no marco de 5 segundos? Ele vai 'Seguir' o criador no marco de 10 segundos? Quando ele vai parar?"
    • Ele prevê a ordem e o timing exato de cada clique, como prever o enredo de um filme antes que ele aconteça.

Por Que Isso Importa (Os Resultados)
A equipe testou isso no Kuaishou, uma plataforma massiva de vídeos curtos com centenas de milhões de usuários. Eles substituíram seu sistema antigo pelo A2Gen e realizaram um grande experimento (teste A/B).

  • O Resultado: Como o sistema agora entende quais partes de um vídeo você realmente aprecia, ele recomenda conteúdo melhor.
  • Os Números:
    • As pessoas assistiram 0,34% mais tempo de vídeo (o que parece pequeno, mas com milhões de usuários, isso é muito tempo).
    • As pessoas interagiram (curtiram, seguiram, comentaram) 8,1% mais.
    • Mais importante, mais pessoas voltaram no dia seguinte (a retenção aumentou 0,162%), o que se traduz em cerca de um milhão de usuários diários extras permanecendo na plataforma.

Em Resumo
O artigo argumenta que não devemos tratar um vídeo como um único item "Sim/Não". Em vez disso, devemos tratá-lo como uma linha do tempo de momentos. Ao usar um modelo que prevê quando e em que ordem você reagirá, o aplicativo finalmente pode entender seu verdadeiro gosto e mostrar vídeos que você realmente quer assistir, em vez de apenas adivinhar com base em um único clique.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →