Decoupled Temporal Encoding for Generative Recommendation
Este artigo propõe o Decoupled Temporal Encoding (DTE), uma estrutura leve para recomendação generativa que melhora os métodos existentes ao separar a dinâmica temporal da ordem dos itens por meio de dois módulos complementares: um módulo macro-temporal personalizado para padrões temporais amplos e um módulo micro-sequencial com portão temporal para interações locais densas.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
No mundo digital, os sistemas de recomendação atuam como os curadores silenciosos de nossas vidas diárias, sugerindo o que assistir, comprar ou comer em seguida. Durante anos, esses sistemas dependeram de um tipo poderoso de inteligência artificial conhecido como Transformer, que se destaca na compreensão de sequências. Pense no histórico de um usuário como uma história: o sistema lê os capítulos dos itens com os quais uma pessoa interagiu para adivinhar o próximo capítulo. Para dar sentido a uma história, a IA precisa saber não apenas o que aconteceu, mas quando e em qual ordem. Métodos padrão para ensinar à IA esse senso de ordem foram emprestados de modelos de linguagem, tratando cada item em uma lista como um simples passo em uma sequência, como palavras em uma frase. No entanto, o comportamento humano no mundo real é muito mais complexo do que uma simples lista. Ele é moldado pelo relógio, pelo calendário e pelo ritmo da vida cotidiana. A fome de uma pessoa na hora do almoço, seus hábitos de compras em um fim de semana ou sua reação a uma promoção repentina são todos padrões temporais que os métodos padrão muitas vezes têm dificuldade em capturar junto com a simples ordem dos eventos.
Pesquisadores da Rajax Network Technology, da Alibaba, trabalhando no ambiente de alta pressão dos serviços de entrega de comida e varejo instantâneo do aplicativo Taobao, identificaram uma lacuna na forma como esses sistemas entendem o tempo. Eles observaram que o comportamento do usuário é impulsionado por duas forças distintas que frequentemente se misturam. Uma força é o contexto amplo e abrangente do tempo: o fato de ser uma terça-feira, de estar perto do almoço ou de uma loja específica estar passando por um aumento súbito de tráfego. A outra força é a sequência imediata e apertada de ações: o fato de um usuário ter clicado em uma loja de macarrão, depois em uma bebida, depois em uma sobremesa em poucos minutos. Os sistemas existentes tentavam alimentar a IA com ambos os sinais através de um único canal unificado, muito parecido com tentar descrever uma tempestade medindo apenas a velocidade do vento e ignorando a chuva. Essa abordagem tornava difícil para o modelo distinguir entre o humor geral do dia e as escolhas rápidas e específicas que o usuário estava fazendo no momento.
Para resolver isso, a equipe desenvolveu um novo framework chamado Codificação Temporal Desacoplada (Decoupled Temporal Encoding). Em vez de forçar a IA a aprender tempo e ordem da mesma fonte, eles construíram dois módulos separados e leves que trabalham em harmonia. O primeiro módulo, que chamam de codificador macro-temporal, foca no quadro geral. Ele injeta sinais compactos no sistema para dizer à IA sobre a hora do dia, o dia da semana e quanto tempo se passou desde a última interação. Isso permite que o modelo entenda que um usuário pedindo o jantar às 19h de uma sexta-feira provavelmente está em uma mentalidade diferente do mesmo usuário pedindo o almoço às 12h de uma segunda-feira. O segundo módulo, o codificador micro-sequencial, lida com os detalhes finos. Ele atua como um porteiro, intervindo apenas para enfatizar a ordem estrita dos eventos quando as interações acontecem tão rapidamente que os registros de tempo (timestamps) se tornam imprecisos. Se um usuário clica em vários itens em rápida sucessão, este módulo garante que a IA preste atenção à sequência precisa desses cliques, em vez de apenas ao fato de que eles aconteceram próximos uns dos outros.
Os pesquisadores testaram essa abordagem em um conjunto de dados massivo contendo bilhões de interações do aplicativo Taobao, bem como em um benchmark público para recomendações de vídeo. Os resultados mostraram que separar esses dois tipos de informação temporal melhorou significamente a capacidade do sistema de prever o que um usuário desejaria a seguir. Em testes offline, o novo método superou todos os modelos de última geração anteriores, alcançando maior precisão na previsão de cliques e reduzindo erros. Crucialmente, a equipe descobriu que o sistema funcionava melhor quando os usuários tinham padrões claros e repetitivos em seu comportamento, como pedidos regulares de almoço, ou quando suas interações eram muito densas. A análise dos padrões de atenção interna da IA revelou que o sistema aprendeu a reforçar esses hábitos periódicos sem perder o rastro da sequência imediata de eventos.
O verdadeiro teste dessa pesquisa veio quando a equipe implementou o sistema no tráfego real do aplicativo Taobao. Em um experimento rigoroso de três semanas envolvendo milhões de usuários reais, o novo método entregou melhorias de negócios mensuráveis. Aumentou a taxa de cliques em 1,8 por cento e a receita por mil impressões em 3,0 por cento, tudo isso adicionando apenas uma quantidade insignificante de atraso ao tempo de resposta do sistema. Como os ganhos foram consistentes e o sistema permaneceu estável, a empresa implementou a atualização para 100 por cento do tráfego do sistema de recomendação de anúncios Shangou em janeiro de 2026. Esta implementação demonstra que, ao desvincular o contexto amplo do tempo da ordem específica das ações, os sistemas de recomendação podem se tornar mais sintonizados com a natureza complexa e rítmica da vida humana, oferecendo sugestões que parecem não apenas oportunas, mas verdadeiramente pessoais.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.