Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning
Este artigo apresenta uma estrutura unificada e agnóstica de modelo para otimizar o engajamento de longo prazo do usuário em sistemas de recomendação de larga escala, identificando comportamentos de sessão preditivos precoces e derivando sinais de recompensa subsequentes, os quais foram implementados com sucesso em múltiplas superfícies do Pinterest para melhorar as métricas de retenção.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está caminhando por uma biblioteca imensa e infinita onde as prateleiras se reorganizam de acordo com o que você olha. Este é o mundo dos sistemas de recomendação, os motores invisíveis por trás de aplicativos como Pinterest, TikTok e Netflix. O trabalho deles é adivinhar o que você gostará em seguida. Por muito tempo, esses sistemas eram como guias turísticos impacientes: eles só se importavam se você parasse para olhar para uma exibição agora mesmo. Se você clicasse em uma imagem, eles mostrariam dez outras exatamente iguais imediatamente. Mas aqui está o problema: se você mostrar às pessoas apenas o que elas já conhecem, elas ficam entediadas e param de visitar a biblioteca. A grande questão que os cientistas estão tentando resolver é: Como recomendamos coisas que mantenham as pessoas voltando por meses ou anos, não apenas pelos próximos cinco minutos?
Para responder a isso, os pesquisadores têm que lidar com uma realidade complicada: não podemos ver o futuro facilmente. Não podemos esperar para ver se um usuário retorna em um mês para decidir o que mostrar a ele hoje. Portanto, em vez de adivinhar o futuro diretamente, eles procuram por "pistas" no presente — pequenos comportamentos que geralmente acontecem logo antes de alguém decidir permanecer por perto. Este artigo é sobre encontrar essas pistas e ensinar o guia turístico da biblioteca a segui-las, transformando uma visita curta e entediante em uma aventura longa e emocionante.
O Problema: A "Armadilha do Clique"
Imagine que você está em um carnaval. Uma barraca de jogos oferece a você um doce instantâneo gratuito se você girar uma roda. Você gira, ganha seu doce e vai embora. O dono da barraca está feliz porque você girou a roda, mas você nunca mais volta. É isso que acontece quando os sistemas de recomendação se preocupam apenas com sinais de curto prazo, como um clique rápido ou um olhar de um segundo. Eles conseguem muitos "giros", mas os usuários ficam entediados e deixam o carnaval para sempre.
Os autores deste artigo, trabalhando na Pinterest, perceberam que otimizar para cliques imediatos estava, na verdade, prejudicando a saúde de longo prazo de sua plataforma. Eles queriam construir um sistema que não dissesse apenas: "Aqui está algo que você pode clicar", mas sim: "Aqui está algo que fará você ficar, explorar e voltar amanhã".
A Solução: O Detetive da "Toca do Coelho"
A equipe teve uma ideia inteligente: em vez de esperar para ver se um usuário retorna na próxima semana (o que é raro e difícil de rastrear), eles procurariam por Recompensas de Fluxo Posterior (Downstream Rewards). Pense nisso como um detetive procurando por pegadas. Se um usuário mergulha profundamente em uma "toca do coelho" de conteúdo relacionado, salva uma imagem ou passa muito tempo explorando, essas são pegadas fortes que dizem: "Esta pessoa está se divertindo muito e provavelmente retornará".
O artigo propõe um framework agnóstico ao modelo. "Agnóstico ao modelo" é uma forma elegante de dizer que "funciona com qualquer tipo de mecanismo de recomendação", seja uma lista simples ou uma IA complexa. Eles não apenas adivinharam quais comportamentos eram bons; eles realizaram um processo de triagem offline massivo para encontrar as ações específicas que realmente previam a lealdade de longo prazo.
As Três Pistas de Ouro
Através de sua análise, eles identificaram três tipos principais de "recompensas" (pistas) que levam a usuários felizes e recorrentes:
O Mergulho Profundo (Engajamento de Sessão Mais Profundo):
Não se trata apenas de clicar; trata-se de quão fundo você vai. O artigo descobriu que, se um usuário clica em um Pin e então mergulha imediatamente em uma "toca do coelho P2P" (uma cadeia de Pins relacionados), salva ou faz o download, isso é uma grande vitória.- A Metáfora: É a diferença entre espiar para dentro de uma sala e realmente se mudar para ela. O sistema aprendeu a recompensar usuários que tiram o tempo para explorar a "toca do coelho" em vez de apenas passar pela superfície.
- O Resultado: Eles descobriram que essas ações profundas estão fortemente ligadas ao retorno dos usuários. De fato, sessões com essas ações profundas levaram os usuários a revisitar o aplicativo significativamente mais cedo.
A Penalidade do "Parecer, mas não ser" (Recompensas Negativas):
Nem todos os cliques são bons. A equipe descobriu que alguns "closeups" (dar zoom em uma imagem) são, na verdade, sinais de tédio. Se um usuário dá zoom por menos de um segundo e sai imediatamente, é um "closeup raso".- A Metáfora: Imagine alguém entrando em uma loja, pegando um item, olhando para ele por uma fração de segundo e o soltando imediatamente. Eles não estão interessados; estão apenas matando o tempo.
- A Correção: O sistema agora trata esses olhares de um segundo como uma recompensa negativa. É como o guia turístico dizendo: "Ei, não mostre este item para esta pessoa novamente; ela claramente não gostou". Eles descobriram que diferentes tipos de usuários precisam de regras diferentes: usuários "principais" precisam de um limite de 1 segundo para ser considerado raso, enquanto usuários "não principais" precisam de apenas 0,5 segundos.
A Nova Aventura (Adoção de Casos de Uso):
Às vezes, os usuários ficam presos em um ciclo de seus interesses antigos. O artigo introduziu uma recompensa para a Adoção de Casos de Uso. Isso acontece quando um usuário se envolve com algo totalmente novo que não se encaixa em seu padrão habitual.- A Metáfora: Se um usuário costuma olhar para "vídeos de gatos" e o sistema mostra a ele um vídeo de "como consertar uma bicicleta", e ele realmente assiste e salva, isso é uma vitória. Significa que o sistema expandiu seus horizonts com sucesso.
- O Objetivo: Isso incentiva a IA a mostrar aos usuários coisas que eles não sabiam que queriam, ajudando-os a construir novos hobbies e interesses, o que os mantém na plataforma por mais tempo.
A Sala de Máquinas: Como Eles Fizeram Funcionar
Você pode se perguntar: "Como você calcula tudo isso sem deixar o aplicativo lento?". Os autores construíram uma nova infraestrutura chamada DRv2.
- O Jeito Antigo: Eles costumavam pré-calcular todas essas recompensas em grandes lotes, o que levava semanas para atualizar. Se quisessem testar uma nova ideia, tinham que esperar semanas.
- O Jeito Novo: Eles construíram um sistema que calcula essas recompensas em tempo real, no momento em que os dados estão sendo lidos. Isso reduziu o tempo para testar novas ideias de 3 semanas para 2 dias. É como mudar de assar um bolo do zero toda vez que você quer uma fatia para ter uma máquina mágica que monta instantaneamente uma fatia fresca sempre que você pede.
Os Resultados: Isso Realmente Funciona?
A equipe testou essas ideias no mundo real usando testes A/B (mostrando um grupo o sistema antigo e outro grupo o novo sistema). Os resultados foram consistentes e positivos:
- Mais Sessões Bem-Sucedidas: O número de sessões onde os usuários fizeram algo significativo (como salvar ou baixar) aumentou em +0,36% de forma geral.
- Mais Tempo Gasto: Os usuários passaram mais tempo no aplicativo, com o tempo total aumentando em +0,10%.
- Melhor Retenção: Mais importante, o número de Usuários Ativos Semanais (WAU) aumentou em +0,1% para usuários principais. Isso prova que o sistema não apenas enganou as pessoas para clicarem; ele realmente as fez querer voltar.
- Sucesso em Diferentes Superfícies: Eles não corrigiram apenas o "Homefeed" (a página principal). Eles aplicaram a mesma lógica à Busca, Pins Relacionados e Notificações. Na Busca, a "taxa de cumprimento" (com que frequência uma busca levou a uma ação real) subiu +0,25%.
A Conclusão
Este artigo sugere que o segredo para manter os usuários felizes não é apenas mostrar o que eles já gostam, mas guiá-los para interações mais profundas e significativas. Ao recompensar "mergulhos profundos", penalizar "cliques falsos" e incentivar "novas aventuras", o sistema pode transformar um olhar rápido em um relacionamento de longo prazo.
Os autores ressaltam cuidadosamente que isso não é uma solução mágica que resolve tudo para sempre, mas é uma ferramenta poderosa e flexível que funciona em diferentes partes do aplicativo. Ao focar na qualidade da jornada, em vez de apenas na velocidade do clique, eles conseguiram construir um sistema de recomendação que parece menos uma máquina de vendas e mais um amigo prestativo que sabe como manter a conversa fluindo.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.