Heterogeneous Ranking in Industrial-Scale Recommender Systems: A Case Study
Este artigo apresenta um estudo de caso industrial de ponta a ponta sobre o ranqueamento de feeds de conteúdo heterogêneo no Google Discover, introduzindo a arquitetura HA-MoE para aprendizado multitarefa adaptativo e o framework de observabilidade LENS para gerenciar efetivamente a diversidade de conteúdo enquanto melhora tanto as métricas offline quanto o engajamento online dos usuários.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está entrando em uma biblioteca enorme e caótica, onde as prateleiras estão constantemente se reorganizando. Uma prateleira contém livros sérios de história, outra tem vídeos engraçados de gatos, uma terceira tem receitas e uma quarta tem notícias de última hora. Em um mundo perfeito, um bibliotecário saberia exatamente o que você quer ler a seguir, esteja você com vontade de uma piada rápida ou de um mergulho profundo na história. Mas no mundo real da internet, essa "biblioteca" é o feed do Google Discover, e o "bibliotecário" é um programa de computador chamado sistema de recomendação.
O desafio para esses bibliotecários de computador é que eles costumavam trabalhar em bibliotecas organizadas de tópico único, como um lugar que só tinha música ou só tinha vídeos curtos. Nesses lugares, tudo parecia e agia da mesma forma. Mas o Google Discover é diferente; ele puxa conteúdo de toda a web aberta. Isso significa que o computador tem que decidir entre um artigo longo, um vídeo de 10 segundos, um post pessoal de um usuário e um resumo gerado por IA, tudo ao mesmo tempo. É como pedir a um único chef para cozinhar um bife perfeito, um suflê delicado e um taco apimentado para o mesmo cliente, tudo usando o mesmo conjunto de ingredientes e ferramentas. Se o chef focar demais no bife, o taco pode ser arruinado. Este artigo aborda o problema complicado de ensinar um único cérebro de computador a lidar com todos esses diferentes "sabores" de conteúdo sem ficar confuso ou favorecer os mais barulhentos e populares.
Os autores deste artigo, uma equipe do Google, enfrentaram um problema específico: seu sistema atual era como um chef "tamanho único". Ele tentava usar um único conjunto de regras para classificar tudo, o que levava a erros. Às vezes, ele impulsionava artigos de click-bait de baixa qualidade apenas porque recebiam muitos cliques, enquanto enterrava vídeos de alta qualidade que as pessoas realmente queriam assistir. Para corrigir isso, eles construíram um novo sistema chamado HA-MoE (Mixture-of-Experts Heterogênea-Adaptativa).
Pense no HA-MoE não como um único chef, mas como uma cozinha movimentada com um gerente inteligente e uma equipe de cozinheiros especializados. No sistema antigo, um cozinheiro tentava fazer tudo. No novo sistema, o "gerente" (a rede de portão ou gating network) olha para o pedido e o tipo de comida (o conteúdo) e decide qual especialista deve lidar com aquilo. Se o pedido for um vídeo, o gerente o envia para o "Especialista em Vídeo". Se for um artigo de texto, ele vai para o "Escritor". Crucialmente, o gerente não apenas adivinha; ele usa um "sinal de heterogeneidade", uma pequena nota que diz: "Ei, isso é um vídeo, trate de forma diferente!". Isso garante que o especialista em vídeo possa brilhar sem ser abafado pelo especialista em artigos.
Mas como você sabe se a cozinha está realmente funcionando bem? A equipe percebeu que olhar apenas para o número total de clientes felizes não era suficiente. Você pode ter um ótimo dia no geral, mas se o especialista em vídeo estiver falhando, você está perdendo oportunidades. Por isso, eles inventaram uma nova maneira de medir o sucesso chamada DL-AUC (AUC de Duplo Nível). Imagine avaliar a cozinha não apenas pelo total de refeições servidas, mas também pelo quão bem o especialista em vídeo se saiu em comparação ao especialista em artigos. Essa nova pontuação ajuda a detectar problemas onde um tipo de conteúdo está sendo injustamente ignorado.
Para garantir que o sistema permaneça saudável ao longo do tempo, eles também construíram uma ferramenta chamada LENS. Isso é como um par de óculos de raio-X para a cozinha. Permite que os engenheiros espiem dentro do céreão do computador para ver qual "especialista" está fazendo o quê. Se o sistema começar a ficar preguiçoso e todos os especialistas começarem a fazer a mesma coisa, o LENS detecta isso imediatamente. Isso ajuda a equipe a corrigir problemas antes que eles estraguem a experiência do usuário.
Os resultados foram promissores. Quando testaram este novo sistema em um enorme conjunto de dados de interações reais de usuários, ele teve um desempenho melhor ao classificar tanto ações positivas (como cliques e curtidas) quanto ações negativas (como descartar um post) em comparação ao sistema antigo. Ele conseguiu deter o "viés da maioria", onde tipos de conteúdo populares costumavam esmagar os menos comuns. Em testes online com usuários reais, o novo sistema levou mais pessoas a abrir o aplicativo, rolar mais profundamente e explorar uma variedade maior de conteúdos. O artigo sugere que, ao ensinar explicitamente o computador a respeitar as diferenças entre os tipos de conteúdo, em vez de forçá-los a serem iguais, podemos construir feeds mais inteligentes, mais justos e mais agradáveis para todos.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.