← Últimos artigos
🤖 machine learning

A Production-Ready RL Framework for Personalized Utility Tuning with Pareto Sweeping in Pinterest Recommender Systems

Este artigo apresenta o PRL-PUTS, um framework de aprendizado por reforço pronto para produção e independente de ranqueamento que automatiza o ajuste de pesos de utilidade personalizados por meio de varredura de Pareto para otimizar dinamicamente compensações multiobjetivo no Homefeed do Pinterest, resultando em melhorias significativas no engajamento sem adicionar latência de serviço.

Autores originais: Yichu Zhou, Mehdi Ben Ayed, Lin Yang, Jiacong He, Andreanne Lemay, Jiaye Wang, Jaewon Yang, Josie Zeng, Dhruvil Deven Badani, Yijie Dylan Wang, Jiajing Xu, Charles Rosenberg

Publicado 2026-05-19
📖 4 min de leitura☕ Leitura rápida

Autores originais: Yichu Zhou, Mehdi Ben Ayed, Lin Yang, Jiacong He, Andreanne Lemay, Jiaye Wang, Jaewon Yang, Josie Zeng, Dhruvil Deven Badani, Yijie Dylan Wang, Jiajing Xu, Charles Rosenberg

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine o Pinterest como uma biblioteca enorme e movimentada, onde milhões de livros (Pins) são constantemente recomendados aos visitantes. A biblioteca possui um bibliotecário muito inteligente (o Ranker) que examina cada livro e prevê o quanto um visitante específico pode gostar dele com base em diferentes critérios: "Eles vão clicar nisso?", "Vão salvar no seu quadro?", "Vão ver uma imagem relacionada?"

O Jeito Antigo: O Manual de Regras "Tamanho Único"

No passado, os gerentes da biblioteca tinham que decidir como combinar essas previsões em uma pontuação única para determinar quais livros mostrar primeiro. Eles usavam uma fórmula simples:

Pontuação Total = (Cliques × Peso A) + (Salvamentos × Peso B)

O problema era que o Peso A e o Peso B eram definidos manualmente. Se os gerentes quisessem mais salvamentos, aumentavam manualmente o Peso B. Mas isso era lento, rígido e aplicava exatamente a mesma regra a todos. Um adolescente procurando ideias para festas e um profissional procurando decoração para a casa recebiam exatamente a mesma "receita" de recomendações, mesmo que suas necessidades fossem totalmente diferentes. Era como um chef usando exatamente a mesma quantidade de sal para uma sopa destinada a um bebê e para uma sopa destinada a um crítico gastronômico experiente.

A Nova Solução: PRL-PUTS (O Sous-Chef Inteligente e Adaptativo)

O artigo apresenta o PRL-PUTS, um novo sistema que atua como um sous-chef inteligente e adaptável, posicionado ao lado do bibliotecário.

  1. Ele Não Reescreve o Bibliotecário: O bibliotecário principal (o Ranker) permanece exatamente o mesmo. O PRL-PUTS não tenta reeducar o bibliotecário nem alterar como ele lê os livros. Ele apenas se posiciona acima deles.
  2. Ele Ajusta a Receita em Tempo Real: Para cada solicitação individual de visitante, o PRL-PUTS analisa o contexto (Quem é essa pessoa? O que estão fazendo agora?) e decide instantaneamente: "Para esta pessoa específica, vamos enfatizar um pouco mais os 'Salvamentos'", ou "Para esta pessoa, vamos enfatizar mais as 'Imagens Relacionadas'".
  3. Ele Aprende com a Experiência: Em vez de adivinhar os pesos, o PRL-PUTS é um agente de Aprendizado por Reforço. Ele testa diferentes "receitas" (combinações de pesos) de forma segura e controlada, observa o que acontece (o usuário interagiu?) e aprende qual receita funciona melhor para qual tipo de pessoa.

O Truque da "Varredura Pareto": O Cardápio de Opções

Uma das partes mais difíceis de gerenciar um sistema de recomendação é que nem sempre é possível vencer em tudo. Se você pressionar demais por "Salvamentos", pode obter menos "Cliques".

O artigo introduz uma ferramenta de governança inteligente chamada Varredura Pareto. Imagine que o sistema não escolhe apenas uma melhor receita. Em vez disso, ele gera um cardápio inteiro de receitas possíveis (uma "Frente de Pareto").

  • Receita A: Maximiza Salvamentos, reduz ligeiramente Cliques.
  • Receita B: Um equilíbrio perfeito.
  • Receita C: Maximiza Cliques, reduz ligeiramente Salvamentos.

Os líderes de negócios (stakeholders) podem olhar para este cardápio e dizer: "Hoje, nosso objetivo é obter mais Salvamentos, então vamos mudar o sistema para a Receita A". Eles podem fazer isso instantaneamente, girando um único dial (um parâmetro chamado α\alpha), sem precisar reeducar todo o modelo de IA ou esperar semanas por uma nova atualização.

Como Funciona no Mundo Real (Homefeed do Pinterest)

A equipe testou isso no Homefeed do Pinterest (o feed principal que os usuários veem ao fazer login).

  • Velocidade: Funciona tão rápido que os usuários não percebem nenhum atraso. É como um garçom que sussurra uma sugestão ao chef enquanto a comida já está sendo empratada.
  • Segurança: Se o sistema falhar, ele volta instantaneamente para os pesos manuais antigos e seguros.
  • Resultados: Quando giraram o dial para favorecer "Salvamentos" para certos usuários, observaram um aumento de 0,13% em "Sessões Bem-sucedidas" (sessões onde os usuários realmente fizeram algo positivo). Isso pode parecer pequeno, mas em uma plataforma com milhões de usuários, é uma vitória massiva.

A Conclusão Principal

O artigo prova que você não precisa reconstruir completamente seu mecanismo de recomendação para torná-lo mais inteligente. Ao adicionar uma pequena camada inteligente por cima que personaliza a "receita" para cada usuário individual e oferece aos gerentes um cardápio de opções de compensação, você pode obter melhores resultados, adaptar-se mais rapidamente a mudanças nos negócios e manter o sistema estável.

Em resumo: O PRL-PUTS transforma um manual de regras rígido e global em uma conversa flexível e personalizada entre o sistema e o usuário, gerenciada por um dial simples que os líderes de negócios podem girar sempre que precisam mudar as prioridades.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →