← Últimos artigos
📊 statistics

Calibrate Globally, Measure Everywhere: Scaling LLM-Based Prevalence Measurement Across A/B Experiments

Este artigo apresenta uma solução de nível de sistema e de baixo custo para a plataforma de experimentação do Pinterest que escala a medição de prevalência de conteúdo baseada em LLM através de centenas de testes A/B simultâneos ao implementar uma calibração global única e continuamente atualizada de buckets de pontuação de ML, permitindo, assim, o rastreamento diário de alta fidelidade para mais de 20 vezes mais braços de experimento do que a rotulagem tradicional por experimento via LLM dentro do mesmo orçamento.

Autores originais: Zehao Xu, Tony Paek, Kevin O'Sullivan, Attila Dobi

Publicado 2026-07-30
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Zehao Xu, Tony Paek, Kevin O'Sullivan, Attila Dobi

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está administrando uma cidade enorme e movimentada, onde milhões de pessoas caminham pelas ruas todos os dias. Nesta cidade, existem milhares de lojas, parques e outdoors diferentes, e os planejadores urbanos querem saber exatamente quanto tempo as pessoas passam olhando para tipos específicos de coisas — como "ferramentas de jardinagem" ou "arte gerada por IA". Este é o mundo da medição de prevalência: descobrir qual fração do total de "impressões" (ou olhares) pertence a uma determinada categoria.

Para tomar decisões sobre a cidade, os planejadores frequentemente realizam experimentos A/B. Isso é como testar duas versões diferentes de uma placa de rua: uma versão para metade das pessoas, outra para a outra metade, para ver qual delas as deixa mais felizes ou engajadas. Geralmente, para saber se uma placa está funcionando, você precisa contar os resultados. Mas aqui está o detalhe: às vezes, a coisa que você quer contar é difícil de medir. Você não pode simplesmente perguntar a cada pessoa o que ela viu; isso levaria uma eternidade e custaria uma fortuna. No mundo digital, essa tarefa "difícil de medir" é frequentemente realizada por Modelos de Linguagem de Grande Escala (LLMs) — computadores de IA superinteligentes que podem ler uma imagem ou uma postagem e dizer: "Sim, isso é sobre jardinagem" ou "Não, isso não é". Embora esses juízes de IA sejam incrivelmente precisos, pedir a eles que examinem cada item em uma cidade com bilhões de visitantes diários é caro demais e lento demais para ser feito para cada experimento individual.

É aqui que entra o artigo de Zehao Xu e sua equipe no Pinterest. Eles enfrentaram um problema: estavam realizando centenas de experimentos todos os dias e precisavam saber a "prevalência" de certos tipos de conteúdo (como o quanto de pins eram sobre IA ou problemas de segurança) para cada grupo de experimento. Eles não podiam pagar à IA para rotular cada item em cada teste novo. Então, construíram um sistema inteligente que atua como um "tradutor global". Em vez de pedir à IA cara para verificar cada item em cada novo experimento, eles pedem que a IA verifique uma amostra representativa de toda a cidade uma vez por dia. Eles usam essa amostra para ensinar um modelo mais barato e rápido a adivinhar a prevalência. Então, usam esse modelo rápido para medir todo o resto instantaneamente. O resultado? Eles conseguem rastrear mudanças na exposição de conteúdo para centenas de experimentos todos os dias, capturando mudanças minúsculas que uma única verificação cara perderia — tudo sem gastar dinheiro extra com rótulos de IA.

O Problema: O "Padrão Ouro" é Caro Demais

No mundo da mídia online, empresas como o Pinterest precisam equilibrar a manutenção do engajamento dos usuários com a garantia de que eles não vejam excessivamente certos tipos de conteúdo (como imagens inseguras ou spam de baixa qualidade). Para fazer isso, elas realizam testes A/B. Nesses testes, elas ajustam o algoritmo para ver se ele altera a quantidade de um tipo específico de conteúdo que os usuários veem.

Para medir isso, o "padrão ouro" é usar uma IA (um LLM) para examinar uma amostra de conteúdo e rotulá-la perfeitamente. Isso é como ter uma equipe de críticos de arte especialistas examinando cada pintura em uma galeria para contar quantas são paisagens. É preciso, mas é lento e incrivelmente caro. Se você tem centenas de experimentos rodando ao mesmo tempo e precisa verificar o conteúdo para cada grupo em cada experimento, o custo seria astronômico. Você simplesmente não pode pagar para contratar os "especialistas" para olhar tudo, todos os dias.

Além disso, as mudanças que as empresas monitoram são frequentemente muito pequenas. Se um novo algoritmo reduz a quantidade de "arte gerada por IA" que os usuários veem em apenas 2% ou 5%, uma única verificação cara pode não ser precisa o suficiente para dizer se essa mudança é real ou apenas ruído aleatório. É como tentar ouvir um sussurro em uma sala barulhenta com um único microfone caro; você pode perder o sussurro inteiramente.

A Solução: Um Mapa de Calibração Global

A equipe do Pinterest percebeu que não precisavam pedir à IA cara para rotular tudo para cada experimento. Em vez disso, precisavam de uma maneira de "calibrar" um método mais barato e rápido usando a sabedoria da IA cara.

Pense da seguinte forma: imagine que você tem um termômetro superpreciso, mas lento (o LLM) e um termômetro barato e rápido (a pontuação do modelo de ML). O termômetro barato fornece um número, mas não é perfeitamente preciso. No entanto, se você usar o termômetro caro para verificar a temperatura em alguns pontos específicos todos os dias, poderá criar um mapa que lhe diz exatamente como corrigir a leitura do termômetro barato para qualquer localização.

O artigo descreve um sistema que faz exatamente isso:

  1. Calibração Global: Em vez de rotular itens para cada experimento separadamente, eles executam um processo de amostragem global diária. Eles usam o LLM caro para rotular uma amostra representativa de todo o tráfego da plataforma.
  2. Agrupamento (Bucketing): Eles pegam as pontuações do modelo barato e rápido (que prevê a probabilidade de um item ser, por exemplo, "gerado por IA") e as agrupam em "baldes" ou categorias (ex: 0–10%, 10–20%, etc.).
  3. A Tradução: Usando os rótulos do LLM diário, eles calculam exatamente qual porcentagem de itens em cada balde é realmente "gerada por IA". Isso cria uma tabela de consulta: "Se o modelo barato diz que um item está no balde de 80–90%, há 95% de chance de ele ser realmente gerado por IA".
  4. Medição Instantânea: Agora, para qualquer novo experimento, eles não precisam chamar a IA cara. Eles apenas olham as pontuações do modelo barato para os itens naquele experimento, veem em quais baldes eles caem e usam o mapa pré-calculado para saber a prevalência instantaneamente.

Os Resultados: Capturando os Sussurros

A equipe testou este sistema contra as medições do "padrão ouro" do LLM em experimentos do mundo real. Os resultados foram impressionantes:

  • Escala: O sistema está atendendo atualmente cerca de 100 experimentos e 250 grupos diferentes (braços) todos os dias.
  • Eficiência: Comparado ao método antigo de realizar uma única verificação cara por experimento, este novo sistema fornece medições diárias para mais de 20 vezes mais experimentos simultâneos usando o mesmo orçamento de rotulagem.
  • Precisão: Em cerca de 300 auditorias de produção, o intervalo de confiança de 95% do sistema continha a resposta do LLM caro 92% das vezes. Isso significa que o método barato e rápido é quase tão confiável quanto o caro.
  • Sensibilidade: A descoberta mais emocionante foi sobre a detecção de pequenas mudanças. Em um experimento, o novo sistema detectou uma redução relativa pequena, mas consistente, de 4,2% em um tipo específico de conteúdo. Uma única verificação de LLM cara naquele mesmo experimento teria perdido isso inteiramente porque o ruído era muito alto. Ao agregar dados diários, o novo sistema conseguiu ouvir o "sussurro" que o microfone caro perdeu.

Por Que Isso Importa

Isso não é apenas sobre economizar dinheiro; é sobre tomar decisões melhores. Antes deste sistema, as equipes poderiam ter que deixar de medir a prevalência de conteúdo em muitos experimentos porque era caro demais. Ou, elas poderiam tomar decisões baseadas em um único ponto de dados ruidoso que perdeu tendências pequenas, mas importantes.

Ao "calibrar globalmente e medir em todo lugar", a equipe criou um sistema onde o custo da IA cara é pago uma vez (ou amortizado) e depois reutilizado milhares de vezes. Isso transforma um processo lento e caro em uma rotina diária e reutilizável. Isso permite que as equipes de produto vejam o quadro completo de como suas mudanças afetam a exposição de conteúdo, garantindo que a plataforma permaneça segura, de alta qualidade e envolvente para todos, sem estourar o orçamento.

O artigo enfatiza que este é um feito de nível de sistema, não apenas uma nova fórmula matemática. Trata-se de construir um pipeline que pega uma tarefa recorrente e cara e a transforma em um ativo reutilizável. Embora o artigo observe que os custos dos LLMs podem diminuir no futuro, tornando a rotulagem direta mais barata, a lógica deste sistema — usar uma calibração global para escalar as medições — continua sendo uma ferramenta poderosa para gerenciar experimentos complexos e de grande escala hoje.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →