Blending Proxy Metrics with a North Star
Este artigo propõe uma estrutura de mistura ideal para testes A/B que equilibra dinamicamente métricas de proxy e uma "estrela guia" com base no poder do experimento e na qualidade do proxy, oferecendo insights acionáveis para o design de experimentos e demonstrando sua aplicação no mundo real na Netflix.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você é um capitão pilotando um navio enorme (uma empresa como a Netflix) através de águas com neblina. Seu objetivo final é alcançar uma ilha específica e distante chamada "A Estrela do Norte" (o verdadeiro sucesso comercial, como manter clientes por anos). No entanto, a neblina é tão espessa que você não consegue ver a ilha claramente até estar quase lá.
Para navegar, você tem duas ferramentas:
- A Bússola da Estrela do Norte: Ela aponta diretamente para o seu destino, mas é muito fraca e instável. Você só pode confiar nela se navegar por um tempo muito longo (executar um experimento gigante).
- O Radar de Proximidade: Ele detecta pequenas ondulações na água (cliques de usuários, engajamento) que acontecem antes de você chegar à ilha. É super sensível e fornece um sinal claro imediatamente, mas nem sempre significa que você está realmente indo em direção à ilha.
O Dilema
No passado, as empresas tinham que escolher: "Eu confio na fraca Estrela do Norte ou no barulhento Radar de Proximidade?"
- Se você confiar demais no Radar de Proximidade, pode navegar em direção a uma ondulação que parece promissora, mas que leva a um beco sem saída.
- Se você esperar pela Estrela do Norte, pode navegar por anos sem tomar decisões, perdendo oportunidades.
A Solução: O "Blend Inteligente"
O artigo de Winston Chou propõe um sistema de navegação inteligente que combina (blend) essas duas ferramentas. Em vez de escolher uma, o computador do navio ajusta automaticamente o quanto ele confia em cada ferramenta com base em quanta informação ele coletou.
Veja como o "Blend Inteligente" funciona, usando analogias simples:
1. A Analogia do "Botão de Volume"
Imagine que o processo de tomada de decisão é um rádio com dois botões de volume: um para o Radar de Proximidade (cliques) e outro para a Estrela do Norte (retenção).
- Quando o experimento é pequeno (poucos dados): O sinal da Estrela do Norte está muito baixo para ser ouvido. O sistema aumenta o volume do Radar de Proximidade e diminui o da Estrela do Norte. Você toma decisões baseadas nos sinais imediatos e sensíveis porque ainda não tem dados suficientes para ver o quadro geral.
- Quando o experimento é gigante (muitos dados): Você navegou o suficiente para que a Estrela do Norte seja finalmente visível. O sistema aumenta automaticamente o volume da Estrela do Norte e diminui o do Radar de Proximidade. Você para de adivinhar com base em ondulações e começa a pilotar pela direção do destino real.
O artigo prova que existe uma maneira matematicamente "perfeita" de girar esses botões em cada etapa da jornada.
2. A Analogia do "Teste de Sabor"
Imagine que você é um chef tentando criar um novo prato.
- A Estrela do Norte é o teste de sabor final feito por um crítico gastronômico (ele amou ou não?). Isso leva tempo e é raro.
- O Radar de Proximidade é o cheiro da cozinha enquanto você cozinha. É imediato e diz se algo está queimando ou com um cheiro bom.
Se você tem apenas uma amostra pequena (uma colherada), não pode confiar na opinião do crítico ainda, então você depende do cheiro. Mas se você cozinhou mil panelas, a opinião do crítico se torna a mais importante. O método do artigo diz exatamente quanto peso dar ao "cheiro" versus ao "gosto do crítico" com base em quantas panelas você cozinhou.
3. A Analogia do "Engarrafamento" (Projetando Experimentos)
O artigo também muda a forma como você planeja seus experimentos.
- Se o seu Radar de Proximidade é excelente (como um cheiro muito preciso), você não precisa cozinhar grandes lotes para saber se o prato está bom. Você pode realizar muitos experimentos pequenos e rápidos. Isso é como pegar muitos caminhos secundários para desviar do trânsito.
- Se o seu Radar de Proximidade é ruim (o cheiro é pouco confiável), você não pode confiar nele. Você tem que esperar pelo crítico. Isso significa que você precisa realizar menos experimentos, porém muito maiores.
Prova no Mundo Real: Netflix
O autor testou isso na Netflix.
- A Estrela do Norte: "Reproduções" (o usuário realmente assistiu ao filme?). Isso é difícil de medir rapidamente.
- O Radar de Proximidade: "Cliques" (o usuário clicou no título?). Isso é fácil de medir instantaneamente.
Nos dados da Netflix, os "Cliques" eram muito mais sensíveis do que as "Reproduções".
- Para testes pequenos, o sistema dependia principalmente de Cliques.
- Para testes massivos (milhões de usuários), o sistema mudava para depender principalmente de Reproduções.
- O Resultado: Ao combinar esses elementos, a Netflix obteve melhores resultados do que se tivesse usado apenas Cliques ou apenas Reproduções. Eles cometeram menos erros e encontraram mais funcionalidades de sucesso.
A Conclusão
Você não precisa escolher entre dados "rápidos, mas barulhentos" e dados "lentos, mas precisos". Ao usar uma abordagem combinada que altera automaticamente a confiança dos dados rápidos para os dados precisos conforme você coleta mais informações, você pode tomar decisões melhores e mais rápidas.
Pontos Principais do Artigo:
- Não escolha um lado: Use ambas as métricas, mas dê pesos diferentes a elas.
- O tamanho importa: Quanto maior o seu experimento, mais você deve confiar na "Estrela do Norte" (o objetivo real).
- A qualidade importa: Se o seu "Radar de Proximidade" for muito bom, você pode realizar mais experimentos pequenos. Se for ruim, você precisa de menos experimentos, porém maiores.
- A matemática funciona: O artigo fornece uma fórmula para calcular exatamente como misturar essas métricas para obter o melhor resultado possível.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.