Nobody Puts Bonferroni in a Corner
O artigo defende que a correção de Bonferroni é uma escolha superior para experimentação online, demonstrando através de simulações e dados da Spotify que ela oferece intervalos de confiança incondicionais simples e que sua perda de poder estatístico é mínima quando aplicada corretamente apenas às métricas de sucesso, tornando-a frequentemente indistinguível de métodos mais sofisticados.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você é o gerente de uma grande fábrica de música (como a Spotify) e tem uma equipe de engenheiros propondo milhares de novas ideias: mudar a cor de um botão, adicionar um novo filtro de busca ou criar uma playlist automática.
Para saber se essas ideias funcionam, vocês fazem "experimentos" (testes A/B). Metade dos usuários vê a versão antiga, a outra metade vê a nova. Se a nova versão for melhor, vocês a lançam para todos.
O problema é que, quando vocês testam muitas coisas ao mesmo tempo (métricas diferentes, como "tempo de escuta", "número de cliques", "crescimento de assinantes"), a estatística tradicional começa a brincar de "sorte".
O Problema: O Jogo da Sorte e os Falsos Positivos
Se você jogar uma moeda 10 vezes, é provável que dê "cara" pelo menos uma vez, mesmo que a moeda seja honesta. Se você testar 20 ideias diferentes sem cuidado, a chance de achar que uma delas funcionou (quando na verdade foi só sorte) é enorme. Isso é chamado de Falso Positivo.
Na indústria, o consenso antigo era: "Não use o método mais simples (Bonferroni) porque ele é muito conservador e vai impedir que lancemos coisas boas. Use métodos mais complexos e 'inteligentes'."
Este artigo diz: "Esperem aí! O método simples (Bonferroni) é, na verdade, o melhor amigo de vocês, e ninguém está usando a maneira certa."
O autor, Mårten Schultzberg, usa quatro argumentos principais para defender o "Bonferroni" (que vamos chamar de O Guardião Simples).
1. A Regra de Ouro: Não Confunda "Sucesso" com "Segurança"
Aqui está o grande segredo que a maioria das pessoas ignora. Em um experimento, nem todas as métricas têm o mesmo papel.
- Métricas de Sucesso: São as vitórias. "A música toca mais?", "O usuário clica mais?". Se pelo menos uma dessas melhorar, o time quer lançar a mudança.
- Métricas de Guarda-Chuva (Guardrails): São os freios de segurança. "O app não travou?", "A bateria não drenou?". Se qualquer uma dessas piorar, o time não deve lançar, não importa o quanto a métrica de sucesso tenha melhorado.
A Analogia do Carro:
Imagine que você está dirigindo um carro novo.
- Métricas de Sucesso: O carro é mais rápido? (Você quer que isso aconteça).
- Métricas de Guarda-Chuva: Os freios funcionam? O motor não superaqueceu? (Você quer que isso não aconteça).
O erro comum é tratar os freios e o motor como se fossem "metas de velocidade". O autor diz: Não conte os freios na sua lista de metas!
Se você tem 2 metas de sucesso e 10 freios de segurança, o método Bonferroni não deve dividir sua "sorte" por 12. Ele deve dividir apenas por 2.
- Por que? Porque um erro nos freios (dizer que estão bons quando estão ruins) só torna mais fácil não lançar o carro. Isso não cria um falso positivo de lançamento. O único jeito de lançar algo ruim é se você errar na métrica de sucesso.
- Resultado: Ao separar o que é "vitória" do que é "segurança", o método Bonferroni deixa de ser "punitivo" e se torna muito mais leve e justo.
2. O Mapa do Tesouro (Intervalos de Confiança)
Outros métodos estatísticos complexos são como mapas que só mostram o tesouro se você já tiver encontrado o caminho. Eles dizem: "Se você achou um sucesso, aqui está o mapa". Mas se você não achou, o mapa é inútil.
O Guardião Simples (Bonferroni) é diferente. Ele desenha um mapa completo e honesto para todas as métricas, seja elas vencedoras ou não.
- Ele diz: "Aqui está o intervalo de confiança para o tempo de escuta. Aqui está para os cliques. Aqui está para a bateria."
- Isso é crucial para engenheiros e gerentes de produto. Eles precisam saber não apenas se algo funcionou, mas quanto funcionou e com que certeza. Métodos mais complexos muitas vezes não conseguem dar essa informação clara para todas as métricas ao mesmo tempo.
3. Planejar a Viagem Antes de Sair (Cálculo de Amostra)
Antes de começar um experimento, você precisa saber quantos usuários testar.
- Com o Guardião Simples, é fácil: você faz uma conta simples e sabe exatamente quantas pessoas precisa. É como calcular o combustível para uma viagem com uma régua.
- Com os métodos complexos, é como tentar calcular o combustível sem saber quantas pessoas vão subir no carro ou se vai chover. Você precisa fazer suposições que ninguém consegue provar antes de começar. Isso torna o planejamento difícil e impreciso.
4. O Custo Real da "Sorte" (Poder Estatístico)
A maior crítica ao Bonferroni é: "Ele é tão conservador que vamos perder muitas ideias boas (perder poder estatístico)".
O autor fez um estudo com 1.296 experimentos reais da Spotify e descobriu algo surpreendente:
- Quando as métricas são poucas e bem definidas (apenas as de sucesso): A diferença entre o método simples e os métodos complexos é quase zero. Você não perde quase nada de "ideias boas" ao usar o simples.
- Quando as métricas são muitas e mal definidas: Aí sim, os métodos complexos ajudam um pouco mais (ganham cerca de 4% a 5% a mais de lançamentos). Mas o autor argumenta que, se você tem 10 métricas de sucesso, você provavelmente está fazendo o experimento errado. Você deveria ter focado em 2 ou 3 principais.
A Lição: A diferença de poder não vem do método estatístico, mas de como você organiza suas perguntas. Se você organizar bem (separando sucesso de segurança), o método simples funciona tão bem quanto os complexos.
Conclusão: Por que voltar ao básico?
O artigo é um chamado para parar de ter medo do método mais simples.
- Confiança: Em uma empresa, as decisões são tomadas com base nesses números. Se o método é complexo e difícil de explicar, as pessoas param de confiar nele. O Bonferroni é transparente: "Dividimos o risco pelo número de vitórias que buscamos".
- Simplicidade: Ele funciona bem com intervalos de confiança, com planejamento de tamanho de amostra e com testes sequenciais (olhar os dados enquanto o experimento roda).
- A Verdade: A maioria das mudanças de produto não funciona. A maioria dos testes é "nula". Em um mundo onde a maioria das coisas não tem efeito, métodos que permitem mais "falsos positivos" (como os métodos de FDR) apenas aumentam o lixo estatístico, fazendo com que times lancem coisas que não funcionam.
Em resumo: Não tenha medo de usar o "Guardião Simples". Se você separar claramente o que é "vitória" do que é "segurança", ele será tão poderoso quanto os métodos complexos, mas muito mais honesto, fácil de entender e confiável para toda a empresa.
O título do artigo é uma brincadeira com a frase "Ninguém coloca o Rocky em um canto" (Nobody puts Baby in a corner), sugerindo que o Bonferroni foi injustamente "empurrado para o canto" da estatística e merece voltar ao centro do palco.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.