← Últimos artigos
📊 statistics

Nobody Puts Bonferroni in a Corner

O artigo defende que a correção de Bonferroni é uma escolha superior para experimentação online, demonstrando através de simulações e dados da Spotify que ela oferece intervalos de confiança incondicionais simples e que sua perda de poder estatístico é mínima quando aplicada corretamente apenas às métricas de sucesso, tornando-a frequentemente indistinguível de métodos mais sofisticados.

Autores originais: Mårten Schultzberg

Publicado 2026-04-13
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Mårten Schultzberg

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é o gerente de uma grande fábrica de música (como a Spotify) e tem uma equipe de engenheiros propondo milhares de novas ideias: mudar a cor de um botão, adicionar um novo filtro de busca ou criar uma playlist automática.

Para saber se essas ideias funcionam, vocês fazem "experimentos" (testes A/B). Metade dos usuários vê a versão antiga, a outra metade vê a nova. Se a nova versão for melhor, vocês a lançam para todos.

O problema é que, quando vocês testam muitas coisas ao mesmo tempo (métricas diferentes, como "tempo de escuta", "número de cliques", "crescimento de assinantes"), a estatística tradicional começa a brincar de "sorte".

O Problema: O Jogo da Sorte e os Falsos Positivos

Se você jogar uma moeda 10 vezes, é provável que dê "cara" pelo menos uma vez, mesmo que a moeda seja honesta. Se você testar 20 ideias diferentes sem cuidado, a chance de achar que uma delas funcionou (quando na verdade foi só sorte) é enorme. Isso é chamado de Falso Positivo.

Na indústria, o consenso antigo era: "Não use o método mais simples (Bonferroni) porque ele é muito conservador e vai impedir que lancemos coisas boas. Use métodos mais complexos e 'inteligentes'."

Este artigo diz: "Esperem aí! O método simples (Bonferroni) é, na verdade, o melhor amigo de vocês, e ninguém está usando a maneira certa."

O autor, Mårten Schultzberg, usa quatro argumentos principais para defender o "Bonferroni" (que vamos chamar de O Guardião Simples).


1. A Regra de Ouro: Não Confunda "Sucesso" com "Segurança"

Aqui está o grande segredo que a maioria das pessoas ignora. Em um experimento, nem todas as métricas têm o mesmo papel.

  • Métricas de Sucesso: São as vitórias. "A música toca mais?", "O usuário clica mais?". Se pelo menos uma dessas melhorar, o time quer lançar a mudança.
  • Métricas de Guarda-Chuva (Guardrails): São os freios de segurança. "O app não travou?", "A bateria não drenou?". Se qualquer uma dessas piorar, o time não deve lançar, não importa o quanto a métrica de sucesso tenha melhorado.

A Analogia do Carro:
Imagine que você está dirigindo um carro novo.

  • Métricas de Sucesso: O carro é mais rápido? (Você quer que isso aconteça).
  • Métricas de Guarda-Chuva: Os freios funcionam? O motor não superaqueceu? (Você quer que isso não aconteça).

O erro comum é tratar os freios e o motor como se fossem "metas de velocidade". O autor diz: Não conte os freios na sua lista de metas!

Se você tem 2 metas de sucesso e 10 freios de segurança, o método Bonferroni não deve dividir sua "sorte" por 12. Ele deve dividir apenas por 2.

  • Por que? Porque um erro nos freios (dizer que estão bons quando estão ruins) só torna mais fácil não lançar o carro. Isso não cria um falso positivo de lançamento. O único jeito de lançar algo ruim é se você errar na métrica de sucesso.
  • Resultado: Ao separar o que é "vitória" do que é "segurança", o método Bonferroni deixa de ser "punitivo" e se torna muito mais leve e justo.

2. O Mapa do Tesouro (Intervalos de Confiança)

Outros métodos estatísticos complexos são como mapas que só mostram o tesouro se você já tiver encontrado o caminho. Eles dizem: "Se você achou um sucesso, aqui está o mapa". Mas se você não achou, o mapa é inútil.

O Guardião Simples (Bonferroni) é diferente. Ele desenha um mapa completo e honesto para todas as métricas, seja elas vencedoras ou não.

  • Ele diz: "Aqui está o intervalo de confiança para o tempo de escuta. Aqui está para os cliques. Aqui está para a bateria."
  • Isso é crucial para engenheiros e gerentes de produto. Eles precisam saber não apenas se algo funcionou, mas quanto funcionou e com que certeza. Métodos mais complexos muitas vezes não conseguem dar essa informação clara para todas as métricas ao mesmo tempo.

3. Planejar a Viagem Antes de Sair (Cálculo de Amostra)

Antes de começar um experimento, você precisa saber quantos usuários testar.

  • Com o Guardião Simples, é fácil: você faz uma conta simples e sabe exatamente quantas pessoas precisa. É como calcular o combustível para uma viagem com uma régua.
  • Com os métodos complexos, é como tentar calcular o combustível sem saber quantas pessoas vão subir no carro ou se vai chover. Você precisa fazer suposições que ninguém consegue provar antes de começar. Isso torna o planejamento difícil e impreciso.

4. O Custo Real da "Sorte" (Poder Estatístico)

A maior crítica ao Bonferroni é: "Ele é tão conservador que vamos perder muitas ideias boas (perder poder estatístico)".

O autor fez um estudo com 1.296 experimentos reais da Spotify e descobriu algo surpreendente:

  • Quando as métricas são poucas e bem definidas (apenas as de sucesso): A diferença entre o método simples e os métodos complexos é quase zero. Você não perde quase nada de "ideias boas" ao usar o simples.
  • Quando as métricas são muitas e mal definidas: Aí sim, os métodos complexos ajudam um pouco mais (ganham cerca de 4% a 5% a mais de lançamentos). Mas o autor argumenta que, se você tem 10 métricas de sucesso, você provavelmente está fazendo o experimento errado. Você deveria ter focado em 2 ou 3 principais.

A Lição: A diferença de poder não vem do método estatístico, mas de como você organiza suas perguntas. Se você organizar bem (separando sucesso de segurança), o método simples funciona tão bem quanto os complexos.


Conclusão: Por que voltar ao básico?

O artigo é um chamado para parar de ter medo do método mais simples.

  1. Confiança: Em uma empresa, as decisões são tomadas com base nesses números. Se o método é complexo e difícil de explicar, as pessoas param de confiar nele. O Bonferroni é transparente: "Dividimos o risco pelo número de vitórias que buscamos".
  2. Simplicidade: Ele funciona bem com intervalos de confiança, com planejamento de tamanho de amostra e com testes sequenciais (olhar os dados enquanto o experimento roda).
  3. A Verdade: A maioria das mudanças de produto não funciona. A maioria dos testes é "nula". Em um mundo onde a maioria das coisas não tem efeito, métodos que permitem mais "falsos positivos" (como os métodos de FDR) apenas aumentam o lixo estatístico, fazendo com que times lancem coisas que não funcionam.

Em resumo: Não tenha medo de usar o "Guardião Simples". Se você separar claramente o que é "vitória" do que é "segurança", ele será tão poderoso quanto os métodos complexos, mas muito mais honesto, fácil de entender e confiável para toda a empresa.

O título do artigo é uma brincadeira com a frase "Ninguém coloca o Rocky em um canto" (Nobody puts Baby in a corner), sugerindo que o Bonferroni foi injustamente "empurrado para o canto" da estatística e merece voltar ao centro do palco.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →