Nobody Puts Bonferroni in a Corner
Dit paper pleit ervoor dat de Bonferroni-correctie in online experimenten een ondergewaardeerde, maar superieure keuze is vanwege zijn eenvoud, geschiktheid voor steekproefgrootteberekeningen en het feit dat het, wanneer correct toegepast op succesmetrieken, een vergelijkbaar vermogen behoudt als complexere FWER-methoden.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Titel: Waarom de "Bonferroni" de onterecht gemiste held is van online experimenten
Stel je voor dat je een groot feest organiseert (een experiment) en je wilt weten of je nieuwe muziek (een nieuwe functie) de sfeer verbetert. Je kijkt naar tien verschillende dingen: lachen de mensen meer? Zullen ze langer blijven dansen? Kopen ze meer drankjes? (Dit zijn je metrieken).
Het probleem is: hoe meer dingen je bekijkt, hoe groter de kans dat je per ongeluk iets ziet dat er niet is. Als je naar tien dingen kijkt, is het bijna zeker dat er één ding "toevallig" beter lijkt, terwijl het eigenlijk niets is. In de statistiek noemen we dit het meerdere-toetsingsprobleem.
Vroeger dachten experts: "Oh nee, als je naar zoveel dingen kijkt, moet je je eisen extreem streng maken om geen fouten te maken." Ze gebruikten daarvoor een methode genaamd Bonferroni. Maar die methode kreeg een slechte reputatie: "Te streng! Te conservatief! Je mist hierdoor leuke dingen!" Mensen begonnen daarom andere, "slimmere" methoden te gebruiken.
Mårten Schultzberg, een data-expert bij Spotify, zegt in dit artikel: "Wacht even. Die reputatie is onterecht. Bonferroni is eigenlijk de beste vriend voor online experimenten, mits je het goed gebruikt."
Hier is de uitleg in simpele taal, met een paar creatieve vergelijkingen:
1. De "Waarheidscontrole" (Betrouwbaarheid)
Stel je voor dat je een nieuwsbericht leest.
- Andere methoden zeggen: "Kijk, dit nieuwsbericht is waar!" Maar als je de details in de krant leest, blijkt dat het alleen waar is als je al gelooft dat het waar is. Het is een beetje wazig.
- Bonferroni zegt: "Hier is een foto van de gebeurtenis. Deze foto is 100% eerlijk en toont precies wat er is gebeurd, ongeacht of je het gelooft of niet."
In de wereld van data betekent dit: Bonferroni geeft je een betrouwbare schatting (een "betrouwbaarheidsinterval") van het effect. Je weet precies hoe groot de verbetering is en hoe zeker je kunt zijn. De "slimmere" methoden geven vaak een mooier getal, maar dat getal is soms een illusie als je te veel variabelen hebt. Voor een bedrijf als Spotify is het belangrijker om niet per ongeluk een slechte functie te lanceren, dan om elke kleine kans op een verbetering te grijpen.
2. De "Wachters" vs. De "Winnaars" (De sleutel tot de oplossing)
Dit is het belangrijkste punt van het artikel. Veel mensen denken dat je alle tien metrieken moet straffen met de strenge Bonferroni-regel. Maar dat is niet nodig!
Stel je voor dat je een team hebt dat een nieuwe auto bouwt:
- De Winnaars (Success Metrics): Dit zijn de dingen die de auto beter moeten maken (bijv. snellere acceleratie). Als één van deze dingen echt beter is, mogen we de auto lanceren.
- De Wachters (Guardrail Metrics): Dit zijn de dingen die de auto niet slechter mogen maken (bijv. de motor mag niet oververhitten, de banden mogen niet lekken). Als één van deze dingen slechter wordt, blokkeren we de lancering.
Het inzicht:
Als je een "wachter" (zoals de motor) controleert en je ziet per ongeluk dat hij "beter" lijkt (een vals positief), maakt dat de lancering niet waarschijnlijker. Integendeel, als je per ongeluk denkt dat de motor slechter is dan hij is, blokkeer je een goede auto. Dat is jammer, maar het leidt niet tot een verkeerde lancering.
De enige manier om een verkeerde lancering te krijgen, is als je denkt dat een "Winnaar" (zoals de snelheid) beter is, terwijl dat niet zo is.
- De conclusie: Je hoeft alleen maar streng te zijn voor de Winnaars. De "Wachters" tellen niet mee voor de strenge straf.
- Het resultaat: In plaats van je eisen streng te maken voor 10 dingen, doe je dat alleen voor de 2 of 3 echte Winnaars. De straf (Bonferroni) wordt dus veel milder dan mensen denken!
3. De "Reisplanner" (Voorbereiding)
Voordat je een experiment start, moet je weten hoeveel mensen je nodig hebt.
- Bonferroni is als een simpele, betrouwbare GPS. Je typt je bestemming in en hij zegt: "Je hebt X brandstof nodig." Iedereen begrijpt dit en iedereen kan het controleren.
- De "slimmere" methoden zijn als een GPS die zegt: "Je hebt X brandstof nodig, als het weer goed is, als er geen files zijn, en als je auto een bepaalde kleur heeft." Je kunt de berekening niet controleren omdat je die voorwaarden niet kent voordat je vertrekt.
Voor grote bedrijven is het cruciaal om van tevoren te weten of een experiment kans van slagen heeft. Bonferroni maakt dit makkelijk en eerlijk.
4. De Kosten van "Slimmer" zijn
Is het dan helemaal niet erg dat Bonferroni iets minder vaak een "winnaar" vindt dan de andere methoden?
Het artikel laat zien dat het verschil heel klein is, zolang je maar de "Wachters" en "Winnaars" goed scheidt (zoals in punt 2).
- Als er echt maar weinig verbeteringen zijn (wat vaak het geval is bij productveranderingen), vinden de "slimme" methoden nauwelijks meer dan Bonferroni.
- Als je de "Wachters" per ongeluk meetelt, zijn de "slimme" methoden bijna net zo streng als Bonferroni anyway.
De Grootte van het Probleem
Het artikel concludeert met een belangrijke les voor iedereen die met data werkt:
Vertrouwen is alles.
Als je een methode kiest die complex is, waar mensen niet begrijpen hoe het werkt, en die soms "wazige" resultaten geeft, verliezen mensen het vertrouwen in je data. Dan stoppen ze met luisteren naar de experimenten.
Bonferroni is de "oude, saaie" methode, maar hij is:
- Eerlijk: Hij geeft altijd een waarheidsgetrouwe foto.
- Eenvoudig: Iedereen begrijpt de berekening.
- Veilig: Hij voorkomt dat je per ongeluk slechte functies lanceert.
Kortom:
Stop met bang te zijn voor Bonferroni. Gebruik het, maar zorg ervoor dat je weet welke metrieken echt belangrijk zijn voor succes (de Winnaars) en welke alleen als waarschuwing dienen (de Wachters). Als je dat doet, is Bonferroni de perfecte, betrouwbare kompasnaald voor je experimenten.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.