← Nieuwste papers
🤖 machine learning

Variance Reduction for Heavy-Tailed Monetization Metrics in Ranking Experiments via Post-Stratification

Dit artikel presenteert een praktisch framework dat post-stratificatie en CUPED combineert om de variantie in heavy-tailed monetisatie-metrieken voor ranking-experimenten te verminderen, waardoor ShareChat in staat is om een gelijkwaardige statistische betrouwbaarheid te bereiken met ongeveer 45% minder verkeer, terwijl de beslissingsstabiliteit wordt verbeterd.

Oorspronkelijke auteurs: Neeti Pokharna, Olivier Jeunen, Yatharth Saraf, Aleksei Ustimenko

Gepubliceerd 2026-06-04
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Neeti Pokharna, Olivier Jeunen, Yatharth Saraf, Aleksei Ustimenko

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Probleem: Het "Walvis"-probleem in A/B-testen

Stel je voor dat je een test uitvoert om te zien of een nieuwe functie in een video-app ervoor zorgt dat mensen meer geld uitgeven. Je verdeelt je gebruikers in twee groepen: Groep A ziet de oude versie, en Groep B ziet de nieuwe versie.

Normaal gesproken tel je gewoon al het geld op dat door iedereen in Groep A is uitgegeven en vergelijk je dat met Groep B. Maar in apps zoals ShareChat (waar gebruikers virtuele cadeaus kopen voor makers) zijn de uitgavepatronen extreem ongelijkmatig.

Denk aan een visreis:

  • 99,9% van de vissen die je vangt, zijn piepkleine minnotjes die bijna niets wegen.
  • 0,01% van de vissen zijn enorme "walvissen" (superrijke gebruikers) die evenveel wegen als een auto.

In een standaardtest, als er door puur geluk een van deze "walvissen" in Groep A terechtkomt, lijkt Groep A een enorm succes. Als diezelfde walvis in Groep B terechtkomt, lijkt Groep B een mislukking. Omdat deze walvissen zo zwaar zijn, domineren ze de wiskunde. Ze creëren zoveel "ruis" (willekeur) dat je niet kunt zien of de nieuwe functie daadwerkelijk werkt of dat je gewoon geluk hebt gehad met waar de walvissen terechtkwamen.

Dit betekent dat je de test heel lang moet draaien of een enorme hoeveelheid verkeer nodig hebt om een betrouwbaar antwoord te krijgen. Vaak kun je niet genoeg verkeer genereren, waardoor je geen beslissingen kunt nemen.

De Oplossing: De visbak sorteren

De auteurs stellen een slimme manier voor om dit op te lossen, genaamd Post-Stratificatie, gecombineerd met een techniek genaamd CUPED.

Zo werkt het, stap voor stap:

1. De vissen sorteren (Stratificatie)

In plaats van de hele bak met vissen als één grote groep te bekijken, sorteer je ze in aparte emmers voordat je de test begint, gebaseerd op hoe ze zich in het verleden hebben gedragen.

  • Emmer 1: De "Walvissen" (de top 0,01% van de uitgevers).
  • Emmer 2: De "Regulieren" (de rest).

2. De emmers wegen

Hier zit de magische truc. Wanneer je het eindresultaat berekent, tel je de emmers niet simpelweg gelijkmatig op. Je geeft de emmers verschillende gewichten op basis van hoeveel mensen er in de echte wereld aanwezig zijn.

  • Omdat "Walvissen" zeldzaam zijn, krijgt hun emmer een miniem gewicht (zoals 0,0001).
  • Omdat "Regulieren" algemeen voorkomen, krijgt hun emmer een enorm gewicht.

De Analogie: Stel je voor dat je een kookwedstrijd beoordeelt. Als één rechter een miljardair is die een score van 1.000.000 geeft, en 999 andere rechters scores van 5 geven, dan verpest de score van de miljardair het gemiddelde.

  • Oude manier: Je neemt het gemiddelde van alle scores. De score van de miljardair domineert.
  • Nieuwe manier: Je zegt: "De miljardair is één persoon, dus zijn score telt slechts als 0,001 van het totaal. De 999 reguliere rechters tellen voor 99,9%." Nu zorgt de extreme score van de miljardair er niet voor dat het resultaat wild heen en weer slaat.

3. De data gladstrijken (CUPED)

Binnen elke emmer gebruiken ze ook een truc genaamd CUPED. Dit is als het gebruik van de eerdere uitgaven van een gebruiker als een "basislijn".

  • Als een gebruiker normaal gesproken \100 uitgeeft, en in de test \110 uitgeeft, zegt CUPED: "Oké, dat is gewoon hun normale hoge uitgave, niet noodzakelijkerwijs vanwege de nieuwe functie."
  • Het trekt de voorspelbare delen van de uitgaven eraf, waardoor alleen de echte veranderingen overblijven die door het experiment zijn veroorzaakt.

De Resultaten: Snellere beslissingen met minder verkeer

Door deze methode te gebruiken, behaalden de auteurs indrukwekkende resultaten bij ShareChat:

  • Minder Ruis: Ze verminderden de "ruis" (variantie) in hun gegevens met 99%.
  • Snellere Tests: Ze kunnen nu met 45% minder verkeer hetzelfde niveau van vertrouwen bereiken.
    • Analogie: Het is alsof je een fluistering duidelijk kunt horen in een lawaaierige kamer zonder te hoeven schreeuwen. Je hebt geen grotere menigte nodig om de waarheid te horen; je hebt alleen een betere manier nodig om te luisteren.
  • Betrouwbaarheid: Ze hebben dit getest op meer dan 40 echte experimenten. De methode hielp hen om kleine, echte verbeteringen op te merken die voorheen onzichtbaar zouden zijn geweest.

Belangrijke Regels en Waarschuwingen

Het artikel wijst ook op wanneer je deze methode NIET moet gebruiken:

  1. Gebruik het niet als je een functie test die specif kindelijk gericht is op Walvissen.
    • Analogie: Als je een nieuwe "VIP-lounge" test die specifiek voor de rijke walvissen is, wil je hun belang niet naar beneden afwegen. Als je dat doet, loop je het risico dat je de conclusie mist dat de VIP-lounge geweldig is voor hen. Deze methode is bedoeld voor algemene verbeteringen die de hele gebruikersbasis helpen.
  2. Gebruik het niet als alleen de "Walvissen" veranderen.
    • Als de nieuwe functie alleen invloed heeft op de top 0,01% van de gebruikers, zal deze methode dat effect verbergen omdat het de walvissen behandelt als een kleine groep met een laag gewicht.

Samenvatting

Het artikel presenteert een praktisch hulpmiddel voor bedrijven die A/B-testen uitvoeren op geldgerelateerde statistieken. Door gebruikers in groepen te verdelen en de zeldzame, extreem veel uitgevende uitschieters lager te wegen, kunnen ze voorkomen dat de "walvissen" de resultaten kapen. Dit stelt hen in staat om snellere, meer zelfverzekerde beslissingen te nemen over hun product zonder dat ze miljoenen extra gebruikers nodig hebben.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →