← Derniers articles
🤖 machine learning

Variance Reduction for Heavy-Tailed Monetization Metrics in Ranking Experiments via Post-Stratification

Ce document présente un cadre pratique combinant la post-stratification et la méthode CUPED pour réduire la variance des métriques de monétisation à distribution lourde pour les expériences de classement, permettant ainsi à ShareChat d'atteindre une confiance statistique équivalente avec environ 45 % de trafic en moins tout en améliorant la stabilité des décisions.

Auteurs originaux : Neeti Pokharna, Olivier Jeunen, Yatharth Saraf, Aleksei Ustimenko

Publié 2026-06-04
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Neeti Pokharna, Olivier Jeunen, Yatharth Saraf, Aleksei Ustimenko

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le Problème : Le problème des « Baleines » dans les tests A/B

Imaginez que vous menez un test pour voir si une nouvelle fonctionnalité dans une application vidéo pousse les gens à dépenser plus d'argent. Vous divisez vos utilisateurs en deux groupes : le Groupe A voit l'ancienne version, et le Groupe B voit la nouvelle version.

Habituellement, vous additionnez simplement tout l'argent dépensé par tout le monde dans le Groupe A et vous le comparez au Groupe B. Mais dans des applications comme ShareChat (où les utilisateurs achètent des cadeaux virtuels pour les créateurs), les habitudes de dépenses sont extrêmement disparates.

Pensez à une sortie de pêche :

  • 99,9 % des poissons que vous attrapez sont de minuscules vairons qui ne pèsent presque rien.
  • 0,01 % des poissons sont des « baleines » massives (des utilisateurs super riches) qui pèsent aussi lourd qu'une voiture.

Dans un test standard, si l'une de ces « baleines » atterrit dans le Groupe A par pure chance, le Groupe A semble être un immense succès. Si cette même baleine atterrit dans le Groupe B, le Groupe B semble être un échec. Parce que ces baleines sont si lourdes, elles dominent les calculs. Elles créent tellement de « bruit » (aléas) qu'il devient impossible de savoir si la nouvelle fonctionnalité fonctionne réellement ou si vous avez simplement eu de la chance avec l'emplacement des baleines.

Cela signifie que vous devez faire durer le test très longtemps ou obtenir un trafic massif pour obtenir une réponse fiable. Souvent, vous ne pouvez pas obtenir assez de trafic, et donc vous ne pouvez pas prendre de décisions.

La Solution : Trier l'aquarium

Les auteurs proposent une méthode astucieuse pour corriger cela appelée Post-Stratification, combinée à une technique nommée CUPED.

Voici comment cela fonctionne, étape par étape :

1. Trier les poissons (Stratification)

Au lieu de regarder tout l'aquarium comme un seul grand groupe, vous triez les poissons dans des compartiments séparés avant de commencer le test, en fonction de leur comportement passé.

  • Compartiment 1 : Les « Baleines » (les 0,01 % de dépensiers les plus élevés).
  • Compartiment 2 : Les « Réguliers » (tous les autres).

2. Pondérer les compartiments

C'est là que réside l'astuce. Lorsque vous calculez le résultat final, vous ne vous contentez pas d'additionner les compartiments de manière égale. Vous attribuez aux compartiments des poids différents basés sur leur présence réelle dans le monde.

  • Puisque les « Baleines » sont rares, leur compartiment reçoit un poids minuscule (comme 0,0001).
  • Puisque les « Réguliers » sont courants, leur compartiment reçoit un poids énorme.

L'analogie : Imaginez que vous jugiez un concours de cuisine. Si un juge est un milliardaire et donne un score de 1 000 000, tandis que 999 autres juges donnent des scores de 5, le score du milliardaire fausse la moyenne.

  • Ancienne méthode : Vous prenez la moyenne de tous les scores. Le score du milliardaire domine.
  • Nouvelle méthode : Vous dites : « Le milliardaire est une seule personne, donc son score ne compte que pour 0,001 du total. Les 999 juges réguliers comptent pour 99,9 %. » Désormais, le score erratique du milliardaire ne fait plus basculer le résultat de manière disproportionnée.

3. Lisser les données (CUPED)

À l'intérieur de chaque compartiment, ils utilisent également une astuce appelée CUPED. C'est comme utiliser les dépenses passées d'un utilisateur comme une « ligne de base ».

  • Si un utilisateur dépense habituellement 100 $, et que pendant le test il dépense 110 $, CUPED dit : « D'accord, c'est juste son niveau de dépense élevé habituel, pas forcément dû à la nouvelle fonctionnalité. »
  • Cela soustrait les parties prévisibles des dépenses, ne laissant que les réels changements causés par l'expérience.

Les Résultats : Des décisions plus rapides avec moins de trafic

En utilisant cette méthode, les auteurs ont obtenu des résultats impressionnants chez ShareChat :

  • Moins de bruit : Ils ont réduit le « bruit » (la variance) de leurs données de 99 %.
  • Tests plus rapides : Ils peuvent désormais obtenir le même niveau de confiance avec 45 % de trafic en moins.
    • Analogie : C'est comme être capable d'entendre un chuchotement clairement dans une pièce bruyante sans avoir besoin de crier. Vous n'avez pas besoin d'une foule plus grande pour entendre la vérité ; vous avez juste besoin d'une meilleure façon d'écouter.
  • Fiabilité : Ils ont testé cela sur plus de 40 expériences réelles. La méthode les a aidés à repérer de petites améliorations réelles qui seraient restées invisibles auparavant.

Règles importantes et mises en garde

L'article précise également quand NE PAS utiliser cette méthode :

  1. Ne l'utilisez pas si vous testez une fonctionnalité spécifiquement pour les Baleines.
    • Analogie : Si vous testez un nouveau « Salon VIP » spécifiquement pour les baleines riches, vous ne voulez pas diminuer l'importance de leur contribution. Si vous le faites, vous pourriez manquer le fait que le Salon VIP est incroyable pour eux. Cette méthode est destinée aux améliorations générales qui bénéficient à l'ensemble des utilisateurs.
  2. Ne l'utilisez pas si seules les « Baleines » changent.
    • Si la nouvelle fonctionnalité n'affecte que le haut 0,01 % des utilisateurs, cette méthode masquera cet effet car elle traite les baleines comme un groupe minuscule à faible poids.

Résumé

L'article présente un outil pratique pour les entreprises qui réalisent des tests A/B sur des mesures liées à l'argent. En triant les utilisateurs en groupes et en réduisant le poids des valeurs aberrantes (outliers) qui dépensent énormément, ils empêchent les « baleines » de détourner les résultats. Cela leur permet de prendre des décisions plus rapides et plus confiantes sur leur produit sans avoir besoin de millions d'utilisateurs supplémentaires.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →