← नवीनतम पेपर
📊 statistics

Nobody Puts Bonferroni in a Corner

यह शोध पत्र तर्क देता है कि बोनफेरोनी सुधार (Bonferroni correction) अपनी सरलता, नमूना आकार गणना के लिए सुगमता, और केवल सफलता मेट्रिक्स (success metrics) पर लागू होने पर फाल्स पॉजिटिव्स को प्रभावी ढंग से नियंत्रित करने की क्षमता के कारण, अधिक परिष्कृत विधियों की तुलना में शक्ति हानि (power loss) को कम करते हुए, ऑनलाइन प्रयोगों के लिए एक अल्प-मूल्यांकित किंतु श्रेष्ठ विकल्प है।

मूल लेखक: Mårten Schultzberg

प्रकाशित 2026-04-13
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mårten Schultzberg

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल जहाज (Spotify) के कप्तान हैं जिसके पास हजारों कर्मियों का क्रू है। हर दिन, आप नए विचारों का परीक्षण करना चाहते हैं: शायद एक नया गाना रिकमेंडेशन एल्गोरिदम, एक अलग बटन का रंग, या प्लेलिस्ट को व्यवस्थित करने का एक नया तरीका। ये आपके प्रयोग (experiments) हैं।

यह तय करने के लिए कि कोई विचार अच्छा है या नहीं, आप डेटा देखते हैं। लेकिन यहाँ एक समस्या है: आप जितनी अधिक चीजों को देखेंगे, उतनी ही अधिक संभावना है कि आपको एक "भूत" (ghost) दिखाई देगा।

समस्या: मशीन में "भूत"

यदि आप एक बार सिक्का उछालते हैं, तो "Heads" आना सामान्य है। यदि आप इसे 100 बार उछालते हैं, तो शुद्ध भाग्य से भी आपको लगभग निश्चित रूप से 10 बार लगातार "Heads" मिल जाएगा।

डेटा साइंस में, इसे मल्टीपल टेस्टिंग प्रॉब्लम (Multiple Testing Problem) कहा जाता है। यदि आप एक प्रयोग पर 20 अलग-अलग मेट्रिक्स (जैसे "सुनने में बिताया गया समय," "स्किप रेट," "नए फॉलोअर्स") देखते हैं, और आप एक मानक नियम का उपयोग करके यह कहते हैं कि "यह एक सफलता है," तो आप अनजाने में उनमें से 1 को केवल संयोगवश सफल घोषित कर देंगे।

यदि आप इन "भूतिया" सफलताओं को लगातार शिप करते रहते हैं, तो आप अंततः ऐसे फीचर्स बनाएंगे जो कुछ भी नहीं करते बल्कि इंजीनियरिंग का समय बर्बाद करते हैं और आपके उपयोगकर्ताओं को भ्रमित करते हैं। आप अपने डेटा पर से भरोसा खो देते हैं।

पुराना समाधान: "ब्रूट फोर्स" लॉकडाउन

वर्षों से, सांख्यिकीविदों (statisticians) ने कहा है: "भूतों को रोकने के लिए, आपको अविश्वसनीय रूप से सख्त होना चाहिए।" सबसे प्रसिद्ध सख्त नियम बोनफेरोनी (Bonferroni) है।

बोनफेरोनी को एक क्लब के अत्यधिक सख्त सुरक्षा गार्ड की तरह समझें।

  • नियम: यदि आप अंदर जाना चाहते हैं (सफलता घोषित करना), तो आपको एक वीआईपी पास चाहिए। लेकिन चूंकि 20 लोग अंदर आने की कोशिश कर रहे हैं, इसलिए गार्ड वीआईपी पास की संख्या को 20 से विभाजित कर देता है। अब, आपको एक ऐसा पास चाहिए जिसे पाना 20 गुना कठिन हो।
  • परिणाम: यह बहुत सुरक्षित है। लगभग कोई भूत अंदर नहीं आता। लेकिन यह वास्तविक सितारों (अच्छे विचारों) के लिए भी बहुत कठिन है। कई अच्छे विचारों को खारिज कर दिया जाता है क्योंकि मानक बहुत ऊँचा रखा गया है।

इस कारण से, कई कंपनियों ने "स्मार्टर" गार्ड (जैसे होल्म (Holm) या होममेल (Hommel)) का उपयोग करना शुरू किया जो थोड़े उदार हैं, या यहाँ तक कि "एफडीआर (FDR) गार्ड" भी जिनका कहना है, "अगर कुछ भूत अंदर आ भी जाएं, तो भी ठीक है, जब तक कि अधिकांश लोग असली हों।"

पेपर का बड़ा विचार: "बोनफेरोनी को कोने में मत डालो"

लेखक, मार्टन शुल्ज़बर्ग (Mårten Schultzberg) का तर्क है कि हर कोई बोनफेरोनी को गलत तरीके से आंक रहा है। उनका कहना है कि बोनफेरोनी वास्तव में इस विशिष्ट कार्य के लिए सबसे अच्छा गार्ड है, लेकिन केवल तभी जब आप समझते हैं कि क्लब वास्तव में कैसे काम करता है।

यहाँ चार कारण दिए गए हैं, जिन्हें सरल भाषा में समझाया गया है:

1. "गार्डरेल" की गलतफहमी (सबसे महत्वपूर्ण बिंदु)

अधिकांश लोग सोचते हैं कि बोनफेरोनी बहुत सख्त है क्योंकि वे हर एक मेट्रिक को गार्ड के खिलाफ गिनते हैं।

  • सफलता मेट्रिक्स (Success Metrics): ये वे चीजें हैं जो आप बढ़ते हुए देखना चाहते हैं (जैसे, "क्या लोगों ने अधिक सुना?")। यदि ये बढ़ते हैं, तो आप फीचर को शिप करते हैं।
  • गार्डरेल मेट्रिक्स (Guardrail Metrics): ये वे चीजें हैं जो आप घटते हुए नहीं देखना चाहते (जैसे, "क्या ऐप क्रैश हुआ?" या "क्या लोग परेशान हुए?")। आप तभी शिप करते हैं जब ये सुरक्षित रहें।

उपमा: कल्पना कीजिए कि आप एक नया कर्मचारी रख रहे हैं।

  • सफलता मेट्रिक: "क्या वे कोडिंग कर सकते हैं?" (आपको इसका 'हाँ' होना चाहिए)।
  • गार्डरेल मेट्रिक: "क्या उनका कोई आपराधिक रिकॉर्ड है?" (आपको इसका 'नहीं' होना चाहिए)।

यदि उम्मीदवार का आपराधिक रिकॉर्ड है, तो आप उन्हें अस्वीकार कर देते हैं। लेकिन यदि आप गलती से सोचते हैं कि उनका आपराधिक रिकॉर्ड है जबकि नहीं है (एक गलत अलार्म), तो आप बस उन्हें काम पर नहीं रखते। आप एक अपराधी को नहीं रखते! गार्डरेल मेट्रिक पर एक गलत अलार्म आपको केवल अधिक सतर्क बनाता है; यह आपको एक बुरा व्यक्ति काम पर रखने के लिए मजबूर नहीं करता।

पेपर का अंतर्दृSight: आपको केवल सफलता मेट्रिक्स के बारे में बहुत सख्त होने की आवश्यकता है। गार्डरेल्स को उसी सख्त गणित की आवश्यकता नहीं है क्योंकि गार्डरेल पर एक "गलत अलार्म" केवल एक अच्छे विचार को रोकता है, वह एक बुरे विचार को शिप नहीं करता।

  • पुराना तरीका: 10 सफलता मेट्रिक्स + 10 गार्डरेल्स = जांचने के लिए 20 चीजें। बोनफेरोनी आपकी सख्ती को 20 से विभाजित करता है। (बहुत सख्त!)
  • नया तरीका: केवल 10 सफलता मेट्रिक्स गिनें। बोनफेरोनी आपको 10 से विभाजित करता है। (बहुत अधिक निष्पक्ष!)

जब आप ऐसा करते हैं, तो बोनफेरोनी बहुत कम "दंडित" करने वाला और बहुत अधिक व्यावहारिक हो जाता है।

2. "मानचित्र" बनाम "कुतुबनुमा" (कॉन्फिडेंस इंटरवल्स)

जब आपको एक "विजेता" मिलता है, तो आपको पता होना चाहिए कि वह कितना अच्छा है।

  • बोनफेरोनी एक स्पष्ट, ईमानदार मानचित्र देता है। यह कहता है, "हम 95% आश्वस्त हैं कि सुधार 1% और 5% के बीच है।" यह मानचित्र प्रत्येक मेट्रिक के लिए वैध है, यहाँ तक कि उन मेट्रिक्स के लिए भी जो नहीं जीते।
  • "स्मार्टर" तरीके (होल्म/होममेल) एक ऐसे कुतुबनुमा (compass) की तरह हैं जो केवल तभी काम करता है जब आप पहले से ही खजाने के द्वीप पर खड़े हों। वे विजेताओं के लिए दिशा बता सकते हैं, लेकिन वे हारने वालों के लिए विश्वसनीय मानचित्र नहीं दे सकते। यदि आप उन सभी के लिए इनका उपयोग करने का प्रयास करते हैं, तो मानचित्र धुंधला और भ्रमित करने वाला हो जाता है।

Spotify जैसी कंपनी के लिए, हर चीज़ के लिए एक स्पष्ट, ईमानदार मानचित्र होना, केवल विजेताओं के लिए थोड़े बेहतर कुतुबनुमा होने से अधिक मूल्यवान है।

3. यात्रा की योजना बनाना (सैंपल साइज)

प्रयोग चलाने से पहले, आपको यह जानने की आवश्यकता होती है कि कितने उपयोगकर्ताओं का परीक्षण करना है।

  • बोनफेरोनी एक साधारण कैलकुलेटर की तरह है। आप नंबर डालते हैं, और यह आपको बताता है कि परीक्षण कितनी देर तक चलाना है।
  • "स्मार्टर" तरीके एक जटिल मौसम सिमुलेशन की तरह हैं। इनका उपयोग करने के लिए, आपको परीक्षण शुरू करने से पहले ही अनुमान लगाना होगा कि आकाश में कितने "भूत" हैं। चूंकि आप पहले से यह नहीं जान सकते, इसलिए कंपनियां अक्सर गणित को अनदेखा कर देती हैं और अनुमान लगा लेती हैं। इससे परीक्षण बहुत कम या बहुत लंबे समय तक चलने के कारण गलत परिणाम मिलते हैं।

4. "वास्तविक दुनिया" का परीक्षण

लेखक ने एक सिमुलेशन चलाया और Spotify के 1,296 वास्तविक प्रयोगों को देखा।

  • परिणाम: जब उन्होंने "गार्डरेल" तर्क का उपयोग किया (सख्त गणना में गार्डरेल्स को अनदेखा करना), तो "स्मार्टर" तरीकों (होल्म/होममेल) ने बोनफेरोनी की तुलना में केवल लगभग 4-5% अधिक प्रयोग शिप किए।
  • कैच (Catch): वास्तविक दुनिया में, अधिकांश प्रयोग "नल" (null) होते हैं (कुछ नहीं होता)। जब कुछ नहीं होता, तो "स्मार्टर" तरीके वास्तव में अधिक विजेता नहीं खोजते; वे बस बार को थोड़ा सा कम कर देते हैं।
  • ट्रेड-ऑफ: क्या 4% अधिक प्रयोग शिप करना स्पष्ट, ईमानदार मानचित्र (कॉन्फिडेंस इंटरवल्स) और आसान योजना खोने के लायक है? लेखक का कहना है: संभवतः नहीं।

निष्कर्ष

पेपर यह नहीं कह रहा है कि "सुधार (corrections) करना बंद करें।" यह कह रहा है: "बोनफेरोनी से डरना बंद करें।"

यदि आप अपने प्रयोगों को सही ढंग से व्यवस्थित करते हैं (सफलता को "गार्डरेल" से अलग करना), तो बोनफेरोनी:

  1. सरल है: इसे अपने बॉस को समझाना आसान है।
  2. ईमानदार है: यह हर परिणाम के लिए एक स्पष्ट मानचित्र देता है।
  3. निष्पक्ष है: यह वास्तव में इतना सख्त नहीं है यदि आप गार्डरेल्स को गिनना बंद कर दें।

"स्मार्टर" तरीके सुनने में फैंसी लगते हैं, लेकिन वे एक ऐसी फेरारी की तरह हैं जो ट्रैफिक में फंस जाती है। बोनफेरोनी एक भरोसेमंद टोयोटा कैमरी है जो आपको हर बार मंजिल तक पहुँचाती है, सड़क का स्पष्ट दृश्य लेकर।

संक्षेप में: "बहुत सख्त" होने के डर को आपको खराब फीचर्स शिप करने न दें। सरल, ईमानदार उपकरण का उपयोग करें, लेकिन सुनिश्चित करें कि आप केवल उन्हीं चीजों के बारे में सख्त हैं जो वास्तव में मायने रखती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →