← नवीनतम पेपर
📈 economics

Variance reduction combining pre-experiment and in-experiment data

यह शोध पत्र एक सामान्य, सुदृढ़ और स्केलेबल ढांचे का प्रस्ताव करता है जो ए/बी टेस्टिंग में महत्वपूर्ण विचरण न्यूनीकरण (variance reduction) प्राप्त करने के लिए प्री-एक्सपेरिमेंट और इन-एक्सपेरिमेंट डेटा को संयोजित करता है, जिससे प्रयोगात्मक संवेदनशीलता और निर्णय लेने की गति में सुधार होता है, जैसा कि Etsy के अनुभवजन्य परिणामों द्वारा प्रमाणित किया गया है।

मूल लेखक: Zhexiao Lin, Pablo Crespo

प्रकाशित 2026-03-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhexiao Lin, Pablo Crespo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे हैं: क्या वेबसाइट पर एक नए फीचर ने वास्तव में लोगों से अधिक चीजें खरीदने के लिए प्रेरित किया?

यह जानने के लिए, आप एक परीक्षण (एक A/B टेस्ट) चलाते हैं। आप अपने आधे विज़िटर्स को नया फीचर दिखाते हैं (ट्रिटमेंट ग्रुप) और दूसरे आधे को पुराना वर्ज़न (कंट्रोल ग्रुप)। फिर, आप बिक्री की तुलना करते हैं।

समस्या यह है कि मानव व्यवहार बहुत अव्यवस्थित होता है। कुछ लोग स्वाभाविक रूप से बड़े खर्च करने वाले होते हैं; अन्य केवल सस्ते सौदों की तलाश में रहते हैं। कुछ लोग रात के 2 बजे आते हैं जब वे थके हुए होते हैं; अन्य दोपहर में आते हैं जब वे ऊर्जावान होते हैं। यह "शोर" (noise) यह देखने में बाधा डालता है कि क्या नया फीचर वास्तव में काम कर रहा था या यह परिणाम केवल किस्मत का खेल था।

एक स्पष्ट तस्वीर पाने के लिए, आपको इस शोर को कम करने (वेरिएंस/विचलन) की आवश्यकता है। यदि आप अधिक लोगों को परीक्षण में शामिल नहीं कर सकते (क्योंकि इसमें पैसा खर्च होता है), तो आपको अपने पास मौजूद डेटा को ही अधिक सटीक बनाना होगा।

पुराना तरीका: रियरव्यू मिरर (पीछे का दर्पण) में देखना

वर्षों से, कंपनियों ने एक चतुर ट्रिक का उपयोग किया जिसे CUPED कहा जाता है। इसे रियरव्यू मिरर (पीछे देखने वाला दर्पण) की तरह समझें।

टेस्ट शुरू होने से पहले ही, आप उपयोगकर्ता का इतिहास देखते हैं: पिछले महीने उन्होंने कितना खर्च किया था? पिछले सप्ताह उन्होंने कितने आइटम देखे थे? आप इस पुराने डेटा का उपयोग यह अनुमान लगाने के लिए करते हैं कि उनका प्रदर्शन कैसा होना चाहिए था। फिर, आप उस भविष्यवाणी के आधार पर टेस्ट के परिणामों को एडजस्ट करते हैं।

  • अच्छी बात: यह शोर को कम करने में मदद करता है।
  • बुरी बात: रियरव्यू मिरर केवल यह दिखाता है कि आप कहाँ थे, न कि आप कहाँ जा रहे हैं। यदि किसी उपयोगकर्ता का पिछला महीना शांत रहा लेकिन आज वह अचानक उत्साहित है, तो रियरव्यू मिरर इसे मिस कर देता है। भविष्यवाणी एकदम सटीक नहीं होती।

जाल: "मीडिएटर" (मध्यस्थ) का जाल

आप सोच सकते हैं, "क्यों न हम यह देखें कि वे टेस्ट के दौरान क्या कर रहे थे? जैसे, अभी वे कार्ट में कितने आइटम जोड़ रहे हैं?"

यह तर्कसंगत लगता है, लेकिन यह एक जाल है!
कल्पना कीजिए कि नया फीचर एक चमकदार लाल "अभी खरीदें" (Buy Now) बटन है।

  1. बटन लोगों को अधिक क्लिक करने के लिए प्रेरित करता है (ट्रिटमेंट)।
  2. अधिक क्लिक करने से कार्ट में अधिक आइटम जुड़ते हैं (इन-एक्सपेरिमेंट डेटा)।
  3. कार्ट में अधिक आइटम होने से अधिक बिक्री होती है (आउटकम/परिणाम)।

यदि आप कार्ट में आइटमों के लिए "एडजस्ट" करने की कोशिश करते हैं, तो आप अनजाने में बटन के प्रभाव को मिटा रहे होते हैं। आप कह रहे हैं, "खैर, उन्होंने अधिक खरीदा क्योंकि उन्होंने कार्ट में अधिक आइटम डाले," लेकिन आप भूल गए कि बटन ने ही उन्हें कार्ट में अधिक आइटम डालने के लिए प्रेरित किया था! इसे बायस (पक्षपात) कहा जाता है। यह एक पौधे की वृद्धि मापने की कोशिश करने जैसा है, लेकिन फिर इस तथ्य के लिए एडजस्ट करना कि पौधा अब लंबा हो गया है। आप निष्कर्ष निकालेंगे कि उर्वरक (खाद) ने कुछ नहीं किया!

नया समाधान: "साइड-डोर" रणनीति

यह पेपर एक शानदार नया फ्रेमवर्क प्रस्तावित करता है जो रियरव्यू मिरर (पुराना डेटा) को एक विशिष्ट प्रकार के साइड-डोर (वर्तमान डेटा) के साथ जोड़ता है।

लेखकों ने महसूस किया कि सभी "टेस्ट के दौरान" का डेटा एक जाल नहीं है। कुछ डेटा केवल शोर है जो बहुत प्रेडिक्टिव (भविभविष्यवाणी करने योग्य) है, लेकिन वह ट्रीटमेंट (उपचार/फीचर) के कारण उत्पन्न नहीं हुआ है।

उपमा: बारिश वाले दिन का सफर
कल्पना कीजिए कि आप एक नए ट्रैफिक ऐप (ट्रिटमेंट) का परीक्षण कर रहे हैं कि क्या यह लोगों को काम पर तेज़ी से पहुँचाता है (आउटकम)।

  • जाल: आप "ट्रैफिक लाइट पर बिताया गया समय" देखते हैं। ऐप रूट (रास्ता) बदल सकता है, जिससे लाइटों पर बिताया गया समय बदल जाता है। यदि आप इसके लिए एडजस्ट करते हैं, तो आप ऐप की सफलता को छिपा देते हैं।
  • सुरक्षित डेटा: आप टेस्ट के दौरान "आसमान का रंग" या "ऊपर उड़ रहे पक्षियों की संख्या" देखते हैं।
    • क्या ट्रैफिक ऐप आसमान का रंग बदलता है? नहीं।
    • क्या ट्रैफिक ऐप पक्षियों की संख्या बदलता है? नहीं।
    • लेकिन, यदि बारिश हो रही है (नीला आसमान), तो हर कोई धीरे गाड़ी चलाता है। यदि धूप खिली है, तो हर कोई तेज़ी से गाड़ी चलाता है।

"आसमान का रंग" एक पोस्ट-ट्रीटमेंट वेरिएबल है (जिसे आप टेस्ट के दौरान देखते हैं), लेकिन यह ट्रीटमेंट-इन्सेंसिटिव (उपचार-संवेदी नहीं) है—यानी ऐप ने इसे नहीं बदला। यह अत्यधिक प्रेडिक्टिव भी है (बारिश सबको धीमा कर देती है)।

इस पेपर का तरीका कैसे काम करता है

लेखकों ने इन "सुरक्षित आसमान के रंगों" को खोजने के लिए दो-चरणीय प्रणाली बनाई है:

  1. चरण 1: रियरव्यू मिरर (CUPAC)। सबसे पहले, वे पिछले इतिहास के आधार पर बिक्री का अनुमान लगाने के लिए मानक विधि (मशीन लर्निंग) का उपयोग करते हैं। यह "पुराने" शोर को हटा देता है।
  2. चरण 2: सुरक्षित साइड-डोर (नया ट्रिक)। वे देखते हैं कि उपयोगकर्ता अभी क्या कर रहे हैं (जैसे "पेज पर बिताया गया समय" या "क्लिक की संख्या")।
    • वे एक त्वरित सांख्यिकीय परीक्षण चलाते हैं: "क्या ट्रीटमेंट ग्रुप और कंट्रोल ग्रुप के औसत मानों में कोई अंतर था?"
    • यदि उत्तर हाँ है: तो यह एक जाल है (ट्रीटमेंट ने इसे बदल दिया)। इसे हटा दें।
    • यदि उत्तर नहीं है: तो यह सुरक्षित है! ट्रीटमेंट ने इसे नहीं बदला, लेकिन यह अंतिम परिणाम का अनुमान लगाने के लिए अभी भी बहुत अच्छा है। इसे रखें।

इसके बाद वे इस "सुरक्षित साइड-डोर" डेटा को समीकरण में जोड़ देते हैं। चूंकि ट्रीटमेंट ने इसे नहीं बदला, इसलिए इसे जोड़ने से बायस (पक्षपात) पैदा नहीं होता है। लेकिन चूंकि यह बहुत प्रेडिक्टिव है, इसलिए यह एक शक्तिशाली 'नॉइज़-कैंसलिंग हेडफ़ोन' की तरह काम करता है, जिससे अंतिम परिणाम बहुत स्पष्ट हो जाता है।

यह क्यों महत्वपूर्ण है

  • यह सुरक्षित है: आपको यह अनुमान लगाने की ज़रूरत नहीं है कि कौन सा डेटा सुरक्षित है। यह पेपर इसे टेस्ट करने के लिए एक गणितीय नियम देता है।
  • यह अधिक शक्तिशाली है: "टेस्ट के दौरान" का डेटा अक्सर "पिछले" डेटा की तुलना में बहुत अधिक प्रासंगिक होता है। इसके सुरक्षित हिस्सों का उपयोग करके, आप अधिक सटीक सिग्नल प्राप्त करते हैं।
  • यह व्यावहारिक है: यह उन टूल्स के साथ काम करता है जिनका उपयोग कंपनियाँ पहले से ही कर रही हैं। आपको अपना पूरा सिस्टम बदलने की ज़रूरत नहीं है; आप बस यह दूसरा चरण जोड़ देते हैं।

संक्षेप में:
यह पेपर हमें सिखाता है कि कैसे प्रयोग के "लाइव" डेटा का उपयोग हमारे परिणामों को अधिक सटीक बनाने के लिए किया जाए, बिना अनजाने में उस प्रभाव को मिटाए जिसे हम मापने की कोशिश कर रहे हैं। यह शोर-रहित हेडफ़ोन पहनने जैसा है जो मानवीय व्यवहार के शोर को फ़िल्टर करता है, जिससे आप अपने नए फीचर की सफलता की वास्तविक आवाज़ सुन पाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →