← नवीनतम पेपर
📊 statistics

Estimated Ranking Tables and Uncertainty

यह शोध पत्र K जनसंख्याओं की वास्तविक रैंकिंग के लिए संयुक्त विश्वास क्षेत्रों (joint confidence regions) के साथ अनुमानित रैंकिंग तालिकाओं के निर्माण के लिए एक विधि प्रस्तावित करता है, जो रैंकिंग अनिश्चितता को दृश्य रूप से संप्रेषित करने और व्यक्तिगत रैंकों के लिए सीमांत विश्वास सेट (marginal confidence sets) प्रदान करने के लिए सामान्यता धारणाओं (normality assumptions) और मानक त्रुटियों का उपयोग करती है।

मूल लेखक: Tommy Wright

प्रकाशित 2026-07-30
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tommy Wright

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप सैकड़ों बूथों वाले एक विशाल विज्ञान मेले में हैं, जहाँ प्रत्येक बूथ पर एक अलग प्रोजेक्ट प्रदर्शित किया गया है। यदि आप केवल गलियारों में घूमकर स्कूलों के नाम वर्णमाला के क्रम (alphabetical order) में पढ़ते हैं, तो आपको यह पता लगाने के लिए बार-बार आगे-पीछे कूदना पड़ेगा कि वास्तव में प्रथम स्थान पर कौन जीता है। आपको आँखों को सिकोड़ना होगा, संख्याओं की तुलना करनी होगी और अनुमान लगाना होगा कि सबसे "अच्छा" कौन है। यह बिल्कुल उसी तरह का भ्रम है जो सांख्यिकीविदों (statisticians) के डेटा टेबल जारी करने पर होता है। वे अक्सर देशों, राज्यों या शहरों को वर्णमाला के क्रम में सूचीबद्ध करते हैं, जो किसी विशिष्ट नाम को खोजने के लिए तो अच्छा है लेकिन प्रतियोगिता में कौन जीत रहा है या हार रहा है, यह देखने के लिए बहुत बुरा है।

यह शोध पत्र सांख्यिकी (statistics) की दुनिया में रहता है, विशेष रूप से उस शाखा में जो इस बात से संबंधित है कि हम एक नमूने (sample) से चीजों को कैसे मापते हैं (जैसे 1,000 लोगों से उनके आवागमन के बारे में पूछना) ताकि पूरी जनसंख्या के बारे में अनुमान लगाया जा सके। यहाँ मुख्य विचार अनिश्चितता (uncertainty) है। क्योंकि हम एक नमूने के आधार पर अनुमान लगा रहे हैं, हमारे नंबर पूर्ण तथ्य नहीं हैं; वे थोड़े "उतार-चढ़ाव" (wiggle room) के साथ अनुमान हैं। यदि राज्य A का औसत आवागमन 30 मिनट है और राज्य B का 30.1 मिनट है, तो क्या राज्य B वास्तव में धीमा है, या यह सर्वेक्षण का केवल एक संयोग है? यह शोध पत्र तर्क देता है कि हमें इन रैंकिंग्स को दिखाने का एक नया तरीका चाहिए जो केवल नाम सूचीबद्ध न करे, बल्कि यह भी दिखाए कि हम प्रथम, द्वितीय या अंतिम स्थान पर होने के बारे में कितने निश्चित (या अनिश्चित) हैं।


द ग्रेट रैंकिंग शफल (The Great Ranking Shuffle)

टॉमी राइट, जो अमेरिकी जनगणना ब्यूरो के एक शोधकर्ता हैं, डेटा टेबल को देखने के हमारे तरीके को ठीक करने के मिशन पर हैं। उनका मानना है कि जब कोई सरकारी एजेंसी संख्याओं की एक सूची जारी करती है—जैसे कि विभिन्न राज्यों में लोगों को काम पर जाने में कितना समय लगता है—तो उन्हें इसे केवल A से Z के क्रम में सूचीबद्ध नहीं करना चाहिए। इसके बजाय, उन्हें इसे एक अनुमानित रैंकिंग तालिका (Estimated Ranking Table) के रूप में प्रस्तुत करना चाहिए।

इसे एक स्पोर्ट्स लीग की तरह समझें। यदि आप टीमों को केवल वर्णमाला के क्रम में सूचीबद्ध करते हैं, तो आपको लीडरबोर्ड देखने के लिए स्वयं गणित करना पड़ता है। राइट कहते हैं, "बस हमें लीडरबोर्ड दिखा दीजिए!" लेकिन यहाँ एक पेच है: वास्तविक जीवन में, लीडरबोर्ड एक स्थिर, अपरिवर्तनीय तथ्य नहीं है। यह एक नमूने पर आधारित एक क्षणिक दृश्य (snapshot) है, और यह अनिश्चितता के बादल के साथ आता है।

राइट का शोध पत्र एक सरल लेकिन बहुत बड़े सवाल को संबोधित करता है: "क्या एक डेटा टेबल को स्पष्ट रूप से एक अनुमानित रैंकिंग तालिका के रूप में प्रस्तुत किया जाना चाहिए?" उनका उत्तर एक जोरदार "हाँ" है। उनका तर्क है कि लगभग हर तालिका जो विभिन्न समूहों के लिए संख्याएँ दिखाती है, उसे उच्चतम मान से निम्नतम मान के क्रम में व्यवस्थित किया जाना चाहिए, और इसमें एक दृश्य मार्गदर्शिका होनी चाहिए जो उन रैंकिंग के इर्द-गिर्द अनिश्चितता के "कोहरे" को दर्शाती हो।

अनिश्चितता का "कोहरा" (The "Fog" of Uncertainty)

राइट के समाधान को समझने के लिए, कल्पना कीजिए कि आप अपने दोस्तों की ऊंचाई को रैंक करने की कोशिश कर रहे हैं। आप एक रूलर से उन्हें मापते हैं, लेकिन आपका रूलर थोड़ा डगमगा रहा है। आप सोचते हैं कि आपकी सहेली एलिस 5'6" है और बॉब 5'5" है। लेकिन क्योंकि आपका रूलर डगमगा रहा है, शायद बॉब वास्तव में 5'5.5" है और एलिस 5'5.4" है। यदि आप केवल लिख देते हैं कि "एलिस #1 है, बॉब #2 है," तो आप इस बारे में झूठ बोल रहे हैं कि आप कितने निश्चित हैं।

राइट एक विधि पेश करते हैं जिसे DIFF जॉइंट कॉन्फिडेंस रीजन (DIFF Joint Confidence Region) कहा जाता है। "DIFF" का अर्थ है अंतर (differences)। केवल एक व्यक्ति की ऊंचाई देखने के बजाय, यह विधि प्रत्येक जोड़ी के बीच के अंतर को देखती है। यह पूछती है: "क्या एलिस और बॉब के बीच का अंतर इतना बड़ा है कि हम आश्वस्त हो सकें कि एलिस लंबी है, या क्या अंतर इतना कम है कि वे बराबर हो सकते हैं?"

वह एक विज़ुअल टूल का उपयोग करते हैं जो एक ग्रिड या सीढ़ी जैसा दिखता है।

  • लंबवत अक्ष (Vertical Axis) रैंक (प्रथम स्थान, द्वितीय स्थान, आदि) है।
  • क्षैतिज अक्ष (Horizontal Axis) समूहों (जैसे राज्य या देश) को उनके सर्वोत्तम अनुमानित संख्या के आधार पर सूचीबद्ध करता है।
  • बॉक्स (Boxes) दिखाते हैं कि एक समूह कहाँ हो सकता है।

यदि कोई राज्य स्पष्ट रूप से विजेता है, तो उसका बॉक्स सबसे ऊपर एक एकल, ठोस वर्ग होगा। लेकिन यदि दो राज्य बहुत करीब हैं, तो उनके बॉक्स ओवरलैप होंगे, जिससे संभावनाओं का एक "बादल" बन जाएगा। यह बादल बताता है, "हे, राज्य A शायद #1 है, लेकिन वह वास्तव में #2 भी हो सकता है, और राज्य B #1 हो सकता है।"

तीन उदाहरण: आवागमन से लेकर गणित के स्कोर तक

राइट केवल सिद्धांत की बात नहीं करते; वह अपने विचार का परीक्षण करने के लिए तीन वास्तविक दुनिया के उदाहरणों का उपयोग करते हैं।

1. द कम्यूट केओस (USA के राज्य - The Commute Chaos)
उन्होंने सभी 51 राज्यों (वाशिंगटन डी.सी. सहित) में काम पर जाने के औसत समय को देखा। पारंपरिक वर्णमाला तालिका में, आपको यह देखने के लिए मैरीलैंड और नॉर्थ डकोटा को खोजना पड़ेगा कि किसका आवागमन सबसे लंबा और सबसे छोटा है। राइट की रैंकिंग तालिका में, मैरीलैंड 32.2 मिनट के आवागमन के साथ स्पष्ट रूप से शीर्ष पर है, और नॉर्थ डकोटा और साउथ डकोटा 16.9 मिनट के साथ सबसे नीचे हैं।
सबसे अच्छी बात "कोहरा" है। शीर्ष और सबसे निचले स्तर के राज्यों के पास बहुत छोटे बादल हैं, जिसका अर्थ है कि हम इस बारे में बहुत आश्वस्त हैं कि वे सबसे तेज़ और सबसे धीमे हैं। लेकिन बीच में, जहाँ कई राज्यों का समय समान है (लगभग 23 से 25 मिनट), वहाँ बादल बहुत बड़े हैं। यह हमें बताता है कि हालांकि हम कह सकते हैं कि "मैरीलैंड सबसे धीमा है," हम 100% निश्चित नहीं हो सकते कि, उदाहरण के लिए, इलिनोइस #5 है या #6। तालिका स्वीकार करती है, "हमें बीच में पक्का पता नहीं है!"

2. द स्पेंडिंग स्प्री (भारत - The Spending Spree)
इसके बाद, उन्होंने देखा कि भारत के 18 प्रमुख राज्यों में लोग हर महीने भोजन और वस्तुओं पर कितना पैसा खर्च करते हैं। शीर्ष खर्च करने वाला तेलंगाना था 8,158 (मुद्रा इकाइयों में), और सबसे कम छत्तीसगढ़ था 4,483। फिर से, रैंकिंग तालिका ने दिखाया कि शीर्ष और निचले स्तर स्पष्ट थे, लेकिन बीच के राज्यों में बहुत अधिक ओवरलैप था। यह नीति निर्माताओं को यह देखने में मदद करता है कि जबकि कुछ राज्य स्पष्ट रूप से समृद्ध या गरीब हैं, बीच के राज्य बिना अधिक डेटा के निर्णय लेने के लिए बहुत करीब हैं।

3. द मैथ शोडाउन (OECD देश - The Math Showdown)
अंत में, उन्होंने 37 देशों के PISA टेस्ट के गणित स्कोर को देखा। जापान और कोरिया 536 और 527 के स्कोर के साथ स्पष्ट नेता थे। सूची के निचले हिस्से में कोलंबिया, कोस्टा रिका और मैक्सिको थे। विज़ुअल ने दिखाया कि शीर्ष देश अलग थे, लेकिन बीच के देशों का समूह (स्कोर लगभग 470-490) एक विशाल, उलझा हुआ बादल था। इसका मतलब है कि बीच के पैक में यह कहना कि "देश X, देश Y से बेहतर है" अक्सर एक अनुमान होता है, तथ्य नहीं।

यह क्यों महत्वपूर्ण है

राइट का शोध पत्र सुझाव देता है कि हमें यह मानने से बचना चाहिए कि एक अकेला नंबर पूर्ण सत्य है। इन अनुमानित रैंकिंग तालिकाओं (Estimated Ranking Tables) का उपयोग करके, सांख्यिकीय एजेंसियां तेजी से और अधिक स्पष्ट रूप से संवाद कर सकती हैं। एक वर्णमाला सूची के माध्यम से खोजने के बजाय, तालिका तुरंत "विजेता" और "हारने वाले" को दिखाती है। इससे भी महत्वपूर्ण बात यह है कि यह अनिश्चितता को भी दिखाती है।

उनका तर्क है कि हमें "निहित" (Implicit) रैंकिंग (जहाँ आपको क्रम का अनुमान लगाना पड़ता है) से हटकर "स्पष्ट" (Explicit) रैंकिंग (जहाँ क्रम दिखाया जाता है, संदेह के कोहरे के साथ) की ओर बढ़ना चाहिए। उनका मानना है कि यदि हम ऐसा करते हैं, तो हम इस बारे में झूठे दावे करना बंद कर देंगे कि कौन "बेहतर" या "कमतर" है, जब वास्तव में डेटा बहुत अस्पष्ट हो।

संक्षेप में, राइट हमें कह रहे हैं: "हमें केवल संख्याओं की सूची न दें। हमें एक ऐसा लीडरबोर्ड दें जो यह स्वीकार करे कि दौड़ कितनी करीबी है।" यह इस बारे में ईमानदार होने का एक तरीका है कि हम क्या जानते हैं और हम किस चीज़ का केवल अनुमान लगा रहे हैं, जिससे डेटा केवल तथ्यों की सूची नहीं, बल्कि इस बात की एक कहानी बन जाता है कि हम उन तथ्यों के बारे में कितने आश्वस्त हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →