← नवीनतम पेपर
📊 statistics

Measures of predictive accuracy, miscalibration and discrimination

यह शोध पत्र ABC और गिनी स्कोर जैसे व्यापक रूप से उपयोग किए जाने वाले भविष्य कहनेवाला सटीकता मापों की आलोचना करता है क्योंकि वे माध्य-सुसंगत हानि फलनों (mean-consistent loss functions) के साथ संरेखित नहीं हैं, और इसके बजाय एक नए मर्फी अपघटन (Murphy's decomposition) और लोरेन्ज़-वक्र-आधारित मेट्रिक्स का प्रस्ताव देता है ताकि ईमानदार मॉडल मूल्यांकन और सुदृढ़ पूर्वानुमान प्रभुत्व विश्लेषण सुनिश्चित किया जा सके।

मूल लेखक: Łukasz Delong, Mario Wüthrich

प्रकाशित 2026-05-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Łukasz Delong, Mario Wüthrich

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कोच हैं जो अपने शहर के लिए सबसे अच्छा मौसम पूर्वानुमानकर्ता (weather forecaster) चुनने की कोशिश कर रहे हैं। आपके पास दो उम्मीदवार हैं, एलिस और बॉब। वे दोनों हर दिन तापमान का अनुमान लगाने के लिए एक संख्या देते हैं। आप कैसे तय करेंगे कि कौन बेहतर है?

यह पेपर एक कोच के लिए नियम पुस्तिका की तरह है, जिसे सांख्यिकीविदों (statisticians) लुकास डेलोंग और मारियो वुथ्रिच द्वारा लिखा गया है। यह तर्क देता है कि इन पूर्वानुमानकर्ताओं को आंकने का हमारा सामान्य तरीका अक्सर त्रुटिपूर्ण होता है, और यह इसे करने का एक बेहतर, अधिक ईमानदार तरीका प्रदान करता है।

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. स्वर्णि स्वर्णिम नियम: निरंतरता (Consistency)

पेपर एक मौलिक नियम से शुरू होता है: आपको एक पूर्वानुमानकर्ता को उसी "रूलर" (माप यंत्र) का उपयोग करके आंकना चाहिए जिसका उपयोग आपने उन्हें प्रशिक्षित करने के लिए किया था।

यदि आप चाहते हैं कि आपके पूर्वानुमानकर्ता औसत तापमान की भविष्यवाणी करें, तो आपको उन्हें इस आधार पर आंकना चाहिए कि वे औसत के कितने करीब हैं। यदि आप एक अलग रूलर का उपयोग करते हैं (जैसे कि एक ऐसा जो उन्हें बहुत अधिक होने के लिए दंडित करता है लेकिन बहुत कम होने के लिए अनदेखा कर देता है), तो आप एक ऐसे विजेता को चुन सकते हैं जो वास्तव में औसत की भविष्यवाणी करने में बहुत खराब है। लेखक कहते हैं कि हमें "कंसिस्टेंट लॉस फंक्शन्स" (विशेष रूप से जिन्हें ब्रेगमन डायवर्जेंस कहा जाता है) का उपयोग करना चाहिए। इसे एक पूरी तरह से कैलिब्रेटेड स्केल की तरह समझें जो केवल तभी वजन सटीक रूप से मापता है जब आप सही चीज़ तौल रहे हों।

2. भविष्यवाणी में दो दोष (Two Flaws in a Prediction)

लेखक मर्फी के अपघटन (Murphy's Decomposition) की अवधारणा का उपयोग करके एक भविष्यवाणी के प्रदर्शन को दो भागों में विभाजित करते हैं। कल्पना कीजिए कि एक भविष्यवाणी लक्ष्य पर एक तीर फेंकने जैसा है।

  • मिसकैलिब्रेशन (लक्ष्य की सटीकता - The Aim): यह मापता है कि क्या पूर्वानुमानकर्ता "ईमानदार" है। यदि कोई पूर्वानुमानकर्ता कहता है "तापमान 70 डिग्री होगा," तो क्या वास्तव में औसतन 70 ही होता है? यदि वे लगातार गलत होते हैं (उदाहरण के लिए, वे हमेशा 70 कहते हैं, लेकिन वास्तव में यह 65 होता है), तो वे "मिसकैलिब्रेटेड" हैं।
  • डिस्क्रिमिनेशन (फैलाव - The Spread): यह मापता है कि क्या पूर्वानुमानकर्ता "उपयोगी" है। यदि कोई पूर्वानुमानकर्ता हर दिन बस यही कहता है कि "यह 70 डिग्री होगा," तो वे पूरी तरह से कैलिब्रेटेड हो सकते हैं (यदि औसत 70 है), लेकिन वे बेकार हैं क्योंकि वे आपको यह नहीं बताते कि कब गर्मी या ठंड होगी। एक अच्छे पूर्वानुमानकर्ता को बदलते मौसम के अनुरूप अपनी भविष्यवाणियों में बदलाव करने की आवश्यकता होती है।

3. लोकप्रिय उपकरणों के साथ समस्या (ABC और Gini स्कोर)

वास्तविक दुनिया में (विशेष रूप से बीमा और वित्त में), लोग पूर्वानुमानकर्ताओं को आंकने के लिए दो विशिष्ट उपकरणों का उपयोग करना पसंद करते हैं:

  1. ABC स्कोर: यह दो कर्व्स (लोरेंज और कंसंट्रेशन कर्व्स) के बीच के क्षेत्र को देखता है। यह एक ग्राफ देखने जैसा है कि पूर्वानुमानकर्ताओं की भविष्यवाणियां सच्चाई की तुलना में कितनी "लहराती" (wiggle) हैं।
  2. गिनी इंडेक्स (Gini Index): यह असमानता (जैसे धन) को मापने के लिए उपयोग किया जाने वाला एक प्रसिद्ध सांख्यिकी है। यहाँ, इसका उपयोग यह देखने के लिए किया जाता है कि पूर्वानुमानकर्ताओं की भविष्यवाणियां कितनी भिन्न होती हैं।

पेपर की बड़ी चेतावनी:
लेखक सिद्ध करते हैं कि ये लोकप्रिय उपकरण "बेईमान" निर्णायक हैं।

  • "चलते हुए रूलर" की समस्या: ABC और गिनी स्कोर उन लोगों के आधार पर अपने नियम बदलते हैं जिन्हें वे आंक रहे हैं। यह एक फुटबॉल मैच में रेफरी की तरह है जो खेल के आधार पर गोलपोस्ट का आकार बदल देता है। यदि आप इन स्कोर का उपयोग सर्वश्रेष्ठ पूर्वानुमानकर्ता को चुनने के लिए करते हैं, तो आप उसे चुन सकते हैं जो केवल संयोग से रेफरी के बदलते नियमों में फिट बैठता है, न कि उसे जो वास्तव में सबसे अच्छा है।
  • "जीरो" का जाल: लेखक दिखाते हैं कि ABC स्कोर शून्य (पूरी तरह से सपाट) हो सकता है भले ही पूर्वानुमानकर्ता झूठ बोल रहा हो (मिसकैलिब्रेटेड हो)। यह एक स्पीडोमीटर की तरह है जो "0 mph" पढ़ता है भले ही कार पीछे की ओर चल रही हो। नया ABC2 स्कोर इस विशिष्ट जाल को ठीक करता है, लेकिन यह अभी भी "चलते हुए रूलर" की समस्या से ग्रस्त है।

समाधान: मर्फी के अपघटन (Murphy's Decomposition) के मापों पर टिके रहें। ये "कंसिस्टेंट रूलर" (ब्रेगमन डायवर्जेंस) का उपयोग करते हैं और पूर्वानुमानकर्ता के आधार पर अपने नियम नहीं बदलते हैं। वे एक निष्पक्ष, ईमानदार तुलना प्रदान करते हैं।

4. जब कर्व्स आपस में टकराते हैं (The Tie-Breaker)

आमतौर पर, हम कर्व्स को देखकर पूर्वानुमानकर्ताओं की तुलना करते हैं। यदि एक कर्व हमेशा दूसरे के ऊपर रहता है, तो यह कहना आसान है कि कौन बेहतर है। लेकिन वास्तविक जीवन में, कर्व्स अक्सर एक-दूसरे को काटते हैं (जैसे दौड़ के दौरान दो धावक अपनी स्थिति बदलते हैं)।

  • पुराना दृष्टिकोण: यदि कर्व्स आपस में टकराते हैं, तो हम आसानी से यह नहीं कह सकते थे कि कौन बेहतर था।
  • नया दृष्टिकोण: लेखक दिखाते हैं कि जब ये कर्व्स टकराते हैं, तो वे "मर्फी कर्व्स" (कंसिस्टेंट रूलर के लिए उपयोग किए जाने वाले तकनीकी ग्राफ) की तरह ही समान संख्या में टकराते हैं।
  • नया नियम: यदि कर्व्स ठीक एक बार टकराते हैं, तो हम अभी भी एक निष्पक्ष निर्णय ले सकते हैं, लेकिन हमें अधिक विशिष्ट होना होगा। हम केवल यह नहीं कह सकते कि "पूर्वानुमानकर्ता A बेहतर है।" हमें यह कहना होगा कि "पूर्वानुमानकर्ता A बेहतर है यदि हम बड़े तूफानों (उच्च विचरण/variance) की अधिक परवाह करते हैं," या "पूर्वानुमानकर्ता B बेहतर है यदि हम हल्की बूंदाबांदी की अधिक परवाह करते हैं।"

वे सिद्ध करते हैं कि इन क्रॉसिंग परिदृश्यों में, निर्णय लेने वाला कारक गिनी इंडेक्स नहीं, बल्कि वैरिएंस (Variance) बनता है।

सारांश: आपको क्या करना चाहिए?

यदि आप भविष्यवाणियों (जैसे मौसम, बीमा जोखिम, या स्टॉक की कीमतें) का मूल्यांकन कर रहे हैं:

  1. विजेता चुनने के लिए ABC स्कोर या गिनी इंडेक्स पर भरोसा न करें। वे पक्षपाती रेफरी की तरह हैं जो खेल के बीच में ही नियम बदल देते हैं।
  2. मर्फी के अपघटन (Murphy's Decomposition) का उपयोग करें। यह एक सुसंगत, अपरिवर्तनीय रूलर का उपयोग करके स्कोर को "ईमानदारी" (Miscalibration) और "उपयोगिता" (Discrimination) में विभाजित करता है।
  3. यदि ग्राफ आपस में टकराते हैं, तो घबराएं नहीं। वैरिएंस (विचरण) और उस विशिष्ट प्रकार की त्रुटि को देखें जिसकी आप परवाह करते हैं। यह पेपर आपको यह तय करने का एक नया, गणितीय रूप से सुदृढ़ तरीका देता है कि कौन जीतता है, भले ही मुकाबला बहुत करीबी क्यों न हो।

संक्षेप में: उन लोकप्रिय, चकाचौंध भरे मेट्रिक्स का उपयोग करना बंद करें जो धोखा देते हैं। उन ईमानदार, सुसंगत मेट्रिक्स का उपयोग करें जो वास्तव में वही मापते हैं जो आप मापने का दावा करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →