← नवीनतम पेपर
📊 statistics

Evaluating the Quality of the Quantified Uncertainty for (Re)Calibration of Data-Driven Regression Models

यह शोध पत्र व्यवस्थित रूप से रिग्रेशन कैलिब्रेशन मेट्रिक्स और रीकैलिब्रेशन विधियों का मूल्यांकन करता है, जो यह प्रकट करता है कि मौजूदा मेट्रिक्स अक्सर परस्पर विरोधी और विरोधाभासी परिणाम उत्पन्न करते हैं, जिससे सावधानीपूर्वक मेट्रिक चयन की महत्वपूर्ण आवश्यकता उजागर होती है और एक्सपेक्टेड नॉर्मलाइज्ड कैलिब्रेशन एरर (ENCE) तथा कवरेज विड्थ-बेस्ड क्राइटेरियन (CWC) को सबसे भरोसेमंद विकल्पों के रूप में पहचानता है।

मूल लेखक: Jelke Wibbeke, Nico Schönfisch, Sebastian Rohjans, Andreas Rauh

प्रकाशित 2026-04-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jelke Wibbeke, Nico Schönfisch, Sebastian Rohjans, Andreas Rauh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मौसम विज्ञानी को काम पर रख रहे हैं ताकि वह आपको यह तय करने में मदद कर सके कि क्या आपको छाता साथ लाना चाहिए। आप नहीं चाहते कि वह सिर्फ इतना कहे कि "बारिश होगी"; आप चाहते हैं कि वह कहे, "बारिश होगी, और मुझे इस बात का 90% यकीन है।"

AI और मशीन लर्निंग की दुनिया में, इस "आत्मविश्वास के स्तर" (confidence level) को अनिश्चितता परिमाणीकरण (Uncertainty Quantification) कहा जाता है। लेकिन समस्या यह है कि आपको यह कैसे पता चलेगा कि AI वास्तव में अपने आत्मविश्वास के बारे में ईमानदार है या नहीं? क्या वह एक भरोसेमंद पूर्वानुमान लगाने वाला है, या वह सिर्फ अंदाज़ा लगा रहा है और पक्का होने का नाटक कर रहा है?

यह शोध पत्र अनिवार्य रूप से उन उपकरणों के लिए एक गुणवत्ता नियंत्रण रिपोर्ट (quality control report) है जिनका उपयोग हम यह जाँचने के लिए करते हैं कि ये AI "मौसम विज्ञानी" सच बोल रहे हैं या नहीं।

समस्या: बहुत सारे पैमाने, कोई मानक नहीं

लेखकों ने पाया कि वैज्ञानिकों ने दर्जनों अलग-अलग "पैमाने" (metrics) बना लिए हैं यह मापने के लिए कि एक AI अपने अनिश्चितता का अनुमान कितनी अच्छी तरह लगाता है। समस्या यह है कि ये सभी पैमाने अलग-अलग चीजें मापते हैं, अलग-अलग इकाइयों का उपयोग करते हैं, और अक्सर विरोधाभासी उत्तर देते हैं।

उपमा:
कल्पना कीजिए कि आप एक कार के स्पीडोमीटर की गुणवत्ता को परखने की कोशिश कर रहे हैं।

  • पैमाना A कहता है: "स्पीडोमीटर बेहतरीन है क्योंकि सुई 95% समय सही नंबर की ओर इशारा करती है।"
  • पैमाना B कहता है: "स्पीडोमीटर बेकार है क्योंकि सुई बहुत ज्यादा हिलती रहती है।"
  • पैमाना C कहता है: "स्पीडोमीटर शानदार है क्योंकि औसत गति सड़क के संकेतों से मेल खाती है।"

यदि आप पैमाने A का उपयोग करते हैं, तो आप सोचते हैं कि कार बहुत अच्छी है। यदि आप पैमाने B का उपयोग करते हैं, तो आप सोचते हैं कि यह खराब है। कार बदली नहीं है; केवल पैमाना बदला है। AI की दुनिया में, शोधकर्ता उस पैमाने को "चुन रहे थे" (cherry-picking) जो उनके AI को सबसे अच्छा दिखाता था, जिससे भ्रामक परिणाम मिल रहे थे।

प्रयोग: "सत्य परीक्षण" (The Truth Test)

इसे ठीक करने के लिए, लेखकों ने एक विशाल, नियंत्रित प्रयोग किया। उन्होंने केवल वास्तविक दुनिया के डेटा को नहीं देखा (जो कि अव्यवस्थित होता है); बल्कि उन्होंने पूरी तरह से सिम्युलेटेड दुनिया बनाई जहाँ वे सटीक सत्य जानते थे।

  1. "परफेक्ट" दुनिया: उन्होंने एक ऐसा AI बनाया जो बिल्कुल जानता था कि उसे कितना आत्मविश्वासी होना चाहिए।
  2. "तोड़फोड़" चरण (The Sabotage Phase): इसके बाद उन्होंने जानबूझकर AI के आत्मविश्वास को विशिष्ट तरीकों से बिगाड़ा:
    • इसे बहुत अधिक आत्मविश्वासी बनाना (जैसे एक ड्राइवर जो सोचता है कि वह बर्फबारी में भी 100 मील प्रति घंटे की रफ्तार से गाड़ी चला सकता है)।
    • इसे बहुत अधिक अनिश्चित बनाना (जैसे एक ड्राइवर जो सोचता है कि वह बिल्कुल भी गाड़ी नहीं चला सकता)।
    • इसे पक्षपाती (biased) बनाना (हमेशा गलत गति का अनुमान लगाना)।

फिर, उन्होंने इस बिगड़े हुए AI पर सभी अलग-अलग "पैमानों" को चलाया ताकि यह देखा जा सके कि कौन से पैमाने वास्तव में समस्या को पकड़ पाते हैं।

निष्कर्ष: "अराजकता" और "नायक"

परिणाम चौंकाने वाले थे। अलग-अलग पैमाने अक्सर पूरी तरह से असहमत होते थे।

  • कभी-कभी, एक पैमाना कहता, "बहुत बढ़िया काम!" जब AI वास्तव में खराब हो चुका था।
  • कभी-कभी, एक पैमाना कहता, "बहुत बुरा!" जब AI वास्तव में ठीक था।

इसका मतलब यह है कि कई वैज्ञानिक अध्ययनों में, शोधकर्ता शायद उन "सुधारों" का जश्न मना रहे थे जो वास्तव में अस्तित्व में ही नहीं थे, केवल इसलिए क्योंकि उन्होंने एक ऐसा पैमाना चुना जो उनके पक्ष में था।

अध्ययन के नायक:
सब कुछ टेस्ट करने के बाद, लेखकों ने पाया कि दो "पैमाने" सबसे विश्वसनीय जासूस थे:

  1. ENCE (Expected Normalized Calibration Error): इसे एक स्मार्ट डिटेक्टिव के रूप में सोचें जो पूरी तस्वीर देखता है। यह जाँचता है कि क्या AI का आत्मविश्वास पूरे दायरे में उसकी वास्तविक गलतियों से मेल खाता है। इसे काम करने के लिए किसी विशेष सेटिंग की आवश्यकता नहीं है और यह लगभग हर झूठ को पकड़ लेता है।
  2. CWC (Coverage Width-based Criterion): यह एक सख्त निरीक्षक की तरह है जो दो चीजें एक साथ जाँचता है: "क्या उत्तर सही रेंज में आया?" और "क्या रेंज बहुत चौड़ी या बहुत संकीर्ण थी?" यह बहुत अच्छा है, लेकिन इसके लिए आपको पहले से एक विशिष्ट "कॉन्फिडेंस लेवल" (जैसे 95%) सेट करना आवश्यक है।

एक पेच: आकार मायने रखता है

अध्ययन में यह भी पाया गया कि ये पैमाने तभी अच्छी तरह काम करते हैं जब आपके पास बहुत सारा डेटा हो। यदि आपके पास केवल कुछ सौ उदाहरण (जैसे एक छोटा डेटासेट) हैं, तो पैमाने अस्थिर हो जाते हैं और रैंडम उत्तर देने लगते हैं। परिणामों पर भरोसा करने के लिए आपको कम से कम 500-1,000 डेटा पॉइंट्स की आवश्यकता होती है।

मुख्य सीख

यदि आप किसी महत्वपूर्ण चीज़ के लिए AI बना रहे हैं—जैसे कि एक सेल्फ-ड्राइविंग कार या मेडिकल डायग्नोसिस—तो आप यह जाँचने के लिए कि क्या वह सुरक्षित है, केवल किसी भी टूल का उपयोग नहीं कर सकते। आपको सही उपकरणों का उपयोग करना होगा।

लेखकों की सलाह:

  • केवल एक पैमाने का उपयोग करना बंद करें।
  • यदि आप सुरक्षित रहना चाहते हैं, तो ENCE (स्मार्ट डिटेक्टिव) या CWC (सख्त निरीक्षक) का उपयोग करें।
  • यदि आप कम मात्रा में डेटा के साथ काम कर रहे हैं, तो बहुत सावधान रहें; परिणाम अविश्वसनीय हो सकते हैं।

संक्षेप में: AI के आत्मविश्वास पर तब तक भरोसा न करें जब तक कि आपने सही पैमाने से इसकी जाँच न कर ली हो। अन्यथा, आप एक ऐसी कार चला रहे होंगे जिसका स्पीडोमीटर खराब है, और आप सोच रहे होंगे कि यह पूरी तरह से कैलिब्रेटेड है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →