← नवीनतम पेपर
📊 statistics

Beyond ECE: Calibrated Size Ratio, Risk Assessment, and Confidence-Weighted Metrics

यह शोध पत्र ओवरकॉन्फिडेंस (अति-आत्मविश्वास) के जोखिमों का पता लगाने में मानक एक्सपेक्टेड कैलिब्रेशन एरर (ECE) की सीमाओं की आलोचना करता है और जोखिम मूल्यांकन के लिए कैलिब्रेटेड साइज रेशियो (CSR) तथा मॉडल कॉन्फिडेंस के विभेदक मूल्य का बेहतर मूल्यांकन करने के लिए कॉन्फिडेंस-वेटेड मेट्रिक्स (जैसे cwAUC) से युक्त एक नए ढांचे का प्रस्ताव करता है।

मूल लेखक: Fernando Martin-Maroto, Nabil Abderrahaman, Gonzalo G. de Polavieja

प्रकाशित 2026-05-06
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fernando Martin-Maroto, Nabil Abderrahaman, Gonzalo G. de Polavieja

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मौसम विज्ञानी हैं। हर दिन, आप बारिश की संभावना का अनुमान लगाते हैं। यदि आप कहते हैं कि बारिश की 90% संभावना है, और जब भी आप ऐसा अनुमान लगाते हैं तो 90% बार वास्तव में बारिश होती है, तो आप "कैलिब्रेटेड" (calibrated) हैं। आप अपनी निश्चितता के बारे में ईमानदार हैं।

वर्षों से, मशीन लर्निंग समुदाय ने इस ईमानदारी को मापने के लिए एक एकल पैमाने का उपयोग किया है, जिसे ECE (Expected Calibration Error) कहा जाता है। इस शोध पत्र के लेखक तर्क देते हैं कि यह पैमाना टूटा हुआ है। यह एक कार और खाई के बीच की दूरी मापने जैसा है, लेकिन कार को दीवार से 1 मीटर दूर खड़े होने और खाई के किनारे से 1 मीटर दूर खड़े होने के बीच कोई अंतर न करना। AI की दुनिया में, यह विश्वास करना कि आप 95% निश्चित हैं जबकि आप वास्तव में गलत हैं, एक आपदा है। जब आप गलत हों और 55% सुनिश्चित हों, तो वह केवल एक मामूली गलती है। पुराना पैमाना (ECE) इन दोनों त्रुटियों को समान मानता है।

यहाँ वे क्या प्रस्तावित करते हैं, सरल उपमाओं का उपयोग करते हुए:

1. "कैलिब्रेटेड साइज रेशियो" (CSR): "झूठ कितना बड़ा है?" मापने वाला मीटर

लेखक एक नया मीट्रिक पेश करते हैं जिसे CSR कहा जाता है। इसे एक "जोखिम गुणक" (Risk Multiplier) के रूप में सोचें।

  • पुराना तरीका (ECE): यह गिनता है कि आप कितनी बार गलत थे, चाहे आपने कितनी भी जोर से अपनी आत्मविश्वास की घोषणा की हो।
  • नया तरीका (CSR): यह पूछता है, "यदि आपके आत्मविश्वास के स्कोर वास्तव में वास्तविक संभावनाएँ होते, तो हमें यह देखने के लिए कि यह शुद्ध भाग्य से हुई गलतियाँ हैं, दुनिया को कितना बड़ा होना पड़ता?"

उपमा:
कल्पना कीजिए कि आप एक जुआरी हैं।

  • परिदृश्य A: आप एक सिक्के के उछाल पर $1 का दांव लगाते हैं, यह कहते हुए कि "मुझे जीतने की 55% संभावना है।" आप हार जाते हैं। यह एक छोटा, कष्टप्रद नुकसान है।
  • परिदृश्य B: आप अपनी पूरी जीवन भर की बचत दांव पर लगा देते हैं, यह कहते हुए कि "मुझे जीतने की 99% संभावना है।" आप हार जाते हैं। यह एक आपदा है।

पुराना पैमाना (ECE) दोनों को "एक नुकसान" के रूप में देखता है। नया पैमाना (CSR) परिदृश्य B को एक बड़े खतरे के रूप में देखता है। यदि आपका CSR 1 है, तो आप पूरी तरह से ईमानदार हैं। यदि यह 10 है, तो इसका मतलब है कि आपका आत्मविश्वास इतना खतरनाक रूप से बढ़ा हुआ है कि आपको यह देखने के लिए कि ये गलतियाँ संयोग से हुईं, एक 10 गुना बड़ा डेटासेट चाहिए होगा। यदि यह 1,000,000 है, तो इसका मतलब है कि आप डरावने स्तर तक आत्मविश्वास के साथ झूठ बोल रहे हैं।

लेखक आपको एक "रिस्क प्रोबेबिलिटी" (PriskP_{risk}) भी देते हैं। यह एक सरल प्रतिशत है जो बताता है: "99% संभावना है कि यह मॉडल खतरनाक रूप से अति-आत्मविश्वासी (overconfident) है।"

2. "कॉन्फिडेंस-वेटेड एक्यूरेसी" (cwA): "उपयोगी आत्मविश्वास" मापने वाला मीटर

यह जानना कि एक मॉडल जोखिम भरा है (उच्च CSR), महत्वपूर्ण है, लेकिन यह जानना भी महत्वपूर्ण है कि क्या उसका आत्मविश्वास उपयोगी है। एक मॉडल पूरी तरह से सुरक्षित (कम जोखिम) हो सकता है, लेकिन पूरी तरह से बेकार (वह हर बार केवल 50% का अनुमान लगाता है)।

लेखक cwA का प्रस्ताव करते हैं। इसे एक "बोनस स्कोर" के रूप में सोचें।

  • मानक सटीकता (Standard Accuracy): यह गिनता है कि आपने कितनी बार सही उत्तर दिया।
  • cwA: यह गिनता है कि आपने कितनी बार सही उत्तर दिया, लेकिन आपको अतिरिक्त अंक देता है यदि आप सही होने पर बहुत आश्वस्त थे, और आपकी सजा काटता है यदि आप गलत होने पर भी आश्वस्त थे।

उपमा:
कल्पना कीजिए कि एक छात्र परीक्षा दे रहा है।

  • छात्र A 80% सही उत्तर देता है लेकिन हर चीज़ के बारे में अनिश्चित है।
  • छात्र B 80% सही उत्तर देता है लेकिन उन चीजों के बारे में बहुत आश्वस्त है जो उन्होंने सही की हैं और उन चीजों के बारे में अनिश्चित है जो उन्होंने गलत की हैं।
  • छात्र C 80% सही उत्तर देता है लेकिन उन चीजों के बारे में बहुत आश्वस्त है जो उन्होंने गलत की हैं।

मानक सटीकता तीनों को समान (80%) देखती है।

  • cwA छात्र B को पसंद करता है (उच्च स्कोर)।
  • cwA छात्र C से नफरत करता है (कम स्कोर)।
  • CSR (चरण 1 से) छात्र C के लिए "खतरा!" चिल्लाएगा।

3. "कॉन्फिडेंस-वेटेड AUC" (cwAUC): "विवेक के साथ रैंकिंग"

एक प्रसिद्ध मीट्रिक है जिसे AUC कहा जाता है, जो यह मापता है कि एक मॉडल अच्छे उत्तरों को बुरे उत्तरों से ऊपर कितनी अच्छी तरह रैंक करता है। यह शोध पत्र सिद्ध करता है कि AUC, कैलिब्रेशन के प्रति "अंधा" है। आप एक मॉडल ले सकते हैं, उसके आत्मविश्वास के नंबरों को बदल सकते हैं (उसे अति-आत्मविश्वासी या कम आत्मविश्वासी बना सकते हैं), और AUC स्कोर नहीं बदलेगा क्योंकि यह केवल क्रम (order) की परवाह करता है, परिमाण (magnitude) की नहीं।

लेखकों ने cwAUC बनाया है। यह AUC की तरह ही है, लेकिन यह आत्मविश्वास के 'वॉल्यूम' को सुनता है।

  • यदि मॉडल एक सही उत्तर को गलत उत्तर से ऊपर रैंक करता है और उस पर बहुत आश्वस्त है, तो cwAUC एक बड़ा बढ़ावा (boost) देता है।
  • यदि मॉडल उन्हें सही ढंग से रैंक करता है लेकिन बहुत कम आश्वस्त है, तो बढ़ावा छोटा होता है।
  • यदि मॉडल उन्हें सही ढंग से रैंक करता है लेकिन गलत उत्तर पर अत्यधिक आश्वस्त है, तो स्कोर गिर जाता है।

यह मीट्रिक बताता है कि क्या मॉडल का आत्मविश्वास वास्तव में उसकी रैंकिंग में मूल्य जोड़ता है, या यह केवल शोर (noise) है।

उन्होंने क्या पाया?

लेखकों ने कई वास्तविक दुनिया के डेटासेट्स (जैसे मेडिकल रिकॉर्ड, क्रेडिट स्कोर और इमेज रिकग्निशन) और सिंथेटिक डेटा पर इन नए उपकरणों का परीक्षण किया।

  1. पुराना पैमाना भ्रामक है: उन्होंने पाया कि मानक कैलिब्रेशन विधियाँ (जैसे "आइसोटोनिक रिग्रेशन") अक्सर मॉडलों को पुराने पैमाने (ECE) पर बेहतर दिखाती हैं, लेकिन वास्तव में उन्हें अधिक खतरनाक बना देती हैं। ये विधियाँ मॉडल को औसत त्रुटि को कम करने के लिए गलत उत्तरों पर अत्यधिक आत्मविश्वासी (99%) होने के लिए मजबूर कर सकती हैं।
  2. नए उपकरण खतरे को पकड़ लेते हैं: उनके नए CSR मीट्रिक ने सफलतापूर्वक उन "जोखिम भरे" मॉडलों की पहचान की जिन्हें पुराने उपकरणों ने मिस कर दिया था। कुछ मामलों में, मानक कैलिब्रेशन ने जोखिम की संभावना को लगभग 100% तक बढ़ा दिया।
  3. प्लैट स्केलिंग (Platt Scaling) अधिक सुरक्षित है: उन्होंने पाया कि "प्लैट स्केलिंग" जैसी सरल विधि अधिक जटिल विधियों की तुलना में मॉडलों को सुरक्षित (कम जोखिम) रखने में अधिक प्रभावी रही, भले ही वह हमेशा पुराने ECE पैमाने पर "परफेक्ट" न दिखे।

सारांश

यह शोध पत्र तर्क देता है कि हमें AI के आत्मविश्वास को उस पैमाने से मापना बंद कर देना चाहिए जो सभी गलतियों को समान मानता है।

  • CSR आपको बताता है कि क्या मॉडल खतरनाक रूप से अति-आत्मविश्वासी है (यह "क्या यह एक झूठ है?" मापने वाला मीटर है)।
  • cwA आपको बताता है कि क्या मॉडल का आत्मविश्वास वास्तव में बेहतर निर्णय लेने में आपकी मदद कर रहा है (यह "क्या यह उपयोगी है?" मापने वाला मीटर है)।

साथ मिलकर, वे एक स्पष्ट तस्वीर प्रदान करते हैं कि क्या एक AI सिस्टम भरोसेमंद है या वह आत्मविश्वास के साथ आपको खाई में गिराने के लिए तैयार खड़ा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →