← नवीनतम पेपर
💻 computer science

Quantile Adaptive Temperature Scaling for Confidence Calibration

यह शोध पत्र क्वांटटाइल एडेप्टिव टेम्परेचर स्केलिंग (QaTS) को प्रस्तुत करता है, जो एक पोस्ट-हॉक कैलिब्रेशन विधि है जो विषम मिसकैलिब्रेशन को प्रभावी ढंग से संबोधित करने और विविध परिदृश्यों में मौजूदा अत्याधुनिक तकनीकों से बेहतर प्रदर्शन करने के लिए भविष्यवाणी आत्मविश्वास क्वांटटाइल के आधार पर तापमान को गतिशील रूप से समायोजित करती है।

मूल लेखक: Omprakash Chakraborty, Leo Fillioux, Ismail Ben Ayed, Jose Dolz

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Omprakash Chakraborty, Leo Fillioux, Ismail Ben Ayed, Jose Dolz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

समस्या: अति-आत्मविश्वासी छात्र (The Overconfident Student)

कल्पना कीजिए कि एक डीप लर्निंग मॉडल (एक AI) एक परीक्षा दे रहा एक बहुत ही बुद्धिमान छात्र है। यह छात्र सही उत्तर देने में बहुत अच्छा है, लेकिन उसकी एक बुरी आदत है: वह हमेशा अति-आत्मविश्वासी रहता है।

भले ही छात्र केवल अनुमान लगा रहा हो, वह कहता है, "मुझे 99% यकीन है कि यही सही उत्तर है!" लेकिन अक्सर, वह गलत होता है। वास्तविक दुनिया में (जैसे स्वास्थ्य सेवा या सेल्फ-ड्राइविंग कारों में), यह खतरनाक है। यदि किसी डॉक्टर के AI का कहना है, "मुझे 99% यकीन है कि यह एक ट्यूमर है," लेकिन वास्तव में वह एक हानिरहित तिल है, तो मरीज को अनावश्यक सर्जरी से गुजरना पड़ सकता है।

हमें AI को यह सिखाने के तरीके की आवश्यकता है कि जब वह वास्तव में अनुमान लगा रहा हो तो कहे, "मुझे केवल 60% यकीन है," और जब वह वास्तव में आश्वस्त हो तो कहे, "मुझे 95% यकीन है।" इस प्रक्रिया को कैलिब्रेशन (Calibration) कहा जाता है।

पुराना समाधान: "एक ही आकार के लिए उपयुक्त" थर्मोस्टेट (The "One-Size-Fits-All" Thermostat)

इस अति-आत्मविश्वास को ठीक करने का एक लंबे समय से मानक तरीका टेम्परेचर स्केलिंग (Temperature Scaling - TS) नामक एक विधि रही है।

AI के आत्मविश्वास स्कोर को कमरे के तापमान के रूप में सोचें।

  • यदि कमरा बहुत गर्म है (AI बहुत अधिक आत्मविश्वासी है), तो आप थर्मोस्टेट को कम कर देते हैं।
  • यदि कमरा बहुत ठंडा है, तो आप इसे बढ़ा देते हैं।

पुराना तरीका एक सिंगल, ग्लोबल थर्मोस्टेट का उपयोग करता था। यह पूरे घर को देखता था और कहता, "ठीक है, हर कोई बहुत गर्म है, इसलिए मैं हर एक कमरे के लिए तापमान समान मात्रा में कम कर दूँगा।"

खामी: यह अच्छी तरह से काम नहीं करता क्योंकि "कमरे" (AI के अनुमान) अलग-अलग होते हैं।

  • कुछ अनुमान बहुत गलत और अति-आत्मविश्वासी होते हैं (वे "गर्म" कमरे)।
  • कुछ अनुमान वास्तव में काफी सटीक होते हैं और उन्हें केवल थोड़े से सुधार की आवश्यकता होती है।
  • कुछ अनुमान बीच के स्तर पर होते हैं।

सभी पर एक ही सुधार लागू करके, पुराना तरीका अक्सर आसान समस्याओं को ठीक कर देता है लेकिन सबसे कठिन, खतरनाक त्रुटियों को अनसुधारित छोड़ देता है। यह एक जलती हुई रसोई और एक गुनगुने लिविंग रूम दोनों को ठंडा करने के लिए बर्फ के पानी की बिल्कुल समान मात्रा का उपयोग करने जैसा है।

नया समाधान: QaTS (द "स्मार्ट, कस्टमाइज्ड" थर्मोस्टेट)

लेखक एक नई विधि पेश करते हैं जिसे क्वांटाइल-एडेप्टिव टेम्परेचर स्केलिंग (Quantile-Adaptive Temperature Scaling - QaTS) कहा जाता है।

कच्चे आत्मविश्वास स्कोर (जैसे, "99%") को देखने के बजाय, QaTS यह देखता है कि वह स्कोर अन्य सभी भविष्यवाणियों की तुलना में कहाँ रैंक करता है। इसे क्वांटाइल (Quantile) कहा जाता है।

उपमा: दौड़ (The Analogy: The Race)
कल्पना कीजिए कि AI अपने ही खिलाफ एक दौड़ दौड़ रहा है।

  1. पुराना तरीका: यह धावक की गति (आत्मविश्वास स्कोर) को देखता है और सभी को 5 mph धीमी करने के लिए कहता है।
  2. QaTS का तरीका: यह धावक की दौड़ में स्थिति को देखता है।
    • "आप धावकों के निचले 10% में हैं (वे जो सबसे अधिक भ्रमित और अति-आत्मविश्वासी हैं)। आपको एक बड़ा धीमा होना पड़ेगा।"
    • "आप शीर्ष 10% में हैं (वे जो आमतौर पर सही होते हैं)। आपको केवल एक मामूली समायोजन की आवश्यकता है।"
    • "आप बीच में हैं? आपको मध्यम समायोजन मिलेगा।"

QaTS प्रत्येक एकल भविष्यवाणी के लिए उसके रैंक के आधार पर एक कस्टम तापमान बनाता है। यह समझता है कि सबसे बड़ी गलतियाँ विशिष्ट "ज़ोन" (zones) में होती हैं और उन ज़ोन को विशेष रूप से लक्षित करता है।

यह एक बड़ी बात क्यों है

पेपर दिखाता है कि यह "रैंक-आधारित" दृष्टिकोण पुराने "स्कोर-आधारित" दृष्टिकोण की तुलना में बहुत स्मार्ट है, जिसके तीन मुख्य कारण हैं:

  1. यह वास्तविक समस्याओं को लक्षित करता है: सबसे बड़ी त्रुटियां आमतौर पर विशिष्ट समूहों में होती हैं (जैसे, जब AI दुर्लभ वस्तुओं पर अनुमान लगा रहा होता है)। QaTS इन समूहों को ढूंढता है और उन्हें ठीक करता है, जबकि पुराना तरीका उन्हें मिस कर देता है।
  2. यह "अराजकता" में भी जीवित रहता है (डिस्ट्रीब्यूशन शिफ्ट): कल्पना कीजिए कि AI को धूप वाले दिनों के लिए प्रशिक्षित किया गया है लेकिन उसे बारिश वाले दिनों में काम करना पड़ता है। मौसम अलग होने के कारण कच्चे नंबर (आत्मविश्वास स्कोर) बहुत बदल सकते हैं। हालांकि, रैंकिंग आमतौर पर वही रहती है (AI अभी भी उन्हीं चीजों के बारे में सबसे अधिक आश्वस्त है, बस अलग नंबरों के साथ)। क्योंकि QaTS रैंकिंग (कौन #1 है, #2 है, #3 है) पर निर्भर करता है न कि कच्चे नंबरों पर, यह वातावरण बदलने पर भी पूरी तरह से काम करता रहता है।
  3. यह AI को नहीं तोड़ता: कुछ अन्य विधियाँ आत्मविश्वास को ठीक करने के लिए AI के वास्तविक उत्तरों को बदलने की कोशिश करती हैं (जिससे वे कम सटीक हो सकते हैं)। QaTS एक "पोस्ट-प्रोसेसिंग" फ़िल्टर की तरह है। यह आत्मविश्वास के नंबरों को ठीक करता है, बिना उत्तरों को बदले। AI अभी भी सही उत्तर चुनता है; वह बस यह स्वीकार करता है, "मैं अब इस पर 100% निश्चित नहीं हूँ।"

परिणाम

लेखकों ने कई अलग-अलग कार्यों पर इसका परीक्षण किया:

  • मानक चित्र: बिल्लियों और कुत्तों को पहचानना।
  • लॉन्ग-टेल्ड डेटा (Long-Tailed Data): दुर्लभ जानवरों को पहचानना (जहाँ AI आमतौर पर बहुत भ्रमित होता है)।
  • मेडिकल इमेज: एक्स-रे का विश्लेषण करना।
  • टेक्स्ट: समाचार लेखों को समझना।
  • करप्टेड डेटा: शोर (noise), धुंधलापन या कोहरे वाली छवियां।

लगभग हर एक परीक्षण में, QaTS ने पिछले सर्वोत्तम तरीकों की तुलना में AI के आत्मविश्वास अनुमानों को बहुत अधिक विश्वसनीय बना दिया। इसने "एक्सपेक्टेड कैलिब्रेशन एरर" (यह मापने का पैमाना कि आत्मविश्वास कितना गलत है) को काफी कम कर दिया, विशेष रूप से उन कठिन स्थितियों में जहाँ अन्य तरीके विफल रहे।

सारांश

पेपर तर्क देता है कि हमें सभी AI भविष्यवाणियों के साथ एक जैसा व्यवहार नहीं करना चाहिए। जिस तरह एक शिक्षक एक संघर्षरत छात्र और एक प्रतिभाशाली छात्र को एक ही होमवर्क नहीं देगा, उसी तरह हमें हर AI भविष्यवाणी पर एक ही आत्मविश्वास सुधार लागू नहीं करना चाहिए।

QaTS एक सरल, कुशल उपकरण है जो यह देखता है कि एक भविष्यवाणी दूसरों की तुलना में कैसे रैंक करती है और उसके लिए एक कस्टम "कॉन्फिडेंस करेक्शन" लागू करता है। यह AI सिस्टम को अधिक सुरक्षित और भरोसेमंद बनाता है, खासकर जब वे कठिन या असामान्य स्थितियों का सामना कर रहे होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →