← नवीनतम पेपर
🤖 machine learning

Benchmarking non-conformity score functions in conformal prediction

यह शोध पत्र कॉन्फॉर्मल प्रेडिक्शन (conformal prediction) में नॉन-कन्फॉर्मिटी स्कोर फंक्शन्स का एक अवलोकन प्रदान करता है और उनमें संशोधन प्रस्तुत करता है, तथा विशेष रूप से क्लास-इम्बैलेंस्ड (class-imbalanced) स्थितियों के तहत प्रेडिक्शन सेट्स उत्पन्न करने में उनकी प्रभावशीलता को बेंचमार्क करने के लिए एक नवीन मूल्यांकन पद्धति प्रस्तावित करता है।

मूल लेखक: Sol Erika Boman

प्रकाशित 2026-05-26
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sol Erika Boman

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रोज़मर्रा के उदाहरणों का उपयोग करके पेपर का विवरण दिया गया है।

बड़ी तस्वीर: "एक चीज़ का अनुमान लगाने" से "एक सुरक्षित सूची बनाने" तक

कल्पना कीजिए कि आप "जानवर पहचानो" खेल खेल रहे हैं। एक मानक मशीन लर्निंग मॉडल एक आत्मविश्वासी दोस्त की तरह है जो एक तस्वीर की ओर इशारा करता है और कहता है, "यह निश्चित रूप से एक बिल्ली (Cat) है।" कभी-कभी वे सही होते हैं, लेकिन कभी-कभी गलत भी होते हैं, और वे अपनी अनिश्चितता को कभी स्वीकार नहीं करते।

कन्फॉर्मल प्रेडिक्शन (Conformal Prediction) एक अलग दृष्टिकोण है। केवल एक जानवर का अनुमान लगाने के बजाय, मॉडल आपको संभावनाओं की एक सूची (list) देता है। यह कह सकता है, "यह संभवतः एक बिल्ली है, लेकिन यह एक कुत्ता या एक लोमड़ी भी हो सकती है।"

इस पद्धति का जादू एक सुरक्षा जाल (safety net) की गारंटी देना है। यदि आप मॉडल को बताते हैं, "मैं चाहता हूँ कि मैं 95% सुनिश्चित रहूँ कि मेरा उत्तर इस सूची में है," तो मॉडल इस बात को सुनिश्चित करने के लिए अपनी सूची के आकार को समायोजित करेगा कि समय के साथ, वास्तविक जानवर उस सूची के अंदर 95% बार मौजूद रहे।

समस्या: सूची कितनी बड़ी होनी चाहिए?

पेपर एक महत्वपूर्ण प्रश्न पूछता है: हम कैसे तय करें कि सूची में क्या जाना चाहिए?

यदि सूची बहुत छोटी है (जैसे, केवल "बिल्ली"), तो आप वास्तविक उत्तर को चूक सकते हैं। यदि सूची बहुत बड़ी है (जैसे, "बिल्ली, कुत्ता, लोमड़ी, हैम्स्टर, गोल्डफिश"), तो आप सुरक्षित तो हैं, लेकिन सूची बेकार है क्योंकि इसमें सब कुछ शामिल है।

मॉडल द्वारा यह तय करने के लिए कि सूची में क्या रखा जाए, जिस उपकरण का वह उपयोग करता है उसे नॉन-कन्फॉर्मिटी स्कोर (Non-conformity Score) कहा जाता है। इस स्कोर को एक "अजीबोगरीब मीटर" (Weirdness Meter) के रूप में समझें।

  • कम स्कोर (Low Score): डेटा पॉइंट उस क्लास के लिए बहुत सामान्य दिखता है (जैसे, एक रोएँदार तस्वीर बिल्ली की तरह बहुत अधिक दिखती है)।
  • उच्च स्कोर (High Score): डेटा पॉइंट उस क्लास के लिए अजीब या "नॉन-कन्फॉर्मिंग" दिखता है (जैसे, अगर आप बिल्ली कहने की कोशिश कर रहे हैं, तो एक पत्थर की तस्वीर बहुत अजीब लगेगी)।

पेपर का लक्ष्य विभिन्न प्रकार के डेटा (जैसे जानवरों की तस्वीरें) में अलग-अलग प्रकार के "अजीबोगरीब मीटर" का परीक्षण करना था ताकि यह देखा जा सके कि कौन सा सबसे उपयोगी सूची (ऐसी सूचियाँ जो छोटी हैं लेकिन फिर भी सुरक्षित हैं) बनाता है।

परीक्षित किए गए "अजीबोगरीब मीटर" (Weirdness Meters)

लेखकों ने विभिन्न प्रकार के डेटा (जैसे जानवरों की छवियों) में "अजीबोगरीबपन" को मापने के कई तरीकों का परीक्षण किया। यहाँ मुख्य तुलना दी गई है, उपमाओं का उपयोग करते हुए:

  1. लेबल डिस्टेंस (द "टारगेट प्रैक्टिस" मीटर):

    • यह कैसे काम करता है: यह मापता है कि मॉडल का अनुमान "परफेक्ट" उत्तर से कितना दूर है। कल्पना कीजिए कि आप निशाने पर तीर फेंक रहे हैं। यदि तीर बुल्सआई (bullseye) के करीब है, तो स्कोर कम है (अजीब नहीं)। यदि यह दूर है, तो स्कोर अधिक है।
    • पेपर का निष्कर्ष: यह बहुत अच्छा रहा, विशेष रूप से "कोसाइन डिस्टेंस" (Cosine Distance) नामक दूरी मापने के एक विशिष्ट तरीके का उपयोग करते समय (जो केवल कच्ची दूरी के बजाय अनुमान की दिशा को देखता है)।
  2. मार्जिन डिस्टेंस (द "बॉर्डर पेट्रोल" मीटर):

    • यह कैसे काम करता है: परफेक्ट उत्तर से दूरी मापने के बजाय, यह दो उत्तरों के बीच की सीमा (border) से निकटता को मापता है। यदि आप "बिल्ली" और "कुत्ता" के बीच की रेखा पर खड़े हैं, तो आप बहुत भ्रमित हैं (उच्च अजीबोगरीबपन)। यदि आप "बिल्ली" के क्षेत्र में गहराई में हैं, तो आप आश्वस्त हैं (कम अजीबोगरीबपन)।
    • पेपर का निष्कर्ष: यह एक सुपरस्टार परफॉर्मर था, जिसने अक्सर सबसे छोटी और सबसे कुशल सूचियाँ बनाईं, विशेष रूप से प्रतिशत में बदलने से पहले के कच्चे नंबरों को देखते समय।
  3. मीन डिस्टेंस (द "ग्रुप हग" मीटर):

    • यह कैसे काम करता है: यह एक नई तस्वीर की तुलना उस क्लास के लिए पहले देखी गई सभी तस्वीरों के "औसत" (average) से करता है। यदि एक नई बिल्ली की तस्वीर औसत बिल्ली जैसी दिखती है, तो यह एक अच्छा फिट है। यदि यह कुत्ते जैसी दिखती है, तो यह अजीब है।
    • पेपर का निष्कर्ष: यह कई श्रेणियों वाले जटिल डेटासेट्स (जैसे CIFAR100) के लिए सबसे अच्छा तरीका था।
  4. APS/RAPS/SAPS (द "रैंकिंग" मीटर):

    • यह कैसे काम करता है: ये अधिक जटिल तरीके हैं जो उत्तरों की रैंकिंग को देखते हैं। वे कहते हैं, "आइए शीर्ष अनुमान जोड़ें, फिर दूसरा, फिर तीसरा..." जब तक कि हम पर्याप्त सुरक्षित महसूस न करें कि रुक जाएँ। वे सूचियों को बहुत बड़ा होने से रोकने के लिए कुछ गणितीय ट्रिक्स (regularization) जोड़ते हैं।
    • पेपर का निष्कर्ष: ये अच्छे थे, लेकिन अक्सर "डिस्टेंस" मीटर की तुलना में थोड़ी बड़ी सूचियाँ बनाते थे। दिलचस्प बात यह है कि पेपर ने पाया कि इन तरीकों को निष्पक्ष बनाने के लिए जोड़ा गया रैंडम "शोर" (noise) वास्तव में सुरक्षा गारंटी के लिए आवश्यक नहीं था; एक साधारण निश्चित संख्या भी उतना ही अच्छा काम करती थी।
  5. ग्रेडिएंट/फीचर डिस्टेंस (द "डीप डाइव" मीटर):

    • यह कैसे काम करता है: ये केवल अंतिम आउटपुट पर ही नहीं, बल्कि कंप्यूटर के मस्तिष्क के गहरे हिस्सों (फीचर लेयर्स) के अंदर अजीबोगरीबपन को मापने की कोशिश करते हैं।
    • पेपर का निष्कर्ष: ये गणनात्मक रूप से भारी (धीमे) थे और हमेशा सरल तरीकों से बेहतर प्रदर्शन नहीं करते थे।

"अनुचित" परीक्षण: असंतुलित क्लासेस (Imbalanced Classes)

लेखकों ने यह भी परीक्षण किया कि जब डेटा अनुचित हो तो क्या होता है। कल्पना कीजिए कि एक डेटासेट है जहाँ 90% तस्वीरें बिल्लियों की हैं, और केवल 1% बाघों (Tigers) की हैं।

  • चुनौती: मॉडल बिल्लियों को पहचानने में बहुत अच्छा है लेकिन बाघों को पहचानने में बहुत खराब है।
  • परिणाम: जब मॉडल को 95% सुनिश्चित होने के लिए मजबूर किया जाता है, तो यह लगभग हर एक तस्वीर के लिए सूची में "बाघ" को शामिल कर देता है, भले ही तस्वीर स्पष्ट रूप से एक बिल्ली की हो।
  • क्यों? मॉडल बाघों के बारे में इतना अनिश्चित है कि वह सुरक्षित खेलना चाहता है। यह एक सुरक्षा गार्ड की तरह है जो बाघ को मिस करने से इतना डरता है कि वह इमारत में प्रवेश करने वाले हर व्यक्ति को रोक देता है। पेपर नोट करता है कि हालांकि यह भविष्यवाणी को "ईमानदार" बनाता है (यह स्वीकार करता है कि इसे नहीं पता), यह सूची को बहुत बड़ा और सामान्य वस्तुओं के लिए कम उपयोगी बना देता है।

मुख्य निष्कर्ष

  1. कोई एक विजेता नहीं: हर स्थिति के लिए एक भी "सर्वश्रेष्ठ" अजीबोगरीब मीटर नहीं है।
    • सरल कार्यों के लिए, Label Distance या Margin Distance सबसे अच्छा काम करता है।
    • कई श्रेणियों वाले जटिल कार्यों के लिए, Mean Distance चैंपियन था।
  2. दिशा मायने रखती है: Cosine Distance (डेटा की दिशा/कोण को मापना) का उपयोग करना मानक दूरी की तुलना में अक्सर बेहतर था, विशेष रूप से हाई-डायमेंशनल स्पेस (जैसे डीप लर्निंग मॉडल) में।
  3. सादगी की जीत: सबसे जटिल तरीके (जैसे डीप फीचर ग्रेडिएंट्स) जरूरी नहीं कि बेहतर परिणाम दें और वे बहुत धीमे भी थे।
  4. आर्किटेक्चर मायने रखता है: उपयोग किए गए कंप्यूटर मॉडल का प्रकार (जैसे ResNet बनाम EfficientNet) इस बात को बदल देता है कि कौन सा "अजीबोगरीब मीटर" सबसे अच्छा काम करता है, जिससे पता चलता है कि मीटर का चयन आपके विशिष्ट मॉडल के उपयोग पर निर्भर करता है।

संक्षेप में, यह पेपर सुरक्षित AI सूचियाँ बनाने के लिए उपकरणों का एक "मेन्यू" प्रदान करता है। यह दिखाता है कि अपने विशिष्ट समस्या के लिए सही "अजीबोगरीब मीटर" चुनकर, आप सुरक्षा से समझौता किए बिना अपनी भविष्यवाणियों की सूचियों को छोटा और उपयोगी रख सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →