← नवीनतम पेपर
🤖 machine learning

Correcting Performance Estimation Bias in Imbalanced Classification with Minority Subconcepts

यह शोध पत्र प्रेडिक्टेड-वेटेड बैलेंस्ड एक्यूरेसी (pBA) को प्रस्तुत करता है, जो एक व्यावहारिक मूल्यांकन मीट्रिक है जो अनुपलब्ध वास्तविक सबकॉन्सेप्ट लेबल को अनुमानित पोस्टीरियर प्रोबेबिलिटीज (predicted posterior probabilities) से बदलकर असंतुलित वर्गीकरण में प्रदर्शन अनुमान पूर्वाग्रह को कम करता है ताकि विषम उप-जनसंख्याओं (heterogeneous subpopulations) में मॉडल के प्रदर्शन का अधिक स्थिर और व्याख्या योग्य मूल्यांकन प्रदान किया जा सके।

मूल लेखक: Taylor Maxson, Roberto Corizzo, Yaning Wu, Nathalie Japkowicz, Colin Bellinger

प्रकाशित 2026-04-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Taylor Maxson, Roberto Corizzo, Yaning Wu, Nathalie Japkowicz, Colin Bellinger

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ इस शोध पत्र का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी समस्या: "औसत" का झूठ

कल्पना कीजिए कि आप एक नए स्कूल लंच प्रोग्राम का मूल्यांकन करने वाले प्रिंसिपल हैं। आप पूछते हैं, "छात्रों को खाना कैसा लगा?" प्रिंसिपल कहता है, "बहुत अच्छा! औसत रेटिंग 10 में से 9 है।"

सुनने में अच्छा लग रहा है, है ना? लेकिन क्या होगा अगर यह "औसत" एक राज छिपा रहा हो?

  • ग्रुप A (बहुसंख्यक): 90% छात्र साधारण सैंडविच खा रहे हैं। उन्हें यह बहुत पसंद है (10/10)।
  • ग्रुप B (अल्पसंख्यक): 10% छात्रों को नट्स (nuts) से गंभीर एलर्जी है और वे एक विशेष, बेस्वाद, ग्लूटेन-मुक्त भोजन खा रहे हैं। उन्हें यह बिल्कुल पसंद नहीं है (1/10)।

यदि आप केवल औसत देखते हैं, तो प्रोग्राम एक बड़ी सफलता दिखता है (9/10)। लेकिन यदि आप सब-ग्रुप्स (subgroups) को देखते हैं, तो आप देखते हैं कि एलर्जी वाले समूह के लिए यह प्रोग्राम एक आपदा है। "औसत" स्कोर आपको धोखा दे रहा है क्योंकि यह सैंडविच खाने वाले बड़े समूह को एलर्जी से पीड़ित छोटे समूह पर हावी होने देता है।

मशीन लर्निंग में इम्बैलेंस्ड डेटा (Imbalanced Data) के साथ भी ठीक यही होता है।

  • क्लास (Class): "बीमार मरीज़" (अल्पसंख्यक) बनाम "स्वस्थ मरीज़" (बहुसंख्यक)।
  • सब-कॉन्सेप्ट्स (Subconcepts): "बीमार" समूह के भीतर, "फ्लू" (सामान्य) और "दुर्लभ आनुवंशिक विकार" (बहुत दुर्लभ) हो सकते हैं।

यदि किसी डॉक्टर के AI मॉडल की "फ्लू" पर सटीकता 95% है लेकिन "दुर्लभ आनुवंशिक विकार" पर केवल 10% है, तो कुल स्कोर अभी भी बहुत अच्छा दिख सकता है। लेकिन वास्तविक दुनिया में, वह AI उन लोगों को विफल कर रहा है जिन्हें मदद की सबसे अधिक आवश्यकता है। शोध पत्र इसे परफॉरमेंस एस्टीमेशन बायस (Performance Estimation Bias) कहता है।

पुराना तरीका बनाम नया तरीका

पुराना तरीका (अनवेटेड स्कोर - Unweighted Scores):
यह ऐसा है जैसे स्कूल प्रिंसिपल बस औसत ले लेता है। यह मान लेता है कि हर छात्र समान है, चाहे उनकी संख्या कितनी भी हो। डेटा के संदर्भ में, यदि "दुर्लभ बीमारी" आपके टेस्ट डेटा का केवल 1% हिस्सा है, तो कंप्यूटर उसे गलत होने पर शायद ही ध्यान देगा। स्कोर ऊँचा रहता है, जिससे सुरक्षा का एक झूठा अहसास होता है।

पिछला "उपचार" (ट्रू वेट्स - True Weights):
शोधकर्ताओं ने पहले इसे ठीक करने की कोशिश की और कहा, "आइए हम दुर्लभ बीमारी वाले मरीजों को फ्लू वाले मरीजों की तुलना में 100 गुना अधिक महत्व दें।" यह पूरी तरह से काम करता है, लेकिन, इसके लिए आपको एक सुपरपावर की आवश्यकता है: आपको परीक्षण करने से पहले ही यह पता होना चाहिए कि मरीज को वास्तव में कौन सी विशिष्ट बीमारी है। वास्तविक दुनिया में, आपको यह तब तक पता नहीं होता जब तक कि बाद में पता न चल जाए। यह लंच प्रोग्राम को ग्रेड करने के लिए यह जानने जैसा है कि हर छात्र की एलर्जी क्या है, इससे पहले कि वे एक निवाला भी लें।

पेपर का समाधान (प्रेडिक्टेड-वेटेड बैलेंस्ड एक्यूरेसी या "pBA"):
लेखकों ने एक चतुर तरीका निकाला। उन्होंने महसूस किया कि आपको सब-कॉन्सेप्ट को निश्चित रूप से जानने की ज़रूरत नहीं है; आपको बस एक अच्छा अनुमान चाहिए।

  1. ट्रेनिंग चरण (Training Phase): वे एक सहायक AI (एक "सब-कॉन्सेप्ट क्लासिफायर") को अलग-अलग प्रकार के "बीमार" मरीजों (फ्लू बनाम दुर्लभ विकार) को पहचानने के लिए प्रशिक्षित करते हैं, जहाँ लेबल (labels) ज्ञात होते हैं।
  2. टेस्टिंग चरण (Testing Phase): जब कोई नया मरीज आता है, तो मुख्य AI निदान करता है। साथ ही, सहायक AI उस मरीज को देखता है और कहता है, "मुझे 80% यकीन है कि यह फ्लू है, लेकिन 20% संभावना है कि यह दुर्लभ विकार है।"
  3. जादुई गणित (The Magic Math): एक सख्त विकल्प (फ्लू या विकार) चुनने के बजाय, नया तरीका उस 80/20 के अनुमान का उपयोग स्कोर को एडजस्ट करने के लिए करता है।
    • यदि मुख्य AI "फ्लू" को सही पहचानता है, तो उसे सामान्य स्कोर मिलता है।
    • यदि मुख्य AI "दुर्लभ विकार" को गलत पहचानता है, लेकिन सहायक AI अनिश्चित था (शायद उसने सोचा कि यह फ्लू है), तो दंड (penalty) कम होता है।
    • यदि मुख्य AI "दुर्लभ विकार" को गलत पहचानता है और सहायक AI को पूरा विश्वास था कि यह एक दुर्लभ विकार है, तो दंड भारी होता है।

यह एक "सॉफ्ट, अनसर्टेन्टी-अवेयर" (Soft, Uncertainty-Aware) स्कोर बनाता है। यह केवल अंतिम उत्तर को नहीं देखता; यह देखता है कि सिस्टम मरीज के प्रकार के बारे में कितना आश्वस्त था।

यह क्यों मायने रखता है ( "मुझे इसकी परवाह क्यों करनी चाहिए?" )

पेपर ने तीन प्रकार के वास्तविक डेटा पर इसका परीक्षण किया:

  1. टेबुलर डेटा (Tabular Data): जैसे संख्याओं के स्प्रेडशीट (जैसे क्रेडिट स्कोर, वाहन के प्रकार)।
  2. मेडिकल इमेजिंग (Medical Imaging): फेफड़ों के एक्स-रे (फेफड़ों की विभिन्न समस्याओं को देखना)।
  3. टेक्स्ट (Text): हेट स्पीच (नफरत भरे भाषण) का पता लगाना (नफरत भरे भाषणों के विभिन्न प्रकारों को देखना)।

परिणाम:

  • "औसत" स्कोर अक्सर एक झूठ बोलता है। कई मामलों में, मानक स्कोर बहुत अधिक था, लेकिन मॉडल वास्तव में छोटे, दुर्लभ समूहों के लिए विफल हो रहा था।
  • नया स्कोर (pBA) सच बोलता है। जब मॉडल दुर्लभ समूहों में विफल होता है, तो यह स्कोर को कम कर देता है, भले ही टेस्ट सेट ज्यादातर सामान्य मामलों से भरा हो।
  • इसका उद्देश्य स्कोर को कम करना नहीं है। कभी-कभी, यदि दुर्लभ समूह सामान्य मामलों की तुलना में अनुमान लगाने में आसान होते हैं, तो नया स्कोर ऊपर जाता है। यह निराशावादी होने की कोशिश नहीं कर रहा है; यह इस बारे में सटीक होने की कोशिश कर रहा है कि मॉडल वास्तव में कहाँ अच्छा या बुरा है।

निष्कर्ष वाला उदाहरण (Takeaway Analogy)

कल्पना कीजिए कि आप एक टैलेंट शो के जज हैं।

  • पुराना स्कोर: आप हर वोट को गिनते हैं। यदि 900 लोग "गायक" के लिए वोट देते हैं और 10 लोग "जगलर" (Juggler) के लिए, तो गायक 99% समय जीत जाता है। आपको कभी पता नहीं चलेगा कि जगलर वास्तव में बहुत खराब है।
  • पेपर का स्कोर: आप महसूस करते हैं कि जगलर एक "दुर्लभ एक्ट" है। आप दर्शकों से पूछते हैं, "आपको कितना यकीन है कि यह एक जगलर है?"
    • यदि दर्शक भ्रमित हैं (अनिश्चित हैं), तो आप जगलर की गलती के लिए उसे बहुत अधिक दंडित नहीं करते हैं।
    • यदि दर्शक पक्के हैं कि यह एक जगलर है, और जगलर असफल हो जाता है, तो आप उसे बड़ा "F" (फेल) देते हैं।
    • यह एक अधिक निष्पक्ष रिपोर्ट कार्ड देता है जो आपको बताता है: "गायक महान है, लेकिन जगलर को और अभ्यास की आवश्यकता है," भले ही जगलर को केवल 10 वोट मिले हों।

सारांश

यह पेपर AI मॉडल को ग्रेड देने का एक नया तरीका पेश करता है जो "लोकप्रिय" समूहों को "दुर्लभ" समूहों की विफलताओं को छिपाने नहीं देता है। यह एक "अनुमान लगाने" वाली प्रणाली का उपयोग करके ग्रेड को एडजस्ट करता है, यह सुनिश्चित करता है कि यदि कोई AI एक छोटे, महत्वपूर्ण समूह को विफल करता है, तो अंतिम स्कोर उस विफलता को दर्शाता है, जिससे चिकित्सा या सुरक्षा जैसे क्षेत्रों में खतरनाक गलतियों को रोका जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →