Never mind the metrics -- what about the uncertainty? Visualising confusion matrix metric distributions
यह शोध पत्र तर्क देता है कि अनुभवजन्य क्लासिफायर प्रदर्शन मेट्रिक्स में निहित पर्याप्त अनिश्चितता अक्सर मॉडल सटीकता में देखे गए अंतरों पर हावी हो जाती है, जो भ्रम मैट्रिक्स (confusion matrix) वितरणों और ROC स्पेस में पोस्टीरियर प्रेडिक्टिव प्रोबेबिलिटीज के नवीन विज़ुअलाइज़ेशन के माध्यम से एक संतुलित दृष्टिकोण की वकालत करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ शोध पत्र "Never Mind the Metrics—What About the Uncertainty?" का सरल, बोलचाल की भाषा में स्पष्टीकरण दिया गया है।
मुख्य विचार: स्कोरकार्ड पर आँख मूँदकर भरोसा न करें
कल्पना कीजिए कि आप एक शूटिंग प्रतियोगिता के जज हैं। एक शूटर 10 में से 9 बार निशाने केंद्र (bullseye) पर लगाता है। दूसरा 10 में से 8 बार। कागज़ पर, पहला शूटर बेहतर दिखता है।
लेकिन क्या होगा अगर पहले शूटर ने कुल केवल 10 शॉट ही लिए हों, जबकि दूसरे शूटर ने 1,000 शॉट लिए हों? पहले शूटर का स्कोर अस्थिर है; हो सकता है कि वह सिर्फ किस्मत से जीत गया हो। दूसरे शूटर का स्कोर ठोस है; हम जानते हैं कि वह वास्तव में कुशल है।
यह शोध पत्र तर्क देता है कि आर्टिफिशियल इंटेलिजेंस (AI) और मशीन लर्निंग की दुनिया में, हम "स्कोर" (परफॉरमेंस मेट्रिक) के प्रति बहुत जुनूनी हैं और "किस्मत के कारक" (अनिश्चितता/uncertainty) पर पर्याप्त ध्यान नहीं दे रहे हैं। लेखक चाहते हैं कि हम इस बात पर बहस करना बंद करें कि कौन सा स्कोर "सबसे अच्छा" है और यह समझने पर ध्यान दें कि हमारे पास उपलब्ध डेटा के आधार पर हम उस स्कोर पर वास्तव में कितना भरोसा कर सकते हैं।
समस्या: "एकल संख्या" का जाल (The "Single Number" Trap)
जब कोई AI चीजों को दो श्रेणियों में बांटने की कोशिश करता है (जैसे "स्पैम" बनाम "स्पैम नहीं"), तो हम कन्फ्यूजन मैट्रिक्स (Confusion Matrix) नामक टूल का उपयोग करते हैं। यह एक सरल तालिका है जो गिनती करती है:
- इसने कितनी बार सही अनुमान लगाया।
- इसने कितनी बार गलत अनुमान लगाया।
वैज्ञानिक फिर इस पूरी तालिका को एक एकल संख्या में बदल देते हैं, जैसे सटीकता (Accuracy) या MCC (Matthews Correlation Coefficient)। AI की संस्कृति सबसे अधिक संख्या के पीछे भागने की है। यदि मॉडल A का स्कोर 0.95 है और मॉडल B का 0.94 है, तो सभी मॉडल A को विजेता घोषित कर देते हैं।
लेखक कहते हैं कि यह खतरनाक है। क्यों? क्योंकि वह एकल संख्या इस तथ्य को छिपा देती है कि डेटा डिस्क्रीट (discrete) (टुकड़ों में) और फाइनाइट (finite) (सीमित) है। आप आधा सही अनुमान नहीं लगा सकते। आपके पास पूर्ण संख्याएँ होती हैं। और चूंकि आपके पास उदाहरणों की संख्या सीमित है, इसलिए आपका स्कोर केवल एक अनुमान है, कोई तथ्य नहीं।
समाधान: "धुंधलेपन" को विज़ुअलाइज़ करना
शोध पत्र उन स्कोर्स के पीछे के "धुंधलेपन" या अनिश्चितता को देखने का एक तरीका पेश करता है। वे दो मुख्य तरीकों का उपयोग करते हैं:
1. 3D टेट्राहेड्रोन (The Confusion Simplex)
कल्पना कीजिए कि AI टेस्ट के सभी संभावित परिणाम एक 3D पिरामिड (टेट्राहेड्रोन) के भीतर बिंदु हैं।
- पिरामिड का प्रत्येक कोना एक विशिष्ट प्रकार के परिणाम (जैसे, सभी सही पॉजिटिव) के लिए एक परफेक्ट स्कोर का प्रतिनिधित्व करता है।
- इस पिरामिड के भीतर हर संभव टेस्ट रिजल्ट एक बिंदु है।
लेखक दिखाते हैं कि फ्लैट 2D चार्ट देखने के बजाय, हम इस 3D आकार को देख सकते हैं। यह हमें देखने में मदद करता है कि जब एक श्रेणी दुर्लभ (class imbalance) होती है, तो डेटा का "आकार" कैसे बदल जाता है। यह ऊपर से नक्शा देखने बनाम 3D टेरेन मॉडल देखने जैसा है; 3D दृश्य आपको उन पहाड़ियों और घाटियों (बारीकियों) को दिखाता है जिन्हें फ्लैट नक्शा छिपा देता है।
2. "संभावनाओं का बादल" (The "Cloud of Possibility")
यह मुख्य योगदान है। लेखक गणित (विशेष रूप से बेयसियन सांख्यिकी) का उपयोग इस प्रश्न का उत्तर देने के लिए करते हैं: "यदि हम नए डेटा के साथ यह परीक्षण फिर से चलाएं, तो हमें क्या स्कोर मिल सकते हैं?"
वे आपको केवल एक स्कोर नहीं देते। वे आपको एक वितरण (distribution) देते—संभावित स्कोर्स का एक बादल।
- छोटा डेटा (Small Data): यदि आपने केवल 20 वस्तुओं पर AI का परीक्षण किया है, तो "बादल" चौड़ा और धुंधला है। AI आज 0.9 स्कोर कर सकता है, लेकिन कल 0.7 कर सकता है। अनिश्चितता अधिक है।
- बड़ा डेटा (Large Data): यदि आप 10,000 वस्तुओं का परीक्षण करते हैं, तो "बादल" सिकुड़कर एक छोटा, तीक्ष्ण बिंदु बन जाता है। स्कोर स्थिर है।
उन्होंने इंटरैक्टिव टूल्स (जैसे डिजिटल ग्राफ जिन्हें आप चला सकते हैं) बनाए हैं ताकि इसे दिखाया जा सके। वे दिखाते हैं कि छोटे डेटासेट के लिए, दो अलग-अलग AI के संभावित स्कोर्स का "बादल" पूरी तरह से ओवरलैप हो सकता है। भले ही एक AI का औसत स्कोर थोड़ा अधिक हो, लेकिन अनिश्चितता इतनी बड़ी है कि आप वास्तव-में यह नहीं कह सकते कि एक दूसरे से बेहतर है।
मुख्य निष्कर्ष: अधिक डेटा, कम ड्रामा
यह शोध पत्र तीन मुख्य बातें बताता है:
- मेट्रिक्स स्मूथ हैं, डेटा चंकी (Chunky) है: परफॉरमेंस स्कोर (जैसे MCC) ग्राफ पर चिकनी रेखाओं की तरह दिखते हैं, लेकिन वास्तविक डेटा पूर्ण संख्याओं से बना होता है (आप 3.5 सही उत्तर नहीं दे सकते)। यह बेमेल स्थिति डेटा में ऐसी "जंप" पैदा करती है जिसे मानक चार्ट छिपा देते हैं।
- अनिश्चितता वास्तविक है: जब आपके पास डेटा कम होता है, या जब कोई एक श्रेणी बहुत दुर्लभ होती है (जैसे दुर्लभ बीमारी का पता लगाना), तो आपका परफॉरमेंस स्कोर अत्यधिक अनिश्चित होता है। 0.8 का स्कोर वास्तव में 0.5 और 0.9 के बीच कहीं भी हो सकता है।
- बहस करना बंद करें, डेटा इकट्ठा करना शुरू करें: लेखक का तर्क है कि वैज्ञानिक इस बात पर बहुत अधिक समय बिताते हैं कि कौन सा मेट्रिक (MCC बनाम F1 बनाम Accuracy) "सर्वश्रेष्ठ" है। वे कहते हैं कि यह एक भटकाव है। अनिश्चितता का असली समाधान बेहतर मेट्रिक चुनना नहीं है; बल्कि अधिक डेटा प्राप्त करना है।
एक रचनात्मक उपमा: मौसम का पूर्वानुमान
AI परफॉरमेंस मेट्रिक को मौसम के पूर्वानुमान की तरह समझें।
- मेट्रिक: "बारिश की 80% संभावना है।"
- अनिश्चितता: यदि मौसम विज्ञानी ने केवल 3 दिनों के मौसम के इतिहास को देखा है, तो यह 80% केवल एक अनुमान है। यह आसानी से 50% या 100% हो सकता है। अनिश्चितता का "बादल" चौड़ा है।
- डेटा: यदि मौसम विज्ञानी ने 100 साल के मौसम के इतिहास को देखा है, तो यह 80% बहुत सटीक है। "बादल" बहुत छोटा और सघन है।
शोध पत्र कहता है: "80%" संख्या "79%" से बेहतर है, इस पर बहस न करें। इसके बजाय पूछें: "उस संख्या तक पहुँचने के लिए आपने कितने वर्षों के मौसम के डेटा का उपयोग किया है?" यदि डेटा कम है, तो संख्या अविश्वसनीय है, चाहे वह कितनी भी प्रभावशाली क्यों न दिखे।
निष्कर्ष
लेखक चाहते हैं कि शोधकर्ता विनम्र रहें। जब आप किसी AI मॉडल का शानदार स्कोर देखें, तो पूछें: "यह स्कोर कितना अनिश्चित है?" यदि डेटासेट छोटा है, तो स्कोर शोर (noisy) भरा होने की संभावना है। यह शोध पत्र इस शोर को विज़ुअलाइज़ करने के उपकरण प्रदान करता है, इस उम्मीद में कि वैज्ञानिक एकल संख्याओं को पूर्ण सत्य मानने के बजाय उन्हें एक अनुमान के रूप में देखना शुरू करेंगे जिसे विश्वसनीय बनाने के लिए अधिक डेटा की आवश्यकता होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।