On the QUEST for Uncertainty Quantification via Highest Density Regions
यह शोध पत्र QUEST को प्रस्तुत करता है, जो एक नवीन अनिश्चितता परिमाणीकरण ढांचा (uncertainty quantification framework) है जो उच्चतम घनत्व वाले क्षेत्रों के आयतन (volume of highest density regions) के माध्यम से अनिश्चितता को अभिलक्षणित करता है, जो प्रॉपर स्कोरिंग नियमों का एक सैद्धांतिक रूप से सुदृढ़ विकल्प प्रदान करता है जो अखंडता (monotonicity) और अपरिवर्तनीयता (invariance) जैसे प्रमुख अभिगृहितों को संतुष्ट करता है और चयनात्मक भविष्यवाणी बेंचमार्क में मानक मापों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप मौसम की भविष्यवाणी करने की कोशिश कर रहे हैं। आपके पास एक मॉडल है जो कहता है, "कल बारिश होगी।" लेकिन मॉडल कितना आश्वस्त है? क्या वह 99% आश्वस्त है, या वह सिर्फ अंदाज़ा लगा रहा है? मशीन लर्निंग की दुनिया में, इस "कितने आश्वस्त" वाले हिस्से को अनसर्टेन्टी क्वांटिफिकेशन (Uncertainty Quantification - UQ) कहा जाता है।
लंबे समय से, वैज्ञानिक इस अनिश्चितता को मापने के लिए मानक उपकरणों का उपयोग करते आए हैं, जैसे कि हर चीज़ को मापने के लिए एक स्केल (रूलर) का उपयोग करना। लेकिन इस पेपर के लेखक, सैम गोरिंग और उनकी टीम का तर्क है कि कभी-कभी स्केल गलत उपकरण होता है। यदि आप एक जेलीफ़िश की "नरमी" को स्केल से मापने की कोशिश करते हैं, तो आपको एक अजीब नंबर मिलेगा जो वास्तव में यह नहीं बताता कि जेलीफ़िश कैसी है।
यहाँ उनके नए विचार, QUEST का एक सरल विवरण दिया गया है, जो रोजमर्रा के उदाहरणों का उपयोग करता है।
समस्या: "स्केल" हमेशा काम नहीं करता
अधिकांश वर्तमान तरीके औसत (mean) और उस औसत से चीजों के फैलाव (variance) को देखकर अनिश्चितता को मापते हैं।
- उदाहरण: कल्पना कीजिए कि आप लोगों की भीड़ को देख रहे हैं।
- परिदृश्य A (सामान्य): हर कोई एक तंग, व्यवस्थित घेरे में खड़ा है। औसत बिल्कुल बीच में है, और हर कोई इसके करीब है। यहाँ "अनिश्चितता" कम है।
- परिदृश्य B (तिरछा/Skewed): अधिकांश लोग एक तंग घेरे में हैं, लेकिन एक विशाल व्यक्ति 10 मील दूर खड़ा है। भीड़ का "औसत" स्थान अब उस विशाल व्यक्ति की ओर खिंच गया है।
- परिदृश्य C (द्वि-मोडल/Bimodal): आधे लोग बाईं ओर एक घेरे में हैं, और आधे लोग दाईं ओर एक घेरे में हैं, और बीच में एक बड़ा खाली अंतराल है।
पुराने तरीके (जैसे वेरिएंस) यहाँ भ्रमित हो जाते हैं। परिदृश्य B में, वह विशाल व्यक्ति "फैलाव" को बहुत बड़ा बना देता है, जिससे कंप्यूटर सोचता है कि अनिश्चितता बहुत अधिक है, भले ही 99% लोग वास्तव में बहुत अनुमानित हों। परिदृश्य C में, पुराने तरीके कह सकते हैं कि अनिश्चितता अधिक है क्योंकि भीड़ विभाजित है, लेकिन वे गलती से बीच के खाली अंतराल को भी उच्च संभावना दे सकते हैं, जो कि असंभव है।
पेपर का तर्क है कि जब हम सबसे संभावित परिणाम (वह "मोड" या भीड़ का शिखर) खोजना चाहते हैं, तो ये पुराने उपकरण हमें भ्रामक उत्तर देते हैं।
समाधान: QUEST ( "फ्लैशलाइट" विधि)
लेखक एक नया ढांचा प्रस्तावित करते हैं जिसे QUEST (Quantifying Uncertainty via highest dEnSiTy regions) कहा जाता है।
पूरे फैलाव को औसत से मापने के बजाय, QUEST एक अलग सवाल पूछता है: "सबसे संभावित 90% भीड़ को पकड़ने के लिए हमें कितनी जगह की आवश्यकता है?"
- उदाहरण: कल्पना कीजिए कि आपके पास एक फ्लैशलाइट है जो केवल कमरे के सबसे चमकीले हिस्सों (उन क्षेत्रों जहाँ सबसे अधिक लोग हैं) पर चमक सकती है।
- कम अनिश्चितता: यदि भीड़ एक तंग समूह में है, तो आपकी फ्लैशलाइट को 90% लोगों को पकड़ने के लिए एक बहुत छोटा घेरा चाहिए होगा। आपकी रोशनी का "आयतन" (volume) छोटा है।
- उच्च अनिश्चितता: यदि भीड़ एक विशाल मैदान में फैली हुई है, तो 90% लोगों को पकड़ने के लिए आपकी फ्लैशलाइट बहुत बड़ी होनी चाहिए। आपकी रोशनी का "आयतन" बहुत बड़ा है।
QUEST उस फ्लैशलाइट बीम के आकार (आयतन) को मापता है।
- छोटा आयतन = उच्च विश्वास (भीड़ सिमटी हुई है)।
- बड़ा आयतन = कम विश्वास (भीड़ बिखरी हुई है)।
यह अजीब आकृतियों के लिए पूरी तरह से काम करता है। यदि भीड़ दो समूहों में विभाजित है (परिदृश्य C), तो फ्लैशलाइट बस दोनों समूहों पर अलग-अलग चमकती है। यह बीच के खाली अंतराल पर रोशनी बर्बाद नहीं करती है। यह वास्तव में यह बताने का एक अधिक ईमानदार तरीका है कि भविष्यवाणी कितनी अनिश्चित है।
अनिश्चितता के तीन प्रकार
पेपर अनिश्चितता को तीन श्रेणियों में बांटता है, और QUEST उन सभी को मापता है:
- एलियटोरिक अनिश्चितता (Aleatoric Uncertainty - "शोर"): यह दुनिया की स्वाभाविक यादृच्छिकता (randomness) है। भले ही आप मॉडल के बारे में सब कुछ जानते हों, मौसम फिर भी अप्रत्याशित हो सकता है। QUEST इसे "वास्तविक भीड़" के कसाव को देखकर मापता है।
- एपिस्टेमिक अनिश्चितता (Epistemic Uncertainty - "अज्ञानता"): यह वह अनिश्चितता है क्योंकि मॉडल अभी पर्याप्त नहीं जानता है। यह उस छात्र की तरह है जिसने पढ़ाई नहीं की है। QUEST इसे मॉडल के "विश्वासों" के फैलाव को देखकर मापता है। यदि मॉडल बेतरतीब ढंग से अनुमान लगा रहा है, तो "फ्लैशलाइट" बहुत बड़ी है। यदि मॉडल आश्वस्त है, तो फ्लैशलाइट छोटी है।
- कुल अनिश्चितता (Total Uncertainty): यह दोनों का संयोजन है। QUEST प्राकृतिक शोर और मॉडल की अज्ञानता दोनों को एक स्कोर में मिला देता है।
यह क्यों मायने रखता है ("स्वयंसिद्ध नियम" या Axioms)
लेखकों ने केवल एक अच्छा विचार नहीं बनाया; उन्होंने यह साबित किया कि यह नियमों (axiвiums) के एक सेट का पालन करता है जो किसी भी अच्छे अनिश्चितता माप के लिए आवश्यक हैं।
- नियम 1: यदि आप भीड़ को अधिक फैलाते हैं, तो अनिश्चितता बढ़नी चाहिए। (QUEST इसे पास करता है; पुराने तरीके कभी-कभी विफल हो जाते हैं)।
- नियम 2: यदि आप भीड़ को बिना फैलाए बस एक अलग स्थान पर ले जाते हैं, तो अनिश्चितता समान रहनी चाहिए। (QUEST इसे पास करता है; पुराने तरीके कभी-कभी भ्रमित हो जाते हैं)।
- नियम 3: माप कभी भी ऋणात्मक (negative) नहीं होना चाहिए। (QUEST इसे पास करता है; कुछ पुराने गणितीय उपकरण ऋणात्मक संख्या दे सकते हैं, जो "अनिश्चितता" के लिए तर्कहीन है)।
परिणाम
टीम ने जटिल डेटा आकृतियों (तिरछी भीड़, विभाजित भीड़) के साथ कंप्यूटर सिमुलेशन का उपयोग करके पुराने तरीकों (वेरिएंस और एंट्रॉपी) के मुकाबले QUEST का परीक्षण किया।
- परिणाम: QUEST सबसे विश्वसनीय भविष्यवाणियों को चुनने में बेहतर था। जब शोधकर्ताओं ने कंप्यूटर को केवल "सबसे निश्चित" डेटा बिंदुओं पर भविष्यवाणी करने के लिए कहा, तो QUEST ने उन्हें पुराने तरीकों की तुलना में गलतियों से बचने में बहुत बेहतर मदद की, विशेष रूप से जब डेटा अजीब या आउटलेयर्स (outliers) वाला था।
सारांश
संक्षेप में, पेपर कहता है: अनिश्चितता को औसत से किनारों की दूरी मापकर नहीं। बल्कि यह मापकर कि "सबसे संभावित" चीजों को कवर करने के लिए कितनी जगह की आवश्यकता है।
यह कपड़ों के एक बिखरे हुए ढेर के दो सिरों के बीच की दूरी मापने के बजाय, उस टोकरी के आकार को मापने जैसा है जिसमें सबसे साफ और सबसे अच्छी तरह से तह किए गए 90% कपड़े रखे जा सकें। यह यह जानने का एक अधिक मजबूत, तार्किक और "ईमानदार" तरीका है कि आप अपने AI की भविष्यवाणियों पर कितना भरोसा कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।