← नवीनतम पेपर
🤖 machine learning

A Probabilistic Circuit-Induced Pseudo-Metric for Out-of-Distribution Detection

यह शोध पत्र एक नवीन आउट-ऑफ-डिस्ट्रीब्यूशन डिटेक्शन फ्रेमवर्क प्रस्तुत करता है जो एक पदानुक्रमित संभावना वेक्टर (Hierarchical Likelihood Vector) और एक संगत छद्म-मीट्रिक (pseudo-metric) को परिभाषित करने के लिए प्रोबेबिलिस्टिक सर्किट्स की आंतरिक पदानुक्रमित संरचना का लाभ उठाता है, जिससे बिना किसी होल्ड-आउट इन-डिस्ट्रीब्यूशन डेटा की आवश्यकता के अनसुपरवाइज्ड डिटेक्शन और शिफ्ट लोकलाइजेशन सक्षम होता है।

मूल लेखक: Bhumika K, Vidhya S, Narayanan C Krishnan

प्रकाशित 2026-08-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bhumika K, Vidhya S, Narayanan C Krishnan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही विशिष्ट क्लब के सुरक्षा गार्ड हैं। आपका काम यह तय करना है कि किसे अंदर आने देना है और किसे नहीं। आमतौर पर, आपके पास अपने नियमित ग्राहकों (regulars) के दिखने का एक मानसिक विवरण होता है: उनकी लंबाई, उनकी पसंदीदा टोपी, उनके चलने का तरीका। यदि कोई नियॉन रंग के जोकर वाले सूट में आता है, तो आप तुरंत समझ जाते हैं कि वह वहां के लायक नहीं है। लेकिन क्या होगा अगर वह व्यक्ति लगभग किसी नियमित ग्राहक जैसा ही दिखता हो, बस उसकी शर्ट थोड़ी अलग हो? या क्या होगा अगर क्लब इतना बड़ा हो कि आप हर नियमित ग्राहक के हर एक विवरण को याद न रख सकें? यह "आउट-ऑफ-डिस्ट्रीब्यूशन" (OOD) डिटेक्शन की चुनौती है, जो आर्टिफिशियल इंटेलिजेंस की दुनिया में है। यह कंप्यूटर को यह सिखाने का कार्य है कि, "हे, यह डेटा अजीब लग रहा है; यह उस चीज़ से मेल नहीं खाता जो मैंने सीखा था," बिना किसी दूसरी तुलनात्मक सूची की आवश्यकता के।

यह समझने के लिए कि यह पेपर उस समस्या को कैसे हल करता है, हमें उस उपकरण को देखना होगा जिसका वे उपयोग कर रहे हैं: एक "प्रोबेबिलिस्टिक सर्किट" (Probabilistic Circuit)। इसे एक अव्यवस्थित न्यूरल नेटवर्क के रूप में नहीं, बल्कि संभावनाओं के एक विशाल, व्यवस्थित पारिवारिक वृक्ष (family tree) के रूप में सोचें। नीचे, आपके पास सरल तथ्य होते हैं (जैसे "क्या यह पिक्सेल काला है?")। जैसे-जैसे आप पेड़ में ऊपर बढ़ते हैं, इन तथ्यों को बड़े विचारों में जोड़ा जाता है (जैसे "क्या यह एक वृत्त है?")। पेड़ का शीर्ष आपको एक अंतिम स्कोर देता है: "इस तस्वीर के बिल्ली होने की कितनी संभावना है?" पुराने तरीके के साथ समस्या यह है कि सुरक्षा गार्ड (या AI मॉडल) अक्सर केवल पेड़ के शीर्ष पर मौजूद उस अंतिम स्कोर को देखते हैं। वे पेड़ के बीच में मौजूद सभी दिलचस्प विवरणों को अनदेखा कर देते हैं। यह पेपर तर्क देता है कि पूरे पेड़ को देखकर, न कि केवल शीर्ष को, हम "जोकर वाले सूट" को बहुत बेहतर तरीके से पकड़ सकते हैं।

शोधकर्ता, जो भारतीय प्रौद्योगिकी संस्थान पलाकाड में कार्यरत हैं, एक नई विधि पेश करते हैं जिसे Hierarchical Likelihood Vector (HLV) कहा जाता है। केवल AI से, "क्या यह एक बिल्ली है?" पूछने के बजाय (जो एक एकल संख्या देता है), वे AI से उसके पारिवारिक वृक्ष के विभिन्न स्तरों पर कई प्रश्न पूछते हैं। "क्या यह एक वृत्त है?" "क्या यह एक काला पिक्सेल है?" "क्या यह एक विशिष्ट प्रकार का वक्र (curve) है?" वे इन सभी उत्तरों को एक सूची, या एक वेक्टर में एकत्र करते हैं। यह सूची HLV है। यह एक चेकलिस्ट देने जैसा है जिसमें जूतों से लेकर टोपी तक के हर विवरण का विवरण है, न कि केवल एक "नियमित जैसा दिखता है" वाला स्टैम्प।

इस चेकलिस्ट का उपयोग करके, उन्होंने Hierarchical Likelihood Distance (HLD) नामक दूरी मापने का एक नया तरीका बनाया। कल्पना कीजिए कि आपके पास एक "परफेक्ट रेगुलर" की चेकलिस्ट है और एक "नए व्यक्ति" की चेकलिस्ट है। HLD इन दो सूचियों के बीच की दूरी को मापता है। यदि नए व्यक्ति की सूची "परफेक्ट रेगुलर" की सूची से बहुत अलग है, तो दूरी अधिक होती है, और AI को अलार्म बजाने का संकेत मिलता है। इस पेपर की चतुराई यह है कि उन्होंने गणितीय रूप से "परफेक्ट रेगुलर" की चेकलिस्ट को सीधे AI के मस्तिष्क से निकालने का तरीका खोज निकाला है, बिना बाद में तुलना करने के लिए अतिरिक्त फोटो को सहेजने की आवश्यकता के। यह सिस्टम को बहुत कुशल बनाता है और वास्तविक दुनिया में उपयोग के लिए तैयार करता है जहाँ आपके पास अतिरिक्त डेटा उपलब्ध नहीं होता।

जब उन्होंने टैबुलर डेटा (जैसे ग्राहकों की जानकारी वाली स्प्रेडशीट) और हस्तलिखित संख्याओं (MNIST) की छवियों पर इस विचार का परीक्षण किया, तो परिणाम उत्साहजनक थे। अपने सिमुलेशन में, HLV विधि उन पुराने तरीकों की तुलना में "जोकरों" को पकड़ने में बेहतर थी जो केवल पेड़ के शीर्ष को देखते थे। उदाहरण के लिए, टैबुलर डेटासेट पर, जब उन्होंने 100 वस्तुओं के बैचों का परीक्षण किया, तो नए तरीके ने अजीब डेटा को 93% बार पकड़ा, जबकि पुराने तरीके अक्सर 50% या उससे कम पर अटके हुए थे। इससे भी महत्वपूर्ण बात यह है कि नया तरीका अधिक स्थिर था; जब डेटा थोड़ा अस्त-व्यस्त हुआ या जब AI का मॉडल त्रुटिपूर्ण था, तो यह आसानी से भ्रमित नहीं हुआ।

पेपर ने यह भी दिखाया कि यह विधि एक जासूस की तरह कार्य कर सकती है। क्योंकि HLV पेड़ के प्रत्येक नोड (node) का हिसाब रखता है, शोधकर्ता यह देख सकते थे कि चेकलिस्ट में कौन से विशिष्ट प्रश्न अलग थे। यदि AI एक अंक '6' को '0' समझने में भ्रमित था, तो यह विधि उस छवि के ठीक उस हिस्से (मध्य लूप) की ओर इशारा कर सकती थी जिसने समस्या पैदा की। यह "लोकलाइजेशन" (localization) हमें यह समझने में मदद करता है कि AI क्यों सोचता है कि कुछ अजीब है, बजाय इसके कि वह केवल यह जाने कि वह अजीब है।

हालाँकि, लेखक सावधानीपूर्वक नोट करते हैं कि यह सब कुछ हमेशा के लिए हल करने वाला कोई जादुई समाधान नहीं है। उनकी विधि इस बात पर निर्भर करती है कि AI मॉडल एक विशिष्ट प्रकार का "प्रोबेबिलिस्टिक सर्किट" हो जो सुव्यवस्थित और संरचित हो। यदि मॉडल अव्यवस्थित या असंरचित है, तो गणित स्पष्ट रूप से काम नहीं करता है। साथ ही, जबकि यह विधि उस डेटा को पकड़ने में बेहतरीन है जो मॉडल में फिट नहीं बैठता, यदि मॉडल स्वयं वास्तविकता का एक खराब प्रतिनिधित्व है (जैसे बिल्ली की धुंधली फोटो), तो सिस्टम वास्तविक बिल्लियों को भी अजीब बताकर फ्लैग कर सकता है। लेखकों ने पाया कि उच्च-रिज़ॉल्यूशन वाली छवियों (28x28 पिक्सेल) पर, गलत अलार्म की दर बढ़ गई क्योंकि मॉडल हर सूक्ष्म विवरण को पूरी तरह से पकड़ने में संघर्ष कर रहा था।

संक्षेप में, यह पेपर सुझाव देता है कि AI के मस्तिष्क के भीतर की पूरी बातचीत को सुनकर, न कि केवल अंतिम निष्कर्ष को, हम डेटा के लिए बेहतर सुरक्षा प्रणाली बना सकते हैं। यह एक एकल "हाँ/नहीं" निर्णय को एक समृद्ध, बहु-स्तरीय जांच में बदल देता है, जिससे AI उन सूक्ष्म बदलावों को पकड़ पाता है जिन्हें अन्य तरीके मिस कर देते हैं, और वह यह सब बिना किसी बैकअप सूची के कर सकता है। यह AI को अपनी सीमाओं के प्रति अधिक जागरूक बनाने और अप्रत्याशित को पहचानने में अधिक सक्षम बनाने की दिशा में एक कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →