← नवीनतम पेपर
💻 computer science

Unified Multi-Layer Subspace Modeling for Cross-Domain OOD Detection

यह शोध पत्र PRISM को प्रस्तुत करता है, जो एक मॉडल-अज्ञेय (model-agnostic) पोस्ट-हॉक विधि है जो आउट-ऑफ-डिस्ट्रीब्यूशन इनपुट्स का पता लगाने के लिए क्लास-कंडीशनल महलानोबिस डिस्टेंस और रेसिडुअल एनर्जी को संयोजित करके मल्टी-लेयर फीचर्स को एक एकल पदानुक्रमित एम्बेडिंग (hierarchical embedding) में एकीकृत करता है, जिससे एक ही डिफ़ॉल्ट कॉन्फ़िगरेशन और न्यूनतम इन्फरेंस ओवरहेड के साथ स्टेट-ऑफ-द-आर्ट क्रॉस-डोमेन प्रदर्शन प्राप्त होता है।

मूल लेखक: Gerhard Krumpl, Henning Avenhaus, Horst Possegger

प्रकाशित 2026-09-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gerhard Krumpl, Henning Avenhaus, Horst Possegger

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक आर्टिफिशियल इंटेलिजेंस (कृत्रिम बुद्धिमत्ता) पैटर्न पहचानने में असाधारण रूप से कुशल हो गया है। जब इसे बिल्लियों, कुत्तों या कारों की हजारों तस्वीरें दिखाई जाती हैं, तो ये सिस्टम उन विशिष्ट वस्तुओं को उच्च सटीकता के साथ पहचानने के लिए सीख जाते हैं। हालांकि, एक मौलिक खामी बनी हुई है: ये सिस्टम अक्सर अत्यधिक आत्मविश्वासी होते हैं। यदि आप एक प्रशिक्षित बिल्ली-पहचानने वाले सिस्टम को टोस्टर की तस्वीर दिखाते हैं, तो वह केवल यह नहीं कह सकता कि "मुझे नहीं पता।" इसके बजाय, वह आत्मविश्वास से घोषित कर सकता है, "यह एक बहुत ही अजीब बिल्ली है।" ऐसा इसलिए होता है क्योंकि सिस्टम को केवल बिल्लियों पर प्रशिक्षित किया गया था; उसे इस बात का कोई बोध नहीं है कि उसके प्रशिक्षण के दायरे से बाहर क्या है। मेडिकल इमेजिंग या औद्योगिक सुरक्षा जैसे उच्च-जोखम वाले क्षेत्रों में, इस तरह की गलती खतरनाक है। एक ऐसा सिस्टम जो किसी मरीज का गलत निदान आत्मविश्वास के साथ करता है या मशीन के पुर्जे में दरार को इसलिए अनदेखा कर देता है क्योंकि वह मान लेता है कि वह विसंगति किसी ज्ञात वस्तु का ही एक अजीब रूप है, वह शांत और विनाशकारी विफलताओं का कारण बन सकता है। इस क्षेत्र के शोधकर्ताओं का लक्ष्य एक ऐसा सुरक्षा तंत्र बनाना है जो विश्वसनीय रूप से यह पहचान सके कि कोई इनपुट उस श्रेणी का है जिसे सिस्टम ने पहले कभी नहीं देखा है।

वर्षों से, वैज्ञानिक इन न्यूरल नेटवर्क के आंतरिक कामकाज को देखकर इस समस्या को हल करने का प्रयास कर रहे हैं। ये नेटवर्क कई परतों के माध्यम से छवियों को संसाधित करते हैं, जो बिल्कुल प्याज के छिलके उतारने जैसा है। शुरुआती परतें किनारों और रंगों जैसी सरल चीजों का पता लगाती हैं, जबकि गहरी परतें जटिल आकृतियों और वस्तुओं को पहचानती हैं। अज्ञात इनपुट का पता लगाने के लिए अधिकांश मौजूदा तरीके केवल इनमें से एक परत पर निर्भर करते हैं। कुछ केवल नेटवर्क द्वारा लिए गए अंतिम निर्णय को देखते हैं, जबकि अन्य अंतिम चरण से ठीक पहले की विशेषताओं की जांच करते हैं। समस्या यह है कि कोई भी एकल परत हर स्थिति के लिए आदर्श नहीं होती है। कभी-कभी शुरुआती परतें सबसे अच्छे संकेत देती हैं कि कोई छवि अजीब है; अन्य समय में, गहरी परतें अधिक जानकारीपूर्ण होती हैं। चूंकि "सर्वश्रेष्ठ" परत छवि के प्रकार और विशिष्ट समस्या के आधार पर बदलती रहती है, इसलिए केवल एक परत चुनने वाले तरीके नए वातावरण में जाने पर अक्सर विफल हो जाते हैं। अन्य दृष्टिकोण कई परतों से संकेतों को संयोजित करने का प्रयास करते हैं, लेकिन उन्हें आमतौर पर एक अंशांकन (कैलिब्रेशन) चरण की आवश्यकता होती है जहाँ उन्हें उसी अज्ञात डेटा के उदाहरणों का उपयोग करके ट्यून किया जाता है जिसे उन्हें वास्तव में पहचानना चाहिए। यह एक विरोधाभास पैदा करता है: अज्ञात का पता लगाने वाले डिटेक्टर बनाने के लिए, आपको पहले अज्ञात के उदाहरण देखने की आवश्यकता होती है, जो एक सामान्य सुरक्षा उपकरण बनाने के उद्देश्य को ही विफल कर देता है।

एक नए अध्ययन में, शोधकर्ता PRISM नामक एक विधि प्रस्तावित करते हैं जो इन कमियों से बचते हुए पूरे नेटवर्क को अलग-अलग परतों के संग्रह के बजाय एक एकल, एकीकृत प्रणाली के रूप में मानती है। किसी एक परत पर भरोसा करने या कई परतों के स्कोर का औसत निकालने के बजाय, PRISM नेटवर्क के उथले, मध्य और गहरे हिस्सों से जानकारी एक साथ एकत्र करता है। यह इन विभिन्न दृश्यों को एक एकल, व्यापक प्रतिनिधित्व में जोड़ देता है। शोधकर्ता फिर एक सांख्यिकीय तकनीक का उपयोग करके इस संयुक्त स्थान के भीतर "सामान्य" डेटा के आकार का मानचित्रण करते हैं। वे एक मॉडल बनाते हैं कि विशिष्ट, ज्ञात छवियां इन सभी परतों के माध्यम से एक साथ देखे जाने पर कैसी दिखती हैं। जब एक नई छवि आती है, तो सिस्टम दो चीजें जाँचता है। पहला, यह मापता है कि वह छवि उस संयुक्त स्थान के भीतर ज्ञात डेटा के केंद्र से कितनी दूर है। दूसरा, यह जाँचता है कि क्या छवि में ऐसी कोई विशेषताएँ हैं जो उस दिशा की ओर संकेत करती हैं जिसे सिस्टम ने पहले कभी नहीं देखा है, जो अनिवार्य रूप से यह मापता है कि छवि का कितना हिस्सा ज्ञात पैटर्न द्वारा समझाया नहीं जा सकता है।

शोधकर्ताओं ने प्राकृतिक फोटोग्राफ, एमआरआई और एंडोस्कोपिक वीडियो जैसे मेडिकल स्कैन और औद्योगिक निरीक्षण कार्यों सहित विविध वास्तविक दुनिया के परिदृश्यों में इस दृष्टिकोण का परीक्षण किया। उन्होंने PRISM की तुलना बाईस अन्य अत्याधुनिक (स्टेट-ऑफ-द-आर्ट) विधियों से की। परिणामों ने दिखाया कि PRISM ने अन्य सभी को लगातार पछाड़ दिया, और प्रत्येक के लिए विशेष ट्यूनिंग की आवश्यकता के बिना सभी विभिन्न डोमेन में उच्चतम औसत सटीकता प्राप्त की। महत्वपूर्ण रूप से, इसने केवल ज्ञात, "इन-डिस्ट्रीब्यूशन" उदाहरणों का उपयोग करके यह उपलब्धि हासिल की, जिसे अपनी सेटिंग्स को कैलिब्रेट करने के लिए अज्ञात के किसी भी उदाहरण की आवश्यकता नहीं थी। जबकि अन्य विधियाँ चिकित्सा इमेजिंग जैसे किसी एक विशिष्ट क्षेत्र में अच्छा प्रदर्शन करती थीं, वे अक्सर औद्योगिक फोटो या प्राकृतिक दृश्यों को लागू करने में संघर्ष करती थीं। इसके विपरीत, PRISM ने हर जगह मजबूत प्रदर्शन बनाए रखा। अध्ययन में यह भी पाया गया कि यह विधि कंप्यूटर की प्रोसेसिंग गति में लगभग कोई अतिरिक्त समय नहीं जोड़ती है, जिससे यह वास्तविक समय के उपयोग के लिए व्यावहारिक बन जाती है।

इस कार्य का मुख्य निष्कर्ष यह है कि अज्ञात का पता लगाने का सबसे विश्वसनीय तरीका एक एकल "सर्वश्रेष्ठ" परत की तलाश करना या पूर्व-ट्यून किए गए संयोजनों पर भरोसा करना नहीं है, बल्कि नेटवर्क की पूरी गहराई को एक सुसंगत दृश्य में मिलाना है। सभी परतों में एक साथ ज्ञात डेटा की ज्यामिति का मॉडल बनाकर, सिस्टम विभिन्न डेटासेट की विशिष्ट विचित्रताओं के प्रति सुदृढ़ हो जाता है। शोधकर्ताओं ने प्रदर्शित किया है कि यह दृष्टिकोण उन अस्थिर अंशांकन चरणों को समाप्त करता है जो वर्तमान विधियों को परेशान करते हैं। उन्होंने दिखाया कि जब आप यह अनुमान लगाने की कोशिश करना बंद कर देते हैं कि नेटवर्क का कौन सा हिस्सा सबसे महत्वपूर्ण है और इसके बजाय पूरे नेटवर्क को एक साथ बोलने देते हैं, तो आपको एक ऐसा डिटेक्टर मिलता है जो बहुत अधिक सुसंगत और विश्वसनीय है। यह सुझाव देता है कि सुरक्षा-महत्वपूर्ण अनुप्रयोगों के लिए, आगे का रास्ता एकीकृत, बहु-परत मॉडलिंग में निहित है जो डेटा की पूर्ण जटिलता का सम्मान करता है, न कि नेटवर्क के केवल एक हिस्से को देखकर समस्या को सरल बनाने में।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →