← नवीनतम पेपर
💻 computer science

SphOR: A Representation Learning Perspective on Open-set Recognition for Identifying Unknown Classes in Deep Learning Models

यह शोध पत्र SpHOR का प्रस्ताव करता है, जो एक नवीन ओपन-सेट रिकग्निशन फ्रेमवर्क है जो ऑर्थोगोनल लेबल एम्बेडिंग्स, स्फेरिकल कंस्ट्रेंट्स और लेबल स्मूथिंग के साथ एकीकृत मिक्सअप के माध्यम से फीचर रिप्रेजेंटेशन लर्निंग को बढ़ाता है, और अज्ञात वर्गों को बेहतर ढंग से अलग करने के लिए फीचर स्पेस को स्पष्ट रूप से आकार देकर अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Nadarasar Bahavan, Sachith Seneviratne, Saman Halgamuge

प्रकाशित 2026-02-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nadarasar Bahavan, Sachith Seneviratne, Saman Halgamuge

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही विशिष्ट क्लब के सुरक्षा गार्ड हैं। आपका काम आईडी (ID) चेक करना है। आपके पास 100 विशिष्ट नामों (जिन्हें "ज्ञात वर्ग" या Known Classes कहा जाता है) की एक सूची है जिन्हें अंदर आने की अनुमति है।

समस्या: "परिचितता का जाल" (The Familiarity Trap)
पुराने दिनों में, यदि कोई अजनबी बिना आईडी के सामने आ जाता जिसका नाम आपकी सूची में नहीं होता, तो गार्ड घबरा जाता था। वे शायद अजनबी के चेहरे को देखते, देखते कि उसकी नाक और आँखें किसी ज्ञात सदस्य से कुछ हद तक मिलती-जुलती हैं, और कहते, "ओह, यह ज़रूर बॉब होगा!" और उसे अंदर जाने देते। यह एक गलती है। AI में, इसे "परिचितता का जाल" (Familiarity Trap) कहा जाता है। AI उन चीजों के बारे में बहुत अधिक आत्मविश्वासी हो जाता है जिन्हें वह वास्तव में नहीं जानता क्योंकि वह केवल सामान्य समानताओं (जैसे "नाक होना") को देख रहा होता है न कि विशिष्ट विवरणों को।

साथ ही, अधिकांश AI गार्ड सभी को 100 स्लॉट्स में से किसी एक में फिट करने के लिए प्रशिक्षित होते हैं। यदि कोई नया व्यक्ति आता है, तो AI उन्हें निकटतम स्लॉट में जबरन फिट कर देता है, भले ही वे वहां फिट न बैठते हों।

समाधान: SpHOR (एक "स्मार्ट गार्ड")
यह पेपर एक नई विधि पेश करता है जिसे SpHOR कहा जाता है। केवल चेहरों को पहचानने के लिए गार्ड को प्रशिक्षित करने के बजाय, SpHOR इस बात को बदल देता है कि गार्ड क्लब के मानसिक मानचित्र (mental map) को कैसे व्यवस्थित करता है। यह सुनिश्चित करने के लिए कि AI को पता हो कि कौन जाना चाहिए और कौन नहीं, यह तीन चतुर तरीकों का उपयोग करता है।

यहाँ बताया गया है कि SpHOR कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करके:

1. "ऑर्थोगोनल" नियम (कमरों को अलग करना)

कल्पना कीजिए कि क्लब में एक विशाल बॉलरूम है। पुराने सिस्टम में, सभी 100 वीआईपी केंद्र में भीड़ लगाए हुए थे, एक-दूसरे से टकरा रहे थे।
SpHOR की ट्रिक: यह प्रत्येक वीआईपी समूह को उनके अपने अलग, गैर-अतिव्यापी (non-overlapping) गलियारे में धकेलता है।

  • उपमा: सोचिए कि गलियारे एक-दूसरे से बिल्कुल 90-डिग्री के कोण पर हैं (जैसे कमरे का कोना)। यदि आप "बिल्ली" वाले गलियारे में हैं, तो आप "कुत्ते" वाले गलियारे से शारीरिक रूप से बहुत दूर हैं।
  • यह कैसे मदद करता है: यदि कोई अजनबी अंदर आता है, तो वह केवल इसलिए "बिल्ली" वाले गलियारे में नहीं पहुँच जाएगा क्योंकि उसके शरीर पर बाल हैं। वह गलियारों के बीच के खाली स्थान में होगा, जिसे गार्ड तुरंत "अज्ञात" के रूप में पहचान लेगा।

2. "स्फेरिकल" बाधा (ग्लोब/गोला)

आमतौर पर, AI डेटा को कागज की एक सपाट शीट पर मैप करता है (यूक्लिडियन स्पेस)। एक सपाट शीट पर, आप गोलों को और अधिक दूर तक खींचते जा सकते हैं, और उनके पास कभी जगह खत्म नहीं होती। इससे यह बताना मुश्किल हो जाता है कि "ज्ञात" क्षेत्र कहाँ समाप्त होता है और "अज्ञात" क्षेत्र कहाँ शुरू होता है।
SpHOR की ट्रिक: यह सभी डेटा को एक ग्लोब (एक गोले) की सतह पर रखने के लिए मजबूर करता है।

  • उपमा: कल्पना कीजिए कि सभी वीआईपी एक बास्केटबॉल पर चिपके हुए स्टिकर हैं। वे गेंद के ऊपर ही रह सकते हैं। उन्हें गेंद की सतह पर ही रहना होगा।
  • यह कैसे मदद करता है: एक गोले पर, सीमित स्थान होता है। यदि आप एक नया स्टिकर (एक अज्ञात वर्ग) गेंद पर लगाने की कोशिश करते हैं, तो उसे मौजूदा समूहों के बीच जगह बनानी होगी। यदि वह किसी क्लस्टर में ठीक से फिट नहीं बैठता है, तो गार्ड उसे एक बाहरी व्यक्ति के रूप में देखता है। यह एक प्राकृतिक "सीमा" बनाता है कि क्या ज्ञात है।

3. "मिक्सअप" और "स्मूथिंग" प्रशिक्षण (अभ्यास ड्रिल)

गार्ड को बेहतर बनाने के लिए, SpHOR केवल उन्हें बिल्लियों या कुत्तों की स्पष्ट तस्वीरें नहीं दिखाता है।

  • मिक्सअप (Mixup): गार्ड को एक ऐसी फोटो दिखाई जाती है जो 50% बिल्ली और 50% कुत्ते की है। गार्ड को यह सीखना होता है कि यह "आधी-बिल्ली-आधी-कुत्ता" वाली चीज़ किसी भी समूह में पूरी तरह से नहीं आती है। यह गार्ड को विनम्र होना सिखाता है और यह स्वीकार करना सिखाता है कि, "यह अजीब है, यह पूरी तरह से बिल्ली नहीं है।"
  • लेबल स्मूथिंग (Label Smoothing): गार्ड को यह बताने के बजाय कि, "यह 100% बिल्ली है," गार्ड को बताया जाता है, "यह ज्यादातर एक बिल्ली है, लेकिन शायद थोड़ा सा कुछ और भी हो सकता है।"
  • यह कैसे मदद करता है: यह गार्ड को अत्यधिक आत्मविश्वासी होने से रोकता है। यह AI को सिखाता है कि दुनिया अव्यवस्थित है। जब वास्तव में कोई अज्ञात अजनबी आता है, तो AI के "बिल्ली" के बॉक्स में जबरदस्ती फिट करने की संभावना कम होती है और "मुझे नहीं पता कि यह क्या है" कहने की संभावना अधिक होती है।

परिणाम: एक बेहतर सुरक्षा प्रणाली

पेपर ने इस "SpHOR" गार्ड का परीक्षण कई कठिन परीक्षणों (जैसे पक्षियों की बहुत समान प्रजातियों या कारों के मॉडल के बीच अंतर करना) पर अन्य गार्डों के विरुद्ध किया।

  • पुराने गार्ड: अक्सर नए पक्षियों को पुराने पक्षियों के साथ भ्रमित कर देते थे, या उन अजनबियों से धोखा खा जाते थे जो थोड़े परिचित दिखते थे।
  • SpHOR गार्ड: क्योंकि इसने अपने मानसिक मानचित्र को एक गोले पर अलग-अलग, गैर-अतिव्यापी कमरों में व्यवस्थित किया था, और क्योंकि इसने "मिश्रित" उदाहरणों के साथ अभ्यास किया था, यह गलत अनुमान लगाने के बजाय, "मैं इसे नहीं जानता" कहने में बहुत बेहतर था।

संक्षेप में:
SpHOR चीजों को पहचानने के लिए AI को सिखाने का एक नया तरीका है। केवल चेहरों को याद करने के बजाय, यह इसकी स्मृति को एक संरचित, गोलाकार मानचित्र में अलग-अलग कमरों के साथ व्यवस्थित करता है। यह भ्रमित करने वाले उदाहरणों के साथ अभ्यास भी करता है ताकि यह अत्यधिक आत्मविश्वासी न हो जाए। यह इसे बिना गलती किए अजनबियों (अज्ञात वर्गों) को पहचानने में बहुत बेहतर बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →