← नवीनतम पेपर
🤖 machine learning

Know Yourself Better: Diverse Object-Related Features Improve Open Set Recognition

यह शोध पत्र ओपन सेट रिकग्निशन (open set recognition) में फीचर डाइवर्सिटी (feature diversity) की भूमिका का विश्लेषण करता है, जो प्रदर्शन के साथ इसके मजबूत सहसंबंध को प्रकट करता है और एक नवीन विधि प्रस्तावित करता है जो विविध डिस्क्रिमिनेटिव फीचर्स (diverse discriminative features) का लाभ उठाकर अत्याधुनिक दृष्टिकोणों से काफी बेहतर प्रदर्शन करती है।

मूल लेखक: Jiawen Xu, Margret Keuper

प्रकाशित 2026-06-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiawen Xu, Margret Keuper

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य समस्या: "अति-आत्मविश्वासी अनुमान"

कल्पना कीजिए कि आप एक क्लब के सुरक्षा गार्ड हैं। आपके पास वीआईपी (VIPs) को पहचानने की एक सूची है (जिन्हें "ज्ञात" क्लासेस कहा जाता है): एलिस, बॉब और चार्ली।

एक रात, एक अजनबी अंदर आता है जो थोड़ा बहुत एलिस जैसा दिखता है। क्योंकि आपकी ट्रेनिंग केवल एलिस, बॉब और चार्ली तक ही सीमित थी, आपका दिमाग जबरदस्ती उसे किसी से मिलाने की कोशिश करता है। आप पूरे आत्मविश्वास के साथ कहते हैं, "यह एलिस है!" भले ही वह वास्तव में एक अजनबी हो। एआई (AI) की दुनिया में, इसे ओपन सेट रिकग्निशन (Open Set Recognition - OSR) कहा जाता है। समस्या यह है कि मानक एआई मॉडल यह कहने में बहुत खराब होते हैं कि, "मुझे नहीं पता कि यह कौन है।" वे बस उस चीज़ का अनुमान लगाते हैं जो उनके ज्ञान के सबसे करीब होती है, और अक्सर 100% आत्मविश्वास के साथ, जो वास्तविक जीवन में खतरनाक हो सकता है।

मूल विचार: सिर्फ एक चीज़ को न देखें

इस शोध पत्र के लेखकों ने एक सरल प्रश्न पूछा: ये मॉडल अजनबियों को पहचानने में क्यों विफल होते हैं?

उन्होंने पाया कि मॉडल बहुत आलसी होते हैं। वे चीजों को पहचानने के लिए केवल एक स्पष्ट विशेषता (feature) का उपयोग करके सीखते हैं।

  • उपमा: कल्पना कीजिए कि आप एक बच्चे को बिल्ली पहचानना सिखा रहे हैं। यदि आप उन्हें केवल नारंगी फर वाली बिल्लियों की तस्वीरें दिखाते हैं, तो बच्चा सीख सकता है कि "नारंगी = बिल्ली"।
  • विफलता: यदि एक तेंदुआ (एक अजनबी) नारंगी कोट पहनकर आता है, तो बच्चा चिल्लाएगा, "यह एक बिल्ली है!" क्योंकि उसने केवल रंग को देखा। उसने कान, पूंछ और धब्बों को अनदेखा कर दिया।

शोध पत्र का तर्क है कि अजनबियों (आउटलेयर्स) को पहचानने के लिए, एक मॉडल को एक साथ कई अलग-अलग विशेषताओं (रंग, आकार, बनावट, आकार) को सीखना होगा, न कि केवल सबसे आसान एक विशेषता को। इसे फीचर डाइवर्सिटी (Feature Diversity) कहा जाता है।

प्रयोग: "आकार बनाम रंग" परीक्षण

इसे साबित करने के लिए, शोधकर्ताओं ने कंप्यूटर के साथ एक सरल खेल खेला:

  1. परिदृश्य A: उन्होंने कंप्यूटर को नीले गोले और लाल आयत दिखाए। कंप्यूटर ने केवल रंग (नीला बनाम लाल) देखकर उन्हें आसानी से अलग करना सीख लिया।
  2. परिदृश्य B: उन्होंने इसमें एक लाल गोला जोड़ दिया। अब, रंग पर्याप्त नहीं था। एक लाल गोले को लाल आयत से अलग करने के लिए, कंप्यूटर को आकार के बारे में भी सीखना अनिवार्य था।

परिणाम: परिदृश्य B वाला कंप्यूटर (जिसने रंग और आकार दोनों सीखे थे) परिदृश्य A वाले कंप्यूटर (जो केवल रंग जानता था) की तुलना में एक "अजनबी" (नीला आयत) को पहचानने में बहुत बेहतर था।

  • सबक: जब एक मॉडल को अपना काम करने के लिए अधिक विविध विशेषताएं सीखने के लिए मजबूर किया जाता है, तो वह उन चीजों को पहचानने में बेहतर हो जाता है जिन्हें वह नहीं जानता।

गुप्त नुस्खा: "तापमान" (Temperature) का नॉब

शोधकर्ताओं ने फिर एक विशिष्ट टूल को देखा जिसका उपयोग एआई को प्रशिक्षित करने के लिए किया जाता है, जिसे सुपरवाइज्ड कॉन्ट्रास्टिव लर्निंग (Supervised Contrastive Learning - SupCon) कहा जाता है। यह टूल एआई को समान चीजों को एक साथ समूह बनाने और अलग चीजों को एक-दूसरे से दूर धकेलने में मदद करता है।

इस टूल के अंदर एक सेटिंग है जिसे टेम्परेचर (Temperature) कहा जाता है (इसे एक वॉल्यूम नॉब या मसालों के स्तर की तरह समझें)।

  • कम तापमान (Low Temperature): एआई बहुत सख्त हो जाता है। यह सबसे कठिन-से-पहचानने योग्य जोड़ों पर तीव्रता से ध्यान केंद्रित करता है। यह कहता है, "मुझे इन दोनों के बीच के सूक्ष्म अंतर खोजने ही होंगे!"
  • उच्च तापमान (High Temperature): एआई अधिक सहज हो जाता है। यह आसान अंतरों पर ध्यान केंद्रित करता है।

खोज: शोधकर्ताओं ने पाया कि अलग-अलग "टेम्परेचर" सेटिंग्स एआई को डेटा को पूरी तरह से अलग तरीकों से देखने के लिए प्रेरित करती हैं।

  • एक मॉडल बिल्ली के फर की बनावट पर ध्यान केंद्रित कर सकता है।
  • दूसरा मॉडल (जो अलग तापमान पर प्रशिक्षित है) उसके कानों के आकार पर ध्यान केंद्रित कर सकता है।

वे एक ही अपराध स्थल को देख रहे दो जासूसों की तरह हैं। जासूस A पदचिह्नों को देखता है; जासूस B उंगलियों के निशान को देखता है। अकेले उनके पास पूरी तस्वीर नहीं है, लेकिन मिलकर, वे केस सुलझा लेते हैं।

समाधान: "टीमवर्क" दृष्टिकोण

चूंकि एक तापमान पर प्रशिक्षित एक एआई मॉडल केवल तस्वीर का एक हिस्सा देखता है, इसलिए लेखकों ने एक सरल समाधान प्रस्तावित किया: एनसेंबल (Ensemble)

एक एआई मॉडल को प्रशिक्षित करने के बजाय, वे तीन मॉडल प्रशिक्षित करते हैं, जिनमें से प्रत्येक में एक अलग "टेम्परेचर" सेटिंग होती है।

  1. मॉडल 1 (लो टेम्प) बारीक विवरणों को देखता है।
  2. मॉडल 2 (मीडियम टेम्प) मध्यम विवरणों को देखता है।
  3. मॉडल 3 (हाई टेम्प) बड़ी तस्वीर को देखता है।

जब कोई नई छवि आती है, तो वे तीनों मॉडलों से उनकी राय मांगते हैं और उत्तरों को मिला देते हैं। क्योंकि वे अलग-अलग कोणों से वस्तु को देख रहे हैं (विभिन्न विशेषताओं का उपयोग कर रहे हैं), वे उन "अजनबियों" को पहचानने में बहुत बेहतर होते जिन्हें एक एकल मॉडल मिस कर देता।

परिणाम

टीम ने मानक इमेज डेटासेट्स (जैसे CIFAR-100 और TinyImageNet) पर इसका परीक्षण किया।

  • परिणाम: उनके "टीमवर्क" दृष्टिकोण ने लगातार अन्य शीर्ष तरीकों को पछाड़ दिया।
  • क्यों? ऐसा इसलिए नहीं था क्योंकि उन्होंने कोई अधिक जटिल एल्गोरिदम का उपयोग किया था। यह केवल इसलिए था क्योंकि उन्होंने अलग-अलग तापमानों का उपयोग करके मॉडलों को विविध प्रकार की विशेषताएं सीखने के लिए मजबूर किया, जिससे अंतिम निर्णय बहुत अधिक मजबूत हो गया।

सारांश

यह शोध पत्र हमें सिखाता है कि अज्ञात को पहचानने के लिए एआई को बेहतर और सुरक्षित बनाने के लिए, हमें केवल इसे एक ट्रिक का मास्टर बनने के लिए प्रशिक्षित नहीं करना चाहिए। हमें इसे एक जनरललिस्ट (generalist) बनाना चाहिए जो कई अलग-अलग विवरणों को नोटिस करता है। विभिन्न सेटिंग्स के साथ प्रशिक्षित मॉडलों की "राय" को मिलाकर, हमें एक ऐसा सिस्टम मिलता है जो अपनी सीमाओं को जानता है और गलत उत्तर देने के लिए आत्मविश्वास के साथ अनुमान लगाने की संभावना बहुत कम रखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →