← नवीनतम पेपर
🤖 machine learning

An Empirical Study into Clustering of Unseen Datasets with Self-Supervised Encoders

यह शोध पत्र अनुभवजन्य रूप से यह प्रदर्शित करता है कि जबकि स्व-पर्यवेक्षित (self-supervised) एनकोडर, पर्यवेक्षित (supervised) एनकोडर्स की तुलना में अनदेखे डेटासेट पर बेहतर सामान्यीकरण करते हैं, उन्हें ImageNet-1k पर फाइन-ट्यून करने से यह लाभ उलट जाता है, और आगे यह स्थापित करता है कि UMAP स्पेस में सिलुएट स्कोर (silhouette score), अनलेबल डेटा पर क्लस्टरिंग प्रदर्शन का मूल्यांकन करने के लिए एक विश्वसनीय प्रॉक्सी के रूप में कार्य करता है।

मूल लेखक: Scott C. Lowe, Joakim Bruslund Haurum, Sageev Oore, Thomas B. Moeslund, Graham W. Taylor

प्रकाशित 2026-09-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Scott C. Lowe, Joakim Bruslund Haurum, Sageev Oore, Thomas B. Moeslund, Graham W. Taylor

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक आर्टिफिशियल इंटेलिजेंस के विशाल परिदृश्य में, एक शक्तिशाली विचार ने जड़ें जमा ली हैं: मशीनें दुनिया को केवल यह सुनकर नहीं सीख सकतीं कि हर चीज़ क्या है, बल्कि केवल लाखों छवियों को खुद देखकर भी सीख सकती हैं। यह दृष्टिकोण, जिसे 'सेल्फ-सुपरवाइज्ड लर्निंग' (स्व-पर्यवेक्षित शिक्षण) के रूप में जाना जाता है, कंप्यूटर को दृश्य पैटर्न का एक मानसिक मानचित्र बनाने की अनुमति देता है—आकृतियों, बनावट और संरचनाओं को पहचानना—बिना किसी इंसान द्वारा हर तस्वीर को नाम दिए बिना। एक बार जब कंप्यूटर इस मानचित्र को बना लेता है, तो इसका उपयोग नई समस्याओं को हल करने के लिए किया जा सकता है, जैसे कि पक्षी के एक विशिष्ट प्रकार की पहचान करना या मेडिकल स्कैन को छाँटना। हालाँकि, एक महत्वपूर्ण प्रश्न बना हुआ है: यदि हम एक ऐसे कंप्यूटर को लें जिसने सामान्य तस्वीरों के एक विशाल पुस्तकालय से सीखा है और उसे छवियों का एक पूरी तरह से नया सेट दे दें जिसे उसने पहले कभी नहीं देखा है, तो क्या वह अभी भी उन्हें समझ पाएगा? क्या वह इन अज्ञात तस्वीरों को एक साथ इस तरह से समूहित कर सकता है जो तार्किक रूप से सही हो, केवल उन पैटर्न को देखकर जो उसने पहले सीखे थे, बिना किसी और प्रशिक्षण के?

शोधकर्ताओं की एक टीम ने इस प्रश्न का उत्तर देने के लिए कंप्यूटर के आंतरिक "मानचित्र" को खोज के एक उपकरण के रूप में उपयोग करते हुए इस पर काम किया। उन्होंने कई अलग-अलग प्रकार के प्री-ट्रेन्ड कंप्यूटर विजन मॉडल लिए—कुछ वे जिन्होंने सही उत्तर बताए जाने पर सीखा, और अन्य वे जिन्होंने डेटा में पैटर्न खोजकर खुद सीखा—और उनसे विविध प्रकार के अनदेखे संग्रहों को छाँटने के लिए कहा। इन संग्रहों में कारों और फूलों जैसी परिचित वस्तुएं से लेकर स्केच, हस्तलिखित नंबर और यहाँ तक कि ट्यूमर ऊतक के सूक्ष्म दृश्यों जैसी अधिक अमूर्त श्रेणियां शामिल थीं। शोधकर्ताओं ने मॉडलों को कुछ भी नया नहीं सिखाया; उन्होंने बस मॉडलों को छवियों को देखने, उन्हें उनके फीचर्स (विशेषताओं) को दर्शाने वाली संख्याओं की एक सूची में बदलने और फिर समान संख्याओं को एक साथ समूहबद्ध करने के लिए मानक सॉर्टिंग एल्गोरिदम का उपयोग करने दिया। लक्ष्य यह देखना था कि क्या कंप्यूटर द्वारा बनाए गए समूह वास्तविक दुनिया की श्रेणियों से मेल खाते हैं, जैसे कि "कुत्ता" या "कार", या कंप्यूटर उन्हें किसी और चीज़ के आधार पर समूहबद्ध कर रहा था, जैसे कि पृष्ठभूमि का रंग या छवि की शैली।

परिणामों ने इन विभिन्न प्रकार के मॉडलों के सोचने के तरीके में एक दिलचस्प विभाजन का खुलासा किया। जब छवियां उन छवियों के समान थीं जिन्हें मॉडलों ने अपने शुरुआती प्रशिक्षण के दौरान देखा था, तो वे मॉडल जिन्होंने वस्तुओं के लिए स्पष्ट रूप से नाम सीखे थे, सबसे अच्छा प्रदर्शन करते थे। वे इन परिचित वस्तुओं को उच्च सटीकता के साथ छाँट सकते थे। हालाँकि, जैसे ही शोधकर्ताओं ने उन छवियों की ओर रुख किया जो प्रशिक्षण डेटा से बहुत भिन्न थीं—जैसे कि रेखाचित्र, पेंटिंग या सूक्ष्म स्लाइड—तो वे मॉडल जिन्होंने खुद से सीखा था, उन मॉडलों से बेहतर प्रदर्शन करने लगे जिन्हें सिखाया गया था। ये स्व-शिक्षित मॉडल पूरी तरह से विदेशी दृश्य दुनियाओं में अंतर्निहित संरचना को खोजने में बेहतर थे। ऐसा प्रतीत होता है कि विशिष्ट वस्तुओं को पहचानने के लिए मनुष्यों द्वारा प्रशिक्षित मॉडल उन विशिष्ट वस्तुओं के विवरणों पर बहुत अधिक केंद्रित हो गए थे, जबकि स्व-शिक्षित मॉडलों ने दृश्य पैटर्न की एक अधिक लचीली समझ विकसित की थी जो संदर्भ बदलने पर भी बनी रहती है।

अध्ययन ने एक आश्चर्यजनक कमजोरी को भी उजागर किया जब स्व-शिक्षित मॉडलों को बाद में विशिष्ट नाम सीखने के लिए मजबूर किया गया। जब शोधकर्ताओं ने स्व-शिक्षित मॉडलों को वस्तुओं के नाम देने का एक संक्षिप्त कोर्स दिया, तो वे परिचित वस्तुओं को छाँटने में उत्कृष्ट हो गए, लेकिन अजीब, विदेशी छवियों को संभालने की उनकी क्षमता वास्तव में खराब हो गई। वे कम लचीले हो गए, और उस गुण को खो दिया जो उन्हें अज्ञात को संभालने में सक्षम बनाता था। यह सुझाव देता है कि एक मॉडल को किसी विशिष्ट कार्य में विशेषज्ञ बनाने से सिखाना इसे एक सामान्य विशेषज्ञ (जनरलिस्ट) कम सक्षम बना सकता है। इसके अलावा, शोधकर्ताओं ने पाया कि स्व-शिक्षित मॉडल पृष्ठभूमि से बहुत आसानी से भ्रमित हो जाते थे। यदि चित्र की पृष्ठभूमि बदल दी जाती थी, तो स्व-शिक्षित मॉडल वस्तु को पहचानने में संघर्ष करते थे, जबकि मानव लेबल वाले मॉडलों ने पृष्ठभूमि को अनदेखा करने और मुख्य विषय पर ध्यान केंद्रित करने में बेहतर प्रदर्शन किया। यह इंगित करता है कि स्व-शिक्षित मॉडल पूरी तस्वीर को एक एकल, अविभाज्य इकाई के रूप में देखते हैं, जबकि सुपरवाइज्ड मॉडल मुख्य विषय को उसके परिवेश से अलग करना सीखते हैं।

इस कार्य की एक सबसे व्यावहारिक खोज यह है कि बिना सही उत्तरों की आवश्यकता के एक मॉडल कितनी अच्छी तरह काम कर रहा है, इसका आकलन करने का एक नया तरीका। आमतौर पर, यह जानने के लिए कि क्या एक कंप्यूटर ने तस्वीरों के ढेर को सही ढंग से छाँटा है, आपको हर फोटो के लिए सही उत्तर जानने की आवश्यकता होती है। शोधकर्ताओं ने पाया कि वे यह अनुमान लगा सकते थे कि छँटाई कितनी अच्छी तरह काम कर रही है, केवल यह देखकर कि समूह एक साथ कितने कसकर पैक किए गए हैं। यदि समान छवियों के समूह एक-दूसरे के बहुत करीब और अन्य समूहों से दूर थे, तो छँटाई के सही होने की संभावना अधिक थी। यह "टाइटनेस" (कसाव) स्कोर विशेष रूप से तब प्रभावी रहा जब छवियों को पहली बार एक निम्न-आयामी स्थान (लोअर-डायमेंशनल स्पेस) में सरल बनाया गया था, एक ऐसी प्रक्रिया जो अनावश्यक शोर को हटा देती है। यह खोज महत्वपूर्ण है क्योंकि इसका अर्थ है कि वैज्ञानिक अब बिना किसी लेबल के भी यह परीक्षण कर सकते हैं कि एक मॉडल नए डेटासेट को कितनी अच्छी तरह समझता है, केवल यह जाँचकर कि डेटा स्वाभाविक रूप से कैसे क्लस्टर (समूहबद्ध) होता है।

शोधकर्ताओं ने यह भी परीक्षण किया कि ये मॉडल उन छवियों को कितनी अच्छी तरह संभाल सकते हैं जिनमें बहुत सूक्ष्म अंतर की आवश्यकता होती है, जैसे कि पक्षियों की विभिन्न प्रजातियों या फूलों की किस्मों के बीच अंतर करना। उन्होंने पाया कि मॉडल आम तौर पर इन अत्यधिक विशिष्ट कार्यों के साथ संघर्ष करते हैं, और "पक्षी" बनाम "फूल" जैसी व्यापक श्रेणियों के साथ बहुत बेहतर प्रदर्शन करते हैं। यह इस विचार के अनुरूप है कि हालांकि ये मॉडल बड़ी तस्वीर देखने में उत्कृष्ट हैं, लेकिन वे अभी तक उन सूक्ष्म विवरणों के लिए स्वाभाविक रूप से उपयुक्त नहीं हैं जो किसी विशिष्ट चीज़ के प्रकार को अलग करते हैं। अध्ययन निष्कर्ष निकालता है कि अज्ञात डेटा को छाँटने के लिए, सबसे अच्छा दृष्टिकोण अक्सर एक स्व-शिक्षित मॉडल का उपयोग करना है जिसे विशिष्ट नाम सीखने के लिए मजबूर नहीं किया गया है, और पैटर्न को स्पष्ट करने के लिए पहले डेटा को सरल बनाना है। यह उन विशाल, बिना लेबल वाली दृश्य दुनिया को व्यवस्थित करने और समझने के लिए कृत्रिम बुद्धिमत्ता का उपयोग करने के लिए एक स्पष्ट मार्ग प्रदान करता है जो उन डेटासेट्स के बाहर मौजूद है जिनका हम प्रशिक्षण के लिए उपयोग करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →