Dimensionality Reduction Meets Network Science: Sensemaking on UMAP's kNN Graph
यह शोध पत्र यह प्रदर्शित करता है कि UMAP द्वारा निर्मित आंतरिक k-निकटतम-पड़ोसी (k-nearest-neighbor) ग्राफ पर पेजरैंक (PageRank), k-कोर अपघटन (k-core decomposition) और क्लस्टरिंग गुणांक विश्लेषण (clustering coefficient analysis) जैसे मानक ग्राफ एल्गोरिदम को लागू करना, उच्च-आयामी डेटा सेंसमेकिंग के लिए एक शक्तिशाली, पूरक दृष्टिकोण प्रदान करता है जो अक्सर विशेष रूप से निर्मित विधियों के बराबर या उनसे बेहतर होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास 60,000 तस्वीरों का एक विशाल, बिखरा हुआ डिब्बा है—कुछ में हाथ से लिखे नंबर हैं, तो कुछ कपड़ों की तस्वीरें हैं जैसे बैग, शर्ट और जूते। आप उनके पैटर्न देखना चाहते हैं, इसलिए आप UMAP नामक एक सुपर-स्मार्ट टूल का उपयोग करते हैं, जो इस 3D (या उससे भी अधिक उच्च-आयामी) अराजकता को एक सपाट 2D कागज पर सिकोड़ देता है।
आमतौर पर, लोग यहीं रुक जाते हैं। वे सुंदर 2D स्कैटर प्लॉट को देखते हैं, बिंदुओं को घूरते हैं, और कहते हैं, "ठीक है, मैं यहाँ बैगों का एक समूह देख सकता हूँ।" लेकिन यह पेपर तर्क देता है कि UMAP वास्तव में उस चित्र को बनाने के क्षण में अपना सबसे अच्छा गुप्त हथियार फेंक देता है।
UMZ को उस कागज पर डेटा को सिकोड़ने से पहले, यह एक छिपा हुआ kNN ग्राफ बनाता है। इस ग्राफ को एक विशाल, अदृश्य दोस्ती का जाल समझें। इस जाल में, हर फोटो के ठीक 15 दोस्त (इसके "k-निकटतम पड़ोसी") होते हैं जिन्हें वह अपने समान मानता है। लेकिन इसमें एक मोड़ है: जबकि हर फोटो 15 दोस्तों को चुनता है, हर फोटो को 15 अन्य लोगों द्वारा चुना नहीं जाता है। कुछ तस्वीरें इतनी अजीब या अनोखी होती हैं कि लगभग कोई भी उन्हें अपना दोस्त नहीं चुनता। अन्य तस्वीरें इतनी "औसत" या "प्रोटोटाइपिकल" होती हैं कि सैकड़ों अन्य तस्वीरें उन्हें अपना सबसे अच्छा मैच मानकर नामांकित करती हैं।
लेखक कहते हैं: "इस जाल को मत फेंको! यह 2D चित्र की तुलना में अधिक ईमानदार है।" उन्होंने इस जाल को बेहतर ढंग से समझने के लिए तीन शानदार तरीके आजमाए।
1. "सबसे लोकप्रिय बच्चा" (PageRank)
प्रश्न: अपने समूह के वास्तविक "प्रतिनिधि" कौन सी तस्वीरें हैं?
पुराना तरीका: लोग आमतौर पर 2D मैप पर एक उभार (blob) के केंद्र के सबसे करीब वाली फोटो चुनते हैं। लेकिन 2D मैप विकृत होता है! एक फैला हुआ उभार एक ऐसा "केंद्र" दिखा सकता है जो वास्तव में किसी वास्तविक फोटो जैसा नहीं दिखता।
नया तरीका: लेखकों ने PageRank नामक एक एल्गोरिदम का उपयोग किया (वही जिसका उपयोग Google वेबसाइटों को रैंक करने के लिए करता है)। इस जाल में, एक फोटो को केवल इसलिए उच्च स्कोर नहीं मिलता क्योंकि बहुत से लोगों ने उसे चुना, बल्कि इसलिए मिलता है क्योंकि अन्य लोकप्रिय फोटो ने उसे चुना।
परिणाम:
- शीर्ष स्कोर वाली तस्वीरें अपने वर्ग के आदर्श, पाठ्यपुस्तक उदाहरणों की तरह दिखीं (जैसे एक क्लासिक "6" या एक मानक मैसेंजर बैग)।
- सबसे कम स्कोर वाली तस्वीरें अजीब, असामान्य थीं।
- प्रमाण: जब उन्होंने पूरे डेटासेट का प्रतिनिधित्व करने के लिए 200 शीर्ष फोटो चुने, तो ये PageRank चयन k-medoids (पुराने तरीके) की तुलना में वर्गों को संतुलित करने में कहीं बेहतर थे। पुराना तरीका बहुत अधिक फोटो उन बिखरे हुए समूहों से चुनता रहा, जबकि PageRank ने एक निष्पक्ष मिश्रण चुना।
- वे कितने आश्वस्त हैं? बहुत। उन्होंने इसे 60,000 छवियों पर चलाया और पाया कि परिणाम तब भी स्थिर रहे जब उन्होंने दोस्तों की संख्या 5 से 100 तक बदली। रैंकिंग लगभग समान रही (सहसंबंध लगभग 0.95)।
2. "कोर बनाम किनारे" (k-Core Decomposition)
प्रश्न: कौन सी तस्वीरें समूह का "हृदय" हैं, और कौन सी बस किनारों पर घूम रही हैं?
पुराना तरीका: HDBSCAN जैसे उपकरण आपको एक सरल लेबल देते हैं: "यह एक बैग है।" लेकिन यह नहीं बताता कि वह बैग एक क्लासिक बैग है या एक अजीब, धुंधला बैग जो परिभाषा में मुश्किल से फिट बैठता है।
नया तरीका: लेखकों ने k-core decomposition का उपयोग किया। कल्पना कीजिए कि आप एक प्याज छील रहे हैं। आप उन फोटो को हटाते रहते हैं जिनके पास सबसे कम नामांकन (कम लोकप्रियता) आते हैं। जो अंत में केंद्र में बचते हैं, वे "कोर" होते हैं।
परिणाम:
- उन्होंने पाया कि "कोर" वाली तस्वीरें सबसे अधिक आत्म-समान और सुसंगत थीं। उदाहरण के लिए, हाथ से लिखे नंबरों की "1" श्रेणी में, कोर केवल पूर्ण "1" ही थे।
- "बैग" श्रेणी में, कोर ने विशिष्ट उप-समूहों को उजागर किया: मैसेंजर बैग, वेस्ट पैक और भारी बनावट वाले बैग। 2D मैप ने केवल "बैग" का एक बड़ा, धुंधला गोला दिखाया, लेकिन ग्राफ ने इसे परतों में खोल दिया।
- प्रमाण: उन्होंने इसकी तुलना HDBSCAN से की। HDBSCAN यह बताने में महान था कि "क्या यह एक बैग है?" लेकिन यह बताने में खराब था कि "यह बैग कितना केंद्रीय है?" ग्राफ पद्धति ने "कोरनेस" का एक क्रमिक पैमाना दिया जो पुराने उपकरणों से छूट गया था।
3. "गुप्त क्लब" (Clustering Coefficient)
प्रश्न: क्या तस्वीरों के छोटे, बहुत ही घनिष्ठ समूह हैं जो बिल्कुल एक जैसे दिखते हैं?
पुराना तरीका: 2D मैप को देखने पर, "6" का एक समूह एक बड़े, ठोस द्रव्यमान की तरह लग सकता है।
नया तरीका: Clustering Coefficient जाल में "त्रिकोणों" की तलाश करता है। यदि फोटो A फोटो B को अपना दोस्त मानता है, और फोटो B फोटो C को अपना दोस्त मानता है, तो क्या फोटो A भी फोटो C को अपना दोस्त मानता है? यदि हाँ, तो वह एक घनिष्ठ समूह (clique) है।
परिणाम:
- इस पद्धति ने तस्वीरों के "माइक्रो-नेबरहुड" को खोज निकाला जो बहुत विशिष्ट शैलियों को साझा करते थे। नंबर "6" के लिए, इसने सूक्ष्म विवरणों के आधार पर समूहों को अलग किया: कुछ का लूप बड़ा था, कुछ झुके हुए थे, कुछ का वक्र विशिष्ट था।
- प्रमाण: उच्चतम "क्लिक-नेस" (clique-ness) वाली शीर्ष 5% तस्वीरों में 98% शुद्धता दर थी (इसका मतलब है कि उनके लगभग सभी पड़ोसी एक ही प्रकार के थे)। यह यादृच्छिक फोटो चुनने की तुलना में बहुत अधिक है।
निचोड़
यह पेपर यह नहीं कहता कि 2D चित्र बेकार है। यह केवल यह कहता है कि यह अधूरा है। दोस्ती के इस छिपे हुए जाल (kNN ग्राफ) को बनाए रखकर और इस पर मानक ग्राफ एल्गोरिदम चलाकर, आप अपने डेटा का बहुत स्पष्ट और अधिक ईमानदार दृश्य प्राप्त करते हैं।
वे कितने आश्वस्त हैं?
उन्होंने परीक्षण के लिए दो विशाल, मानक डेटासेट (MNIST और Fashion MNIST) का उपयोग किया, जिनमें से प्रत्येक में 60,000 छवियां थीं। परिणाम तेज़ थे (एक लैपटॉप पर एक सेकंड से कम समय में चलना) और गणित मौजूदा सर्वोत्तम उपकरणों के विरुद्ध भी खरा उतरा। वे सुझाव देते हैं कि यह दृष्टिकोण अन्य समान उपकरणों के लिए भी काम करता है, लेकिन उन्होंने केवल इन विशिष्ट इमेज सेटों पर ही इसे सिद्ध किया है। वे यह दावा नहीं कर रहे हैं कि यह हर डेटा समस्या को हल कर देता है, लेकिन वे काफी आश्वस्त हैं कि यह केवल 2D बिंदुओं को घूरने की तुलना में "सेंसमेक" (अर्थ निकालने) का एक बहुत बेहतर तरीका है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।