Multi-view biclustering via non-negative matrix tri-factorisation
यह शोध पत्र ResNMTF का प्रस्ताव करता है, जो नॉन-नेगेटिव मैट्रिक्स ट्राइ-फैक्टरइज़ेशन पर आधारित एक नवीन मल्टी-व्यू बायक्लस्टरिंग विधि है जो क्लस्टर की संख्या के पूर्व ज्ञान की आवश्यकता के बिना विविध दृश्यों (views) में ओवरलैपिंग और गैर-समावेशी बायक्लस्टर्स को स्वचालित रूप से खोजता है, साथ ही मूल्यांकन और हाइपरपैरामीटर ट्यूनिंग के लिए एक नए अंतर्निहित मीट्रिक के रूप में 'बिसिलुएट स्कोर' (bisilhouette score) को भी पेश करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो हजारों संदिग्धों (पंक्तियों/rows) और हजारों सुरागों (स्तंभों/columns) वाले एक विशाल रहस्य को सुलझाने की कोशिश कर रहे हैं। लेकिन यहाँ एक मोड़ है: आप केवल सुरागों की एक सूची नहीं देख रहे हैं। आपके पास एक ही समूह के लोगों का वर्णन करने वाली कई नोटबुक (व्यूज़/views) हैं, लेकिन प्रत्येक नोटबुक एक अलग गवाह द्वारा लिखी गई है जिसका दृष्टिकोण अलग है। एक नोटबुक उनके डीएनए (DNA) को सूचीबद्ध कर सकती है, दूसरी उनकी खरीदारी की आदतों को, और तीसरी उनके सोशल मीडिया पोस्ट को।
यह मल्टी-व्यू डेटा (Multi-View Data) की दुनिया है। समस्या यह है कि हर नोटबुक में मौजूद हर सुराग हर संदिग्ध के लिए उपयोगी नहीं होता है। कुछ सुराग केवल लोगों के एक विशिष्ट समूह के लिए मायने रखते हैं। आपका लक्ष्य इन छिपे हुए समूहों (clusters) और उन्हें परिभाषित करने वाले विशिष्ट सुरागों को एक साथ खोजना है। इसे बाइक्लस्टरिंग (Biclustering) कहा जाता है।
प्रस्तुत शोध पत्र हमें दो मुख्य चीजें प्रदान करता है जो हमारे जैसे जासूसों की मदद करती हैं: एक नया, अधिक स्मार्ट जासूसी उपकरण जिसे ResNMTF कहा जाता है, और हमारे काम को ग्रेड देने का एक नया तरीका जिसे बिसिलहैट स्कोर (Bisilhouette Score) कहा जाता है।
यहाँ सरल शब्दों में इसका विवरण दिया गया है:
1. समस्या: बहुत अधिक शोर, बहुत अधिक दृष्टिकोण
अतीत में, यदि आप डेटा में समूह खोजना चाहते थे, तो आप शायद सभी नोटबुक्स को एक विशाल ढेर में मिला देते थे। लेकिन यह अव्यवस्थित है। यदि एक नोटबुक में केवल इधर-उधर की लिखावट (शोर/noise) है, तो वह पूरे ढेर को खराब कर देती है। या, यदि आप प्रत्येक नोटबुक को अलग-अलग देखते हैं, तो आप उस बड़े चित्र को मिस कर देते हैं जहाँ समूह आपस में मिलते हैं।
मौजूदा उपकरण कठोर नियमपुस्तकों की तरह थे:
- वे अक्सर यह मांग करते थे कि आप शुरू करने से पहले आपको पता हो कि आप कितने समूहों की तलाश कर रहे हैं (जैसे संदिग्धों की संख्या खोजने से पहले ही उनका अनुमान लगाना)।
- उन्हें संघर्ष करना पड़ता था यदि समूह ओवरलैप होते थे (एक संदिग्ध दो गिरोहों का हिस्सा हो सकता है) या यदि कुछ संदिग्ध किसी भी गिरोह के नहीं थे।
- वे इस स्थिति को आसानी से नहीं संभाल पाते थे जहाँ नोटबुक A और नोटबुक B में एक ही लोग साझा होते हैं लेकिन अलग-अलग सुराग, जबकि नोटबुक C में अलग-अलग लोग लेकिन समान सुराग साझा होते हैं।
2. समाधान: ResNMTF (एक लचीला जासूस)
लेखकों ने एक नया तरीका बनाया जिसे ResNMTF (रिस्ट्रिक्टिव नॉन-नेगेटिव मैट्रिक्स ट्राई-फैक्टराइजेशन) कहा जाता है। इसे एक सुपर-स्मार्ट, लचीले जासूसी एजेंट के रूप में सोचें।
"ट्राई-फैक्टर" जादू: कल्पना कीजिए कि आप एक अस्त-व्यस्त कमरे को व्यवस्थित करने की कोशिश कर रहे हैं। केवल वस्तुओं को छांटने के बजाय, आप समस्या को तीन भागों में तोड़ते हैं:
- कमरे में कौन है (पंक्तियाँ/लोग)।
- कमरे में क्या वस्तुएं हैं (स्तंभ/सुराग)।
- वे कैसे एक साथ फिट होते हैं (छिपा हुआ पैटर्न)।
ResNMTF इन तीनों परतों को एक साथ अलग करने के लिए गणित का उपयोग करता है।
"रिस्ट्रिक्टिव" (प्रतिबंधात्मक) महाशक्ति: यह सबसे शानदार हिस्सा है। ResNMTF आपको जासूस को यह बताने की अनुमति देता है: "हे, नोटबुक 1 और नोटबुक 2 एक ही लोगों के बारे में बात कर रही हैं, इसलिए उनके 'कौन' (Who) सूचियों को समान मानें।" या, "नोटबुक 1 और नोटबुक 3 एक ही सुरागों के बारे में बात कर रही हैं, इसलिए उनके 'क्या' (What) सूचियों को समान मानें।"
यह एक ऐसे जासूस की तरह है जो कह सकता है, "ठीक है, मैं जानता हूँ कि इन दो गवाहों ने एक ही कार देखी थी, इसलिए मैं उनके नोट्स को जोड़ दूँगा, लेकिन मैं जानता हूँ कि यह तीसरा गवाह एक अलग कार देख रहा था, इसलिए मैं उन नोट्स को अलग रखूँगा।" यह बिना भ्रमित हुए साझा लोगों या साझा सुरागों के किसी भी मिश्रण को संभालता है।क्रिस्टल बॉल (भविष्यवाणी करने वाले गोले) की आवश्यकता नहीं: पुराने उपकरणों के विपरीत, ResNMTF को यह अनुमान लगाने की आवश्यकता नहीं है कि कितने समूह मौजूद हैं। यह विभिन्न संख्याओं को आज़माता है, जाँचता है कि कौन सा सबसे अधिक तर्कसंगत है, और इसमें एक "कचरा संग्रहकर्ता" (garbage collector) सुविधा भी है। यदि इसे कोई ऐसा समूह मिलता है जो केवल रैंडम शोर (गलत सुराग) जैसा दिखता है, तो यह उसे स्वचालित रूप से बाहर निकाल देता है।
3. ग्रेडिंग सिस्टम: बिसिलहैट स्कोर (Bisilhouette Score)
एक बार जब जासूस समूह खोज लेता है, तो आप कैसे जानेंगे कि उसने कितना अच्छा काम किया है?
- पुराना तरीका (सिलहैट स्कोर): कल्पना कीजिए कि एक कक्षा को ग्रेड दे रहे हैं। पुराना तरीका पूछता था, "छात्र एक साथ कितनी करीब बैठे हैं?" और "वे अगले समूह से कितनी दूर हैं?" लेकिन यह तब विफल हो जाता था जब छात्र एक साथ दो समूहों में बैठे हों (ओवरलैप) या कुछ छात्र अकेले बैठे हों (नॉन-एक्सहॉस्टिव)।
- नया तरीका (बिसिलहैट स्कोर): लेखकों ने इस अव्यवस्थित, ओवरलैपिंग दुनिया के लिए विशेष रूप से एक नया ग्रेडिंग सिस्टम बनाया है।
- यह केवल उन सुरागों का उपयोग करके लोगों के एक समूह को देखता है जो उस विशिष्ट समूह को परिभाषित करते हैं।
- यह पूछता है: "क्या ये लोग इन विशिष्ट सुरागों के आधार पर एक साथ मजबूती से जुड़े हुए हैं, और क्या वे बाकी सभी से स्पष्ट रूप से भिन्न हैं?"
- स्कोर: यह -1 और 1 के बीच एक स्कोर देता है। एक उच्च स्कोर का अर्थ है कि जासूस ने स्पष्ट और सुव्यवस्थित समूह खोजे हैं। कम स्कोर का अर्थ है कि समूह अव्यवस्थित या नकली हैं।
यह स्कोर गेम-चेंजर क्यों है?
यह एक दिशा-सूचक (compass) के रूप में कार्य करता है। चूंकि वास्तविक जीवन में आप "सही" उत्तर नहीं जानते (अनसुपरवाइज्ड लर्निंग), इसलिए आप एक मानक उत्तर कुंजी का उपयोग नहीं कर सकते। बिसिलहैट स्कोर आपको बताता है, "हे, यदि आप इस सेटिंग को बदलते हैं, तो समूह और भी अव्यवस्थित हो जाते हैं। यदि आप इसे इस तरह बदलते हैं, तो वे और अधिक स्पष्ट हो जाते हैं।" यह आपको बिना पहले से उत्तर जाने, सर्वोत्तम परिणाम प्राप्त करने के लिए जासूस की सेटिंग्स को ट्यून करने में मदद करता है।
4. वास्तविक जीवन में यह कैसे काम करता है
लेखकों ने दो प्रकार के मामलों पर इसका परीक्षण किया:
- नकली मामले (सिंथेटिक डेटा): उन्होंने नकली डेटा बनाया जहाँ वे उत्तर जानते थे। ResNMTF ने समूहों को पूरी तरह से खोज लिया, भले ही डेटा शोर से भरा हो या समूह ओवरलैप हो रहे हों। इसने लगातार अन्य प्रसिद्ध जासूसी उपकरणों (जैसे GFA और iSSVD) को पछाड़ दिया।
- वास्तविक मामले:
- समाचार लेख: BBC, Reuters और The Guardian से लेखों को समूहित करना। ResNMTF ने पाया कि "खेल" (Sports) से संबंधित लेख तीनों समाचार पत्रों में एक साथ समूहबद्ध थे, भले ही उपयोग किए गए शब्द थोड़े अलग थे।
- चिकित्सा डेटा (कैंसर और कोशिकाएं): उन्होंने रोगी डेटा (जीन, प्रोटीन, आदि) को देखा। ResNMTF ने विभिन्न प्रकार की कैंसर कोशिकाओं और उन्हें परिभाषित करने वाले विशिष्ट जीन की सफलतापूर्वक पहचान की, भले ही कुछ रोगियों में मिश्रित संकेत या लुप्त डेटा मौजूद था।
निष्कर्ष
यह शोध पत्र हमें जटिल, बहु-स्रोत डेटा में छिपे हुए पैटर्न खोजने के लिए एक नया, लचीला उपकरण (ResNMTF) और उन पैटर्न को मापने के लिए एक नया पैमाना (बिसिलहैट स्कोर) प्रदान करता है।
उपमा:
यदि डेटा में पैटर्न खोजना एक ऐसी अव्यवस्त लाइब्रेरी को व्यवस्थित करने जैसा है जहाँ किताबें अलग-अलग भाषाओं और विषयों में लिखी गई हैं:
- पुराने उपकरण सभी किताबों को एक ही शेल्फ में डालने की कोशिश करते थे या आपसे पूछते थे कि आपको कितने शेल्फ की आवश्यकता है।
- ResNMTF एक ऐसा लाइब्रेरियन है जो लेखक और विषय दोनों के आधार पर एक साथ किताबों को छांट सकता है, यह समझते हुए कि कुछ लेखक अलग-अलग सेक्शन में लिखते हैं, और कुछ विषय अलग-अलग भाषाओं में दिखाई देते हैं।
- बिसिलहैट स्कोर लाइब्रेरियन की चेकलिस्ट है ताकि यह सुनिश्चित किया जा सके कि शेल्फ व्यवस्थित हैं और किताबें वास्तव में वहां होनी चाहिए, बिना किसी मैनेजर को यह बताने की आवश्यकता के कि अंतिम व्यवस्था क्या होनी चाहिए।
यह वैज्ञानिकों और डेटा विश्लेषकों के लिए जटिल डेटा में छिपे हुए सत्यों को खोजने के लिए बहुत आसान बनाता है, बिना किसी भविष्य बताने वाले यंत्र (crystal ball) की सहायता के।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।