Canonical Correlation Analysis as Reduced Rank Regression in High Dimensions
यह शोध पत्र उच्च-आयामी कैनोनिकल कोरिलेशन एनालिसिस (canonical correlation analysis) के लिए एक गणनात्मक रूप से कुशल और सटीक विधि प्रस्तावित करता है, जो इस समस्या को रिड्यूस्ड रैंक रिग्रेशन (reduced rank regression) के रूप में पुनर्गठित करके मौजूदा स्पार्स दृष्टिकोणों की स्केलेबिलिटी और अनुकूलन क्षमता की सीमाओं को दूर करने के लिए स्थापित उच्च-आयामी रिग्रेशन तकनीकों का लाभ उठाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आधुनिक विज्ञान के विशाल परिदृश्य में, शोधकर्ता तेजी से एक विचित्र समस्या का सामना कर रहे हैं: उनके पास प्रेक्षणों (observations) की तुलना में चरों (variables) की संख्या अधिक है। कल्पना कीजिए कि एक जीवविज्ञानी एक अकेले रोग का अध्ययन कर रहा है जो रोगी के रक्त में हजारों जीन को माप सकता है, लेकिन अध्ययन करने के लिए केवल कुछ दर्जन रोगी ही मिल सकते हैं। या एक जलवायु वैज्ञानिक हजारों बिंदुओं पर वैश्विक महासागरीय तापमान को ट्रैक कर रहा है, फिर भी उन्हें कुछ ही मौसम पैटर्न से जोड़ने की कोशिश कर रहा है। इन स्थितियों में, दो डेटा सेटों के बीच संबंध खोजने के लिए उपयोग किए जाने वाले मानक गणितीय उपकरण अक्सर विफल हो जाते हैं। वे सूचना की विशाल मात्रा से अभिभूत हो जाते हैं, जिससे ऐसे परिणाम निकलते हैं जो गणितीय रूप से अस्थिर या व्याख्या करने में असंभव होते हैं। चुनौती अप्रासंगिक डेटा के समुद्र में खो जाने के बजाय छिपे हुए कुछ वास्तविक संकेतों को खोजने की है।
यह उस नए अध्ययन का केंद्रीय पहेली है जो 'जर्नल ऑफ मशीन लर्निंग रिसर्च' में प्रकाशित हुआ है। शोधकर्ताओं, क्लेयर डोनेट और एलेना टुचिलिना ने 'कैनोनिकल कोरिलेशन एनालिसिस' नामक एक क्लासिक सांख्यिकीय तकनीक के लिए एक नया दृष्टिकोण विकसित किया है। यह विधि दो अलग-अलग मापों के बीच सबसे मजबूत संबंधों को खोजने के लिए डिज़ाइन की गई है, जैसे कि किसी व्यक्ति के आनुवंशिक प्रोफाइल को उनके स्वास्थ्य परिणामों से जोड़ना, या मस्तिष्क की गतिविधि को व्यवहारिक लक्षणों से जोड़ना। दशकों से, वैज्ञानिक इस तकनीक को तब लागू करने के लिए संघर्ष कर रहे हैं जब एक डेटा सेट विशाल हो और दूसरा छोटा। नया कार्य न केवल तेज़ और अधिक कुशल है, बल्कि अधिक सटीक भी है, जो वैज्ञानिकों को उन डेटा में सार्थक संबंध खोजने की अनुमति देता है जो पहले विश्लेषण के लिए बहुत कठिन थे।
समस्या का मूल डेटा का असंतुलन है। कई वास्तविक दुनिया के परिदृश्यों में, एक सेट के चर उच्च-आयामी (high-dimensional) होते हैं, जिसका अर्थ है कि इसमें हजारों विशेषताएं होती हैं, जबकि दूसरा सेट निम्न-आयामी होता है, जिसमें केवल कुछ ही होते हैं। पारंपरिक विधियाँ अक्सर समीकरण के दोनों पक्षों के साथ समान व्यवहार करती हैं, विशाल सेट में पैटर्न खोजने की कोशिश करती हैं और साथ ही छोटे सेट को सरल बनाने की भी कोशिश करती हैं। यह समरूपता अनावश्यक और गणनात्मक रूप से महंगी है। लेखकों ने महसूस किया कि यदि वे समस्या के साथ अलग तरह से व्यवहार करते—केवल बड़े, जटिल पक्ष पर पैटर्न की खोज पर ध्यान केंद्रित करके और छोटे पक्ष को अकेला छोड़ कर—तो वे उन गणनात्मक बाधाओं को पार कर सकते थे जिन्होंने इस क्षेत्र को परेशान किया है।
उन्होंने जो किया उसे समझने के लिए, दो डेटा सेटों के बीच के संबंध को एक भविष्यवाणी समस्या (prediction problem) के रूप la सोचना मददगार है। दो समूहों के बीच सीधा, अमूर्त लिंक खोजने के बजाय, शोधकर्ताओं ने कार्य को एक रिग्रेशन समस्या के रूप में पुनर्गठित किया। उन्होंने पूछा: यदि हम छोटे सेट की भविष्यवाणी करने के लिए बड़े चर के सेट का उपयोग करते हैं, तो सबसे सरल, सबसे सीधा तरीका क्या है? इस तरह समस्या को पेश करके, वे उच्च-आयामी रिग्रेशन के क्षेत्र से शक्तिशाली उपकरणों का लाभ उठा सके। ये उपकरण उन स्थितियों को संभालने के लिए डिज़ाइन किए गए हैं जहाँ चरों की संख्या डेटा बिंदुओं की संख्या से अधिक होती है, यह मानते हुए कि केवल एक छोटा संख्या में चर ही वास्तव में मायने रखते हैं। यह धारणा, जिसे 'स्पर्सिटी' (sparsity) कहा जाता है, समाधान की कुंजी है।
शोधकर्ताओं ने एक दो-चरणीय प्रक्रिया प्रस्तावित की जो सुरुचिपूर्ण और व्यावहारिक है। पहले, उन्होंने दो डेटा सेटों के बीच के संबंध के एक सरलीकृत संस्करण को खोजने के लिए एक गणितीय तकनीक का उपयोग किया, जो प्रभावी रूप से शोर को फ़िल्टर करता है और केवल सबसे प्रासंगिक कनेक्शनों को रखता है। यह चरण एक घने जंगल के माध्यम से सबसे सीधा रास्ता खोजने के समान है, बजाय इसके कि हर एक पेड़ का मानचित्र बनाने की कोशिश की जाए। दूसरे, उन्होंने उन विशिष्ट दिशाओं को निकाला जो इन कनेक्शनों को परिभाषित करती हैं। क्योंकि उन्होंने पहले चरण में समस्या को पहले ही सरल बना दिया था, इसलिए इस दूसरे चरण को तेजी से और सटीकता से किया जा सकता था, भले ही इसमें दसियों हजार चर शामिल हों।
इस दृष्टिकोण की शक्ति का परीक्षण कठोर प्रयोगों की एक श्रृंखला में किया गया। लेखकों ने कृत्रिम डेटा बनाया जो वास्तविक दुनिया के परिदृश्यों की नकल करता है, जिसमें उनकी नई विधि को कई मौजूदा तकनीकों के विरुद्ध रखा गया। इन सिमुलेशन में, उनकी विधि ने लगातार प्रतिस्पर्धा को पछाड़ दिया। यह मौजूदा तकनीकों की तुलना में बहुत अधिक सटीकता के साथ वास्तविक अंतर्निहित कनेक्शनों को खोजने में सक्षम रही, विशेष रूप से तब जब चरों की संख्या बढ़ती गई। जबकि अन्य विधियाँ डेटा बहुत जटिल होने पर संघर्ष करती या पूरी तरह विफल हो जातीं, नया दृष्टिकोण स्थिर और सटीक बना रहा। इसके अलावा, यह काफी तेज़ था। एक तुलना में, एक प्रतिस्पर्धी विधि को एक डेटासेट को प्रोसेस करने में एक घंटे से अधिक का समय लगा जिसे नए तरीके ने कुछ ही सेकंड में हल कर दिया। यह गति का अंतर महत्वपूर्ण है, क्योंकि इसका मतलब है कि वैज्ञानिक अब उन विशाल डेटासेट का विश्लेषण कर सकते हैं जो पहले बहुत अधिक समय लेने वाले थे।
शोधकर्ताओं ने यह भी प्रदर्शित किया कि उनकी विधि विभिन्न प्रकार के पूर्व ज्ञान (prior knowledge) को शामिल करने के लिए पर्याप्त लचीली है। कई क्षेत्रों में, चर केवल एक यादृच्छिक सूची नहीं होते; उनमें एक संरचना होती है। उदाहरण के लिए, तंत्रिका विज्ञान (neuroscience) में, मस्तिष्क के क्षेत्र समूहों या नेटवर्क में व्यवस्थित होते हैं। जलवायु विज्ञान में, तापमान माप एक ग्रिड में व्यवस्थित होते हैं। नई विधि इन संरचनाओं का सम्मान करने के लिए अनुकूलित की जा सकती है। इसे एक साथ संबंधित चरों के पूरे समूहों को चुनने के लिए, या यह सुनिश्चित करने के लिए बताया जा सकता है कि पड़ोसी चरों के भार समान हों। इन विशिष्ट संरचनाओं वाले डेटा पर परीक्षण किए जाने पर, विधि फिर से श्रेष्ठ साबित हुई, और उन पैटर्न को खोजा जो अन्य दृष्टिकोणों ने छोड़ दिए थे।
यह सिद्ध करने के लिए कि उनकी तकनीक वास्तविक दुनिया में काम करती है, लेखकों ने इसे तीन अलग-अलग डेटा सेटों पर लागू किया। पहला अध्ययन चूहों के अध्ययन से संबंधित था, जो यकृत (liver) में जीन अभिव्यक्ति को फैटी एसिड सांद्रता से जोड़ता है। नई विधि ने उन विशिष्ट जीन और वसा की पहचान सफलतापूर्वक की जो विभिन्न आहारों और आनुवंशिक प्रकारों से सबसे मजबूती से जुड़े थे, जिसने सटीकता और गति दोनों में मौजूदा उपकरणों को पछाड़ दिया। दूसरे अनुप्रयोग ने मानव मस्तिष्क गतिविधि और व्यक्तित्व लक्षणों को देखा। लगभग 150 लोगों के मस्तिष्क स्कैन का विश्लेषण करके, विधि ने विशिष्ट मस्तिष्क क्षेत्रों और प्रेरणा (drive) एवं एनहेडोनिया (anhedonia - आनंद की कमी) जैसे व्यवहारिक लक्षणों के बीच एक स्पष्ट संबंध को उजागर किया। परिणाम न केवल सांख्यिकीय रूप से मजबूत थे बल्कि जैविक रूप से भी तर्कसंगत थे, जो इनाम प्रसंस्करण (reward processing) में शामिल ज्ञात मस्तिष्क क्षेत्रों को रेखांकित करते हैं।
तीसरे वास्तविक दुनिया के परीक्षण में जलवायु विज्ञान शामिल था, जो प्रशांत महासागर में समुद्र की सतह के तापमान को प्रमुख जलवायु सूचकांकों से जोड़ता है। यहाँ, स्थानिक संरचना (spatial structure) को संभालने की उनकी विधि की क्षमता का परीक्षण किया गया। महासागरीय ग्रिड को एक जुड़े हुए नेटवर्क के रूप में मानकर, एल्गोरिदम ने महासागर के उन सुसंगत क्षेत्रों की पहचान की जो वैश्विक मौसम पैटर्न को प्रभावित करते हैं। परिणाम ज्ञात भौतिक घटनाओं, जैसे कि अल नीनो-दक्षिणी दोलन (El Niño-Southern Oscillation), के साथ मेल खाते थे, जो उस स्पष्टता के साथ थे जो सरल विधियाँ प्राप्त नहीं कर सकती थीं। विधि अलग-थलग बिंदुओं के बजाय व्यापक, भौतिक रूप से सार्थक क्लस्टरों के बीच अंतर करने में सक्षम थी, जो महासागर और वायुमंडल कैसे परस्पर क्रिया करते हैं, इसकी अधिक सटीक तस्वीर प्रदान करती है।
इस कार्य का महत्व इन तीन अध्ययनों के विशिष्ट परिणामों से परे है। यह डेटा के उस प्रवाह को संभालने के बारे में सोचने का एक नया तरीका प्रदान करता है जो आधुनिक विज्ञान की विशेषता है। यह पहचानकर कि कई समस्याएं स्वाभाविक रूप से असममित (asymmetric) होती हैं—जहाँ एक पक्ष विशाल और दूसरा छोटा होता है—शोधकर्ता उन गणनात्मक जाल में फंसने से बच सकते हैं जिन्होंने वर्षों से प्रगति को सीमित किया है। इस विधि के लिए भारी कंप्यूटिंग शक्ति या पिछले सैद्धांतिक दृष्टिकोणों द्वारा मांगी गई जटिल प्रारंभिक चरणों की आवश्यकता नहीं है। इसके बजाय, यह खोज का एक सुव्यवस्थित, कुशल मार्ग प्रदान करता है जो वैज्ञानिकों की एक विस्तृत श्रृंखला के लिए सुलभ है।
लेखक सावधानी से नोट करते हैं कि उनकी विधि उन स्थितियों के लिए डिज़ाइन की गई है जहाँ एक डेटा सेट बड़ा और दूसरा छोटा है। वे स्वीकार करते हैं कि दो विशाल डेटा सेटों को एक साथ विश्लेषण करने की चुनौती भविष्य के लिए एक खुला प्रश्न बनी हुई है। हालाँकि, उन असंख्य वैज्ञानिक प्रश्नों के लिए जहाँ यह विषमता मौजूद है, उनका समाधान एक मजबूत और विश्वसनीय उपकरण प्रदान करता है। यह सैद्धांतिक गारंटी और व्यावहारिक अनुप्रयोग के बीच के अंतर को पाटता है, जो गति या सटीकता से समझौता किए बिना शोर में संकेत खोजने का एक तरीका प्रदान करता है। जैसे-जैसे विज्ञान लगातार बड़े डेटासेट उत्पन्न करता जा रहा है, इस तरह की तकनीकें कच्चे नंबरों को वास्तविक समझ में बदलने के लिए आवश्यक होंगी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।