← नवीनतम पेपर
📊 statistics

Kernel Regression with Tensor Trains and Hadamard Overparameterization

यह शोध पत्र KReTTaH को प्रस्तुत करता है, जो मल्टी-वे डेटा इम्प्यूटेशन (multi-way data imputation) के लिए एक ट्रेनिंग-डेटा-मुक्त, व्याख्या योग्य ढांचा है, जो इस समस्या को टेंसर-ट्रेन गुणांकों (tensor-train coefficients) और हैडमार्ड ओवरपैरामीट्राइजेशन (Hadamard overparameterization) के साथ कर्नेल रिग्रेशन के रूप में पुनर्गठित करता है, जो उच्च-आयामी fMRI और डायनेमिक ग्राफ अनुप्रयोगों में महंगी क्रॉस-वैलिडेशन के बिना अत्याधुनिक सटीकता प्राप्त करने के लिए रिमानियन मैनिफोल्ड्स (Riemannian manifolds) पर इन घटकों को संयुक्त रूप से अनुकूलित करता है।

मूल लेखक: Duc Thien Nguyen, Konstantinos Slavakis, Eleftherios Kofidis, Dimitris Pados

प्रकाशित 2026-07-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Duc Thien Nguyen, Konstantinos Slavakis, Eleftherios Kofidis, Dimitris Pados

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, बहु-स्तरीय जिग्सॉ पहेली (jigsaw puzzle) को पूरा करने की कोशिश कर रहे हैं, लेकिन किसी ने उसके हजारों टुकड़े निकाल दिए हैं। आप डिब्बे पर बनी तस्वीर देख सकते हैं, और आपके पास कुछ बिखरे हुए टुकड़े बचे हैं, लेकिन आसमान, समुद्र और पेड़ों के बड़े-बड़े हिस्से गायब हैं। यह "मल्टी-वे डेटा" (multi-way data) के साथ काम करने वाले वैज्ञानिकों और इंजीनियरों का दैनिक संघर्ष है। चाहे वह मस्तिष्क के सक्रिय होने का 3D मूवी हो, शहर में यातायात के प्रवाह का नक्शा हो, या किसी खेल का वीडियो, यह डेटा अक्सर अव्यवस्थित होता है। सेंसर टूट जाते हैं, कनेक्शन टूट जाते हैं, या माप खो जाते हैं, जिससे हमारे सामने एक विशाल, अधूरा पहेली जैसा बन जाता है।

इसे ठीक करने के लिए, वैज्ञानिक आमतौर पर पैटर्न को देखकर गायब टुकड़ों का अनुमान लगाने की कोशिश करते हैं। वे मान लेते हैं कि डेटा में एक छिपा हुआ ढांचा है, जैसे कि एक कम-रिज़ॉल्यूशन वाला स्केच, जिसे भरने पर एक हाई-डेफिनिशन तस्वीर उभर आती है। हालाँकि, वास्तविक दुनिया का डेटा शायद ही कभी सरल होता है; यह जटिल, घुमावदार, गैर-रेखीय (non-linear) संबंधों से भरा होता है जिन्हें समझना कठिन है। पारंपरिक तरीके इन घुमावों को पकड़ने में संघर्ष करते हैं क्योंकि या तो वे भारी गणनाओं में फंस जाते हैं या उन्हें बहुत अधिक अतिरिक्त ट्रेनिंग डेटा की आवश्यकता होती है। बड़ा सवाल यह है: हम एक जटिल, बहु-आयामी पहेली के खाली स्थानों को सटीक रूप से, तेज़ी से और बिना किसी अन्य पहेलियों के विशाल पुस्तकालय की आवश्यकता के, कैसे भर सकते हैं?

यहाँ एक नई विधि आती है जिसे KReTTaH (Kernel Regression with Tensor Trains and Hadamard Overparameterization) कहा जाता है, जिसे शोधकर्ताओं की एक टीम द्वारा विकसित किया गया है। KReTTaH को एक सुपर-स्मार्ट, पैटर्न खोजने वाले जासूस के रूप में समझें जिसे अपने सामने वाली पहेली को हल करने के लिए हजारों अन्य पहेलियों को याद करने की आवश्यकता नहीं है। केवल अनुमान लगाने के बजाय, यह छिपे हुए, गैर-रेखीय संबंधों को समझने के लिए "कर्नेल रिग्रेशन" नामक एक चतुर गणितीय युक्ति का उपयोग करता है।

यह सरल भाषा में इस प्रकार काम करता है। कल्पना कीजिए कि डेटा मिट्टी का एक विशाल, बहु-आयामी ब्लॉक है। KReTTaH पूरे ब्लॉक को एक साथ तराशने की कोशिश नहीं करता है। इसके बजाय, यह समस्या को छोटे, प्रबंधनीय "ट्रेन के डिब्बों" (यही "टेन्सर ट्रेन" वाला हिस्सा है) की एक श्रृंखला में तोड़ देता है। ये डिब्बे आपस में जुड़े हुए हैं, और जिस तरह से वे जुड़ते हैं, उसे एक विशिष्ट, कुशल आकार तक सीमित रखा जाता है, ताकि गणित बहुत भारी न हो जाए।

लेकिन असली जादू यहाँ है: KReTTaH "हैडामार्ड ओवरपैरामीटरइजेशन" (Hadamard overparameterization) नामक तकनीक का भी उपयोग करता है। कल्पना कीजिए कि आप घास के ढेर में एक विशिष्ट सुई खोजने की कोशिश कर रहे हैं। केवल एक सुई खोजने के बजाय, आप कल्पना करते हैं कि वहाँ कई परतों में सुइयां हैं, लेकिन आप एक नियम जोड़ते हैं जो अधिकांश को अदृश्य (शून्य) रहने के लिए मजबूर करता है जब तक कि वे बिल्कुल आवश्यक न हों। यह मॉडल को "स्पार्स" (sparse) बनाने के लिए मजबूर करता है, जिसका अर्थ है कि यह केवल सबसे महत्वपूर्ण, सार्थक पैटर्न को रखता है और शोर (noise) को हटा देता है। यह एक मूर्तिकार की तरह है जो पत्थर के एक बड़े ब्लॉक से शुरुआत करता है लेकिन केवल उन हिस्सों को तराशता है जो मूर्ति नहीं हैं, जिससे एक साफ, कुशल आकार बचता है।

शोधकर्ताओं ने इस नए जासूस का परीक्षण दो बहुत अलग, चुनौतीपूर्ण पहेलियों पर किया। सबसे पहले, उन्होंने मानव मस्तिष्क के 4D फंक्शनल एमआरआई (fMRI) स्कैन को पुनर्गठित करने का प्रयास किया। ये समय के साथ मस्तिष्क की गतिविधि के 3D मूवी की तरह हैं, लेकिन इनमें कई फ्रेम गायब हैं। KReTTaH ने गायब मस्तिष्क गतिविधि को सफलतापूर्वक भरा, और अन्य शीर्ष तरीकों की तुलना में सटीकता में बेहतर प्रदर्शन करते हुए कई प्रतिस्पर्धियों की तुलना में तेज़ गति से काम किया। दूसरा, उन्होंने वास्तविक दुनिया के नेटवर्क (जैसे मैसाचुसेट्स और बर्लिन की सड़कें) में ट्रैफिक फ्लो डेटा का परीक्षण किया। उन्होंने उन सड़कों पर गायब ट्रैफिक गति की भविष्यवाणी करने की कोशिश की जहाँ निगरानी नहीं की जा रही थी। फिर से, KReTTaH ने अन्य तरीकों की तुलना में गायब प्रवाह का बेहतर अनुमान लगाया, तब भी जब डेटा बहुत कम उपलब्ध था।

KReTTaH को जो चीज़ खास बनाती है वह यह है कि यह अपने सेटिंग्स को स्वचालित रूप से समझ लेता है। आमतौर पर, वैज्ञानिकों को सर्वोत्तम परिणाम प्राप्त करने के लिए घंटों तक नॉब्स और डायल (जिन्हें हाइपरपैरामीटर कहा जाता है) को मैन्युअल रूप से ट्यून करने में समय बिताना पड़ता है। KReTTाH, एक विशेष गणितीय परिदृश्य (एक "रीमानियन मैनिफोल्ड") का उपयोग करता है ताकि वह अपने आप सबसे अच्छे समाधान की ओर नीचे की ओर ढलान की तरह बढ़ सके, जिससे बिना मानवीय सहायता के सर्वोत्तम सेटिंग्स मिल सकें।

यह शोध पत्र दिखाता है कि यह दृष्टिकोण केवल एक सैद्धांतिक विचार नहीं है; यह व्यवहार में काम करता है। वास्तविक मस्तिष्क स्कैन डेटा और वास्तविक ट्रैफिक डेटा का उपयोग करके किए गए सिमुलेशन में, KReTTaH ने मौजूदा अत्याधुनिक तरीकों की तुलना में लगातार अधिक सटीक पुनर्निर्माण प्रस्तुत किया। इसने अत्यधिक सटीक और गणनात्मक रूप से कुशल दोनों होने का प्रमाण दिया, जिससे यह सिद्ध हुआ कि आप एक विशाल प्रशिक्षण डेटासेट या अपने उपकरणों को ट्यून करने में दिन बिताए बिना एक जटिल, बहु-आयामी पहेली के गायब हिस्सों को भर सकते हैं। यह सुझाव देता है कि स्मार्ट ज्यामिति को थोड़े "ओवरथिंकिंग" (ओवरपैरामीटरइजेशन) के साथ मिलाने से, जिसे फिर आवश्यक तत्वों तक छाँटा जाता है, हम आज के सबसे अव्यवस्थित डेटा समस्याओं को हल कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →