← नवीनतम पेपर
🤖 machine learning

Renormalization Group Flow Matching for Scalable Local Generative Modeling

यह शोध पत्र रिनॉर्मलाइज़ेशन ग्रुप फ्लो मैचिंग (RGFM) प्रस्तुत करता है, जो एक स्केलेबल जनरेटिव फ्रेमवर्क है जो रिनॉर्मलाइज़ेशन ग्रुप सिद्धांतों का लाभ उठाकर स्थानीय मॉडलों को लगभग रैखिक कम्प्यूटेशनल लागत के साथ लंबी दूरी के सहसंबंधों और वैश्विक सुसंगतता को सटीक रूप से पुनरुत्पादित करने में सक्षम बनाता है।

मूल लेखक: Kanta Masuki, Yuto Ashida

प्रकाशित 2026-08-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kanta Masuki, Yuto Ashida

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया में, कंप्यूटर तेजी से नई चीजों को शून्य से बनाना सीख रहे हैं। वे मौजूदा उदाहरणों के विशाल पुस्तकालयों का अध्ययन करके यथार्थवादी चेहरे, संगीत की रचना, या जटिल आणविक संरचनाएं उत्पन्न कर सकते हैं। ये सिस्टम इस बात को सीखकर काम करते हैं कि डेटा को जोड़ने वाले छिपे हुए पैटर्न क्या हैं, प्रभावी रूप से यह मानचित्रण करते हैं कि सूचना का एक हिस्सा दूसरे से कैसे संबंधित है। हालांकि, एक मौलिक समस्या लंबे समय से इन रचनाकारों को परेशान करती रही है: कुशल और व्यापक होने के बीच संघर्ष। एक ऐसी तस्वीर बनाने के लिए जो किनारों से किनारों तक समझ में आए, एक कंप्यूटर को आमतौर पर एक ही बार में पूरी छवि को देखने की आवश्यकता होती है, एक ऐसी प्रक्रिया जिसमें अत्यधिक कंप्यूटिंग शक्ति और मेमोरी की आवश्यकता होती है। इसके विपरीत, यदि कंप्यूटर ऊर्जा बचाने के लिए केवल छोटे, प्रबंधनीय टुकड़ों को देखता है, तो वह अक्सर कड़ियों को जोड़ने में विफल रहता है, जिसके परिणामस्वरूप ऐसी छवियां बनती हैं जहाँ चेहरे का बायां हिस्सा दाएं हिस्से से मेल नहीं खाता, या जहाँ दृश्य के दूर के हिस्सों के बीच एक सुसंगत संबंध की कमी होती है। स्थानीय दक्षता और वैश्विक निरंतरता के बीच यह समझौता इन तकनीकों को बड़े, अधिक जटिल कार्यों तक विस्तारित करने के लिए एक बड़ी बाधा रहा है।

टोक्यो विश्वविद्यालय के शोधकर्ताओं की एक टीम ने सैद्धांतिक भौतिकी से एक शक्तिशाली अवधारणा, जिसे 'रेनॉर्मलाइजेशन ग्रुप' (renormalization group) के रूप में जाना जाता है, को उधार लेकर इस कठिनाई से निपटने का एक नया तरीका प्रस्तावित किया है। भौतिकी में, इस पद्धति का उपयोग यह समझने के लिए किया जाता है कि विभिन्न आकारों के स्तर पर प्रणालियाँ कैसे व्यवहार करती हैं, जैसे कि परमाणुओं की सूक्ष्म गति से लेकर तरल पदार्थों के बड़े पैमाने के प्रवाह तक। मुख्य विचार यह है कि जबकि ज़ूम इन या ज़ूम आउट करने पर किसी प्रणाली के विवरण बदल जाते हैं, अंतर्निहित नियम अक्सर सुसंगत रहते हैं, जिससे वैज्ञानिकों को शोर (noise) में खोए बिना बहुत सूक्ष्म और बहुत विशाल स्तरों को जोड़ने की अनुमति मिलती है। शोधकर्ताओं, कांता मासुकी और यूटो आशीदा ने इस सिद्धांत को एक नया जेनेरेटिव फ्रेमवर्क बनाने के लिए अनुकूलित किया है जिसे 'रेनॉर्मलाइजेशन ग्रुप फ्लो मैचिंग' (Renormalization Group Flow Matching) कहा जाता है। एक पूरी उच्च-रिज़ॉल्यूशन वाली छवि को एक विशाल, महंगे चरण में संसाधित करने के बजाय, उनकी विधि छवि को क्रमिक रूप से बनाती है, जो व्यापक, मोटे आकारों से शुरू होकर धीरे-धीरे सूक्ष्म विवरणों को भरती है।

नवाचार इस बात में निहित है कि कंप्यूटर डेटा के माध्यम से कैसे आगे बढ़ता है। पारंपरिक तरीके अक्सर एक साथ हर एक पिक्सेल और हर दूसरे पिक्सेल के बीच के संबंध को सीखने की कोशिश करते हैं, जो छवियों के बड़े होने पर गणनात्मक रूप से असंभव हो जाता है। हालाँकि, नया दृष्टिकोण, इस निर्माण प्रक्रिया को पैमानों के प्राकृतिक पदानुक्रम (hierarchy of scales) का सम्मान करते हुए चरणों के एक क्रम में व्यवस्थित करता है। यह डेटा की बड़े पैमाने की संरचना बनाकर शुरू होता है, जैसे कि चेहरे का सामान्य लेआउट या किसी परिदृश्य की रचना। एक बार जब ये व्यापक रेखाएं स्थापित हो जाती हैं, तो सिस्टम अगले स्तर पर जाता है, बारीक बनावट और किनारे जोड़ता है, और यह प्रक्रिया तब तक जारी रहती है जब तक कि अंतिम, उच्च-रिज़ॉल्यूशन विवरण पूरे नहीं हो जाते। महत्वपूर्ण रूप से, इस प्रगति के प्रत्येक चरण में, कंप्यूटर को अपने निर्णय लेने के लिए केवल छवि के एक छोटे, स्थानीय पड़ोस को देखने की आवश्यकता होती है। उसे अगली रेखा खींचने के बारे में जानने के लिए पूरी तस्वीर देखने की आवश्यकता नहीं होती है।

यह स्थानीय ध्यान "रेनॉर्मलाइजेशन ग्रुप फ्लो" से जुड़ी एक विशिष्ट गणितीय युक्ति के कारण संभव हुआ है। इस प्रक्रिया में, सिस्टम प्रभावी रूप से उच्च-आवृत्ति वाले शोर और उन सूक्ष्म विवरणों को फ़िल्टर कर देता है जो पहले ही उत्पन्न किए जा चुके हैं, जिससे डेटा का एक सरल संस्करण पीछे रह जाता है जिसे संभालना आसान होता है। डेटा को बार-बार सरल बनाकर और फिर विवरण वापस जोड़ने के लिए प्रक्रिया को उलटकर, शोधकर्ताओं ने एक ऐसा मार्ग बनाया है जो कंप्यूटर को छोटे पैच पर गणना करने के बावजूद पूरी छवि का बोध बनाए रखने की अनुमति देता है। उन्होंने प्रदर्शित किया कि एक सटीक भविष्यवाणी करने के लिए कंप्यूटर को कितनी दूर तक "देखने" की आवश्यकता है, यह छवि के बड़े होने पर बहुत धीमी गति से बढ़ता है। विशेष रूप से, एक निश्चित आकार की छवि के लिए, आवश्यक दृश्य क्षेत्र केवल लघुगणकीय (logarithmically) रूप से बढ़ता है, जिसका अर्थ है कि बहुत बड़ी छवियों के लिए भी, कंप्यूटर को काम पूरा करने के लिए अपेक्षाकृत छोटा विंडो देखने की आवश्यकता होती है। यह सिस्टम को बिना कंप्यूटिंग लागत विस्फोट के विशाल रिज़ॉल्यूशन तक स्केल करने की अनुमति देता है।

शोधकर्ताओं ने अपने तरीके का परीक्षण सरल गणितीय वितरणों और FFHQ डेटासेट से प्राप्त पोर्ट्रेट सहित जटिल वास्तविक दुनिया की छवियों, दोनों पर किया। एक-आयामी परीक्षणों में, नई विधि ने उन दीर्घ-दूरी के सहसंबंधों (long-range correlations) को सफलतापूर्वक पुनरुत्पादित किया जिन्हें पारंपरिक स्थानीय मॉडल मिस कर देते हैं, जिससे यह सुनिश्चित होता है कि उत्पन्न डेटा के दूर के हिस्से एक-दूसरे के साथ सुसंगत बने रहें। छवि निर्माण पर लागू होने पर, परिणाम आश्चर्यजनक थे। 64 गुणा 64 पिक्सेल के रिज़ॉल्यूशन पर, नई विधि ने मानक स्थानीय मॉडलों की तुलना में बहुत अधिक सुसंगत संरचनाओं और काफी कम त्रुटियों के साथ चेहरे बनाए। यहाँ तक कि 256 गुणा 256 पिक्सेल के उच्च रिज़ॉल्यूशन पर भी, जहाँ कम्प्यूटेशनल चुनौती बहुत अधिक है, नए दृष्टिकोण ने अपने प्रतिस्पर्धियों की तुलना में उच्च गुणवत्ता वाले नमूने तैयार किए। हालाँकि छवियां अभी तक पूर्ण नहीं थीं, जिनमें दूर स्थित चेहरे की विशेषताओं के बीच कुछ विसंगतियां दिखाई दे रही थीं, लेकिन वैश्विक सुसंगतता में सुधार पर्याप्त था।

यह कार्य सुझाव देता है कि निर्माण प्रक्रिया को इस तरह से व्यवस्थित करके कि वह विभिन्न पैमानों पर स्वयं को व्यवस्थित करने वाली भौतिक प्रणालियों की नकल करे, एक ऐसा आर्टिफिशियल इंटेलिजेंस बनाना संभव है जो कुशल भी हो और व्यापक चित्र को समझने में सक्षम भी हो। शोधकर्ताओं ने दिखाया है कि गति के लिए वैश्विक निरंतरता का त्याग करना आवश्यक नहीं है। एक ऐसे ढांचे का उपयोग करके जो मोटे और सूक्ष्म स्तरों को व्यवस्थित रूप से जोड़ता है, उन्होंने उच्च-आयामी डेटा का उपयोग करके केवल स्थानीय गणनाओं के माध्यम से जटिल वास्तविकता का निर्माण करने का एक नया मार्ग खोल दिया है। यह दृष्टिकोण न केवल चित्र बनाने का एक तेज़ तरीका प्रदान करता है; यह एक नया ब्लूप्रिंट भी प्रदान करता है कि कैसे मशीनें एक समय में एक पैमाने पर, बिना कभी भी पूरी दुनिया को अपनी मेमोरी में रखने की आवश्यकता के, जटिल वास्तविकताओं का निर्माण करना सीख सकती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →