← नवीनतम पेपर
💻 computer science

MPDiT: Multi-Patch Global-to-Local Transformer Architecture For Efficient Flow Matching and Diffusion Model

यह शोध पत्र MPDiT को प्रस्तुत करता है, जो एक पदानुक्रमित मल्टी-पैच ट्रांसफॉर्मर आर्किटेक्चर है जो शुरुआती ब्लॉक्स में बड़े पैच के साथ व्यापक वैश्विक संदर्भों को प्रोसेस करके और बाद के ब्लॉक्स में छोटे पैच के साथ स्थानीय विवरणों को परिष्कृत करके मानक डिफ्यूजन ट्रांसफॉर्मर्स की तुलना में कम्प्यूटेशनल लागत को 50% तक कम करता है, साथ ही तेज़ अभिसरण (convergence) के लिए बेहतर एम्बेडिंग डिज़ाइनों का प्रस्ताव भी देता है।

मूल लेखक: Quan Dao, Dimitris Metaxas

प्रकाशित 2026-03-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Quan Dao, Dimitris Metaxas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक उत्कृष्ट कृति पेंट करना सिखाने की कोशिश कर रहे हैं, जैसे कि एक बिल्ली का चित्र।

पुराना तरीका ("आइसोट्रोपिक" समस्या):
पारंपरिक रूप से, रोबोट (एक डिफ्यूजन मॉडल) पहले ब्रश के हर एक स्ट्रोक से पूरी तस्वीर को एक ही स्तर के विवरण के साथ पेंट करने की कोशिश करता है। वह पूरी कैनवास को देखता है, फिर हर एक मूंछ को पेंट करने के लिए ज़ूम इन करता है, फिर वापस ज़ूम आउट करता है, और फिर से ज़ूम इन करता है। वह अपने "मस्तिष्क" (न्यूरल नेटवर्क) की हर एक परत के लिए ऐसा करता है।

यह अविश्वसनीय रूप से अक्षम है। यह एक उपन्यास को पढ़ने जैसा है जहाँ आप कहानी, वाक्यों या शब्दों को समझने से पहले ही हर एक अक्षर को व्यक्तिगत रूप से देखने की कोशिश करते हैं। रोबोट बहुत अधिक ऊर्जा और समय बर्बाद करता है क्योंकि वह सूक्ष्म विवरणों को चित्रित करने के साथ-साथ "बड़ी तस्वीर" को समझने की कोशिश करता है। यह धीमा है, महंगा है, और इसके लिए सुपर-कंप्यूटर की आवश्यकता होती है।

नया समाधान (MPDiT):
इस शोध पत्र के लेखकों, क्वान डाओ और दिमित्रिस मेटैक्सस ने रोबोट को सिखाने का एक स्मार्ट तरीका निकाला है। वे इसे MPDiT (मल्टी-पैच डिफ्यूजन ट्रांसफॉर्मर) कहते हैं। इसे एक पदानुक्रमित पेंटिंग रणनीति (hierarchical painting strategy) के रूप में समझें।

यह इस प्रकार काम करता है, जिसे सरल चरणों में विभाजित किया गया है:

1. "बड़ी तस्वीर" वाला चरण (ग्लोबल कॉन्टेक्स्ट)

इमेज को तुरंत हाई डेफिनेशन में देखने के बजाय, रोबोट शुरुआत में इमेज को एक वाइड-एंगल, धुंधले लेंस के माध्यम से देखता है।

  • उपमा: कल्पना करें कि आप हवाई जहाज से एक शहर के मानचित्र को देख रहे हैं। आप प्रमुख राजमार्गों, शहर के आकार और पार्कों के स्थान को देख सकते हैं, लेकिन आप व्यक्तिगत कारों या लोगों को नहीं देख सकते।
  • यह कैसे मदद करता है: रोब1 इमेज को "बड़े टुकड़ों" (बड़े पैच) में प्रोसेस करता है। यह जल्दी से समझ जाता है: "ठीक है, यह एक बिल्ली है, जो एक चटाई पर बैठी है, और बैकग्राउंड नीला है।" यह बहुत कम प्रयास के साथ यह करता है क्योंकि यह सूक्ष्म विवरणों को अनदेखा कर रहा है।

2. "ज़ूम इन" वाला चरण (लोकल डिटेल्स)

एक बार जब रोबोट का सामान्य लेआउट तैयार हो जाता है, तो वह अपनी कार्यशैली बदल देता है। वह उस धुंधले, बड़ी तस्वीर वाले स्केच को लेता है और ज़ूम इन करता है।

  • उपमा: अब, रोबोट एक आवर्धक लेंस (magnifying glass) लगाता है। वह बिल्ली के कच्चे स्केच को लेता है और उसमें फर की बनावट, आंखों की चमक और मूंछों को भरना शुरू करता है।
  • यह कैसे मदद करता है: केवल रोबोट के मस्तिष्क के अंतिम कुछ हिस्से ही यह भारी काम करते हैं। शुरुआती परतें (जिन्होंने "बड़ी तस्वीर" का काम किया था) अब आराम करने के लिए स्वतंत्र हैं। इससे ऊर्जा की भारी बचत होती है।

3. "स्मार्ट नोट्स" (बेहतर एम्बेडिंग्स)

शोध पत्र ने रोबोट के मस्तिष्क के दो अन्य हिस्सों को भी ठीक किया है ताकि वह तेजी से सीख सके:

  • टाइम एम्बेडिंग (घड़ी): डिफ्यूजन मॉडल समय के साथ धीरे-धीरे "शोर" (noise) को हटाकर काम करते हैं। पुराने तरीके से रोबोट को प्रक्रिया में "समय क्या हुआ है" यह बताना ऐसा था जैसे केवल घंटे और मिनट की सुइयों वाले क्लॉक को पढ़ना। नया तरीका एक फूरियर न्यूरल ऑपरेटर का उपयोग करता है, जो एक उच्च-परिशुद्धता वाले स्टॉपवॉच की तरह है जो समय के सुचारू और प्रवाहमय स्वभाव को समझता है। यह रोबोट को शोर से एक स्पष्ट छवि की ओर अधिक सहजता से बढ़ने में मदद करता है।
  • क्लास एम्बेडिंग (लेबल): जब आप रोबोट को "बिल्ली बनाओ" कहते हैं, तो पुराना तरीका एक एकल, सघन नोट का उपयोग करता था। नया तरीका कई टोकन (जैसे एक शब्द के बजाय पूरा वाक्य) का उपयोग करता है। यह रोबोट को "बिल्ली" लिखे एक स्टिकी नोट देने बनाम एक विस्तृत निर्देश पत्र देने के बीच का अंतर है जिसमें लिखा है "रोएंदार, नारंगी रंग की टैबी, कालीन पर बैठी हुई।" यह रोबोट को अवधारणा को बेहतर ढंग से समझने और तेजी से सीखने में मदद करता है।

परिणाम: आपको इसकी परवाह क्यों करनी चाहिए?

लेखकों ने इमेज के एक विशाल डेटासेट (ImageNet) पर इसका परीक्षण किया। परिणाम प्रभावशाली रहे:

  • गति: नया मॉडल इमेज बनाने में दोगुनी तेज़ है।
  • लागत: यह प्रशिक्षण के दौरान 50% कम कंप्यूटिंग पावर (GFLOPs) का उपयोग करता है। इसका मतलब है कि कंपनियाँ इन मॉडलों को सस्ते हार्डवेयर पर प्रशिक्षित कर सकती हैं, या उन्हें बहुत तेज़ी से प्रशिक्षित कर सकती हैं।
  • गुणवत्ता: कम शक्ति का उपयोग करने के बावजूद, इसकी छवियां पुराने, भारी मॉडलों के समान या उनसे भी बेहतर हैं।

संक्षेप में:
यह शोध पत्र AI को पेंट करना सिखाने के बारे में है—पहले बड़ी तस्वीर सोचना, और फिर बाद में विवरणों पर ध्यान देना, न कि सब कुछ एक साथ करने की कोशिश करना। यह एक ऐसे कलाकार के बीच का अंतर है जो रंग भरने से पहले एक कच्चा रेखाचित्र (sketch) बनाता है (कुशल), बनाम एक ऐसे कलाकार के बीच जो कुत्ते के सिर पर हर एक बाल पेंट करने की कोशिश करता है इससे पहले कि वह तय करे कि कुत्ते का सिर कहाँ है (अकुशल)।

AI के मस्तिष्क को इस तरह व्यवस्थित करके, उन्होंने उच्च-गुणवत्ता वाली इमेज जनरेशन को तेज़, सस्ता और सभी के लिए सुलभ बना दिया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →