← नवीनतम पेपर
💻 computer science

Rethinking Cross-Layer Information Routing in Diffusion Transformers

यह शोध पत्र डिफ्यूजन-एडैप्टिव रूटिंग (DAR) को प्रस्तुत करता है, जो एक सीखने योग्य (learnable), टाइमस्टेप-एडैप्टिव रेसिडुअल मैकेनिज्म है जो डिफ्यूजन ट्रांसफॉर्मर्स में पारंपरिक रेसिडुअल एडिशन को प्रतिस्थापित करता है ताकि सूचना प्रवाह की समस्याओं को कम किया जा सके, जिससे फाइन-ट्यूनिंग के दौरान हाई-फ्रीक्वेंसी विवरणों को सुरक्षित रखते हुए इमेजनेट जनरेशन की गुणवत्ता और प्रशिक्षण दक्षता में महत्वपूर्ण सुधार होता है।

मूल लेखक: Chao Xu, Maohua Li, Qirui Li, Yixuan Xu, Yanke Zhou, Yunhe Li, Cuifeng Shen, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Shao-Qun Zhang

प्रकाशित 2026-05-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chao Xu, Maohua Li, Qirui Li, Yixuan Xu, Yanke Zhou, Yunhe Li, Cuifeng Shen, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Shao-Qun Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कलाकार को शून्य से एक तस्वीर पेंट करना सिखाने की कोशिश कर रहे हैं, जो एक धुंधले, शोर वाले स्टैटिक (static) के बादल से शुरू होकर धीरे-धीरे एक स्पष्ट, तीखी छवि में बदल जाती है। आधुनिक AI इमेज जनरेटर (जिन्हें डिफ्यूजन ट्रांसफॉर्मर कहा जाता है) इसी तरह काम करते हैं।

लंबे समय से, इस रोबोट कलाकार का "दिमाग" भाषा मॉडल (जैसे वे जो निबंध लिखते हैं) से विरासत में मिले एक मानक ब्लूप्रिंट का उपयोग करके बनाया गया है। यह ब्लूप्रिंट रोबोट को बताता है कि उसे अपने मस्तिष्क की एक परत से दूसरी परत तक जानकारी कैसे भेजनी है। यह एक रिले रेस की तरह है जहाँ हर धावक बस अपने संदेश को बैटन (baton) में जोड़ता है और उसे आगे बढ़ा देता है।

इस शोध पत्र के लेखक, चाओ ज़ू (Chao Xu) और उनकी टीम ने इस रिले रेस का बारीकी से निरीक्षण करने का निर्णय लिया। उन्होंने पाया कि बैटन पास करने का मानक तरीका वास्तव में इमेज जनरेशन के लिए दोषपूर्ण है, और उन्होंने एक नया, अधिक स्मार्ट तरीका बनाया जिसे DAR (डिफ्यूजन-एडेप्टिव रूटिंग) कहा जाता है।

यहाँ उनके निष्कर्षों और समाधान का एक सरल विवरण दिया गया है:

1. समस्या: "शोर भरी रिले रेस"

मानक डिज़ाइन में, जैसे-जैसे छवि स्पष्ट होती जाती है (उच्च शोर से कम शोर की ओर बढ़ते हुए), मस्तिष्क की परतों के माध्यम से गुजरने वाली जानकारी अजीब व्यवहार करने लगती है। लेखकों ने तीन विशिष्ट "लक्षणों" की पहचान की है:

  • वॉल्यूम नॉब अधिकतम पर अटक जाना (मैग्निट्यूड इन्फ्लेशन): कल्पना कीजिए कि रिले रेस में धावक हर कदम के साथ अपने संदेश को और तेज़ चिल्लाते जा रहे हैं। जब तक संदेश अंतिम परत तक पहुँचता है, वह इतना तेज़ (गणितीय रूप से विशाल) हो जाता है कि वह बाकी सब कुछ दबा देता है। रोबोट को वॉल्यूम को नियंत्रण में रखने के लिए अविश्वसनीय रूप से कठिन परिश्रम करना पड़ता है।
  • सिग्नल का फीका पड़ जाना (ग्रेडिएंट डिके): रिले रेस में, यदि अंतिम धावक बैटन गिरा देता है, तो पहले धावकों को पता नहीं चलता कि उन्होंने गलती की है। इसी तरह, मानक डिज़ाइन में, "फीडबैक" जो शुरुआती परतों को सुधार करने के लिए बताती है, इतनी कमजोर हो जाती है कि जब तक वह श्रृंखला में वापस ऊपर जाती है, शुरुआती परतें प्रभावी ढंग से सीखना बंद कर देती हैं।
  • सब एक ही बात कहते हैं (रिडंडेंसी): क्योंकि संदेश बहुत तेज़ और विकृत हो जाता है, मस्तिष्क की विभिन्न परतें लगभग समान आउटपुट उत्पन्न करने लगती हैं। यह एक बैठक में 20 लोगों के होने जैसा है, लेकिन वे सभी बार-बार एक ही वाक्य दोहरा रहे हैं। यह मस्तिष्क की शक्ति की बर्बादी है।

लेखकों ने यह भी पाया कि यह मानक रिले रेस "समय के प्रति अंधा" (time-blind) है। यह पेंटिंग के शुरुआती, धुंधले चरण को उसी तरह मानता है जैसे यह अंतिम, स्पष्ट चरण को मानता है। लेकिन वास्तव में, एक रोबोट को तब बड़े आकार (big shapes) पर ध्यान केंद्रित करने की आवश्यकता होती है जब छवि धुंधली होती है, और बारीक विवरणों (tiny details) पर ध्यान केंद्रित करने की आवश्यकता होती है जब छवि स्पष्ट होती है। पुराना डिज़ाइन गियर बदलने में सक्षम नहीं था।

2. समाधान: "स्मार्ट ट्रैफिक कंट्रोलर" (DAR)

टीम ने DAR का प्रस्ताव दिया, जो साधारण "जोड़ो और पास करो" वाली रिले के बजाय एक स्मार्ट, एडेप्टिव ट्रैफिक कंट्रोलर है।

साधारण रूप से हर पिछले संदेश को वर्तमान में जोड़ने के बजाय, नया सिस्टम पूछता है: "चूंकि हम पेंटिंग प्रक्रिया के इस विशिष्ट चरण ('टाइमस्टेप') पर हैं, तो अभी कौन से पिछले संदेश वास्तव में उपयोगी हैं?"

  • यह समय के प्रति जागरूक है: कंट्रोलर जानता है कि छवि अभी भी एक धुंधला बादल है या यह लगभग समाप्त होने वाली है। यदि यह धुंधली है, तो यह "बड़ी तस्वीर" वाली परतों पर ध्यान केंद्रित करता है। यदि यह स्पष्ट है, तो यह "बारीक विवरण" वाली परतों पर ध्यान केंद्रित करता है।
  • यह चयनात्मक है: यह सब कुछ नहीं जोड़ता। यह सबसे अच्छे पिछले सूचना को चुनने और बाकी को अनदेखा करने के लिए एक "सॉफ्ट अटेंशन" तंत्र (एक स्पॉटलाइट की तरह) का उपयोग करता है।
  • यह लचीला है: यह परतों को अलग होने के लिए मजबूर नहीं करता है; यह केवल यह बदलता है कि वे एक-दूसरे से कैसे बात करती हैं। इसका मतलब है कि इसे मौजूदा मॉडलों में बिना उन्हें तोड़े डाला जा सकता है।

3. परिणाम: तेज़ और बेहतर कला

टीम ने एक मानक इमेज डेटासेट (ImageNet) पर इस नए सिस्टम का परीक्षण किया। परिणाम प्रभावशाली थे:

  • बेहतर गुणवत्ता: उत्पन्न की गई छवियां काफी अधिक स्पष्ट और यथार्थवादी थीं (जिसे FID नामक स्कोर से मापा जाता है, जहाँ कम स्कोर बेहतर होता है)। उन्होंने मानक मॉडल की तुलना में एक बड़े अंतर से स्कोर में सुधार किया।
  • बहुत तेज़ प्रशिक्षण: मॉडल ने पुराने मॉडल के समान उच्च गुणवत्ता प्राप्त करने में 8.75 गुना कम स्टेप्स लिए। यह एक उत्कृष्ट कृति पेंट करने में आठ दिनों के बजाय एक दिन में सीखने जैसा है।
  • अन्य अपग्रेड के साथ काम करता है: उन्होंने DAR का परीक्षण REPA नामक एक अन्य लोकप्रिय विधि के साथ किया (जो रोबोट को मौजूदा कला से सीखने में मदद करता है)। दोनों विधियाँ एक साथ पूरी तरह से काम करती हैं, जिससे प्रशिक्षण और भी तेज़ (2x स्पीडअप) हो जाता है बिना किसी टकराव के।

4. एक बोनस: विवरणों को स्पष्ट रखना

पेपर ने यह भी दिखाया कि जब उन्होंने इस नए सिस्टम का उपयोग एक विशाल मॉडल को छोटे, तेज़ मॉडल में "डिस्टिल" (संकुचित) करने के लिए किया, तो नया सिस्टम हाई-फ्रीक्वेंसी विवरणों को बनाए रखने में बहुत बेहतर था।

इसे एक दस्तावेज़ की फोटोकॉपी करने जैसा समझें। पुराना तरीका बारीक टेक्स्ट और तीखे किनारों को धुंधला कर देता। नया DAR तरीका संपीड़न के बाद भी टेक्स्ट को स्पष्ट और किनारों को तीखा रखता है।

सारांश

संक्षेप में, पेपर तर्क देता है कि जिस तरह से AI इमेज जनरेटर अपने मस्तिष्क की परतों के बीच सूचना पास करते थे, वह पुराना हो चुका था। यह बहुत शोर वाला, फीडबैक में बहुत कमजोर और दोहराव वाला था। एक स्मार्ट, समय-जागरूक रूटिंग सिस्टम (DAR) पेश करके, जो सही समय पर सही जानकारी चुनता है, उन्होंने AI को तेजी से सीखना और बेहतर चित्र बनाना सिखाया, जबकि अंतर्निखंड आर्किटेक्चर को सरल और अन्य आधुनिक अपग्रेड के साथ संगत रखा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →