← नवीनतम पेपर
⚡ electrical engineering

Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

Mage-Flow एक कॉम्पैक्ट 4B-स्केल फाउंडेशन मॉडल परिवार है जो एक हल्के उच्च-निष्ठा वाले VAE, एक नेटिव-रिज़ॉल्यूशन डिफ्यूजन ट्रांसफार्मर और सिस्टम-स्तरीय अनुकूलन के सह-डिज़ाइन के माध्यम से कुशल, उच्च-रिज़ॉल्यूशन टेक्स्ट-टू-इमेज जनरेशन और निर्देश-आधारित संपादन प्राप्त करता है, जो एक सिंगल GPU पर अल्ट्रा-लो लेटेंसी के साथ प्रतिस्पर्धी प्रदर्शन प्रदान करता है।

मूल लेखक: Xinjie Zhang, Peng Zhang, Shicheng Zheng, Jinghao Guo, Zhaoyang Jia, Yifei Shen, Xun Guo, Yuxuan Luo, Jiahao Li, Wenxuan Xie, Fanyi Pu, Xiaoyi Zhang, Kaichen Zhang, Zongyu Guo, Tianci Bi, Dongnan Gui
प्रकाशित 2026-07-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinjie Zhang, Peng Zhang, Shicheng Zheng, Jinghao Guo, Zhaoyang Jia, Yifei Shen, Xun Guo, Yuxuan Luo, Jiahao Li, Wenxuan Xie, Fanyi Pu, Xiaoyi Zhang, Kaichen Zhang, Zongyu Guo, Tianci Bi, Dongnan Gui, Zhening Liu, Zimo Wen, Zihan Zheng, Senqiao Yang, Xiao Li, Jinglu Wang, Bin Li, Yan Lu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कलाकार बनाने की कोशिश कर रहे हैं। वर्षों तक, इस कलाकार को वास्तव में प्रतिभाशाली बनाने का एकमात्र तरीका एक ऐसा विशाल मस्तिष्क बनाना था जिसे चलाने के लिए सुपर कंप्यूटरों से भरे एक गोदाम की आवश्यकता होती। ये "विशाल मस्तिष्क" अविश्वसनीय विवरण के साथ शानदार चित्र बना सकते थे या फोटो एडिट कर सकते थे, लेकिन वे इतने भारी और महंगे थे कि केवल कुछ बड़ी कंपनियाँ ही उन्हें वहन कर सकती थीं। वे एक ऐसी फेरारी की तरह थे जिसे शुरू करने के लिए मैकेनिकों की एक पूरी टीम की आवश्यकता होती है।

"जेनरेटिव एआई" (generative AI) का क्षेत्र वास्तव में कंप्यूटर को शून्य से नई चीजें, जैसे कि चित्र, बनाना सिखाने के बारे में है। इसे करने के लिए, कंप्यूटर को दो मुख्य उपकरणों की आवश्यकता होती है। पहला, उसे एक टोकनाइज़र (tokenizer) की आवश्यकता होती है, जो एक अनुवादक की तरह है जो एक अव्यवस्थित, हाई-डेफिनिशन फोटो को निर्देशों की एक संक्षिप्त सूची में बदल देता है जिसे कंप्यूटर समझ सके। दूसरा, उसे एक बैकबोन (backbone) की आवश्यकता होती है, जो मुख्य इंजन है जो उन निर्देशों के आधार पर चित्र बनाता है। बड़ी समस्या यह थी कि अनुवादक (टोकनाइज़र) अक्सर धीमा और अनाड़ी होता था, खासकर बड़े, विस्तृत चित्रों के साथ, जिससे पूरी प्रक्रिया सुस्त हो जाती थी। शोधकर्ता यह सवाल पूछ रहे थे: क्या हम एक ऐसा रोबोट कलाकार बना सकते हैं जो दिग्गजों जितना ही प्रतिभाशाली हो, लेकिन इतना छोटा हो कि एक सिंगल लैपटॉप पर चल सके, बिना उसकी जादुई क्षमता को खोए?

यहाँ मेज-फ्लो (Mage-Flow) आता है, माइक्रोसॉफ्ट मेज टीम का एक नया प्रोजेक्ट जो कहता है, "हाँ, हम यह कर सकते हैं।" एक बड़ा मस्तिष्क बनाने के बजाय, टीम ने पूरे सिस्टम को अविश्वसनीय रूप से कुशल बनाने के लिए इसे ज़मीन से दोबारा बनाने का फैसला किया। उन्होंने केवल 4 बिलियन पैरामीटर्स (आकार का एक माप) वाला एक कॉम्पैक्ट "कलाकार" बनाया, जो वर्तमान में क्षेत्र पर हावी 80-बिलियन-पैरामीटर वाले दिग्गजों की तुलना में बहुत छोटा है।

उन्होंने इसे कुछ चतुर तरीकों का उपयोग करके किया, यहाँ बताया गया है कि यह कैसे हुआ:

1. सुपर-फास्ट अनुवादक (Mage-VAE)
टोकनाइज़र को एक ऐसे अनुवादक के रूप में सोचें जो एक फोटो को एक गुप्त कोड में बदल देता है। पुराने अनुवादक भारी सूटकेस की तरह थे; उन्हें पैक करने और अनपैक करने में बहुत समय लगता था, खासकर हाई-रेज़ोल्यूशन वाली छवियों के लिए। मेज-फ्लो ने एक नया अनुवादक पेश किया जिसे मेज-वीएई (Mage-VAE) कहा जाता है। कल्पना कीजिए कि एक भारी सूटकेस के बजाय, उन्होंने एक जादुई ओरिगामी मशीन बनाई है। यह एक जटिल फोटो को एक छोटे, सलीके से रखे गए पैकेज में मोड़ सकता है और उसे वापस एक पूर्ण चित्र में एक ही, बिजली जैसी तेज़ प्रक्रिया में खोल सकता है। यह नया अनुवादक इतना कुशल है कि यह पुराने भारी अनुवादकों के समान काम करता है लेकिन इमेज को अनपैक करने में लगभग 22 गुना कम ऊर्जा का उपयोग करता है। इसका मतलब है कि रोबोट कलाकार का सारा समय अनुवादक के काम पूरा होने का इंतज़ार करने में खर्च नहीं होता।

2. लचीला कैनवास (Native-Resolution)
आमतौर पर, जब कंप्यूटर चित्र बनाते हैं, तो वे हर छवि को एक कठोर ग्रिड में फिट करने के लिए मजबूर करते हैं, जैसे कि एक लंबे आयत और एक ऊंचे वर्ग को एक ही वर्गाकार बॉक्स में फिट करने की कोशिश करना। इससे जगह बर्बाद होती है और रचनात्मकता सीमित होती है। मेज-फ्लो नेटिव-रेज़ोल्यूशन पैकिंग (Native-Resolution Packing) नामक तकनीक का उपयोग करता है। एक लचीले कैनवास की कल्पना करें जो आपके द्वारा चाही गई छवि के सटीक आकार में ढलने के लिए खिंच और सिकुड़ सकता है, चाहे वह एक चौड़ा मूवी पोस्टर हो या लंबा फोन वॉलपेपर। कंप्यूटर छवियों को बक्सों में कुचलने में समय बर्बाद नहीं करता है; वह उन्हें बिल्कुल वैसे ही बनाता है जैसे वे हैं। यह प्रशिक्षण प्रक्रिया को बहुत तेज़ बनाता है और कलाकार को बिना भ्रमित हुए अत्यधिक आकारों को संभालने की अनुमति देता है।

3. टर्बो इंजन
एक तेज़ अनुवादक और एक लचीले कैनवास के बावजूद, चरण-दर-चरण चित्र बनाने में थोड़ा समय लग सकता है। टीम ने अपने मॉडलों के टर्बो (Turbo) संस्करण बनाने के लिए एक विशेष "डिस्टिलेशन" (distillation) तकनीक का उपयोग किया। इसे कलाकार को छोटे, सतर्क कदमों के बजाय बड़ी छलांग लगाने के लिए सिखाने के रूप में समझें। जबकि एक मानक कलाकार को पेंटिंग पूरी करने में 30 कदम लग सकते हैं, टर्बो संस्करण इसे केवल 4 चरणों में कर सकता है। कम कदम उठाने के बावजूद, गुणवत्ता अविश्वसनीय रूप से उच्च बनी रहती है।

परिणाम
टीम ने अपने 4-बिलियन-पैरामीटर वाले कलाकार का परीक्षण 80-बिलियन-पैरामीटर वाले दिग्गजों के विरुद्ध किया। परिणाम आश्चर्यजनक थे। एक सिंगल शक्तिशाली कंप्यूटर चिप (NVIDIA A100) पर, मेज-फ्लो केवल 0.59 सेकंड में 1024x1024 रेज़ोल्यूशन पर एक उच्च-गुणवत्ता वाली छवि बना सकता है। मौजूदा फोटो को एडिट करने के लिए, इसमें केवल 1.02 सेकंड लगे।

शायद सबसे प्रभावशाली बात यह है कि टर्बो संस्करण बहुत कम मेमोरी (लगभग 18 GB) का उपयोग करते हुए लगभग एक सेकंड में एक फोटो को एडिट कर सकता है, जबकि विशाल मॉडलों को अक्सर इससे दोगुना या तिगुना मेमोरी की आवश्यकता होती है और उन्हें चलने में बहुत अधिक समय लगता है। यह पेपर सुझाव देता है कि यह दृष्टिकोण सिद्ध करता है कि उच्च-गुणवत्ता वाली कला बनाने के लिए आपको एक विशाल, महंगे मस्तिष्क की आवश्यकता नहीं है; आपको बस एक स्मार्ट, कुशल डिज़ाइन की आवश्यकता है।

पेपर ने यह भी दिखाया कि यह सिस्टम एडिटिंग के लिए बहुत अच्छा काम करता है। आप रोबोट को बता सकते हैं कि "बैकग्राउंड को बीच (beach) में बदलें," "व्यक्ति को हटा दें," या "टेक्स्ट जोड़ें," और वह इसे पूरी निष्ठा से करता है। उन्होंने इसे एक बहुत ही विशिष्ट कार्य पर भी परखा: तीरों और टेक्स्ट के साथ वैज्ञानिक आरेख (diagrams) बनाना। छोटा 4-बिलियन मॉडल, थोड़े अतिरिक्त प्रशिक्षण के बाद, एक बहुत बड़े, विशेष मॉडल के लगभग उतना ही अच्छा जटिल आरेख बना सकता है।

संक्षेप में, मेज-फ्लो सुझाव देता है कि एआई आर्ट का भविष्य चीजों को बड़ा और भारी बनाने के बारे में नहीं है। यह उन्हें स्मार्ट, हल्का और तेज़ बनाने के बारे में है, ताकि शक्तिशाली इमेज जनरेशन और एडिटिंग आपके डेस्कटॉप पर, या यहाँ तक कि आपकी जेब में, बिना किसी सुपरकंप्यूटर की आवश्यकता के हो सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →