← नवीनतम पेपर
💻 computer science

MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale

यह शोध पत्र MRT को प्रस्तुत करता है, जो 10M नमूनों पर प्रशिक्षित एक 20B-पैरामीटर वाला मास्क्ड रीजन डिफ्यूजन मॉडल है जो टेक्स्ट-टू-लेयर्स, इमेज-टू-लेयर्स और लेयर्स-टू-लेयर्स कार्यों को एकीकृत करता है ताकि मौजूदा व्यावसायिक और समवर्ती प्रणालियों की तुलना में बेहतर गुणवत्ता और दक्षता के साथ अत्याधुनिक, रीयल-टाइम, मल्टी-लेयर पारदर्शी छवि निर्माण और संपादन प्राप्त किया जा सके।

मूल लेखक: Zhicong Tang, Zhao Zhang, Jingye Chen, Mohan Zhou, Yifan Pu, Yuchi Liu, Yalong Bai, Ethan Smith, Yuhui Yuan

प्रकाशित 2026-05-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhicong Tang, Zhao Zhang, Jingye Chen, Mohan Zhou, Yifan Pu, Yuchi Liu, Yalong Bai, Ethan Smith, Yuhui Yuan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक डिजिटल फोटो एडिटर है, जैसे कि फोटोशॉप, जहाँ आप अलग-अलग "लेयर्स" (परतों) के साथ काम कर सकते हैं। आप बाकी तस्वीर को खराब किए बिना एक टेक्स्ट बॉक्स को हिला सकते हैं, बैकग्राउंड बदल सकते हैं, या किसी आइकन को बदल सकते हैं। अब, एक ऐसे AI की कल्पना करें जो न केवल एक सपाट, तैयार तस्वीर बनाता है, बल्कि उस तस्वीर को ठीक वैसे ही परतों में बनाता है जैसे एक मानव डिज़ाइनर करता है।

यह बिल्कुल वही है जिसके बारे में पेपर "MRT: Masked Region Transformer" है। यहाँ एक सरल विवरण दिया गया है कि उन्होंने क्या बनाया और यह कैसे काम करता है, कुछ रोज़मर्रा के उदाहरणों का उपयोग करते हुए।

बड़ी समस्या: "फ्लैट केक" बनाम "लेयर्ड केक"

आज के अधिकांश AI इमेज जनरेटर उन बेकर्स की तरह हैं जो केवल फ्लैट केक बनाते हैं। वे आपको एक तैयार छवि देते हैं, लेकिन यदि आप ऊपर रखी चेरी को बदलना चाहते हैं, तो आपको पूरा केक फिर से पेंट करना होगा। आप स्पंज को खराब किए बिना चेरी को हिला नहीं सकते या फ्रॉस्टिंग को बदल नहीं सकते।

शोधकर्ताओं ने एक ऐसा AI बनाना चाहा जो एक लेयर्ड केक (परतों वाला केक) बेक करे। वे एक ऐसा सिस्टम चाहते थे जो स्पंज, फिलिंग, फ्रॉस्टिंग और चेरी को अलग-अलग, बाद में एडिट किए जा सकने वाले टुकड़ों के रूप में जनरेट करे। इसे "लेयर्ड इमेज जनरेशन" कहा जाता है।

समाधान: MRT (द मास्टर शेफ)

Canva Research की टीम ने MRT (Masked Region Transformer) नामक एक विशाल AI मॉडल बनाया है। इसे एक मास्टर शेफ के रूप में सोचें जिसने इन लेयर्ड केक्स को शून्य से बनाने के लिए 1 करोड़ (10 मिलियन) से अधिक विभिन्न ग्राफिक डिज़ाइनों (पोस्टर, फ्लायर्स, विज्ञापन) का अध्ययन किया है।

यहाँ तीन मुख्य "सुपरपावर्स" हैं जो इस शेफ के पास हैं:

1. "जादुई रेसिपी" (Text-to-Layers)

आप AI को एक टेक्स्ट विवरण दे सकते हैं, जैसे "एक चमकती हुई बॉल और '20% OFF' साइन के साथ डिस्को पार्टी के लिए एक पोस्टर।"

  • पुराना AI: डिस्को की एक सपाट तस्वीर बना देता।
  • MRT: बैकग्राउंड, डिस्को बॉल और टेक्स्ट को अलग-अलग, पारदर्शी परतों के रूप में बनाता है। आप टेक्स्ट लेयर को बाईं ओर ले जा सकते हैं, या डिस्को बॉल को स्टार में बदल सकते हैं, और बाकी का पोस्टर एकदम सही रहता है।

2. "रिवर्स इंजीनियर" (Image-to-Layers)

यह एक तैयार, फ्लैट केक को वापस उसके अवयवों (ingredients) में अलग करने जैसा है।

  • कार्य: आप एक फ्लैट इमेज अपलोड करते हैं (जैसे किसी वेबसाइट का स्क्रीनशॉट या पोस्टर)।
  • MRT का काम: यह पता लगाता है कि बैकग्राउंड क्या है, टेक्स्ट क्या है, और तस्वीरें क्या हैं। फिर यह उन्हें अलग-अलग, एडिट करने योग्य परतों में "छीलकर" अलग कर देता है।
  • ट्रिक: पेपर का दावा है कि यह अविश्वसनीय रूप से अच्छा काम करता है, यहाँ तक कि कई ओवरलैपिंग वस्तुओं वाले जटिल डिज़ाइनों पर भी, और यह वर्तमान में उपलब्ध अन्य उपकरणों की तुलना में बहुत तेज़ और अधिक सटीक है।

3. "मिक्स-एंड-मैच" (Layers-to-Layers)

यह एडिटिंग वाला हिस्सा है। आप AI को एक डिज़ाइन दे सकते हैं और कह सकते हैं, "यहाँ एक नई लेयर जोड़ें" या "इस विशिष्ट लेयर के स्टाइल को बाकी चीज़ों से मेल खाने के लिए बदलें।"

  • उदाहरण: आपके पास नीले आसमान वाला एक पोस्टर है। आप एक नया सूरज जोड़ना चाहते हैं। MRT सूरज को इस तरह जोड़ता है कि वह मौजूदा आसमान की लाइटिंग और स्टाइल में पूरी तरह फिट बैठता है। या, आप एक बिल्ली की फोटो अपलोड करते हैं और कहते हैं, "इस बिल्ली को इस पोस्टर में फिट होने वाले कार्टून स्टिकर जैसा बना दो।" MRT इसे तुरंत बदल देता है।

सीक्रेट सॉस: उन्होंने इसे कैसे किया

1. "ओवरफ्लो" ट्रिक (बड़ा कैनवास)
आमतौर पर, जब AI कोई तस्वीर बनाता है, तो वह फ्रेम के बाहर जाने वाली किसी भी चीज़ को काट देता है (जैसे फोटो के किनारे से बाहर निकलता हुआ पेड़ की टहनी)।

  • MRT का नवाचार: उन्होंने AI को एक विशाल, अदृश्य कैनवास पर चित्र बनाना सिखाया जो अंतिम तस्वीर से बड़ा है। यह तत्वों को किनारों से "ओवरफ्लो" होने की अनुमति देता है।
  • क्यों महत्वपूर्ण है: यदि आप बाद में उस बाहर निकली हुई टहनी को पोस्टर के दूसरी तरफ ले जाना चाहते हैं, तो AI के पास पूरी टहनी सुरक्षित रहती है, न कि केवल वह हिस्सा जो दिखाई दे रहा था। यह टुकड़ों को पूरा और एडिट करने योग्य रखता है।

2. "मास्किंग" गेम
कल्प Imagine करें कि आप एक खेल खेल रहे हैं जहाँ आपको अनुमान लगाना है कि कंबल के नीचे क्या है।

  • Text-to-Layers: AI एक खाली, शोर भरी (noisy) कैनवास (जैसे पुराने टीवी पर स्टैटिक) से शुरू करता है और परतों को भरता है।
  • Image-to-Layers: AI को तैयार तस्वीर दी जाती है (कंबल हटा दिया गया है), लेकिन उसे बैकग्राउंड और टेक्स्ट को "मास्क" (ढकने) के लिए कहा जाता है, और फिर केवल उन विशिष्ट हिस्सों को "दोबारा बनाने" के लिए कहा जाता है ताकि उन्हें अलग किया जा सके।
  • इस "मास्किंग" तकनीक का उपयोग करके, एक ही AI दिमाग एक साथ लिखने, चीज़ों को अलग करने और एडिट करने का काम संभाल सकता है।

3. गति बढ़ाना (डिस्टिलेशन)
सामान्य तौर पर, एक जटिल लेयर्ड इमेज जनरेट करने में काफी समय लगता है (जैसे किसी धीमी कंप्यूटर रेंडरिंग का इंतज़ार करना)।

  • शोधकर्ताओं ने डिस्टिलेशन (Distillation) नामक तकनीक का उपयोग किया। इसे एक मास्टर शेफ (धीमा, परफेक्ट टीचर) द्वारा एक प्रशिक्षु (तेज़ छात्र) को उसी व्यंजन को 50 के बजाय 8 स्टेप्स में बनाना सिखाने के रूप में समझें।
  • परिणाम: अब AI इन जटिल लेयर्ड डिज़ाइनों को रियल-टाइम में (लगभग 3 से 6 सेकंड में) जनरेट कर सकता है, बिना गुणवत्ता खोए।

परिणाम

पेपर की तुलना अन्य टॉप AI मॉडल्स और कमर्शियल टूल्स से की गई है।

  • गुणवत्ता: यूजर टेस्ट में, लोगों ने अन्य सिस्टमों की तुलना में MRT के परिणामों को पसंद किया क्योंकि इसकी परतें अधिक साफ थीं, टेक्स्ट बेहतर था, और टुकड़े एक साथ अधिक स्वाभाविक रूप से फिट बैठते थे।
  • गति: जटिल छवियों को तोड़ने के मामले में यह "Qwen-Image-Layered" नामक प्रतिस्पर्धी मॉडल की तुलना में 10 से 100 गुना तेज़ है।
  • मेमोरी: यह काफी कम कंप्यूटर मेमोरी का उपयोग करता है, जिसका अर्थ है कि यह क्रैश हुए बिना स्टैंडर्ड शक्तिशाली ग्राफिक्स कार्ड पर चल सकता है।

सारांश में

यह पेपर प्रस्तुत करता है कि डिजिटल इमेज को स्थिर पेंटिंग के रूप में नहीं, बल्कि एडिट करने योग्य लेगो सेट्स (Lego sets) के रूप में देखा जाए। यह इन सेट्स को टेक्स्ट विवरण से बना सकता है, एक तैयार तस्वीर को खोलकर लेगो ब्रिक्स को प्रकट कर सकता है, या डिज़ाइन बदलने के लिए ब्रिक्स को बदल सकता है—और यह सब करते हुए टुकड़ों को पूरा रखता है, भले ही वे बॉक्स के किनारों से बाहर निकल रहे हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →