← नवीनतम पेपर
🤖 AI

InstructMoLE: Instruction-Guided Mixture of Low-rank Experts for Multi-Conditional Image Generation

InstructMoLE एक निर्देश-निर्देशित लो-रैंक विशेषज्ञों के मिश्रण (mixture of low-rank experts) वाले फ्रेमवर्क को पेश करता है जो मल्टी-कंडीशनल इमेज जनरेशन में टास्क इंटरफेरेंस और स्पेशियल फ्रैगमेंटेशन को हल करने के लिए टोकन-लेवल रूटिंग को एक वैश्विक, निर्देश-व्युत्पन्न सिग्नल से बदल देता है, जिससे मौजूदा विधियों की तुलना में श्रेष्ठ कंपोजिशनल कंट्रोल और सिमेंटिक फिडेलिटी प्राप्त होती है।

मूल लेखक: Jinqi Xiao, Qing Yan, Liming Jiang, Zichuan Liu, Hao Kang, Shen Sang, Tiancheng Zhi, Jing Liu, Cheng Yang, Xin Lu, Bo Yuan

प्रकाशित 2026-05-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jinqi Xiao, Qing Yan, Liming Jiang, Zichuan Liu, Hao Kang, Shen Sang, Tiancheng Zhi, Jing Liu, Cheng Yang, Xin Lu, Bo Yuan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट कलाकार (एक AI) है जो आपके द्वारा बताए गए किसी भी दृश्य को बना सकता है। लेकिन कभी-कभी, जब आप उसे एक जटिल निर्देश देते हैं जैसे, "घास पर रेंगते हुए एक बच्चे, पास में चरते हुए एक सफेद घोड़े और एक फुटबॉल हेलमेट का चित्र बनाओ," तो वह भ्रमित हो जाता है।

यदि कलाकार चित्र के हर एक छोटे पिक्सेल (pixel) के लिए स्वतंत्र रूप से निर्णय लेने की कोशिश करता है, तो वह बच्चे का सिर तो सही बना सकता है, लेकिन शरीर में घोड़े का पैर दे सकता है, या हेलमेट को गलत जगह पर तैरा सकता है। परिणाम एक अस्त-व्यस्त, खंडित चित्र होता है जहाँ अलग-अलग हिस्से तार्किक रूप से एक-दूसरे में फिट नहीं बैठते।

यह पेपर इस कलाकार को सिखाने का एक नया तरीका पेश करता है, जिसे InstructMoLE कहा जाता है। यह कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. समस्या: "पिक्सेल-दर-पिक्सेल" का भ्रम

पारंपरिक तरीके (जैसे LoRA) ऐसे हैं जैसे चित्र के हर एक पिक्सेल को अलग-अलग निर्देश देना।

  • उदाहरण: कल्पना कीजिए कि एक गायक दल (choir) है जहाँ हर गायक अलग शीट संगीत पढ़ रहा है। एक गायक सोचता है कि वह घोड़े के बारे में गा रहा है, अगला हेलमेट के बारे में सोचता है। परिणाम शोर है, गीत नहीं।
  • समस्या: इमेज जनरेशन में, इससे "स्थानिक विखंडन" (spatial fragmentation) होता है। बच्चा घोड़े जैसा दिख सकता है, या हेलमेट घास के अंदर हो सकता है। कलाकार आपके अनुरोध के "बड़ी तस्वीर" (big picture) को खो देता है।

2. समाधान: "विशेषज्ञों की परिषद" (Expert Council)

लेखक एक प्रणाली प्रस्तावित करते हैं जिसे Mixture of Low-rank Experts (MoLE) कहा जाता है।

  • उदाहरण: एक सामान्य कलाकार के बजाय, विशेषज्ञों की एक टीम की कल्पना करें।
    • विशेषज्ञ A जानवरों को बनाने में माहिर है।
    • विशेषज्ञ B कपड़ों को बनाने में माहिर है।
    • विशेषज्ञ C लाइटिंग और छाया (shadows) में माहिर है।
  • पुराना तरीका: पुराना सिस्टम हर पिक्सेल को अपना विशेषज्ञ चुनने के लिए कहता था। घास वाला पिक्सेल "विशेषज्ञ A" चुन सकता था, जबकि घोड़े वाला पिक्सेल "विशेषज्ञ B" चुन सकता था, जिससे एक अराजक मिश्रण पैदा होता था।
  • InstructMoLE का तरीका: सिस्टम पहले आपके पूरे निर्देश को देखता है। यह कहता है, "ठीक है, यह अनुरोध जानवरों और वस्तुओं वाले एक दृश्य के बारे में है। मुझे पूरी टीम को एक योजना पर सहमत होने की आवश्यकता है।"

3. असली मंत्र: "निर्देश-निर्देशित रूटिंग" (Instruction-Guided Routing - IGR)

यही मुख्य नवाचार है। पिक्सेल को विशेषज्ञ चुनने देने के बजाय, सिस्टम आपके पूरे वाक्य को पढ़ता है और पूरे इमेज लेयर के लिए एक ही "विशेषज्ञ परिषद" चुनता है।

  • उदाहरण: एक फिल्म निर्देशक के बारे में सोचें। एक दृश्य की शूटिंग करने से पहले, निर्देशक कलाकारों और क्रू को इकट्ठा करता है और कहता है, "आज हम एक बच्चे और एक घोड़े के साथ एक दृश्य फिल्मा रहे हैं। सभी, इस विशिष्ट शैली और संबंध पर ध्यान केंद्रित करें।"
  • यह कैसे मदद करता है: निर्देशक (रूटिंग सिस्टम) यह सुनिश्चित करता है कि चित्र का प्रत्येक हिस्सा एक ही योजना का पालन करे। बच्चा बच्चा ही रहता है, घोड़ा घोड़ा ही रहता है, और वे एक-दूसरे के साथ सही संबंध में रहते हैं। यह "खंडित" लुक को रोकता है।

4. टीम की विविधता बनाए रखना: "ऑर्थोगोनैलिटी लॉस" (Orthogonality Loss)

एक जोखिम यह है कि यदि आपके पास विशेषज्ञों की एक टीम है, तो वे सभी बिल्कुल एक जैसा काम करना शुरू कर सकते हैं (जैसे, सभी 8 विशेषज्ञ केवल घोड़े बनाना सीख जाते हैं)। इसे "एक्सपर्ट कोलैप्स" (expert collapse) कहा जाता है।

  • उदाहरण: एक स्पोर्ट्स टीम की कल्पना करें जहाँ गोलकीपर, स्ट्राइकर और डिफेंडर सभी केवल गोल बचाने के लिए खड़े होने का निर्णय लेते हैं। टीम विफल हो जाती है क्योंकि कोई भी अपना विशिष्ट काम नहीं कर रहा है।
  • समाधान: लेखकों ने एक विशेष नियम (एक गणितीय दंड) जोड़ा है जो विशेषज्ञों को एक-दूसरे से अलग रहने के लिए मजबूर करता है। यह एक कोच की तरह है जो कहता है, "तुम, तुम्हें गोलकीपर बनना है। तुम, तुम्हें स्ट्राइकर बनना है। तुम अपने साथी का वही काम नहीं कर सकते जो वह कर रहा है।"
  • परिणाम: यह सुनिश्चित करता है कि जब सिस्टम एक "परिषद" चुनता है, तो उसे विशेषज्ञों का एक ऐसा समूह मिलता है जो वास्तव में अलग-अलग कौशल लेकर आता है, जिससे अंतिम चित्र बहुत समृद्ध और सटीक बनता है।

निष्कर्ष

पेपर का दावा है कि इस "ग्लोबल डायरेक्टर" दृष्टिकोण (Instruction-Guided Routing) का उपयोग करके और "विशेषज्ञों की टीम" को विविध रहने के लिए मजबूर करके, AI पिछले तरीकों की तुलना में बहुत बेहतर तरीके से जटिल निर्देशों का पालन कर सकता है।

  • पहले: AI एक घोड़े के सिर वाला बच्चा बना सकता था या हेलमेट को गलत पात्र पर लगा सकता था क्योंकि वह बहुत स्थानीय स्तर पर सोच रहा था।
  • अब: AI आपके द्वारा सुनाई गई पूरी कहानी को समझता है और उस कहानी को पूरी छवि में समान रूप से लागू करता है, जिसके परिणामस्वरूप सुसंगत, उच्च-गुणवत्ता वाले चित्र मिलते हैं जो आपके सटीक इरादे से मेल खाते हैं।

लेखकों ने एक शक्तिशाली AI मॉडल (Flux.1) पर इसका परीक्षण किया और पाया कि यह पिछले तरीकों की तुलना में कई विषयों, बदलते स्टाइल और जटिल स्थानिक निर्देशों को संभालने में काफी बेहतर काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →