← नवीनतम पेपर
💻 computer science

MS-CustomNet: Controllable Multi-Subject Customization with Hierarchical Relational Semantics

MS-CustomNet एक नवीन फ्रेमवर्क है जो उपयोगकर्ताओं को व्यक्तिगत विषय की पहचान बनाए रखते हुए पदानुक्रमित व्यवस्थाओं और स्थानिक संबंधों को स्पष्ट रूप से परिभाषित करने की अनुमति देकर मल्टी-सब्जेक्ट इमेज जनरेशन पर ज़ीरो-शॉट, फाइन-ग्रेंड कंट्रोल सक्षम करता है, जिसे एक नए MSI डेटासेट द्वारा समर्थित है और जो पहचान संरक्षण और स्थितिगत नियंत्रण में बेहतर प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Pengxiang Cai, Mengyang Li

प्रकाशित 2026-03-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pengxiang Cai, Mengyang Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक जादुई फोटो एडिटर है जो आपके टेक्स्ट विवरणों को वास्तविक चित्रों में बदल सकता है। आप कह सकते हैं, "एक चटाई पर बिल्ली बनाओ," और वह ऐसा करता है। लेकिन क्या होगा अगर आप कुछ अधिक विशिष्ट चाहते हैं? क्या होगा अगर आप कहना चाहें, "इस विशिष्ट बिल्ली को (जो आपके फोन में है) इस विशिष्ट कटोरे के (जो आपकी रसोई का है) अंदर बैठा दो, जबकि वह विशिष्ट कुत्ता (आपका पड़ोसी का) कटोरे के पीछे से देख रहा हो"?

वर्तमान AI उपकरण प्रतिभाशाली लेकिन थोड़े अराजक चित्रकारों की तरह हैं। वे बिल्ली या कटोरा बनाने में माहिर हैं, लेकिन यदि आप उन्हें बहुत सटीक तरीके से तीन विशिष्ट चीजों को एक साथ रखने के लिए कहते हैं, तो वे अक्सर भ्रमित हो जाते हैं। वे बिल्ली के चेहरे को कुत्ते के कानों के साथ मिला सकते हैं, या वे कटोरे को मेज के बजाय आसमान में तैरता हुआ रख सकते हैं। वे वस्तुओं के एक के ऊपर एक होने, एक-दूसरे के पीछे छिपने या उनके बीच के तालमेल के "नियमों" को समझने में संघर्ष करते हैं।

MS-CustomNet से मिलिए। इसे एक पेंटर के बजाय एक नाटक के कुशल मंच निर्देशक (Master Stage Director) के रूप में सोचें।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: "कॉन्सेप्ट ब्लीड" (Concept Bleed)

कल्पना कीजिए कि आपके पास लेगो (LEGO) ब्रिक्स का एक डिब्बा है। आप एक किला, एक अंतरिक्ष यान और एक रोबोट बनाना चाहते हैं। यदि आप बस सभी ब्रिक्स को एक ढेर में फेंक देते हैं और कहते हैं "मेरे लिए एक दृश्य बनाओ," तो AI गलती से रोबोट के हाथ को अंतरिक्ष यान के पंख पर चिपका सकता है। इसे "कॉन्सेप्ट ब्लीड" कहा जाता है। मौजूदा उपकरण अक्सर पात्रों को अलग रखने या इस बात का पालन करने में विफल रहते면 कि कौन किसके सामने खड़ा है।

2. समाधान: "निर्देशक की पटकथा" (The Director's Script - MS-CustomNet)

MS-CustomNet एक नया सिस्टम है जिसे परम निर्देशक बनने के लिए डिज़ाइन किया गया है। यह केवल अनुमान नहीं लगाता; यह उस पटकथा का पालन करता है जो आप इसे देते हैं।

  • पात्र (पहचान का संरक्षण - Identity Preservation): आप AI को अपने विशिष्ट "अभिनेताओं" (एक विशिष्ट बैकपैक, एक विशिष्ट कप, एक विशिष्ट कुत्ता) की तस्वीरें दिखाते हैं। सिस्टम के पास एक विशेष मेमोरी ट्रिक है जो यह सुनिश्चित करती है कि बैकपैक बैकपैक ही रहे और कुत्ता कुत्ता ही रहे, भले ही उन्हें एक नए दृश्य में स्थानांतरित कर दिया गया हो। यह एक कॉस्ट्यूम विभाग की तरह है जो कभी भी अभिनेताओं की अनूठी विशेषताओं को नहीं खोता।
  • मंच निर्देश (स्थानिक नियंत्रण - Spatial Control): यही जादू वाला हिस्सा है। आप केवल यह नहीं कहते कि "उन्हें एक साथ रखें।" आप AI को एक लेआउट मैप देते हैं। इसे एक थिएटर के फ्लोर प्लान की तरह समझें। आप AI को बताते हैं: "कप कटोरे के अंदर है," या "किताब स्टैक के ऊपर है।" AI इस मैप को पढ़ता है और आपके निर्देशों के अनुसार बिल्कुल वैसा ही दृश्य बनाता है, यह भी ध्यान रखता है कि कौन किसके सामने है या कौन किसके पीछे छिपा है।

3. प्रशिक्षण का मैदान: "MSI डेटासेट"

AI को निर्देश पालन में इतना अच्छा बनाने के लिए, शोधकर्ताओं को एक नया स्कूल बनाना पड़ा। उन्होंने MSI (Multi-Subject Interaction) नामक एक विशाल डेटासेट बनाया।

  • कल्पना कीजिए कि आप एक लाइब्रेरी (COCO डेटासेट) से हजारों तस्वीरें लेते हैं।
  • उन्होंने उबाऊ दृश्यों को हटा दिया और केवल जटिल दृश्य रखे जिनमें कई वस्तुएं आपस में क्रिया कर रही थीं (जैसे एक व्यक्ति के पास गेंद के साथ खेलता हुआ कुत्ता)।
  • फिर उन्होंने "प्रशिक्षण अभ्यास" बनाए जहाँ AI को यह सीखना था कि कैसे एक कुत्ते, एक गेंद और एक व्यक्ति की फोटो ली जाए, और उन्हें नए नियमों के अनुसार पुनर्व्यवस्थित किया जाए। यह एक छात्र द्वारा फ्लैशकार्ड के साथ अभ्यास करने जैसा है जब तक कि वह किसी भी पहेली को हल न कर सके।

4. सीखने की रणनीति: "छोटे कदम" (Curriculum Learning)

आप एक बच्चे को पहले ही दिन मैराथन दौड़ने के लिए नहीं कह सकते। आप पैदल चलने से शुरू करते हैं, फिर जॉगिंग, फिर दौड़ना।
शोधकर्ताओं ने एक समान रणनीति का उपयोग किया जिसे करिकुलम लर्निंग (Curriculum Learning) कहा जाता है।

  • चरण 1: उन्होंने AI को केवल दो वस्तुओं (जैसे, एक कप और एक तश्तरी) को संभालने के लिए सिखाया।
  • चरण 2: एक बार जब AI इसमें अच्छा हो गया, तो उन्होंने इसमें तीसरी वस्तु जोड़ दी।
  • चरण 3: अंत में, उन्होंने इसे एक बार में पांच वस्तुओं तक संभालने दिया।
    इससे AI को अभिभूत और भ्रमित होने से रोका गया, जिससे वह जटिल इंटरैक्शन को चरण-दर-चरण सीख सका।

5. परिणाम: एक पूर्णतः मंचित दृश्य

जब आप MS-CustomNet का उपयोग करते हैं, तो आपको एक ऐसा परिणाम मिलता है जो एक मूवी सेट जैसा महसूस होता है:

  • पहचान (Identity): वस्तुएं बिल्कुल वैसी ही दिखती हैं जैसी आपने दी गई तस्वीरें थीं।
  • स्थिति (Position): वस्तुएं ठीक वहीं होती हैं जहाँ आपने उन्हें बताया था।
  • तालमेल (Interaction): यदि आपने कहा "कप कटोरे के अंदर है," तो AI जानता है कि कटोरे के रिम को कप के ऊपरी हिस्से को ढकते हुए कैसे बनाना है। यह गहराई और परतों (layering) को समझता है।

संक्षेप में:
यदि वर्तमान AI इमेज जनरेटर एक जादूगर की तरह हैं जो टोपी से यादृच्छिक खरगोश निकालता है, तो MS-CustomNet एक शेफ की तरह है जो आपके सटीक नुस्खे (recipe) का पालन करता है। यह आपके द्वारा दिए गए विशिष्ट अवयवों को लेता है, उन्हें ठीक वैसे ही व्यवस्थित करता है जैसा आप चाहते हैं, और सुनिश्चित करता है कि अंतिम व्यंजन स्वादिष्ट और सुसंगत दिखे। यह आपको अपनी दृश्य कहानी का निर्देशक बनने की शक्ति देता है, जिसमें पूर्ण नियंत्रण होता है कि कौन कहाँ खड़ा है और वे कैसे एक-दूसरे के साथ क्रिया करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →