InsertFuse: A Unified Framework for Multi-Category Reference-Guided Image Insertion
InsertFuse मल्टी-कैटेगरी रेफरेंस-गाइडेड इमेज इंसर्शन के लिए एक यूनिफाइड फ्रेमवर्क है जो 'इंसर्शन ऑन-पॉलिसी डिस्टिलेशन' के माध्यम से कैटेगरी-विशिष्ट एक्सपर्ट ट्रेनिंग को कंसोलिडेशन से अलग करके स्टेट-ऑफ-द-आर्ट परफॉरमेंस प्राप्त करता है, जबकि 'टोकन-अलाइन्ड ज्योमेट्री कंडीशनिंग', 'रीजन-बैलेंस्ड फ्लो मैचिंग' और 'रेफरेंस CFG' के माध्यम से स्थानिक नियंत्रण और रेफरेंस फिडेलिटी को बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक मास्टर शेफ हैं जो एक नाजुक सूफ़ले (soufflé) से लेकर एक गाढ़े स्टू (stew) तक कुछ भी बना सकते हैं। अब, कल्पना कीजिए कि कोई आपसे एक ही व्यंजन बनाने के लिए कहता है जो एक ही समय में एक आदर्श सूफ़ले और एक आदर्श स्टू दोनों हो, उसी बर्तन का उपयोग करके और निर्देशों के उसी सेट का उपयोग करके। आप कोशिश कर सकते हैं, लेकिन परिणाम संभवतः एक गीला और बेस्वाद मिश्रण होगा: स्टू के लिए आवश्यक गर्मी सूफ़ले के नाजुक उभार को खराब कर देगी, और स्वाद आपस में टकरा जाएंगे। यह उस तरह की समस्या है जिसका सामना कंप्यूटर वैज्ञानिक तब करते हैं जब वे आर्टिफिशियल इंटेलिजेंस (AI) को फोटो एडिट करना सिखा रहे होते हैं।
AI की दुनिया में, "डिफ्यूजन मॉडल्स" (diffusion models) इन मास्टर शेफ की तरह हैं। वे अविश्वसनीय रूप से स्मार्ट सिस्टम हैं जो चरणों में, रैंडम स्टैटिक (जैसे टीवी पर दिखने वाला शोर) को एक स्पष्ट चित्र में धीरे-धीरे बदलकर चित्र बना सकते हैं या बदल सकते हैं। हाल ही में, ये मॉडल इतने अच्छे हो गए हैं कि हम उनसे कह सकते हैं कि "इस कुर्सी में एक बिल्ली रख दो" या "आसमान को सूर्यास्त में बदल दो।" लेकिन एक पेंच है: अलग-अलग प्रकार के संपादन (edits) के लिए बहुत अलग कौशल की आवश्यकता होती है। उंगली पर एक छोटी सी अंगूठी रखने के लिए सूक्ष्म, नाजुक सटीकता की आवश्यकता होती है। एक पूरे व्यक्ति को दृश्य में डालने के लिए यह समझना आवश्यक है कि उनका शरीर कैसे मुड़ता है और उनके कपड़े कैसे दिखते हैं। एक ही एकल AI मॉडल को एक साथ इन सभी विभिन्न कार्यों में विशेषज्ञ बनाने की कोशिश करना, उस शेफ से एक ही समय में सूफ़ले और स्टू दोनों पकाने के लिए कहने जैसा है; AI भ्रमित हो जाता है, और परिणाम अक्सर अजीब या धुंधले दिखते हैं।
यहीं पर InsertFuse नामक एक नया शोध पत्र आता है। शोधकर्ताओं ने, जिनका नेतृत्व शंघाई जियाओ टोंग यूनिवर्सिटी और अन्य की एक टीम द्वारा किया गया था, महसूस किया कि इन पुराने AI शेफों को प्रशिक्षित करने का तरीका ही समस्या थी। एक ही मॉडल को सब कुछ एक साथ सीखने के लिए मजबूर करने के बजाय, उन्होंने एक चतुर दो-चरणीय प्रणाली बनाई। सबसे पहले, उन्होंने पांच अलग-अलग "विशेषज्ञ" शेफ को प्रशिक्षित किया, जिनमें से प्रत्येक केवल एक प्रकार की सामग्री में विशेषज्ञ था: एक एक्सेसरीज (जैसे गहने) के लिए, एक जानवरों के लिए, एक कपड़ों के लिए, एक सामान्य वस्तुओं के लिए, और एक मनुष्यों के लिए। प्रत्येक विशेषज्ञ अपने विशिष्ट क्षेत्र का मास्टर बन गया, जिसने अन्य चीजों से विचलित हुए बिना अपनी श्रेणी की अनूठी विशेषताओं को ठीक से सीखा।
लेकिन यदि आप केवल एक ऐसा ऐप चाहते हैं जो सब कुछ कर सके, तो पांच अलग-अलग शेफ होना कष्टप्रद है। इसलिए, टीम ने इन्सर्शन ऑन-पॉलिसी डिस्टिलेशन (Insertion On-Policy Distillation - IOPD) नामक एक विशेष प्रशिक्षण तकनीक का आविष्कार किया। इसे एक "छात्र" शेफ के रूप में सोचें जो पांच विशेषज्ञों को काम करते हुए देखता है। छात्र केवल रेसिपी को याद नहीं करता है; वह स्वयं व्यंजन बनाने का अभ्यास करता है, और जब भी वह फंस जाता है, तो वह अगला कदम उठाने के लिए सही विशेषज्ञ से सटीक निर्देश मांगता है। यदि छात्र एक सिर पर टोपी लगाने की कोशिश कर रहा है, तो वह "एक्सेसरी विशेषज्ञ" से पूछता है। यदि वह कमरे में एक व्यक्ति को रखने की कोशिश कर रहा है, तो वह "मानव विशेषज्ञ" से पूछता है। सही समय पर सही विशेषज्ञ से सीखकर, छात्र एक एकीकृत मास्टर शेफ बन जाता है जो किसी भी इन्सर्शन कार्य को पूरी तरह से संभाल सकता है, बिना एक साथ सब कुछ सीखने के भ्रम के।
यह सुनिश्चित करने के लिए कि छात्र शेफ केवल अंदाजा न लगाए कि चीजों को कहाँ रखना है, टीम ने दो विशेष उपकरण भी जोड़े। पहला है टोकन-अलाइन्ड ज्योमेट्री कंडीशनिंग (Token-Aligned Geometry Conditioning), जो AI को एक सटीक GPS मानचित्र देने जैसा है कि नई वस्तु को ठीक कहाँ जाना चाहिए, जिससे यह सुनिश्चित होता है कि वह पृष्ठभूमि में घुले बिना छेद के आकार में पूरी तरह फिट हो जाए। दूसरा है रीजन-बैलेंस्ड फ्लो मैचिंग (Region-Balanced Flow Matching), जो एक निष्पक्ष न्यायाधीश के रूप में कार्य करता है। सामान्य प्रशिक्षण में, AI एक छोटी वस्तु (जैसे ब्रेसलेट) को अनदेखा कर सकता है क्योंकि एक विशाल पृष्ठभूमि (जैसे दीवार) स्क्रीन का अधिकांश हिस्सा घेर लेती है। यह नया उपकरण AI को बताता है, "हे, भले ही ब्रेसलेट छोटा है, लेकिन यह बहुत महत्वपूर्ण है, इसलिए इस पर अतिरिक्त ध्यान दें," जिससे यह सुनिश्चित होता है कि सूक्ष्म विवरण खो न जाएं।
अंत में, यह सुनिश्चित करने के लिए कि डाला गया ऑब्जेक्ट मूल फोटो के बिल्कुल समान दिखे (उसकी अनूठी बनावट और पहचान बनाए रखते हुए), उन्होंने रेफरेंस CFG (Reference CFG) नामक तकनीक का उपयोग किया। यह छात्र शेफ को एक सख्त नियम देने जैसा है: "आपको इस शर्ट के मूल पैटर्न को बनाए रखना होगा, चाहे आप इसे कितना भी खींचें।"
परिणाम प्रभावशाली हैं। जब शोधकर्ताओं ने अपने नए "छात्र" मॉडल का अन्य शीर्ष AI एडिटर्स के मुकाबले परीक्षण किया, तो इसने लगभग हर श्रेणी में जीत हासिल की। इसने मूल वस्तुओं के लुक को बेहतर ढंग से संरक्षित किया, उन्हें अधिक सटीक रूप से रखा, और पृष्ठभूमि को स्वाभाविक बनाए रखा। एक उपयोगकर्ता अध्ययन में जहाँ लोगों ने अपनी पसंदीदा छवियों के लिए मतदान किया, InsertFuse को 50% से अधिक प्रतिभागियों द्वारा चुना गया, जो प्रतिस्पर्धा को बहुत पीछे छोड़ देता है। यह शोध पत्र सुझाव देता है कि विशिष्ट कौशल सीखने की प्रक्रिया को उन्हें संयोजित करने की प्रक्रिया से अलग करके, हम एक ऐसा AI बना सकते हैं जो विशेषज्ञ और सामान्य विशेषज्ञ (specialist and generalist) दोनों हो, जिससे इमेज एडिटिंग की "सोगी स्टू" (सड़े हुए स्टू) की समस्या का समाधान एक बार में हो सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।