DreamOmni3: Scribble-based Editing and Generation
यह शोध पत्र DreamOmni3 प्रस्तुत करता है, जो एक एकीकृत मॉडल है जो एक नवीन डेटा संश्लेषण पाइपलाइन और मूल एवं स्केच की गई छवियों को सटीक दृश्य नियंत्रण के लिए संयोजित करने वाले एक संयुक्त इनपुट ढांचे के माध्यम से लचीले स्क्रिबल-आधारित संपादन और पीढ़ी को सक्षम करके GUI-आधारित निर्माण को आगे बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान कलाकार से बात कर रहे हैं जो आपके द्वारा वर्णित किसी भी चीज़ को बना सकता है। यदि आप कहते हैं, "एक बिल्ली बनाओ," तो वह उसे बना देता है। यदि आप कहते हैं, "बिल्ली को टोपी पहनाओ," तो वह चित्र को बदल देता है। यह AI इमेज जनरेशन और एडिटिंग की दुनिया है, जहाँ कंप्यूटर आपके शब्दों के आधार पर चित्र बनाने और उनमें बदलाव करने के लिए सीखते हैं। लंबे समय तक, इन डिजिटल कलाकारों से बात करने का एकमात्र तरीका टेक्स्ट (शब्द) था। लेकिन यहाँ एक समस्या है: शब्द कभी-कभी अनाड़ी होते हैं। किसी नई वस्तु को ठीक कहाँ रखना है, या किसी बिखरे हुए चित्र के एक विशिष्ट भाग को कैसे बदलना है, इसे सटीक रूप से समझाने की कोशिश करना वैसा ही है जैसे बिना लैंडमार्क वाले मानचित्र का उपयोग करके किसी मित्र को दिशा निर्देश देने की कोशिश करना। आप कह सकते हैं, "पेड़ को बाईं ओर रखें," लेकिन AI उसे बहुत बाईं ओर, या गलत बाईं ओर रख सकता है।
इसे ठीक करने के लिए, वैज्ञानिकों ने इन कलाकारों से बात करने का एक नया तरीका खोजा है: स्क्रिबलिंग (Scribbling - रेखांकन)। केवल टाइप करने के बजाय, आप स्क्रीन पर सीधे घेरे, बॉक्स या टेढ़ी-मेढ़ी रेखाएं बनाने के लिए एक डिजिटल पेन पकड़ सकते हैं ताकि आप AI को दिखा सकें कि आपका वास्तव में क्या मतलब है। यह एक मानचित्र पर किसी स्थान की ओर इशारा करने और यह कहने जैसा है कि "यहाँ!", बजाय इसके कि सड़क का नाम बताया जाए। यह पेपर, DreamOmni3, इस "पॉइंट-एंड-ड्रॉ" (इशारा करो और बनाओ) विधि को पूरी तरह से काम करने में गहराई से उतरता है। यह उन कठिन हिस्सों से निपटता है जहाँ कंप्यूटर को न केवल आपके शब्दों को, बल्कि आपकी टेढ़ी-मेढ़ी हाथ से खींची गई रेखाओं को समझने के लिए सिखाना है, और उन्हें अविश्वसनीय सटीकता के साथ चित्र बनाने या संपादित करने के लिए जोड़ता है।
समस्या: जब शब्द पर्याप्त नहीं होते
कल्पना कीजिए कि आप एक गेम खेल रहे हैं जहाँ आपको एक फोटो को एडिट करना है। आप एक लाल घेरे में रखे खिलौने को हैंडबैग से बदलना चाहते हैं। यदि आप केवल "यहाँ एक हैंडबैग रखो" टाइप करते हैं, तो AI भ्रमित हो सकता है। कौन सा खिलौना? "यहाँ" कहाँ है? क्या घेरा लाल है या काला? क्या यह पहली छवि है या दूसरी? भाषा बड़े विचारों के लिए महान है, लेकिन यह स्क्रीन पर विशिष्ट, सूक्ष्म विवरणों की ओर इशारा करने में बहुत खराब है।
इस पेपर के लेखकों ने महसूस किया कि जबकि AI टेक्स्ट निर्देशों का पालन करने में बहुत अच्छा हो गया है, यह अक्सर जटिल होने पर "कहाँ" और "कैसे" को मिस कर देता है। उपयोगकर्ताओं को अधिक प्रत्यक्ष होने की आवश्यकता है। उन्हें एक चेहरा घेरने के लिए घेरा बनाने और कहने की आवश्यकता है, "यह बाल बदल दो," या एक टेढ़ी-मेढ़ी रेखा खींचने और कहने की आवश्यकता है, "यहाँ एक कार रखो।" यह स्किबल-आधारित एडिटिंग और जनरेशन की अवधारणा है। यह उपयोगकर्ताओं को AI को नियंत्रित करने के लिए टेक्स्ट, इमेज और उनके अपने फ्रीहैंड ड्राइंग को मिलाने की अनुमति देने के बारे में है।
समाधान: DreamOmni3
DreamOmni3 के पीछे की टीम ने एक ऐसा मॉडल बनाने का निर्णय लिया जो स्क्रिबल्स (रेखांकनों) को टेक्स्ट और इमेज के साथ एक समान महत्व देता है। लेकिन एक बड़ी बाधा थी: डेटा। AI मॉडल छात्रों की तरह होते हैं; उन्हें सीखने के लिए हजारों उदाहरण देखने की आवश्यकता होती है। कोई मौजूदा पाठ्यपुस्तक (डेटासेट) नहीं थी जो AI को यह दिखा सके कि एक टेढ़े-मेढ़े हाथ से खींचे गए घेरे को कैसे समझा जाए और उसे एक पूर्ण संपादन में कैसे बदला जाए।
इसलिए, लेखकों ने सबसे पहले एक डेटा फैक्ट्री का आविष्कार किया। उन्होंने मौजूदा छवियों को लिया और लाखों नए प्रशिक्षण उदाहरण बनाने के लिए एक चतुर पाइपलाइन का उपयोग किया।
- एडिटिंग के लिए: उन्होंने फोटो लिए, वस्तुओं को ढूँढा, और फिर मैन्युअल रूप से (या सहायक AI के साथ) उन पर घेरे, बॉक्स और डूडल बनाए। उन्होंने चार प्रकार के कार्य बनाए:
- Scribble + Text: "लाल घेरे में एक कार रखो।"
- Scribble + Text + Image: "इस तस्वीर वाली कार को लाल घेरे में रखो।"
- Image Fusion: एक फोटो से किसी वस्तु को दूसरी में पेस्ट करना, जो एक स्क्रिबल द्वारा निर्देशित हो।
- Doodle Editing: एक रफ स्केच को फोटो में एक वास्तविक वस्तु में बदलना।
- जनरेशन के लिए: उन्होंने वही किया लेकिन एक फोटो के बजाय एक खाली सफेद कैनवास से शुरुआत की, जिससे AI को सिखाया जा सके कि आपके द्वारा स्क्रिबल किए गए स्थान के आधार पर नई चीजें कैसे बनाई जाएं।
उन्होंने इन उदाहरणों के दसियों हज़ार उदाहरणों (मल्टीमॉडल एडिटिंग के लिए 32,000, मल्टीमॉडल जनरेशन के लिए 29,000, और अन्य कार्यों के लिए और भी अधिक) के साथ एक विशाल डेटासेट तैयार किया ताकि मॉडल को यह सिखाया जा सके कि आपके रेखांकनों के माध्यम से आपके मन को कैसे पढ़ा जाए।
जादुई ट्रिक: मॉडल स्क्रिबल को कैसे "देखता" है
यहीं पर यह पेपर वास्तव में चतुर हो जाता है। आमतौर पर, जब आप किसी छवि के एक विशिष्ट भाग को संपादित करना चाहते हैं, तो आप एक बाइनरी मास्क (Binary Mask) का उपयोग करते हैं। मास्क को एक स्टेंसिल की तरह समझें: यह एक ब्लैक-एंड-व्हाइट इमेज है जहाँ सफेद का अर्थ है "इसे बदलें" और काले का अर्थ है "इसे ऐसे ही रहने दें।"
लेखक तर्क देते हैं कि मास्क बहुत कठोर होते हैं। यदि आपको एक ही चित्र में तीन अलग-अलग चीजें बदलनी हैं, तो आपको तीन अलग-अलग ब्लैक-एंड-व्हाइट मास्क की आवश्यकता होगी। यह अव्यवस्थित है और शब्दों में वर्णन करना कठिन है। इसके बजाय, DreamOmni3 रंगीन स्क्रिबल्स (Colored Scribbles) का उपयोग करता है। आप कार के लिए लाल घेरा, पेड़ के लिए नीला वर्ग और आकाश के लिए हरी रेखा बना सकते हैं। AI उन्हें रंग के आधार पर आसानी से पहचान सकता है।
लेकिन एक पेच है: यदि आप कार के ऊपर लाल घेरा बनाते हैं, तो AI कार को देख नहीं पाता क्योंकि लाल स्याही उसे ढक लेती है! इसे हल करने के लिए, DreamOmni3 एक जॉइंट इनपुट स्कीम (Joint Input Scheme) का उपयोग करता है।
- यह AI को एक ही समय में दो छवियां फीड करता है: मूल फोटो और स्क्रिबल्स के साथ वाली फोटो।
- यह एक विशेष एनकोडिंग सिस्टम (पिक्सेल लेबल करने का एक तरीका) का उपयोग करता है जो AI को बताता है, "हे, इस इमेज में लाल घेरा उस इमेज में कार के ठीक उसी स्थान पर है।"
- यह AI को स्क्रिबल (यह जानने के लिए कि आप क्या चाहते हैं) और मूल पिक्सेल (यह जानने के लिए कि वह क्या बदल रहा है) दोनों को देखने की अनुमति देता है, जिससे यह सुनिश्चित होता है कि संपादन सटीक है और बाकी चित्र एकदम सही रहता है।
दिमाग: AI को "अव्यवस्थित" समझना सिखाना
लेखकों ने यह भी महसूस किया कि मानव चित्र अक्सर बिखरे हुए या टेढ़े-मेढ़े होते हैं। एक घेरा अंडे जैसा दिख सकता है; एक रेखा लहरदार हो सकती है। AI को इन अपूर्ण रेखांकनों को समझने में मदद करने के लिए, उन्होंने एक विजुअल लैंग्वेज मॉडल (VLM) पेश किया—एक प्रकार का AI जो तर्क करने में बहुत अच्छा है।
उन्होंने इमेज जनरेटर के साथ इस VLM को प्रशिक्षित किया। VLM एक अनुवादक की तरह कार्य करता है। यह आपके स्क्रिबल और आपके लिखे टेक्स्ट को देखता है, यह पता लगाता है कि आपका वास्तविक अर्थ क्या था (जैसे, "ओह, उन्होंने एक लहरदार घेरा बनाया है, लेकिन वे स्पष्ट रूप से एक कार चाहते हैं"), और फिर इमेज जनरेटर को बताता है कि वास्तव में क्या करना है। यह जॉइंट ट्रेनिंग सुनिश्चित करती है कि AI केवल नियमों का आँख बंद करके पालन नहीं करता है, बल्कि वास्तव में स्क्रिबल के पीछे के इरादे को समझता है।
परिणाम: क्या यह काम करता है?
टीम ने DreamOmni3 का परीक्षण एक नए बेंचमार्क पर किया जिसे उन्होंने बनाया था, जो वास्तविक दुनिया की छवियों और कठिन कार्यों से भरा था। उन्होंने अन्य शीर्ष मॉडलों के साथ इसकी तुलना की, जिनमें GPT-4o और Nano Banana जैसे कुछ प्रसिद्ध व्यावसायिक मॉडल भी शामिल थे।
परिणाम प्रभावशाली थे। DreamOmni3 ने लगातार अन्य ओपन-सोर्स मॉडलों को पछाड़ दिया और कई क्षेत्रों में दिग्गजों की बराबरी की या उनसे बेहतर प्रदर्शन किया।
- मानवीय मूल्यांकनकर्ताओं (Human Evaluators) ने एडिटिंग कार्यों के लिए DreamOmni3 की सफलता दर को 55.88% रेट किया, जो कि GPT-4o (एक मीट्रिक में 59.56%, लेकिन DreamOmni3 अन्य में अधिक सुसंगत था) से अधिक था और Omnigen2 (2.94%) जैसे अन्य मॉडलों की तुलना में काफी अधिक था।
- जनरेशन कार्यों में, DreamOmni3 ने 54.55% की सफलता दर हासिल की, जिसने फिर से अधिकांश प्रतिस्पर्धियों को पीछे छोड़ दिया।
- पेपर नोट करता है कि जबकि व्यावसायिक मॉडल मजबूत हैं, वे कभी-कभी विशिष्ट स्क्रिबल निर्देशों के साथ संघर्ष करते हैं, अक्सर अंतिम छवि में स्क्रिबल्स को छोड़ देते हैं या अनुपात गलत कर देते हैं। हालाँकि, DreamOmni3 को विशेष रूप से इन बारीकियों को संभालने के लिए डिज़ाइन किया गया था, जिससे साफ परिणाम मिले जहाँ स्क्रिबल्स गायब हो गए और संपादन स्वाभाविक लगे।
यह क्यों मायने रखता है
DreamOmni3 केवल AI को स्मार्ट बनाने के बारे में नहीं है; यह AI को अधिक मानवीय बनाने के बारे में है। यह हमारे द्वारा कल्पना किए जाने वाले और हमारे द्वारा वर्णित किए जाने वाले के बीच के अंतर को पाटता है। हमें ड्राइंग, पॉइंटिंग और डूडलिंग करने की अनुमति देकर, यह इमेज एडिटिंग को एक तकनीकी कार्य से एक रचनात्मक बातचीत में बदल देता है। यह पेपर सुझाव देता है कि यह दृष्टिकोण—टेक्स्ट, इमेज और फ्रीहैंड ड्राइंग को स्मार्ट डेटा सिंथेसिस और जॉइंट ट्रेनिंग के साथ जोड़ना—डिजिटल निर्माण उपकरणों के साथ हमारे संवाद करने का भविष्य है। यह दिखाता है कि जब हम कंप्यूटर को हमारे अस्पष्ट शब्दों को समझने के लिए मजबूर करने के बजाय उन्हें हमारे प्रत्यक्ष कार्यों को देखने देना शुरू करते हैं, तो परिणाम बहुत अधिक जादुई होते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।