SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision
पिक्सेल-स्तरीय स्केच-आधारित छवि संपादन के लिए उच्च-गुणवत्ता वाले बेंचमार्क की कमी को दूर करने के लिए, यह शोध पत्र SI-Data डेटासेट और SI-Edit फ्रेमवर्क पेश करता है, जो निर्देश-निर्देशित क्वाड्रुप्लेट्स (quadruplets) को संश्लेषित करने के लिए मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का लाभ उठाते हैं और एक सहयोगात्मक स्थानिक-सिमेंटिक शिक्षण दृष्टिकोण के माध्यम से सटीक, सिमेंटिक रूप से संरेखित स्थानीय विरूपण प्राप्त करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जादुई कलाकार को एक बहुत ही विशिष्ट, सूक्ष्म निर्देश देने की कोशिश कर रहे हैं जो आपकी हर इच्छा को चित्रित कर सकता है। आप कह सकते हैं, "उस फूल के तने को एक चिकनी S-आकार में मोड़ दो।" लेकिन समस्या यह है कि कलाकार थोड़ा ख्याली दुनिया में रहने वाला है। वह "S-आकार" सुनता है और तने को गलत जगह से मोड़ देता है, या वह पूरे पौधे को एक सांप में बदल सकता है बजाय सिर्फ तने को मोड़ने के। यही इमेज एडिटिंग (छवि संपादन) का असली चैलेंज है, जो आर्टिफिशियल इंटेलिजेंस का उपयोग करती है। वैज्ञानिकों ने शक्तिशाली "जेनरेटिव मॉडल्स" बनाए हैं—सोचिए ये डिजिटल कलाकार हैं जिन्हें लाखों चित्रों पर प्रशिक्षित किया गया है—जो टेक्स्ट के आधार पर छवियों को बदल सकते हैं। लेकिन जब आप एक बहुत ही सूक्ष्म, सटीक बदलाव के लिए कहते हैं, जैसे किसी एक पत्ती को मोड़ना या लौ (flame) को खींचना, तो ये डिजिटल कलाकार अक्सर भ्रमित हो जाते हैं। वे चित्र के गलत हिस्से को बदल सकते हैं, या वे ठीक से समझ नहीं पाते कि आप वास्तव में उसे कैसे बदलना चाहते हैं।
इसे ठीक करने के लिए, शोधकर्ताओं ने दो मुख्य तरकीबें आजमाई हैं। एक यह कि कलाकार को एक स्केच दिया जाए, जैसे स्क्रीन पर एक रेखा खींचकर दिखाना कि कहाँ मोड़ना है। दूसरा यह कि टेक्स्ट निर्देश दिए जाएं, जैसे लिखना "इसे यहाँ मोड़ो।" लेकिन प्रत्येक तरकीब में एक दोष है। यदि आप केवल एक स्केच देते हैं, तो कलाकार को यह नहीं पता चलता कि क्या करना है (क्या आप पत्ते को कॉपी करना चाहते हैं, हिलाना चाहते हैं, या बस मोड़ना चाहते हैं?)। यदि आप केवल टेक्स्ट देते हैं, तो उसे यह नहीं पता होता कि किधर करना है। यह पेपर, SI-Edit, इसे हल करने का प्रयास करता है ताकि कलाकार को स्केच और टेक्स्ट दोनों को एक साथ सुनने के लिए प्रशिक्षित किया जा सके, जिससे वह एक अत्यंत सटीक डिजिटल मूर्तिकार की तरह बन सके जो अंतिम पिक्सेल तक छवि को नया आकार दे सकता है।
समस्या: "अनुवाद में खो जाने वाला" कलाकार
कल्पना कीजिए कि आप एक खेल खेल रहे हैं जहाँ आपको अपने एक दोस्त को एक ड्राइंग के बारे में बताना है जो केवल वही बना सकता है जो आप कहते हैं। यदि आप कहते हैं, "पेड़ की टहनी को मोड़ दो," तो आपका दोस्त गलत टहनी को मोड़ सकता है, या वह एक पूरा नया पेड़ बना सकता है। वर्तमान AI टूल्स के साथ यही होता है जो केवल टेक्स्ट निर्देशों को सुनते हैं। वे बड़े बदलावों के लिए बेहतरीन हैं, जैसे "आसमान को नीला कर दो," लेकिन सूक्ष्म, सटीक बदलावों के लिए बहुत खराब हैं। उनमें एक "स्पेशियल एंकर" (स्थानिक लंगर) की कमी है—यह जानने का कोई तरीका कि किस पिक्सेल को हिलाना है।
दूसरी ओर, यदि आप केवल एक स्केच (स्क्रीन पर खींची गई एक रेखा) देते हैं, तो AI जानता है कि कहाँ बनाना है लेकिन यह नहीं जानता कि क्या करना है। क्या वह रेखा किसी पत्ते को हिलाने के लिए है? उसे कॉपी करने के लिए? या बस उसे मोड़ने के लिए? स्पष्ट निर्देश के बिना, AI गलत अनुमान लगा सकता है, जिससे अजीब परिणाम मिल सकते हैं जैसे कि एक पत्ता जो अचानक अपने ही एक कॉपी में बदल जाता है, या एक तना जो गायब हो जाता है।
इस पेपर के लेखकों ने महसूस किया कि सटीक, पिक्सेल-स्तर के नियंत्रण के लिए, आपको दोनों की आवश्यकता है: एक मैप (स्केच) और एक डेस्टिनेशन (टेस्ट)। लेकिन एक बड़ी बाधा थी: किसी ने भी ऐसा प्रशिक्षण मैनुअल नहीं बनाया था जो इन दोनों को पूरी तरह से जोड़ सके।
समाधान: एक नया प्रशिक्षण मैनुअल और एक नया कलाकार
इसे ठीक करने के लिए, टीम को पहले एक विशाल, उच्च-गुणवत्ता वाला प्रशिक्षण डेटासेट बनाना पड़ा जिसे SI-Data कहा जाता है। इसे AI के लिए एक विशाल कुकबुक की तरह समझें। केवल AI को टेक्स्ट विवरण के साथ "पहले" और "बाद" की तस्वीरें दिखाने के बजाय, उन्होंने क्वाड्रुप्लेट्स (चारों का समूह) बनाए—ऐसी चीजें जो एक साथ चलती हैं:
- मूल छवि (शुरुआती बिंदु)।
- लक्ष्य छवि (संपादन के बाद यह कैसी दिखनी चाहिए)।
- एक स्केच (एक सरल रेखा जो सटीक आकार परिवर्तन दिखाती है)।
- एक निर्देश (वह टेक्स्ट जो AI को बताता है कि क्या करना है)।
उन्होंने इन्हें हाथ से नहीं बनाया; ऐसा करने में बहुत समय लगता। इसके बजाय, उन्होंने एक चतुर स्वचालित पाइपलाइन का उपयोग किया। उन्होंने सुंदर तस्वीरें लीं, एक स्मार्ट AI (Qwen3-VL) से एक विशिष्ट संपादन निर्देश (जैसे "टेंट को खींचें") बनाने को कहा, और फिर एक अन्य AI (Nano Banana Pro) का उपयोग करके वास्तव में वह बदलाव किया। फिर, उन्होंने ऑप्टिकल फ्लो नामक एक गणितीय ट्रिक का उपयोग करके स्वचालित रूप से "स्केच" बनाया, यह देखकर कि पिक्सेल मूल से नई छवि में कैसे बदले। इससे उन्हें 6,500 सटीक उदाहरण मिले कि कैसे एक स्केच और एक टेक्स्ट निर्देश को मिलाकर एक सटीक संपादन किया जाता है।
SI-Edit कैसे काम करता है: "सेम पोजीशन" (समान स्थिति) की ट्रिक
इस नए डेटासेट के साथ, उन्होंने एक नया संपादन टूल बनाया जिसे SI-Edit कहा जाता है। यह टूल एक "सहयोगी" कलाकार के रूप में डिज़ाइन किया गया है। यह केवल टेक्स्ट या स्केच को नहीं देखता; यह उन्हें एक साथ देखता है।
पेपर में इसे काम करने के लिए दो मुख्य ट्रिक्स पेश की गई हैं:
- द "टास्क-ट्रिगर" टोकन: उन्होंने हर निर्देश की शुरुआत में एक विशेष गुप्त कोड शब्द, जिसे
<sk>के रूप में लिखा गया है, जोड़ा। इसे एक घंटी की तरह समझें जो कलाकार के पेंटिंग शुरू करने से पहले बजती है। जब AI "घंटी" (<sk>) सुनता है, तो उसे पता चलता है, "ओह, मुझे उन स्केच रेखाओं पर अतिरिक्त ध्यान देने की आवश्यकता है जिन्हें मैं अभी देखने वाला हूँ।" यह AI को समझने में मदद करता है कि स्केच केवल एक सजावट नहीं है; यह एक सख्त नियम है। - सेम पोजीशन एनकोडिंग (SPE): यह सबसे महत्वपूर्ण हिस्सा है। कल्पना कीजिए कि आप कांच के एक टुकड़े पर एक तस्वीर को ट्रेस कर रहे हैं। आपके पास नीचे मूल तस्वीर है और उसके ऊपर आपका स्केच है। यदि आप उन्हें पूरी तरह से संरेखित (align) नहीं करते हैं, तो आपका चित्र गलत हो जाएगा। AI आमतौर पर स्केच और मूल छवि को दो अलग-अलग चीजों के रूप में मानता है, जिससे वे एक-दूसरे से "ड्रिफ्ट" (विचलित) हो जाते हैं। SI-Edit AI को मजबूर करता है कि वह स्केच और मूल छवि को ऐसे व्यवहार करे जैसे वे उसके दिमाग में बिल्कुल एक ही स्थान पर हों। यह स्केच को छवि के ऊपर ओवरले करता है और AI को बताता है, "ये दोनों चीजें एक ही कोऑर्डिनेट्स पर हैं।" यह AI को इस बात पर भ्रमित होने से रोकता है कि मोड़ कहाँ होना चाहिए।
उन्होंने क्या पाया: पिक्सेल स्तर पर सटीकता
टीम ने SI-Edit का परीक्षण SketchEdit, MagicQuill, और FramePainter जैसे अन्य लोकप्रिय टूल्स के मुकाबले किया। परिणाम स्पष्ट थे: SI-Edit नियमों का पालन करने में बहुत बेहतर था।
- ज्यामितीय सटीकता (Geometric Precision): यह मापने में कि AI ने स्केच रेखाओं का कितनी बारीकी से पालन किया, SI-Edit का स्कोर 4.292 (कम स्कोर बेहतर है) था, जबकि अगला सबसे अच्छा टूल MagicQuill का स्कोर 7.434 था। इसका मतलब है कि SI-Edit के मोड़ और वक्र (curves) वास्तव में उपयोगकर्ता द्वारा खींची गई रेखाओं के बहुत करीब थे।
- सिमेंटिक समझ (Semantic Understanding): यह जांचने में कि क्या AI ने वास्तव में वह किया जो टेक्स्ट ने कहा (जैसे "खींचना" बनाम "कॉपी करना"), SI-Edit ने CS नामक एक मीट्रिक पर 0.0174 स्कोर किया, जो अन्य सभी तरीकों को पीछे छोड़ गया।
- उपयोगकर्ता प्राथमिकता (User Preference): जब वास्तविक लोगों ने परिणामों को देखा, तो उन्होंने दृश्य निरंतरता (visual consistency), सटीकता या छवि गुणवत्ता के आधार पर, SI-Edit को अन्य टूल्स की तुलना में 81.3% से 94.8% बार पसंद किया।
पेपर ने यह भी दिखाया कि यह टूल केवल चीजों को मोड़ने तक ही सीमित नहीं है; यह किसी व्यक्ति के पोज़ (pose) को भी बदल सकता है, जैसे कि एक मार्शल आर्टिस्ट को अपनी मुद्रा बदलने के लिए कहना, जबकि उसका चेहरा और कपड़े बिल्कुल वैसे ही रहते हैं।
निष्कर्ष
लेखक सुझाव देते हैं कि एक स्पष्ट मैप (स्केच) को एक स्पष्ट डेस्टिनेशन (टेक्स्ट) के साथ जोड़कर, और AI को उन्हें एक एकीकृत मार्गदर्शक के रूप में देखने के लिए प्रशिक्षित करके, हम अंततः ऐसे इमेज एडिटिंग टूल्स प्राप्त कर सकते हैं जो बाकी चित्र को खराब किए बिना सूक्ष्म, जटिल बदलावों को संभालने के लिए पर्याप्त सटीक हों। उन्होंने केवल एक बेहतर टूल नहीं बनाया; उन्होंने पहला सार्वजनिक डेटासेट बनाया है जो AI को यह सिखाता है, जो भविष्य के शोधकर्ताओं के लिए और भी स्मार्ट डिजिटल कलाकार बनाने के द्वार खोलता है। पेपर का निष्कर्ष है कि जबकि "स्पेशियल एंबिग्युटी" (कहाँ एडिट करना है यह न जानना) और "सिमेंटिक ब्लाइंडनेस" (क्या एडिट करना है यह न जानना) एक बड़ी बाधा थी, यह सहयोगी दृष्टिकोण सफलतापूर्वक पिक्सेल-परफेक्ट एडिटिंग का रास्ता साफ करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।