DrawAI: Agentic Benchmark and Workflow for Making Raster Images Editable
यह शोध पत्र DrawAI प्रस्तुत करता है, जो एक व्यापक ढांचा है जिसमें DrawAI-Bench बेंचमार्क और DrawAI-Flow एजेंटिक वर्कफ़्लो शामिल है, जिसे दृश्य निष्ठा (visual fidelity) और अर्थपूर्ण संपादन क्षमता (semantic editability) के बीच प्रभावी ढंग से संतुलन बनाकर रास्टर छवियों को संरचित, संपादन योग्य ग्राफिक्स में पुनर्गठित करने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक भविष्य के शहर की एक सुंदर, हाई-डेफिनिशन पेंटिंग देख रहे हैं। यह अद्भुत लग रही है, है ना? लेकिन अब, कल्पना कीजिए कि आप इसमें सिर्फ एक चीज़ बदलना चाहते हैं: शायद आप लाल रंग के अंतरिक्ष यान को नीले रंग के यान से बदलना चाहते हैं, या किसी गगनचुंबी इमारत को सड़क के दूसरी ओर ले जाना चाहते हैं। यदि यह चित्र केवल एक मानक डिजिटल फोटो (एक "रास्टर इमेज") है, तो आप अंतरिक्ष यान को बस पकड़कर हिला नहीं सकते। कंप्यूटर के लिए, अंतरिक्ष यान कोई अलग वस्तु नहीं है; यह आकाश और इमारतों के बीच रंगों के बिंदुओं का एक विशिष्ट पैटर्न मात्र है। इसे ठीक करने के लिए, आपको पूरी तस्वीर पर फिर से पेंट करना होगा या चित्र को शुरुआत से बनाना होगा। यह आधुनिक AI द्वारा बनाई गई अधिकांश छवियों की निराशाजनक वास्तविकता है: वे सुंदर तो हैं लेकिन "सपाट" (flat) हैं, जिससे उन्हें पूरे चित्र को खराब किए बिना संपादित करना असंभव हो जाता है।
यह शोध पत्र आर्टिफिशियल इंटेलिजेंस (AI) और कंप्यूटर विज़न की दुनिया में है, जो विशेष रूप से इस बात पर केंद्रित है कि हम AI-जनित छवियों को न केवल सुंदर, बल्कि उपयोगी कैसे बना सकते हैं। मुख्य विचार एक सपाट चित्र को एक "लेयर्ड" (परतदार) फ़ाइल में बदलना है, जैसे कि एक डिजिटल स्क्रैपबुक जहाँ हर स्टिकर, शब्द और आकार एक अलग हिस्सा है जिसे आप उठा सकते हैं या हिला सकते हैं। शोधकर्ता एक पेचीदा पहेली को हल करने की कोशिश कर रहे हैं: आप एक सपाट फोटो को एक संपादन योग्य (editable) भागों के सेट के रूप में जादू से कैसे पुनर्गठित कर सकते हैं बिना मूल लुक को खोए? वे इसे "इमेज-टू-एडिटेबल रिकंस्ट्रक्शन" कहते हैं। यह महत्वपूर्ण है क्योंकि जैसे-जैसे AI स्कूल प्रोजेक्ट्स, विज्ञान पत्रों और प्रेजेंटेशन के लिए विजुअल्स बनाने में बेहतर होता जा रहा है, हमें उन विजुअल्स को इंसानों द्वारा सुधारने के लिए लचीला बनाने की आवश्यकता है, न कि केवल उन्हें देखते रहने के लिए।
शोध का बड़ा विचार: सपाट तस्वीरों को 'एडिटेबल लेगो सेट्स' में बदलना
बीजिंग और सिंघुआ विश्वविद्यालयों के पीछे के शोधकर्ताओं ने एक बड़ी कमी देखी। AI अब अद्भुत चित्र बना सकता है, लेकिन वे चित्र "फ्लैट मोड" में फंसे हुए हैं। यदि आप किसी टाइपो (लिखावट की गलती) को ठीक करना चाहते हैं या कोई चार्ट हिलाना चाहते हैं, तो आप सफल नहीं होंगे जब तक कि आप उसे फिर से न बना लें। इसलिए, उन्होंने इस समस्या को ठीक करने के लिए DrawAI नामक एक नया सिस्टम बनाया। DrawAI को एक सुपर-स्मार्ट डिजिटल आर्किटेक्ट के रूप में समझें जो एक सपाट फोटो को देखता है और कहता है, "मैं जानता हूँ कि यह एक ठोस दीवार जैसा दिखता है, लेकिन मैं इसे लेगो ब्रिक्स से फिर से बनाऊंगा ताकि आप इसे बाद में अलग कर सकें।"
यह साबित करने के लिए कि उनका सिस्टम काम करता है, उन्होंने केवल अनुमान नहीं लगाया; उन्होंने एक विशाल परीक्षण क्षेत्र बनाया जिसे DrawAI-Bench कहा जाता है। एक विशाल बाधा दौड़ की कल्पना करें जिसमें चार अलग-अलग प्रकार की चुनौतियाँ हैं: वैज्ञानिक आरेख (diagrams), प्रेजेंटेशन स्लाइड्स, पोस्टर और फ्लोचार्ट। उन्होंने इस कोर्स को 40 छवियों (प्रत्येक डोमेन में 10 वास्तविक और 10 AI-जनित छवियां) से भरा और परिणामों को ग्रेड करने के लिए 39 अलग-अलग नियमों के साथ एक सख्त स्कोरिंग सिस्टम बनाया। नियम दो मुख्य चीजों की जांच करते हैं:
- फिडेलिटी (Fidelity): क्या पुनर्निर्मित संस्करण मूल के बिल्कुल समान दिखता है? (क्या रंग मेल खाते थे? क्या टेक्स्ट पठनीय है?)
- एडिटेबिलिटी (Editability): क्या आप वास्तव में इसे एडिट कर सकते हैं? (क्या टेक्स्ट एक वास्तविक टेक्स्ट बॉक्स है जिसे आप क्लिक कर सकते हैं? क्या तीर एक वास्तविक रेखा है जिसे आप हिला सकते हैं?)
शोध में पाया गया कि ये दोनों लक्ष्य अक्सर आपस में लड़ते हैं। यदि आप पूरे चित्र को एक एकल ब्लॉक के रूप में कॉपी करते हैं, तो यह एकदम सही दिखता है (उच्च फिडेलिटी) लेकिन आप कुछ भी एडिट नहीं कर सकते (शून्य एडिटेबिलिटी)। यदि आप इसे बहुत सारे छोटे टुकड़ों में तोड़ देते हैं, तो आप सब कुछ एडिट कर सकते हैं, लेकिन चित्र अव्यवस्थित हो सकता है या अपना मूल स्टाइल खो सकता है। चुनौती उस "स्वीट स्पॉट" को खोजने की है।
उन्होंने यह कैसे किया: दो-चरणीय रोबोट टीम
एक ही AI से एक साथ पूरा काम करने के लिए कहने के बजाय (जिससे अक्सर गलतियाँ होती हैं), टीम ने DrawAI-Flow नामक एक दो-चरणीय वर्कफ़्लो बनाया। उन्होंने इस समस्या को एक निर्माण परियोजना की तरह माना जिसमें दो विशेष कर्मचारी थे:
- द पार्सर एजेंट (जासूस): सबसे पहले, यह एजेंट सपाट फोटो को देखता है और आकृतियों के लिए विशेष उपकरणों (जैसे आकृतियों के लिए आवर्धक लेंस और टेक्स्ट के लिए स्कैनर) का उपयोग करके यह पता लगाता है कि चित्र में क्या है। यह केवल अनुमान नहीं लगाता; यह एक विस्तृत "ब्लूप्रिंट" या योजना बनाता है। यह तय करता है, "ठीक है, यह एक टेक्स्ट बॉक्स है, यह एक वृत्त है, और यह एक फोटो है जिसे क्रॉप करने की आवश्यकता है।"
- द रिकंस्ट्रक्शन एजेंट (निर्माता): यह एजेंट ब्लूप्रिंट लेता है और चित्र बनाना शुरू करता है। लेकिन दिलचस्प बात यह है कि यह केवल एक अंतिम छवि नहीं निकालता, बल्कि चित्र बनाने के लिए कोड (एक रेसिपी की तरह) लिखता है। यह थोड़ा सा चित्र बनाता है, जांचता है कि क्या यह सही दिख रहा है, और यदि यह गलत है, तो यह कोड को ठीक करता है और फिर से प्रयास करता है। यह लूप में चलता रहता है—बनाओ, जांचो, ठीक करो—जब तक कि चित्र एकदम सही और पूरी तरह से संपादन योग्य न हो जाए।
उन्होंने क्या पाया: यह केवल AI मॉडल के बारे में नहीं है
टीम ने 13 अलग-अलग AI मॉडल्स (OpenAI, Anthropic, Google और अन्य बड़े नामों से) का परीक्षण 5 अलग-अलग "हार्नेस" (जो कि अलग-अलग टूलकिट या ऑपरेटिंग सिस्टम की तरह हैं जो AI को चलाने में मदद करते हैं) का उपयोग करके किया। यहाँ उनकी खोजें हैं:
- कोई एक विजेता नहीं: ऐसा कोई एक AI मॉडल नहीं था जो हर चीज़ में सर्वश्रेष्ठ हो। कुछ मॉडल चित्र को वास्तविक दिखाने (Fidelity) में बेहतरीन थे लेकिन उसे एडिट करने योग्य बनाने (Editability) में बहुत खराब थे। अन्य मॉडल एडिट करने में अच्छे थे लेकिन चित्र को थोड़ा अलग बना देते थे। उदाहरण के लिए, GPT-5.6 Sol नामक एक मॉडल ने मूल दिखने के लिए 94.0 का स्कोर प्राप्त किया लेकिन एडिट करने के लिए केवल 85.1 का स्कोर मिला। इसके विपरीत, Claude Opus 4.8 को एडिट करने के लिए 91.6 का स्कोर मिला लेकिन समानता के मामले में कम स्कोर मिला।
- टूलकिट आपकी सोच से अधिक मायने रखता है: "हार्नेस" (वह टूल जिसका उपयोग AI को चलाने के लिए किया जाता है) ने बहुत बड़ा अंतर पैदा किया। सही टूलकिट का उपयोग करने से एक मॉडल का स्कोर 13 अंकों से अधिक बढ़ सकता है। यह एक कुंद आरी वाले मास्टर बढ़ई बनाम एक तेज आरी वाले बढ़ई जैसा है; बढ़ई (AI मॉडल) वही है, लेकिन परिणाम पूरी तरह से इस आधार पर बदल जाता है कि उपकरण कैसे हैं।
- वर्कफ़्लो ही असली सफलता है: जब उन्होंने केवल एक बार में काम करने के बजाय अपने विशेष दो-चरणीय वर्कफ़्लो (DrawAI-Flow) का उपयोग किया, तो परिणाम बहुत बेहतर हो गए। विशेष रूप रूप से, Editability स्कोर औसतन 17.6 अंक बढ़ गया। वर्कफ़्लो ने पहचाने गए कंटेंट को वास्तव में अलग-अलग ऑब्जेक्ट्स में बदलने में मदद की जिन्हें आप क्लिक और मूव कर सकते हैं।
- टेक्स्ट सबसे कठिन हिस्सा है: यहाँ तक कि सबसे अच्छे सिस्टम भी टेक्स्ट के साथ संघर्ष करते रहे। जबकि वे इमेज और शेप्स को आसानी से एडिट करने योग्य बना सकते थे, टेक्स्ट को एक वास्तविक, एडिट करने योग्य टेक्स्ट बॉक्स में बदलना कई मॉडल्स के लिए अभी भी एक कमजोर कड़ी थी।
- लागत बनाम गुणवत्ता: उन्होंने यह भी देखा कि इसमें कितनी लागत आती है। उन्होंने पाया कि अधिक पैसा खर्च करने का मतलब हमेशा बेहतर परिणाम नहीं होता है। कुछ महंगे सेटअप वास्तव में सस्ते सेटअप से खराब थे क्योंकि वे गलत टूल्स का उपयोग कर रहे थे या AI से अनावश्यक काम करवा रहे थे।
निष्कर्ष
शोध पत्र यह निष्कर्ष निकालता है कि किसी इमेज को एडिट करने योग्य बनाना केवल एक स्मार्ट AI मॉडल होने के बारे में नहीं है। यह एक पूर्ण प्रणाली के बारे में है जिसमें एक अच्छा मॉडल, उसे चलाने के लिए सही उपकरण और एक स्मार्ट स्टेप-बाय-स्टेप योजना शामिल है। आप केवल AI से यह नहीं कह सकते कि "इसे एडिट करने योग्य बनाओ" और जादू की उम्मीद नहीं कर सकते। आपको एक योजना बनाने के लिए एक जासूस और कोड लिखने के लिए एक निर्माता की आवश्यकता है, जो काम के दौरान उनके काम की जांच करता रहे।
हालाँकि यह सिस्टम अभी भी पूरी तरह से परफेक्ट नहीं है (विशेष रूप से जटिल तालिकाओं और घने पोस्टरों के साथ), यह एक स्पष्ट रास्ता दिखाता है। छवियों को तोड़ने और उन्हें फिर से बनाने के लिए कोड का उपयोग करके, हम अंततः उन सपाट, अपरिवर्तनीय AI चित्रों को लचीले, काम करने योग्य ड्राफ्ट में बदल सकते हैं जिनका इंसान वास्तव में उपयोग और सुधार कर सकते हैं। AI आर्ट का भविष्य केवल सुंदर चित्र बनाने के बारे में नहीं है; यह उन चित्रों के बारे में है जिनके साथ आप खेल सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।