DivCon: Divide and Conquer for Complex Numerical and Spatial Reasoning in Text-to-Image Generation
DivCon एक डिवाइड-एंड-कॉन्कर (विभाजित करो और जीतो) फ्रेमवर्क पेश करता है जो टेक्स्ट-टू-इमेज जनरेशन को सरल संख्यात्मक/स्थानिक तर्क और प्रगतिशील ऑब्जेक्ट सिंथेसिस चरणों में अलग करता है, जिससे हल्के मॉडल्स को क्लोज्ड-सोर्स लार्ज लैंग्वेज मॉडल्स पर निर्भर हुए बिना जटिल मल्टी-ऑब्जेक्ट प्रॉम्प्ट्स के लिए बेहतर लेआउट सटीकता और संवेदी गुणवत्ता प्राप्त करने में सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक कलाकार हैं जिसे किसी व्यक्ति द्वारा दिए गए बहुत ही विशिष्ट और जटिल विवरण के आधार पर एक चित्र बनाने के लिए कहा गया है।
समस्या:
यदि आप एक मानक एआई कलाकार (जैसे लोकप्रिय "स्टेबल डिफ्यूजन") से यह बनाने के लिए कहते हैं: "पाँच लाल सेब, दो नीले पक्षी, और एक बिल्ली जो कुर्सी और पेड़ के बीच बैठी है," तो वह अक्सर भ्रमित हो जाता है। वह शायद पाँच के बजाय तीन सेब बना देगा, बिल्ली को पेड़ के ऊपर रख देगा, या पक्षियों को पूरी तरह से भूल जाएगा। यह ऐसा है जैसे किसी प्रतिभाशाली चित्रकार को एक साथ बहुत सारे विशिष्ट निर्देश संभालने के लिए कहना; वे घबरा जाते हैं और काम बिगाड़ देते हैं।
पुराना समाधान:
इसे ठीक करने के प्रयास में एक "सुपर-इंटेलिजेंट प्रोजेक्ट मैनेजर" (एक विशाल, महंगे GPT-4 जैसे एआई) को पहले एक रफ स्केच (एक लेआउट) बनाने के लिए नियुक्त किया गया, और फिर उस स्केच को चित्रकार को सौंप दिया गया।
- नुकसान: यह "मैनेजर" चलाना अविश्वसनीय रूप से महंगा है, इसे एक्सेस करना कठिन है, और इसके लिए बहुत अधिक कंप्यूटर पावर की आवश्यकता होती है। साथ भी यह कि चित्रकार अभी भी पूरे दृश्य को एक बार में ही पेंट करने की कोशिश करता है, जिससे जटिल हिस्सों में गलतियाँ हो जाती हैं।
नया समाधान: DivCon (डिवाइड एंड कॉन्कर - विभाजित करो और जीतो)
इस शोध पत्र के लेखक, युहाओ जिया और वेनहान टैन ने DivCon नामक एक स्मार्ट तरीका निकाला है। सब कुछ एक साथ करने के बजाय, यह काम को छोटे, प्रबंधनीय हिस्सों में तोड़ देता है। इसे एक घर बनाने की तरह समझें: आप एक ही सेकंड में छत, दीवारें और प्लंबिंग बनाने की कोशिश नहीं करते हैं। आप इसे चरण-दर-चरण करते हैं।
DivCon कैसे काम करता है, यहाँ सरल उपमाओं का उपयोग किया गया है:
चरण 1: "स्मार्ट स्केच" (लेआउट प्रेडिक्शन)
पूरे प्लान को बनाने के लिए एक बहुत महंगे एआई का उपयोग करने के बजाय, DivCon एक छोटे, हल्के एआई (एक स्मार्ट इंटर्न की तरह) का उपयोग करता है और उसे दो-चरणीय चेकलिस्ट देता है:
- चरण A: गणित और तर्क की जाँच। पहले, इंटर्न केवल वाक्य को पढ़ता है और वस्तुओं की गिनती करता है। "ठीक है, मुझे 'पाँच सेब' और 'दो पक्षी' सुनाई दिए।" वह अभी उन्हें बनाने की कोशिश नहीं करता; वह बस गणित करता है और उनकी स्थितियों को नोट करता है।
- चरण B: ड्राइंग प्लान। एक बार जब इंटर्न को सटीक संख्या और स्थितियाँ पता चल जाती हैं, तो वह उन वस्तुओं के लिए रफ बॉक्स (एक ब्लूप्रिंट की तरह) बनाता है जहाँ उन्हें होना चाहिए।
यह क्यों शानदार है: "गिनती करने" को "ड्रॉ करने" से अलग करके, एक छोटा, सस्ता कंप्यूटर प्रोग्राम भी एक विशाल, महंगे एआई की तुलना में बेहतर काम कर सकता है। यह एक कैलकुलेटर देने जैसा है ताकि एक छात्र गणित हल कर सके, और फिर उसे चित्र बनाने देने जैसा है। परिणाम एक सटीक ब्लूप्रिंट होता है बिना किसी उच्च लागत के।
चरण 2: "प्रोग्रेसिव पेंटिंग" (इमेज जनरेशन)
अब जब हमारे पास ब्लूप्रिंट है, तो हमें चित्र बनाना होगा। मानक एआई एक ही बार में पूरी छवि बनाने की कोशिश करता है। DivCon इसे अलग तरह से करता है:
- राउंड 1: पहले "आसान चीजें" पहले। एआई पूरे दृश्य को पेंट करता है, लेकिन वह "आसान" चीजों (जैसे एक बड़ी, साधारण कुर्सी) पर विशेष ध्यान देता है।
- चेक-अप। एआई अपने ही काम को देखता है। "हम्म, कुर्सी बढ़िया दिख रही है। लेकिन 'पाँच सेब' धुंधले दिख रहे हैं, और 'बिल्ली' अजीब लग रही है।"
- राउंड 2: कठिन हिस्सों को ठीक करना। एआई अच्छे हिस्सों को फ्रीज (स्थिर) कर देता है (कुर्सी) और केवल खराब हिस्सों को फिर से पेंट करता है (सेब और बिल्ली)। वह अच्छी चीजों को बिगाड़े बिना अपना सारा ध्यान कठिन विवरणों को ठीक करने में लगा देता है।
उपमा: कल्पना कीजिए कि आप एक फोटो एडिट कर रहे हैं। पूरी तस्वीर को एक साथ ठीक करने के बजाय, आप चेहरे के दाग-धब्बों को ठीक करने के लिए "क्लोन स्टैम्प" टूल का उपयोग करते हैं जबकि बैकग्राउंड को अछूता छोड़ देते हैं। DivCon इसे स्वचालित रूप से करता है।
परिणाम
- बेहतर सटीकता: यह संख्याओं को सही पाता है (5 सेब, न कि 3) और स्थितियों को सही रखता है (बिल्ली कुर्सी और पेड़ के बीच, न कि ऊपर)।
- सस्ता: यह एक अरब डॉलर के सुपरकंप्यूटर के बजाय छोटे, ओपन-सोर्स एआई मॉडल का उपयोग करता है।
- तेज़: क्योंकि यह एक अराजक चरण के बजाय दो केंद्रित चरणों में समस्याओं को ठीक करता है, यह वास्तव में कुशलता से चलता है।
संक्षेप में:
DivCon एक ऐसे प्रोजेक्ट मैनेजर को काम पर रखने जैसा है जो एक बड़े, डरावने कार्य को छोटे, आसान चरणों में तोड़ देता है, और फिर एक पेंटर जो अपनी गलतियों को एक-एक करके ठीक करता है। परिणाम एक ऐसी उत्कृष्ट कृति है जो निर्देशों का पूरी तरह पालन करती है, और इसके लिए किसी भारी बजट की आवश्यकता नहीं होती।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।