OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing
यह शोध पत्र OpenGPT-4o-Image को प्रस्तुत करता है, जो 11 डोमेन और 51 उप-कार्यों को कवर करने वाले 80,000 निर्देश-छवि युग्मों का एक बड़े पैमाने का डेटासेट है, जो व्यवस्थित, स्वचालित डेटा निर्माण के माध्यम से छवि निर्माण और संपादन में एकीकृत मल्टीमॉडल मॉडलों के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस की दुनिया में, ऐसी प्रणालियाँ बनाने की एक बढ़ती हुई महत्वाकांक्षा है जो केवल यह पहचानने से कहीं अधिक कर सकें कि वे क्या देख रही हैं। वर्षों से, कंप्यूटर किसी फोटो का वर्णन करने या किसी छवि के बारे में प्रश्न का उत्तर देने में उत्कृष्ट होते गए हैं। अब, शोधकर्ता एक नए प्रकार की बुद्धिमत्ता बनाने का प्रयास कर रहे हैं जो न केवल एक चित्र को समझ सके, बल्कि उसे शून्य से बना सके या एक साधारण वाक्य के आधार पर उसमें परिवर्तन भी कर सके। यह क्षमता, जिसे इमेज जनरेशन और एडिटिंग (छवि निर्माण और संपादन) के रूप में जाना जाता है, उदाहरणों के विशाल संग्रहों पर निर्भर करती है। जिस तरह एक बच्चा अनगिनत चित्रों का अध्ययन करके और फीडबैक प्राप्त करके चित्र बनाना सीखता है, ये कंप्यूटर मॉडल भी डेटा की विशाल मात्रा को प्रोसेस करके सीखते हैं जो टेक्स्ट विवरणों को उनके द्वारा दर्शाई गई छवियों के साथ जोड़ते हैं। इस सीखने की सामग्री की गुणवत्ता ही सब कुछ है; यदि उदाहरण सरल या दोहराव वाले हैं, तो मॉडल सीमित रह जाता है। वास्तविक दुनिया के जटिल, अव्यवस्थित और विविध अनुरोधों में महारत हासिल करने के लिए, इन प्रणालियों को एक ऐसे पाठ्यक्रम की आवश्यकता है जो उतना ही समृद्ध और संरचित हो जिसका वे अनुकरण करने की कोशिश कर रहे हैं।
शोधकर्ताओं की एक टीम ने एक नया, बड़े पैमाने का डेटा संग्रह जिसे OpenGPT-4o-Image कहा जाता है, प्रदान करके उस पाठ्यक्रम को तैयार करने में कदम उठाया है। उन्होंने पहचाना कि जबकि मौजूदा डेटा सेट ने किसी वस्तु का रंग बदलने या पेंटिंग की शैली को कॉपी करने जैसे बुनियादी कार्यों को कवर किया था, वे अक्सर अधिक कठिन चुनौतियों का सामना करते समय विफल रहे। वास्तविक जीवन उन अनुरोधों से भरा है जिनमें एक साथ कई चरणों की आवश्यकता होती है, जैसे कि एक विशिष्ट वैज्ञानिक आरेख (डायग्राम) के लिए पूछना या यह मांग करना कि एक पात्र को स्थानांतरित किया जाए जबकि पृष्ठभूमि बदल जाए और नया टेक्स्ट जोड़ा जाए। इसे हल करने के लिए, टीम ने 80,000 उच्च-गुणवत्ता वाले निर्देशों और छवियों के जोड़े वाला एक डेटासेट बनाया। उन्होंने इन उदाहरणों को केवल यादृच्छिक (रैंडम) रूप से एकत्र नहीं किया; इसके बजाय, उन्होंने एक व्यवस्थित ढांचा बनाया जो छवि निर्माण की विशाल दुनिया को 11 प्रमुख क्षेत्रों और 51 विशिष्ट उप-कार्यों में विभाजित करता है। यह संरचना यह सुनिश्चित करती है कि कंप्यूटर न केवल चित्र बनाना सीखे, बल्कि स्थान (स्पेस) के बारे में तर्क करना, जटिल तार्किक श्रृंखलाओं का पालन करना और रसायन विज्ञान के चित्रण या बहु-चरणीय संपादन कमांड जैसे विशिष्ट विषयों को संभालना भी सीखे।
शोधकर्ताओं ने अपने कार्य को दो मुख्य श्रेणियों में व्यवस्थित किया: शून्य से चित्र बनाना और मौजूदा चित्रों को बदलना। निर्माण पक्ष के लिए, उन्होंने पांच मुख्य क्षमताओं पर ध्यान केंद्रित किया। पहले, उन्होंने मॉडल को प्राचीन इंक वॉश पेंटिंग से लेकर आधुनिक साइबरपंक सौंदर्यशास्त्र तक, विविध कलात्मक शैलियों की नकल करना सिखाया। दूसरा, उन्होंने इसे जटिल निर्देशों के साथ चुनौती दी जिनमें एक साथ कई विचारों को मन में रखना आवश्यक होता है, जैसे कि एक दृश्य में सटीक स्थानिक संबंधों के साथ वस्तुओं की एक विशिष्ट संख्या रखना। तीसरा, उन्होंने सीधे छवि के भीतर टेक्स्ट लिखने के कठिन कार्य को संभाला, यह सुनिश्चित करते हुए कि शब्द सही ढंग से वर्तनी (स्पेलिंग) के साथ हों और दृश्य के भीतर स्वाभाविक रूप से रखे गए हों। चौथा, उन्होंने ज्यामिति और तर्क को समझने की मॉडल की क्षमता का परीक्षण किया, जिसमें वस्तुओं को गिनने या यह निर्धारित करने के लिए पूछा गया कि कौन सी वस्तु दूसरी से बड़ी है। अंत में, उन्होंने मॉडल की पहुंच को विशिष्ट क्षेत्रों में विस्तारित किया, जैसे विज्ञान और इंजीनियरिंग के लिए चित्र बनाना, जैसे कि ग्रहीय मैग्नेटोस्फीयर या मैकेनिकल गियर्स के आरेख, जहाँ शैक्षिक और अनुसंधान के लिए दृश्य स्पष्टता महत्वपूर्ण है।
संपादन पक्ष पर, टीम ने उन कई तरीकों को कवर करने के लिए एक समान पदानुक्रम (हाइरार्की) डिजाइन किया जिनसे लोग एक तस्वीर को बदलना चाहते हैं। उन्होंने उन कार्यों को शामिल किया जहाँ एक उपयोगकर्ता किसी विशिष्ट वस्तु को जोड़ने, हटाने या बदलने का चाह सकता है जबकि शेष दृश्य को अक्षुण्ण रखा जाए। उन्होंने ऐसे परिदृश्य भी बनाए जहाँ मॉडल को छवि में एम्बेडेड टेक्स्ट को संपादित करना होगा, जैसे कि आसपास की तस्वीर को विकृत किए बिना एक साइन या लेबल को बदलना। शायद सबसे उल्लेखनीय रूप से, उन्होंने जटिल संपादन कार्य पेश किए जिनमें मॉडल को एक साथ कई निर्देशों का पालन करने की आवश्यकता होती है, जैसे कि पृष्ठभूमि को बदलना, एक नया पात्र जोड़ना और एक ही बार में लाइटिंग को बदलना। उन्होंने यहाँ तक कि मल्टी-टर्न इंटरैक्शन (बहु-चरणीय बातचीत) को भी शामिल किया, जहाँ एक उपयोगकर्ता एक निर्देश देता है, परिणाम देखता है, और फिर छवि को और बेहतर बनाने के लिए एक अगला कमांड देता है, जो एक मानव और एक कलाकार के बीच स्वाभाविक बातचीत की नकल करता है।
इस विशाल लाइब्रेरी को बनाने के लिए, शोधकर्ताओं ने एक स्वचालित पाइपलाइन विकसित की जो एक अथक सहायक के रूप में कार्य करती है। उन्होंने टेक्स्ट निर्देश उत्पन्न करने के लिए एक शक्तिशाली लैंग्वेज मॉडल का उपयोग किया और फिर संबंधित चित्र बनाने के लिए एक हाई-एंड इमेज जनरेटर का उपयोग किया। इस प्रक्रिया को सावधानीपूर्वक नियंत्रित किया गया ताकि यह सुनिश्चित हो सके कि डेटा विविध हो और कठिनाई का स्तर संतुलित हो, जो सरल अनुरोधों से लेकर अत्यधिक जटिल चुनौतियों तक जाता है। परिणाम एक ऐसा डेटासेट है जो एक प्रसिद्ध चित्रकार की शैली में कैद किए गए हलचल भरे सड़क दृश्य से लेकर एक वॉर्म गियर सेट के तकनीकी ड्राइंग तक सब कुछ कवर करता है। अग्रणी कंप्यूटर मॉडलों में इस संरचित डेटा को फीड करके, शोधकर्ताओं ने परीक्षण किया कि क्या मॉडल इससे सीख सकते हैं। परिणाम स्पष्ट थे: इस नए डेटासेट पर प्रशिक्षित मॉडल पहले की तुलना में काफी बेहतर प्रदर्शन करते हैं। उन परीक्षणों में जो यह मापते हैं कि एक मॉडल छवि को संपादित करने के लिए निर्देशों का पालन करने में कितना सक्षम है, प्रदर्शन में 18 प्रतिशत तक सुधार हुआ। टेक्स्ट से चित्र बनाने से जुड़े कार्यों के लिए, सुधार लगभग 13 प्रतिशत था।
ये लाभ सुझाव देते हैं कि डेटा कैसे व्यवस्थित किया गया है, यह डेटा की मात्रा जितना ही महत्वपूर्ण है। अध्ययन से पता चलता है कि जब मॉडल विविध प्रकार की संरचित चुनौतियों के संपर्क में आते हैं, तो वे वास्तविक जीवन में होने वाले सूक्ष्म और मांग वाले अनुरोधों को संभालने में अधिक सक्षम हो जाते हैं। वे यह समझने में बेहतर हो जाते हैं कि एक "विशाल फजी बर्ड" (विशाल रोएंदार पक्षी) को एक "छोटे पक्षी" से अलग दिखना चाहिए, या एक "वैज्ञानिक आरेख" के लिए एक "फैंटेसी इलस्ट्रेशन" की तुलना में अलग स्तर की सटीकता की आवश्यकता होती है। जबकि शोधकर्ता नोट करते हैं कि उनका कार्य उस डेटा को उत्पन्न करने के लिए उपयोग किए गए उपकरणों की क्षमताओं पर निर्भर करता है, साक्ष्य एक स्पष्ट मार्ग की ओर संकेत करते हैं। छवि निर्माण के जटिल कार्य को प्रबंधनीय, अच्छी तरह से परिभाषित भागों में व्यवस्थित रूप से तोड़कर, उन्होंने एक ऐसा आधार प्रदान किया है जो आर्टिफिशियल इंटेलिजेंस को सरल नकल से आगे बढ़कर एक अधिक मजबूत, विश्वसनीय और बहुमुखी दृश्य समझ की ओर बढ़ने की अनुमति देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।