OmniGen2: Towards Instruction-Aligned Multimodal Generation
OmniGen2 एक ओपन-सोर्स, इंस्ट्रक्शन-अलाइन्ड मल्टीमॉडल जनरेशन मॉडल है जो टेक्स्ट-टू-इमेज, इमेज एडिटिंग और सब्जेक्ट-ड्रिवन इन-कॉन्टेक्स्ट जनरेशन कार्यों में मौजूदा टेक्स्ट क्षमताओं को बनाए रखते हुए अत्याधुनिक प्रदर्शन प्राप्त करने के लिए डिकपल्ड पैरामीटर्स के साथ एक डुअल-पाथवे आर्किटेक्चर का उपयोग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली कलाकार है जो आपके द्वारा वर्णित किसी भी चीज़ को बना सकता है। लेकिन एक पेच है: कभी-कभी वे आपके निर्देशों को गलत समझ लेते हैं, वे भूल जाते हैं कि "लाल साइकिल" कैसी दिखती है, या जब आप उन्हें मौजूदा फोटो को एडिट करने के लिए कहते हैं तो वे भ्रमित हो जाते हैं।
OmniGen2 ऐसा है जैसे उस कलाकार को एक बड़ा अपग्रेड देना। यह एक नया AI मॉडल है जिसे एक परम "निर्देशों का पालन करने वाली" मशीन के रूप में डिज़ाइन किया गया है। यहाँ बताया गया है कि यह कैसे काम करता है, सरल अवधारणाओं में विभाजित है:
1. दो-चरणीय प्रशिक्षण: "स्कूल" फिर "शिक्षुता" (Apprenticeship)
शोधकर्ताओं ने AI को केवल गहरे पानी में नहीं फेंका। उन्होंने इसका उपयोग एक स्मार्ट, दो-चरणीय प्रशिक्षण प्रक्रिया के लिए किया:
चरण 1: नींव बनाना ("स्कूल" चरण)
सबसे पहले, उन्होंने AI को बहुत सारा सामान्य ज्ञान सिखाया। इसे AI को आर्ट स्कूल भेजने की तरह समझें। उन्होंने दुनिया के बारे में, वस्तुएं कैसी दिखती हैं, प्रकाश कैसे काम करता है, और "पीली ब्रोकली" से लेकर "साइबरपंक सिटी" तक कुछ भी कैसे बनाया जाता है, यह सीखा।- सीक्रेट सॉस: उन्होंने एक विशेष "मस्तिष्क" (एक विजन लैंग्वेज मॉडल) बनाया जो टेक्स्ट और इमेज दोनों को गहराई से समझता है। यह मस्तिष्क एक शिक्षक के रूप में कार्य करता है, AI को निर्देशित करता है ताकि वह केवल अनुमान न लगाए; बल्कि वह समझता है कि आप क्या चाहते हैं।
चरण 2: शिक्षुता (The "Instruction Alignment" Phase)
एक बार जब कलाकार को चित्र बनाना आ जाता है, तो उन्हें सुनना सीखना होता है। यहीं पर AI को विशिष्ट निर्देशों पर प्रशिक्षित किया जाता है जैसे "बैकग्राउंड को पार्क में बदलें" या "बत्तखों को हटा दें।"- कोच: केवल उदाहरण दिखाने के बजाय, AI "कोशिश करो, फीडबैक प्राप्त करो, फिर से कोशिश करो" का खेल खेलता है। यदि यह आपके द्वारा पीली ब्रोकली के बजाय हरी ब्रोकली बनाता है, तो एक "कोच" (एक रिवॉर्ड सिस्टम) इसे कहता है, "नहीं, फिर से कोशिश करो!" AI अपनी गलतियों से सीखता है जब तक कि वह हर बार सही न हो जाए। इसे रिनफोर्समेंट लर्निंग (Reinforcement Learning) कहा जाता है।
2. छवियों के लिए विशेष "जीपीएस" (Omni-RoPE)
AI के लिए यह ट्रैक रखना बहुत कठिन चीजों में से एक है कि किसी तस्वीर में चीजें कहाँ हैं, खासकर जब आप मौजूदा फोटो को एडिट कर रहे हों।
- समस्या: कल्पना कीजिए कि आपके पास कालीन पर बैठी एक बिल्ली की फोटो है। यदि आप AI को कहें "बिल्ली को सोफे पर ले जाओ," तो एक सामान्य AI भ्रमित हो सकता है कि कौन से पिक्सेल बिल्ली के हैं और कौन से कालीन के।
- समाधान (Omni-RoPE): शोधकर्ताओं ने AI को एक विशेष जीपीएस सिस्टम दिया। वे छवि के हर हिस्से को एक अद्वितीय आईडी (जैसे नाम का टैग) और एक स्थान (जैसे पता) के साथ टैग करते हैं। इस प्रकार, जब आप कहते हैं "बिल्ली को ले जाओ," तो AI जानता है कि कौन सा "नाम का टैग" बिल्ली का है और वह बाकी तस्वीर को खराब किए बिना उसे हिला सकता है।
3. "OmniContext" बेंचमार्क: नई अंतिम परीक्षा
शोधकर्ताओं ने महसूस किया कि मौजूदा AI टेस्ट पर्याप्त नहीं थे। वे एक शेफ से "सैंडविच बनाने" के लिए कहने जैसे थे, बिना यह जांचे कि ब्रेड ताज़ा है या चीज़ पिघली हुई है।
- नया टेस्ट: उन्होंने OmniContext नामक एक नया, कठिन एग्जाम बनाया। यह परीक्षण करता है कि क्या AI किसी विशिष्ट व्यक्ति या वस्तु की फोटो देख सकता है और उन्हें नए दृश्यों में पूरी तरह से रख सकता है।
- उदाहरण: "इस कुत्ते की फोटो लो और उसे हवाई के एक बीच पर रख दो।"
- AI को यह सुनिश्चित करना होगा कि कुत्ता बिल्कुल आपके कुत्ते जैसा ही दिखे, न कि कोई रैंडम कुत्ता, जबकि बीच को वास्तविक बनाना होगा। OmniGen2 ने इस टेस्ट में बाजी मारी और लगभग हर अन्य मॉडल को पीछे छोड़ दिया।
4. यह वास्तव में क्या कर सकता है?
OmniGen2 छवियों के लिए एक "स्विस आर्मी नाइफ" है। यह एक ही बार में तीन मुख्य चीजें कर सकता है:
- टेक्स्ट-टू-इमेज (Text-to-Image): आप टाइप करते हैं "टोपी पहने हुए एक बिल्ली," और यह इसे बनाता है।
- इमेज एडिटिंग (Image Editing): आप एक फोटो अपलोड करते हैं और कहते हैं "आसमान को सूर्यास्त में बदलें," और यह बाकी फोटो को खराब किए बिना इसे कर देता है।
- इन-कॉन्टेक्स्ट जनरेशन (In-Context Generation): आप एक पात्र की फोटो अपलोड करते हैं और कहते हैं "इस पात्र को एक जंगल में रखें," और यह उसी सटीक पात्र के साथ एक नया दृश्य बनाता है।
यह एक बड़ी बात क्यों है?
इससे पहले, आपको अक्सर अलग-अलग कामों के लिए अलग-अलग AI टूल्स की आवश्यकता होती थी (ड्रॉ करने के लिए एक, एडिट करने के लिए दूसरा, बैकग्राउंड बदलने के लिए तीसरा)। OmniGen2 इन सभी को एक ही स्मार्ट, आज्ञाकारी मॉडल में जोड़ देता है। यह एक अकेले सहायक की तरह है जो पेंट कर सकता है, फोटो एडिट कर सकता है, और विशेषज्ञों की एक टीम से बेहतर जटिल निर्देशों का पालन कर सकता है।
संक्षेप में: OmniGen2 एक सुपर-स्मार्ट डिजिटल आर्टिस्ट है जिसे पहले दुनिया का ज्ञान सिखाया गया, फिर आपके आदेशों को पूरी तरह से सुनने के लिए प्रशिक्षित किया गया, और अंत में सबसे कठिन चुनौतियों का सामना करने के लिए परीक्षण किया गया ताकि यह साबित हो सके कि यह आपके द्वारा दी गई किसी भी चुनौती को संभाल सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।