Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation
यह शोध पत्र INSET को प्रस्तुत करता है, जो एक एकीकृत विज़ुअल जनरेशन मॉडल है जो छवियों को टेक्स्ट निर्देशों के भीतर मूल शब्दावली टोकन के रूप में एम्बेड करता है और मल्टी-इमेज कंसिस्टेंसी (बहु-छवि निरंतरता) और जटिल निर्देश पालन में मौजूदा तरीकों से काफी बेहतर प्रदर्शन करने के लिए 15 मिलियन इंटरलीव्ड नमूनों के एक स्केलेबल डेटा इंजन का लाभ उठाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक कलाकार को बहुत ही विशिष्ट, जटिल निर्देश देने की कोशिश कर रहे हैं।
पुराना तरीका (द "इंडेक्स कार्ड" समस्या)
वर्तमान में, अधिकांश AI इमेज जनरेटर एक ऐसे लाइब्रेरियन की तरह काम करते हैं जो केवल संख्याओं को समझते हैं। यदि आप एक फोटो से एक विशिष्ट कुत्ता, दूसरी फोटो से एक विशिष्ट टोपी और तीसरी फोटो से एक विशिष्ट बैकग्राउंड चाहते हैं, तो आपको कहना होगा: "चित्र संख्या 1 वाले कुत्ते, चित्र संख्या 2 वाली टोपी और चित्र संख्या 3 वाले बैकग्राउंड का उपयोग करके एक चित्र बनाएं।"
AI को यह याद रखना पड़ता है कि कौन सी संख्या किस तस्वीर के अनुरूप है जबकि वह पेंटिंग करने की कोशिश कर रहा होता है। जैसे-जैसे आप अधिक तस्वीरें जोड़ते हैं, AI भ्रमित हो जाता है। वह भूल जाता है कि कौन सी टोपी किस कुत्ते के साथ जानी चाहिए, या वह अतिरिक्त तस्वीरों को पूरी तरह से अनदेखा कर देता है। यह आंखों पर पट्टी बांधकर पांच गेंदों के साथ करतब दिखाने जैसा है; अंततः, आप उन्हें गिरा देंगे।
नया तरीका: "वाक्यों में चित्र" (Inset)
यह शोध पत्र Inset (इनसेट) नामक एक नया मॉडल पेश करता है। छवियों को अलग-अलग नंबरों वाली फाइलों के रूप में मानने के बजाय, Inset छवियों को वाक्य में शब्दों की तरह मानता है।
कल्प Imagine कीजिए कि आप एक कहानी लिख रहे हैं, लेकिन "कुत्ता" शब्द लिखने के बजाय, आप उस विशिष्ट कुत्ते की एक छोटी, सटीक तस्वीर सीधे वाक्य के बीच में पेस्ट कर देते हैं।
- पुराना तरीका: "कुत्ते को कुर्सी पर रखें (चित्र 1 से)।"
- Inset तरीका: "[कुत्ते की तस्वीर] को कुर्सी पर रखें।"
क्योंकि तस्वीर वाक्य में "कुर्सी" शब्द के ठीक बगल में है, इसलिए AI को अनुमान लगाने या याद रखने की आवश्यकता नहीं है। अर्थ वहीं मौजूद है, बिल्कुल सामने। यह AI को बिना भ्रमित हुए कई अलग-अलग छवियों के साथ जटिल निर्देशों को संभालने की अनुमति देता है।
उन्होंने AI को कैसे प्रशिक्षित किया (द "डेटा फैक्ट्री")
AI को यह सिखाने के लिए, शोधकर्ता इंटरनेट पर पर्याप्त उदाहरण नहीं ढूंढ सके क्योंकि वे दुर्लभ हैं। इसलिए, उन्होंने एक स्केलेबल डेटा इंजन (डेटा के लिए एक रोबोट फैक्ट्री) बनाया।
- फोटोज के लिए: उन्होंने लाखों फोटो लीं और उन्हें अन्य स्मार्ट AI का उपयोग करके अलग-अलग हिस्सों में विभाजित किया। उन्होंने प्रत्येक वस्तु (जैसे "लाल फूलदान" या "नीली बिल्ली") की पहचान की, उसके बारे में एक वाक्य लिखा, और फिर उस विवरण के स्थान पर उस वस्तु की वास्तविक तस्वीर को वाक्य में डाल दिया।
- वीडियो के लिए: उन्होंने AI को यह सिखाने के लिए वीडियो देखे कि चीजें कैसे बदलती हैं। यदि कोई वीडियो बिल्ली को कूदते हुए दिखाता है, तो वे ऐसे निर्देश बनाते हैं जो कहते हैं: "शुरुआत वाली बिल्ली [बैठी हुई बिल्ली की तस्वीर] को लें और उसे कूदने के लिए कहें [कूदती हुई बिल्ली की तस्वीर]।" यह AI को केवल स्थिर नकल करने के बजाय, गति और परिवर्तन को समझने के लिए प्रशिक्षित करता है।
उन्होंने इस मॉडल को प्रशिक्षित करने के लिए ऐसे 1.5 करोड़ (15 मिलियन) "चित्र-वाक्यों" का निर्माण किया।
परिणाम
उन्होंने इस नए मॉडल का परीक्षण InterleaveBench नामक एक कठिन चुनौती पर किया, जिसमें एक जटिल अनुरोध में कई अलग-अलग छवियों को मिलाना शामिल है।
- स्कोर: जब 2 छवियों का उपयोग करने के लिए कहा गया, तो Inset ने अच्छा प्रदर्शन किया। लेकिन जब 5 छवियों का उपयोग करने के लिए कहा गया, तो पुराने मॉडल बिखर गए, जबकि Inset बेहतर होता गया। यह वस्तुओं को मूल रूप में रखने और टेक्स्ट निर्देशों का पालन करने में काफी अधिक सटीक था।
- बोनस: क्योंकि AI ने छवियों को निर्देश के हिस्से के रूप में लेना सीख लिया है, इसलिए यह एडिटिंग (संपादन) भी कर सकता है। आप इसे एक विशिष्ट शर्ट दिखा सकते हैं और कह सकते, "इस शर्ट को फोटो में व्यक्ति को पहनाएं," और यह केवल एक "शर्ट" जैसा दिखने का अनुमान लगाने के बजाय, उस शर्ट के सटीक डिज़ाइन की नकल करेगा।
सारांश में
यह शोध पत्र दावा करता है कि छवियों को संदर्भित करने के लिए "नंबरों" का उपयोग करने के बजाय, उन्हें "शब्दों" की तरह "पढ़ने" देने से, हम जटिल छवियों को बनाने और संपादित करने के लिए बहुत अधिक शक्तिशाली उपकरण बना सकते हैं। उन्होंने यह सिद्ध किया कि उनके नए मॉडल ने, विशेष रूप से तब जब कार्य जटिल हो जाते हैं, सभी वर्तमान ओपन-सोर्स प्रतिस्पर्धियों को पीछे छोड़ दिया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।