← नवीनतम पेपर
💻 computer science

Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation

यह शोध पत्र INSET को प्रस्तुत करता है, जो एक एकीकृत विज़ुअल जनरेशन मॉडल है जो छवियों को टेक्स्ट निर्देशों के भीतर मूल शब्दावली टोकन के रूप में एम्बेड करता है और मल्टी-इमेज कंसिस्टेंसी (बहु-छवि निरंतरता) और जटिल निर्देश पालन में मौजूदा तरीकों से काफी बेहतर प्रदर्शन करने के लिए 15 मिलियन इंटरलीव्ड नमूनों के एक स्केलेबल डेटा इंजन का लाभ उठाता है।

मूल लेखक: Yabo Zhang, Kunchang Li, Dewei Zhou, Xinyu Huang, Xun Wang

प्रकाशित 2026-05-13
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yabo Zhang, Kunchang Li, Dewei Zhou, Xinyu Huang, Xun Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कलाकार को बहुत ही विशिष्ट, जटिल निर्देश देने की कोशिश कर रहे हैं।

पुराना तरीका (द "इंडेक्स कार्ड" समस्या)
वर्तमान में, अधिकांश AI इमेज जनरेटर एक ऐसे लाइब्रेरियन की तरह काम करते हैं जो केवल संख्याओं को समझते हैं। यदि आप एक फोटो से एक विशिष्ट कुत्ता, दूसरी फोटो से एक विशिष्ट टोपी और तीसरी फोटो से एक विशिष्ट बैकग्राउंड चाहते हैं, तो आपको कहना होगा: "चित्र संख्या 1 वाले कुत्ते, चित्र संख्या 2 वाली टोपी और चित्र संख्या 3 वाले बैकग्राउंड का उपयोग करके एक चित्र बनाएं।"

AI को यह याद रखना पड़ता है कि कौन सी संख्या किस तस्वीर के अनुरूप है जबकि वह पेंटिंग करने की कोशिश कर रहा होता है। जैसे-जैसे आप अधिक तस्वीरें जोड़ते हैं, AI भ्रमित हो जाता है। वह भूल जाता है कि कौन सी टोपी किस कुत्ते के साथ जानी चाहिए, या वह अतिरिक्त तस्वीरों को पूरी तरह से अनदेखा कर देता है। यह आंखों पर पट्टी बांधकर पांच गेंदों के साथ करतब दिखाने जैसा है; अंततः, आप उन्हें गिरा देंगे।

नया तरीका: "वाक्यों में चित्र" (Inset)
यह शोध पत्र Inset (इनसेट) नामक एक नया मॉडल पेश करता है। छवियों को अलग-अलग नंबरों वाली फाइलों के रूप में मानने के बजाय, Inset छवियों को वाक्य में शब्दों की तरह मानता है।

कल्प Imagine कीजिए कि आप एक कहानी लिख रहे हैं, लेकिन "कुत्ता" शब्द लिखने के बजाय, आप उस विशिष्ट कुत्ते की एक छोटी, सटीक तस्वीर सीधे वाक्य के बीच में पेस्ट कर देते हैं।

  • पुराना तरीका: "कुत्ते को कुर्सी पर रखें (चित्र 1 से)।"
  • Inset तरीका: "[कुत्ते की तस्वीर] को कुर्सी पर रखें।"

क्योंकि तस्वीर वाक्य में "कुर्सी" शब्द के ठीक बगल में है, इसलिए AI को अनुमान लगाने या याद रखने की आवश्यकता नहीं है। अर्थ वहीं मौजूद है, बिल्कुल सामने। यह AI को बिना भ्रमित हुए कई अलग-अलग छवियों के साथ जटिल निर्देशों को संभालने की अनुमति देता है।

उन्होंने AI को कैसे प्रशिक्षित किया (द "डेटा फैक्ट्री")
AI को यह सिखाने के लिए, शोधकर्ता इंटरनेट पर पर्याप्त उदाहरण नहीं ढूंढ सके क्योंकि वे दुर्लभ हैं। इसलिए, उन्होंने एक स्केलेबल डेटा इंजन (डेटा के लिए एक रोबोट फैक्ट्री) बनाया।

  1. फोटोज के लिए: उन्होंने लाखों फोटो लीं और उन्हें अन्य स्मार्ट AI का उपयोग करके अलग-अलग हिस्सों में विभाजित किया। उन्होंने प्रत्येक वस्तु (जैसे "लाल फूलदान" या "नीली बिल्ली") की पहचान की, उसके बारे में एक वाक्य लिखा, और फिर उस विवरण के स्थान पर उस वस्तु की वास्तविक तस्वीर को वाक्य में डाल दिया।
  2. वीडियो के लिए: उन्होंने AI को यह सिखाने के लिए वीडियो देखे कि चीजें कैसे बदलती हैं। यदि कोई वीडियो बिल्ली को कूदते हुए दिखाता है, तो वे ऐसे निर्देश बनाते हैं जो कहते हैं: "शुरुआत वाली बिल्ली [बैठी हुई बिल्ली की तस्वीर] को लें और उसे कूदने के लिए कहें [कूदती हुई बिल्ली की तस्वीर]।" यह AI को केवल स्थिर नकल करने के बजाय, गति और परिवर्तन को समझने के लिए प्रशिक्षित करता है।

उन्होंने इस मॉडल को प्रशिक्षित करने के लिए ऐसे 1.5 करोड़ (15 मिलियन) "चित्र-वाक्यों" का निर्माण किया।

परिणाम
उन्होंने इस नए मॉडल का परीक्षण InterleaveBench नामक एक कठिन चुनौती पर किया, जिसमें एक जटिल अनुरोध में कई अलग-अलग छवियों को मिलाना शामिल है।

  • स्कोर: जब 2 छवियों का उपयोग करने के लिए कहा गया, तो Inset ने अच्छा प्रदर्शन किया। लेकिन जब 5 छवियों का उपयोग करने के लिए कहा गया, तो पुराने मॉडल बिखर गए, जबकि Inset बेहतर होता गया। यह वस्तुओं को मूल रूप में रखने और टेक्स्ट निर्देशों का पालन करने में काफी अधिक सटीक था।
  • बोनस: क्योंकि AI ने छवियों को निर्देश के हिस्से के रूप में लेना सीख लिया है, इसलिए यह एडिटिंग (संपादन) भी कर सकता है। आप इसे एक विशिष्ट शर्ट दिखा सकते हैं और कह सकते, "इस शर्ट को फोटो में व्यक्ति को पहनाएं," और यह केवल एक "शर्ट" जैसा दिखने का अनुमान लगाने के बजाय, उस शर्ट के सटीक डिज़ाइन की नकल करेगा।

सारांश में
यह शोध पत्र दावा करता है कि छवियों को संदर्भित करने के लिए "नंबरों" का उपयोग करने के बजाय, उन्हें "शब्दों" की तरह "पढ़ने" देने से, हम जटिल छवियों को बनाने और संपादित करने के लिए बहुत अधिक शक्तिशाली उपकरण बना सकते हैं। उन्होंने यह सिद्ध किया कि उनके नए मॉडल ने, विशेष रूप से तब जब कार्य जटिल हो जाते हैं, सभी वर्तमान ओपन-सोर्स प्रतिस्पर्धियों को पीछे छोड़ दिया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →