← नवीनतम पेपर
💻 computer science

iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation

iMontage एक एकीकृत ढांचा है जो विविध इमेज डेटा को टेम्पोरल प्रायर्स (temporal priors) में इंजेक्ट करके प्री-ट्रेंड वीडियो मॉडल्स को बहुमुखी मैनी-टू-मैनी इमेज जनरेटर्स के रूप में पुन: उपयोग करता है, जिससे मोशन कोहेरेंस (motion coherence) को बनाए रखते हुए प्राकृतिक ट्रांज़िशन और एक विस्तृत डायनेमिक रेंज के साथ इमेज सेट्स का निर्माण सक्षम होता है।

मूल लेखक: Zhoujie Fu, Xianfang Zeng, Jinghong Lan, Xinyao Liao, Cheng Chen, Junyi Chen, Jiacheng Wei, Wei Cheng, Shiyu Liu, Yunuo Chen, Gang Yu, Guosheng Lin

प्रकाशित 2026-08-04
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhoujie Fu, Xianfang Zeng, Jinghong Lan, Xinyao Liao, Cheng Chen, Junyi Chen, Jiacheng Wei, Wei Cheng, Shiyu Liu, Yunuo Chen, Gang Yu, Guosheng Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक मास्टर कलाकार बनने के लिए सिखाने की कोशिश कर रहे हैं। लंबे समय तक, हमारे पास दो बहुत अलग प्रकार के रोबोट थे। पहला प्रकार एक एकल, पूर्ण चित्र बनाने में माहिर था जो एक विवरण पर आधारित हो, लेकिन यदि आप उससे पांच अलग-अलग दृश्यों वाली एक पूरी कहानी बनाने के लिए कहते, तो वह भ्रमित हो जाता, और हर फ्रेम में पात्र अलग-अलग लोग दिखते। दूसरा प्रकार एक वीडियो रोबोट था, जिसे फिल्मों पर प्रशिक्षित किया गया था। वह जानता था कि चीजों को सुचारू रूप से कैसे चलाया जाए और कैसे एक चरित्र का चेहरा तब तक एक जैसा रहता है जब तक वह सड़क पर चलता है। लेकिन यह रोबोट थोड़ा कठोर था; यह चिकने, निरंतर प्रवाह के लिए अभ्यस्त था और अचानक, झटकेदार बदलाव करने या बिना किसी सुचारू संक्रमण के पूरी तरह से अलग दृश्यों के बीच कूदने में संघर्ष करता था।

इस कंप्यूटर विज्ञान के कोने में बड़ा सवाल यह है: क्या हम दोनों दुनियाओं का सर्वश्रेष्ठ प्राप्त करने वाला एक एकल कलाकार बना सकते हैं? क्या हम एक ऐसा मॉडल बना सकते हैं जो एक वीडियो रोबोट की तरह समय के सुचारू प्रवाह को समझता हो, लेकिन एक चित्र पुस्तक की तरह विभिन्न छवियों और दृश्यों के बीच कूदने की जंगली, रचनात्मक स्वतंत्रता भी रखता हो? यही वह चुनौती है जिसे नया पेपर, iMontage, हल करने का प्रयास करता है। यह पूछता है कि क्या हम एक वीडियो जनरेटर के शक्तिशाली "मोशन ब्रेन" को फिर से प्रशिक्षित कर सकते हैं ताकि वह छवियों के एक अराजक, कई-से-कई (many-to-many) मिश्रण को संभाल सके, जिससे एक ऐसा उपकरण बन सके जो पूरे स्टोरीबोर्ड बना सके या कई चित्रों को एक साथ संपादित कर सके जबकि सब कुछ सुसंगत रहे।


iMontage का जादू: एक टाइम मशीन के साथ स्टोरीबोर्ड कलाकार

iMontage से मिलिए, एक नया AI मॉडल जो एक सुपर-पावर्ड, ऑल-इन-वन इमेज जनरेटर की तरह कार्य करता है। इसे एक डिजिटल निर्देशक के रूप में सोचें जो संदर्भ फोटो का एक समूह और एक टेक्स्ट निर्देश ले सकता है, और फिर तुरंत नई छवियों की एक पूरी श्रृंखला निकाल सकता है जो एक सुसंगत कहानी बताती है। चाहे आप एक फोटो को संपादित करना चाहते हों, तीन अलग-अलग पात्रों को एक नए दृश्य में मिलाना चाहते हों, या चार-पैनल वाला कॉमिक स्ट्रिप बनाना चाहते हों जहाँ पात्र की पोशाक और बैकग्राउंड नाटकीय रूप से बदल जाता है, iMontage एक ही बार में यह सब करने की कोशिश करता है।

इसका गुप्त मंत्र यह है कि रचनाकारों ने शून्य से एक रोबोट नहीं बनाया। इसके बजाय, उन्होंने एक पूर्व-प्रशिक्षित वीडियो मॉडल लिया—एक ऐसी प्रणाली जो पहले से ही यह समझने के लिए प्रसिद्ध है कि चीजें कैसे चलती हैं और समय के साथ कैसे बदलती हैं—और उसे एक नया काम दिया। आमतौर पर, वीडियो मॉडल चिकने, निरंतर क्लिप्स (जैसे किसी व्यक्ति का चलना) पर प्रशिक्षित होते हैं। वे "हार्ड कट्स" या अचानक होने वाले बदलावों के लिए अभ्यस्त नहीं हैं जहाँ दृश्य तुरंत बदल जाता है। लेखकों ने परिकल्पना की कि यदि वे इस सुचारू वीडियो ढांचे में इमेज डेटा की जंगली, विविध सामग्री को इंजेक्ट कर सकें, तो वे दोनों दुनियाओं का सर्वश्रेष्ठ प्राप्त कर सकते हैं: एक वीडियो की निरंतरता और एक फोटो एल्बम की गतिशील रेंज।

यह कैसे काम करता है: "स्यूडो-फ्रेम" (Pseudo-Frame) ट्रिक

इसे सफल बनाने के लिए, टीम को वीडियो मॉडल को यह सिखाना था कि वह छवियों को एक निरंतर मूवी के रूप में नहीं, बल्कि "फ्रेम्स" के एक लचीले सेट के रूप में देखे जिन्हें इधर-उधर बिखेरा जा सकता है। उन्होंने Marginal RoPE (एक पोजिशनिंग सिस्टम के लिए एक फैंसी नाम) नामक एक चतुर ट्रिक का उपयोग किया।

एक लंबी टाइमलाइन की कल्पना करें। आमतौर पर, एक वीडियो मॉडल फ्रेम 1, 2, 3, 4, 5 को बिल्कुल एक-दूसरे के बगल में देखता है। हालाँकि, iMontage, इनपुट छवियों (संदर्भ जिन्हें आप इसे देते हैं) को टाइमलाइन की शुरुआत (हेड) में "फ्रेम्स" के रूप में और आउटपुट छवियों (नई तस्वीरें जो यह बनाता है) को टाइमलाइन के अंत (टेल) में "फ्रेम्स" के रूप में मानता है। यह बीच में एक बड़ा, खाली गैप छोड़ देता है। यह AI को बताता है: "हे, ये पहली कुछ छवियां तुम्हारे संकेत हैं, और ये अंतिम कुछ छवियां तुम्हारी नई रचनाएं हैं। इन्हें एक फिल्म की तरह एक-दूसरे में सुचारू रूप से बहने की कोशिश मत करो; इन्हें एक कहानी के अलग-अलग चरणों के रूप में समझो।" यह सरल परिवर्तन मॉडल को इस बात को लेकर भ्रमित होने से रोकता है कि वह एक वीडियो देख रहा है या नई तस्वीरों का एक सेट बना रहा है।

प्रशिक्षण: अराजकता से सीखना

आप केवल एक वीडियो रोबोट को "रचनात्मक बनो" कहकर यह उम्मीद नहीं कर सकते कि वह काम करेगा। टीम को इसे सिखाने के लिए एक विशाल, अस्त-व्यस्त डेटासेट तैयार करना पड़ा। उन्होंने केवल सुचारू वीडियो का उपयोग नहीं किया; उन्होंने विशेष रूप से हाई-मोशन क्लिप्स और "हार्ड कट्स" (अचानक दृश्य परिवर्तन) की तलाश की ताकि मॉडल को गतिशील संक्रमणों को संभालने के लिए सिखाया जा सके। उन्होंने लाखों इमेज एडिटिंग पेयर्स को भी मिलाया, जहाँ एक रोबोट को शर्ट का रंग बदलने या किसी वस्तु को हटाने के बारे में सीखना था।

उन्होंने मॉडल को CocktailMix नामक रणनीति का उपयोग करके प्रशिक्षित किया। कल्पना कीजिए कि एक छात्र गणित, कला और संगीत सीख रहा है। यदि आप उन तीनों विषयों को एक साथ उनके सामने रख देंगे, तो वे अभिभूत हो सकते हैं। यदि आप उन्हें एक-एक करके पढ़ाते हैं, तो हो सकता है कि तीसरे विषय तक पहुँचते-पहुँचते वे पहले विषय को भूल जाएँ। लेखकों ने पाया कि सबसे अच्छा तरीका आसान कार्यों से शुरू करना, फिर धीरे-धीरे कठिन कार्यों को जोड़ना और धीरे-धीरे आसान कार्यों पर ध्यान कम करना था। इस "कठिनाई-क्रमित" दृष्टिकोण ने मॉडल को सरल संपादन से लेकर जटिल, बहु-छवि स्टोरीबोर्ड तक सब कुछ संभालने में मदद की, बिना अपना मानसिक संतुलन खोए।

यह क्या कर सकता है (और क्या नहीं कर सकता)

परिणाम प्रभावशाली हैं। परीक्षणों में, iMontage ने दिखाया कि यह कर सकता है:

  • छवियों को संपादित करना (one-to-one): केप का रंग बदलना या कैंची के डिब्बे को हटाना, जो शीर्ष वाणिज्यिक मॉडलों के प्रदर्शन से मेल खाता है।
  • संदर्भों को मिलाना (many-to-one): एक व्यक्ति की फोटो, एक ध्रुवीय भालू की फोटो और एक नाव की फोटो लें, और एक नई छवि उत्पन्न करें जहाँ वे सभी एक सुसंगत दृश्य में एक साथ मौजूद हों।
  • कहानियाँ बनाना (many-to-many): छवियों का एक क्रम (जैसे एक स्टोरीबोर्ड) बनाना जहाँ एक पात्र विभिन्न दृश्यों के माध्यम से घूमता है, भले ही बैकग्राउंड और कैमरा एंगल नाटकीय रूप से बदल जाएं, फिर भी अपनी पहचान बनाए रखता है।

पेपर सुझाव देता है कि यह दृष्टिकोण पिछले तरीकों की तुलना में बेहतर है जिन्होंने इन कार्यों को एकीकृत करने की कोशिश की थी, विशेष रूप से पात्रों को अलग-अलग छवियों में एक जैसा दिखने और दृश्य में अचानक, गतिशील परिवर्तनों को संभालने के मामले में। उपयोगकर्ता अध्ययनों में, लोगों ने निर्देशों का पालन करने और पात्रों की निरंतरता बनाए रखने के लिए अन्य ओपन-सोर्स मॉडलों की तुलना में iMontage को उच्च रेटिंग दी।

हालाँकि, लेखक इसकी सीमाओं के बारे में ईमानदार हैं। वर्तमान में, मॉडल चार इनपुट छवियों और चार आउटपुट छवियों के साथ सबसे अच्छा काम करता है। इसका परीक्षण अभी तक दर्जनों पैनलों वाली अत्यंत लंबी, जटिल कहानियों पर नहीं किया गया है। साथ ही, हालांकि यह कई चीजों में महान है, यह पूर्ण नहीं है; कभी-कभी यह बहुत विशिष्ट, कठिन-से-परिभाषित विवरणों के साथ संघर्ष कर सकता है।

निष्कर्ष

iMontage एक महत्वपूर्ण कदम है क्योंकि यह साबित करता है कि जटिल इमेज समस्याओं को हल करने के लिए आपको एक पूरी तरह से नए प्रकार के AI को बनाने की आवश्यकता नहीं है। एक वीडियो मॉडल को डेटा देने के तरीके को बदलकर—छवियों को एक कठोर मूवी स्ट्रीम के बजाय लचीले "स्यूडो-फ्रेम्स" के रूप में मानकर—हम एक ऐसा उपकरण बना सकते हैं जो सुसंगत भी है और जंगली रूप से रचनात्मक भी। यह सुझाव देता है कि इमेज जनरेशन का भविष्य प्रत्येक काम के लिए एक अलग टूल रखने के बारे में नहीं है, बल्कि एक बहुमुखी "निर्देशक" बनाने के बारे में है जो पहले स्केच से लेकर अंतिम स्टोरीबोर्ड तक, पूरी प्रोडक्शन को संभाल सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →