← नवीनतम पेपर
💬 NLP

VINCIE: Unlocking In-context Image Editing from Video

यह शोध पत्र VINCIE को प्रस्तुत करता है, जो एक ब्लॉक-कॉज़ल डिफ्यूजन ट्रांसफार्मर है जिसे तीन प्रॉक्सी कार्यों के माध्यम से विशेष रूप से वीडियो-व्युत्पन्न मल्टीमॉडल अनुक्रमों पर प्रशिक्षित किया गया है, जो इन-कॉन्टेक्स्ट इमेज एडिटिंग में अत्याधुनिक प्रदर्शन प्राप्त करता है और मल्टी-कॉन्सेप्ट कंपोज़िशन एवं स्टोरी जनरेशन में मजबूत क्षमता प्रदर्शित करता है।

मूल लेखक: Leigang Qu, Feng Cheng, Ziyan Yang, Qi Zhao, Shanchuan Lin, Yichun Shi, Yicong Li, Wenjie Wang, Tat-Seng Chua, Lu Jiang

प्रकाशित 2026-03-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Leigang Qu, Feng Cheng, Ziyan Yang, Qi Zhao, Shanchuan Lin, Yichun Shi, Yicong Li, Wenjie Wang, Tat-Seng Chua, Lu Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक फोटो को एडिट करना चाहते हैं, लेकिन केवल एक कमांड देकर नहीं जैसे "बिल्ली को हटा दो," बल्कि आप इमेज के साथ एक बातचीत करना चाहते हैं। आप कहते हैं, "एक बिल्ली जोड़ो।" फिर, "बिल्ली को टोपी पहनाओ।" फिर, "बिल्ली को स्केटबोर्ड पर बिठाओ।" फिर, "बैकग्राउंड को जंगल में बदल दो।"

इसे इन-कॉन्टेक्स्ट इमेज एडिटिंग (In-Context Image Editing) कहा जाता है। समस्या यह है कि कंप्यूटर को यह सिखाना वैसा ही है जैसे किसी कुत्ते को केवल एक समय में एक चाल दिखाकर शतरंज खेलना सिखाना। आज के अधिकांश AI मॉडल स्थिर "पहले और बाद के" (Before and After) जोड़ों पर प्रशिक्षित होते हैं (जैसे कि एक अव्यवस्थित कमरे की फोटो और एक साफ कमरे की फोटो)। वे एक चीज़ को ठीक करना तो सीख जाते हैं, लेकिन जब आप उन्हें एक क्रम में पाँच चीज़ें करने के लिए कहते हैं, तो वे भ्रमित हो जाते हैं, अक्सर पहले निर्देश को भूल जाते हैं या तस्वीर को बिगाड़ देते हैं।

यहाँ VINCIE (वीडियो-ड्रिवन इन-कॉन्टेक्स्ट इमेज एडिटिंग) आता है। यहाँ इसकी सरल कहानी दी गई है कि उन्होंने इसे कैसे हल किया।

बड़ा विचार: फोटो देखना बंद करें, फिल्में देखना शुरू करें

शोधकर्ताओं ने एक सरल प्रश्न पूछा: "हम इमेज एडिटिंग को स्थिर फोटो का उपयोग करके क्यों सिखा रहे हैं जबकि वास्तविक दुनिया चलती-फिरती है?"

एक फोटो को एक स्थिर फ्रेम के रूप में सोचें। यह आपको बताता है कि कोई चीज़ कैसी दिखती है।
एक वीडियो को एक कहानी के रूप में सोचें। यह आपको बताता है कि आगे क्या होता है।

एक वीडियो में, यदि कोई व्यक्ति कमरे से बाहर जाता है, तो कैमरा "पहले" (कमरे में व्यक्ति) और "बाद" (खाली कमरा) को देखता है। यदि कोई कार पास से गुजरती है, तो वीडियो उस बदलाव को दिखाता है। वीडियो वास्तव में वास्तविक समय में होने वाले बदलावों का एक क्रम है।

उपमा (Analogy):

  • पुराना तरीका: एक जले हुए स्टेक की एक फोटो और एक परफेक्ट स्टेक की एक फोटो देखकर 5-कोर्स मील बनाना सीखने की कोशिश करना। आपको बीच के चरणों का पता नहीं चलता।
  • VINCIE तरीका: एक कुकिंग शो (वीडियो) देखना। आप शेफ को काटना, तलना, मसाला डालना और सजाना देखते हैं। आप केवल शुरुआत और अंत नहीं, बल्कि बदलावों के प्रवाह (flow) को सीखते हैं।

उन्होंने इसे कैसे बनाया (द "मैजिक ट्रांसलेटर")

चूंकि वीडियो निर्देशों के साथ नहीं आते जैसे कि "अब मैं पेड़ हटा रहा हूँ," इसलिए टीम को यह सिखाना पड़ा कि AI वीडियो की कहानी को कैसे पढ़े।

  1. स्क्रिप्टराइटर (VLM): उन्होंने एक स्मार्ट AI (विज़न-लैंग्वेज मॉडल) का उपयोग किया जो वीडियो क्लिप्स को देखता है और एक "स्क्रिप्ट" लिखता है। यह दो फ्रेमों को देखता है और कहता है, "ठीक है, इस सेकंड में, सूरज हिला और कुत्ता कूदा।"
  2. हाइलाइटर (सेगमेंटेशन): उन्होंने AI को यह भी सिखाया कि ठीक उसी चीज़ के चारों ओर "हाइलाइटर" कैसे खींचा जाए जो बदली है। यदि कुत्ता कूदा, तो AI कुत्ते के चारों ओर एक मास्क बनाता है।
  3. अनुक्रम (The Sequence): उन्होंने वीडियो को एक लंबे, इंटरलीव्ड चैन में बदल दिया:
    • इमेज 1 -> निर्देश: "कुत्ता कूदता है" -> डॉग का मास्क -> इमेज 2 -> निर्देश: "सूरज डूबता है" -> आसमान का मास्क -> इमेज 3

तीन प्रशिक्षण खेल (The Three Training Games)

AI को वास्तव में कुशल बनाने के लिए, उन्होंने इसे केवल अगला चित्र अनुमान लगाने के लिए नहीं कहा। उन्होंने इसे एक साथ तीन खेल खिलाए:

  1. "आगे क्या होगा?" गेम (नेक्स्ट इमेज प्रेडिक्शन): "यहाँ दृश्य और निर्देश हैं। अगला फ्रेम कैसा दिखता है?" (यह मुख्य एडिटिंग कार्य है)।
  2. "बदलाव को पहचानो" गेम (करंट सेगमेंटेशन): "यहाँ नई तस्वीर है। क्या आप ठीक से बता सकते हैं कि क्या बदला है?" (यह AI को समझने में मदद करता है कि कहाँ एडिट करना है)।
  3. "क्रिस्टल बॉल" गेम (नेक्स्ट सेगमेंटेशन): "यहाँ वर्तमान दृश्य है। आपको क्या लगता है कि अगला बदलाव कहाँ होगा?" (यह AI को आगे की योजना बनाने में मदद करता है, जैसे कि एक शतरंज खिलाड़ी)।

यह क्यों एक गेम चेंजर है

इसके परिणाम प्रभावशाली हैं क्योंकि AI ने संदर्भ (context) सीखा।

  • कोई "ड्रिफ्टिंग" नहीं: पुराने मॉडल्स में, यदि आप किसी फोटो को 5 बार एडिट करते हैं, तो चौथी बार तक व्यक्ति का चेहरा आलू जैसा दिखने लग सकता है। VINCIE चेहरे को वही व्यक्ति बनाए रखता है क्योंकि इसने वीडियो से सीखा है जहाँ लोग स्थिर रहते हैं भले ही वे चलते रहें।
  • चेन ऑफ थॉट (Chain of Thought): AI कार्य करने से पहले "सोचना" शुरू करता है। यह नए पिक्सेल बनाने से पहले "मास्क" (बदलने वाला क्षेत्र) की भविष्यवाणी करता है। यह एक कलाकार की तरह है जो पेंटिंग करने से पहले आउटलाइन स्केच करता है।
  • उभरते कौशल (Emergent Skills): क्योंकि इसने वीडियो के "प्रवाह" से सीखा, इसने अनजाने में ऐसी चीजें सीखीं जो इसे स्पष्ट रूप से नहीं सिखाई गई थीं, जैसे:
    • कहानी सुनाना (Storytelling): यह छवियों का एक सुसंगत क्रम उत्पन्न कर सकता है जो एक कहानी बताता है (जैसे, एक पात्र का घर से पहाड़ तक चलना)।
    • मल्टी-कॉन्सेप्ट मिक्सिंग: यह एक ही बार में "बिल्ली," "स्पेसशिप," और "जंगल" को मिला सकता है, भले ही उसने कभी इन तीनों को एक साथ वीडियो में न देखा हो।

निचोड़ (The Bottom Line)

VINCIE एक बच्चे को फोटो एडिट करना सिखाने जैसा है, उसे "बिफोर एंड आफ्टर" के फ्लैशकार्ड दिखाने के बजाय हजारों घंटों की फिल्में देखने देने के माध्यम से। वीडियो के प्राकृतिक संचलन और परिवर्तनों से सीखकर, AI एडिटिंग के तर्क (logic) को समझता है, न कि केवल परिणाम को।

यह स्केलेबल है (आप इंटरनेट पर अनंत वीडियो पा सकते हैं) और यह एक ऐसा मॉडल बनाता है जो बिना भ्रमित हुए या पटरी से उतरे लंबी, जटिल एडिटिंग बातचीत को संभाल सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →