← नवीनतम पेपर
💻 computer science

AlignVid: Training-Free Attention Scaling for Semantic Fidelity in Text-Guided Image-to-Video Generation

AlignVid एक प्रशिक्षण-मुक्त विधि है जो विजुअल प्रभुत्व का मुकाबला करने के लिए अटेंशन स्केलिंग मॉड्यूलेशन और गाइडेंस शेड्यूलिंग का उपयोग करके टेक्स्ट-गाइडेड इमेज-टू-वीडियो जनरेशन में सिमेंटिक फिडेलिटी को बढ़ाती है, जिसके साथ कठोर मूल्यांकन के लिए OmitI2V बेंचमार्क का परिचय भी दिया गया है।

मूल लेखक: Yexin Liu, Wen-Jie Shu, Zile Huang, Haoze Zheng, Yueze Wang, Jingjin Zhu, Manyuan Zhang, Ser-Nam Lim, Harry Yang

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yexin Liu, Wen-Jie Shu, Zile Huang, Haoze Zheng, Yueze Wang, Jingjin Zhu, Manyuan Zhang, Ser-Nam Lim, Harry Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ AlignVid पेपर का विवरण दिया गया है, जिसे सरल अवधारणाओं और रचनात्मक उपमाओं (analogies) के माध्यम से समझाया गया है।

बड़ी समस्या: "विजुअल एंकर" (Visual Anchor) प्रभाव

कल्पना कीजिए कि आप एक स्क्रिप्ट के आधार पर एक दृश्य फिल्माने की कोशिश कर रहे हैं एक निर्देशक हैं। आपके पास सेट पर एक संदर्भ फोटो (संदर्भ चित्र) है (वह "इमेज") और एक स्क्रिप्ट है जो आपको बताती है कि क्या करना है (वह "टेक्स्ट प्रॉम्प्ट")।

वर्तमान AI वीडियो जनरेटर में, संदर्भ फोटो एक भारी लंगर (heavy anchor) की तरह है। यह इतना दृश्य रूप से शक्तिशाली और विस्तृत है कि AI इसमें "फँस" जाता है। भले ही आपकी स्क्रिप्ट कहती हो, "आसमान में एक ड्रैगन जोड़ें" या "व्यक्ति को गायब कर दें", AI स्क्रिप्ट को अनदेखा कर देता है। वह बस मूल फोटो को ही बार-बार दिखाता रहता है क्योंकि फोटो के विजुअल विवरण इतने ज़ोर से चिल्ला रहे होते हैं कि टेक्स्ट निर्देश दब जाते हैं।

लेखक इसे "विजुअल डोमिनेंस" (Visual Dominance) कहते हैं। AI इस बात पर इतना केंद्रित हो जाता है कि वह क्या देख रहा है उस पर, कि वह क्या करने के लिए कहा गया है उसे भूल जाता है।

खोज: फोटो को धुंधला करने से मदद मिलती है (लेकिन लुक खराब हो जाता है)

शोधकर्ताओं ने एक छोटा प्रयोग किया। उन्होंने एक स्पष्ट, तीखी फोटो ली और AI को देने से पहले उसे गौसियन ब्लर (Gaussian blur) दिया (यानी उसे धुंधला कर दिया)।

आश्चर्यजनक रूप से, इसने काम किया! जब फोटो धुंधली थी, तो AI ने वास्तव में टेक्स्ट निर्देशों को सुना। उसने ड्रैगन जोड़ा या व्यक्ति को हटा दिया।

  • क्यों? ब्लर ने फोटो के "शोर" (noise) और भटकाने वाले विवरणों को हटा दिया। इसने AI को मजबूर किया कि वह पिक्सेल को घूरना बंद करे और स्क्रिप्ट को सुनना शुरू करे।
  • द कैच (The Catch): इनपुट इमेज को ब्लर करने से अंतिम वीडियो की गुणवत्ता खराब हो जाती है। वीडियो धुंधला और कम गुणवत्ता वाला दिखने लगता है। शोधकर्ताओं ने पूछा: क्या हम ब्लर के लाभ (टेक्स्ट को सुनना) को बिना इमेज को वास्तव में ब्लर किए प्राप्त कर सकते हैं?

समाधान: AlignVid (ध्यान के लिए "वॉल्यूम नॉब")

उत्तर है AlignVid। इमेज को AI में डालने से पहले उसे ब्लर करने के बजाय, AlignVid AI के सोचने के दौरान उसके दिमाग को ट्यून करता है।

AI के अटेंशन मैकेनिज्म को अलग-अलग इनपुट्स के लिए अलग-अलग वॉल्यूम नॉब्स वाले एक साउंड मिक्सिंग बोर्ड की तरह समझें:

  1. इमेज चैनल: अभी बहुत तेज़ है।
  2. टेक्स्ट चैनल: बहुत धीमा है।
  3. वीडियो चैनल: ठीक है।

AlignVid एक स्मार्ट वॉल्यूम नॉब की तरह काम करता है। यह इमेज फ़ाइल को नहीं बदलता है। इसके बजाय, यह AI के प्रोसेसिंग के अंदर इमेज के विवरणों की आवाज़ को कम करता है और टेक्स्ट निर्देशों की आवाज़ को बढ़ा देता है।

यह कैसे काम करता है (दो-चरणीय नृत्य):

  1. अटेंशन स्केलिंग मॉड्यूलेशन (ASM): यह मुख्य वॉल्यूम नॉब है। यह गणितीय रूप से AI के फोकस को "तेज़" (sharpen) करता है। कल्पना कीजिए कि AI लोगों की भीड़ (tokens) को देख रहा है। पहले, वह सभी को समान रूप से देख रहा था। ASM AI को स्क्रिप्ट में बताए गए विशिष्ट लोगों पर तीव्रता से ध्यान केंद्रित करने और बैकग्राउंड के शोर (इमेज विवरण) को अनदेखा करने के लिए प्रेरित करता है। इसे "एन्ट्रॉपी" (भ्रम) को कम करने और AI के ध्यान को अधिक निर्णायक बनाने के रूप में वर्णित किया गया है।
  2. गाइडेंस शेड्यूलिंग (GS): यह टाइमिंग स्विच है। यदि आप टेक्स्ट की आवाज़ बहुत अधिक, बहुत जल्दी, या बहुत लंबे समय तक बढ़ा देते हैं, तो वीडियो अजीब या ग्लिच वाला हो सकता है। GS एक निर्देशक की तरह है जो कहता है, "ठीक है, टेक्स्ट की आवाज़ केवल दृश्य के पहले भाग के दौरान बढ़ाएं जहाँ हम तय करते हैं कि क्या होगा, फिर इसे वापस कम कर दें ताकि अंतिम तस्वीर सुंदर दिखे।" यह सुधार को केवल वहीं और तभी लागू करता है जहाँ इसकी आवश्यकता होती है।

परिणाम: एक नया बेंचमार्क (OmitI2V)

यह साबित करने के लिए कि यह काम करता है, टीम ने केवल अनुमान नहीं लगाया; उन्होंने OmitI2V नामक एक टेस्ट बनाया।

  • कल्पना कीजिए कि 367 अलग-अलग परिदृश्यों वाला एक टेस्ट है।
  • कुछ पूछते हैं कि AI को कुछ जोड़ना (Add) है (जैसे, "मेज़ पर बिल्ली रखें")।
  • कुछ पूछते हैं कि AI को कुछ हटाना (Delete) है (जैसे, "कार को गायब कर दें")।
  • कुछ पूछते हैं कि AI को कुछ बदलना (Modify) है (जैसे, "लाल कार को नीली कार में बदलें")।

उन्होंने पाया कि बिना AlignVid के, शीर्ष AI मॉडल अक्सर इन टेस्ट में विफल रहे, यानी वे निर्देशों को अनदेखा कर देते थे। AlignVid के साथ, मॉडल निर्देशों का पालन बहुत बेहतर तरीके से करते हैं, सफलतापूर्वक वस्तुओं को जोड़ने, हटाने या बदलने में सक्षम होते हैं, और वह भी बिना AI को फिर से प्रशिक्षित किए या उसकी गति को धीमा किए।

सारांश

  • समस्या: AI वीडियो जनरेटर्स शुरुआती इमेज के प्रति बहुत जुनूनी होते हैं और उसमें बदलाव करने के निर्देशों को अनदेखा कर देते हैं।
  • अंतर्दृष्टि: इमेज को ब्लर करने से AI सुनने लगता है, लेकिन इससे तस्वीर खराब हो जाती है।
  • समाधान (AlignVid): एक "ट्रेनिंग-फ्री" विधि जो एक आंतरिक वॉल्यूम नॉब की तरह काम करती है। यह AI के दिमाग के अंदर इमेज के "चिल्लाने" को कम करती है और टेक्स्ट की "फुसफुसाहट" को बढ़ाती है, लेकिन केवल सही समय पर।
  • परिणाम: AI अब वीडियो में वस्तुओं को जोड़ने, हटाने या बदलने के निर्देशों का बहुत बेहतर पालन करता है, जबकि वीडियो को शार्प और हाई-क्वालिटी बनाए रखता है।

नोट: पेपर स्पष्ट रूप से बताता है कि यह विधि इमेज-टू-वीडियो जनरेशन और इमेज एडिटिंग के लिए है। यह दावा नहीं करता है कि इसका उपयोग मेडिकल डायग्नोसिस, क्लिनिकल अनुप्रयोगों, या क्रिएटिव जनरेशन के अलावा अन्य विशिष्ट वास्तविक दुनिया के डिप्लॉयमेंट के लिए किया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →