← नवीनतम पेपर
🤖 AI

Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models

यह शोध पत्र MMHNet को प्रस्तुत करता है, जो एक मल्टीमॉडल पदानुक्रमित नेटवर्क (multimodal hierarchical network) है जिसमें नॉन-कॉज़ल मांबा (non-causal Mamba) शामिल है, जो लघु इंस्टेंस पर प्रशिक्षित वीडियो-टू-ऑडियो मॉडलों को पाँच मिनट से अधिक अवधि का उच्च गुणवत्ता वाला ऑडियो सफलतापूर्वक उत्पन्न करने और सामान्यीकरण करने में सक्षम बनाता है, जो पूर्ववर्ती अत्याधुनिक विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Christian Simon, Masato Ishii, Wei-Yao Wang, Koichi Saito, Akio Hayakawa, Dongseok Shim, Zhi Zhong, Shuyang Cui, Shusuke Takahashi, Takashi Shibuya, Yuki Mitsufuji

प्रकाशित 2026-04-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Christian Simon, Masato Ishii, Wei-Yao Wang, Koichi Saito, Akio Hayakawa, Dongseok Shim, Zhi Zhong, Shuyang Cui, Shusuke Takahashi, Takashi Shibuya, Yuki Mitsufuji

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक फिल्म निर्देशक हैं। आपके पास एक मूक फिल्म (silent movie) का क्लिप है, और आपको इसमें एक बेहतरीन साउंडट्रैक जोड़ना है: भीड़ का शोर, कदमों की आहट, या ट्रैफिक की दूर से आती गूंज। यह Video-to-Audio (V2A) AI का काम है।

लंबे समय तक, ये AI मॉडल "शॉर्ट-टर्म मेमोरी आर्टिस्ट" की तरह रहे हैं। वे बिल्ली के कूदने के 10 सेकंड के क्लिप के लिए आवाज़ बनाने में माहिर थे। लेकिन अगर आप उनसे कार चेज़ (car chase) के 5 मिनट के दृश्य के लिए संगीत बनाने को कहें, तो वे भ्रमित हो जाते हैं, आवाज़ धुंधली और अस्पष्ट हो जाती है, या वे बस एक ही शोर को बार-बार दोहराने लगते हैं।

शोध पत्र "Echoes Over Time" एक नया AI पेश करता है जिसे MMHNet कहा जाता है जो इस समस्या को हल करता है। यह कैसे काम करता है, यहाँ सरल उपमाओं (analogies) के माध्यम से समझाया गया है।

1. समस्या: "पोज़िशनल" जाल (The "Positional" Trap)

आज के अधिकांश AI मॉडल "पोज़िशनल एम्बेडिंग्स" नामक एक कठोर प्रणाली का उपयोग करके चीजों के क्रम को याद करके सीखते हैं। इसे एक फिक्स्ड डिब्बों वाली ट्रेन की तरह समझें।

  • समस्या: यदि ट्रेन 8 डिब्बों (8 सेकंड के वीडियो) के लिए डिज़ाइन की गई है, और आप उसमें 60 डिब्बे (60 सेकंड का वीडियो) जोड़ने की कोशिश करते हैं, तो ट्रेन टूट जाती है। AI खो जाता है क्योंकि उसे यह नहीं पता होता कि उसके पहले से याद किए गए मानचित्र में "डिब्बा नंबर 50" कहाँ फिट बैठता है।
  • परिणाम: जब आप लंबा ऑडियो बनाने की कोशिश करते हैं, तो AI भ्रमित (hallucinate) होने लगता है, आवाज़ वीडियो के साथ तालमेल खो देती है, या वह बस एक ही आवाज़ को बार-बार दोहराने लगता है (जैसे कोई टूटा हुआ रिकॉर्ड)।

2. समाधान: "नॉन-कॉज़ल माम्बा" इंजन (The "Non-Causal Mamba" Engine)

लेखकों ने उस कठोर "ट्रेन" को बदलकर Mamba-2 नामक एक नया इंजन लगाया है, जो विशेष रूप से एक Non-Causal संस्करण है।

  • उपमा: एक ट्रेन कंडक्टर के बजाय एक ऑपरेशन थिएटर के सर्जन की कल्पना करें।
    • एक Causal मॉडल (एक मानक ट्रेन की तरह) केवल वही देख सकता है जो पहले हुआ है। वह भविष्य नहीं देख सकता।
    • एक Non-Causal मॉडल पूरे दृश्य को एक साथ देख सकता है। वह शुरुआत, मध्य और अंत को एक साथ देखता है।
  • यह क्यों मदद करता है: क्योंकि AI एक ही समय में पूरे वीडियो के संदर्भ (context) को देख सकता है, इसलिए उसे किसी विशिष्ट "पोजीशन नंबर" को याद रखने की आवश्यकता नहीं है। वह वीडियो की कहानी को समझता है। यदि 5 मिनट के क्लिप के अंत में एक कार दुर्घटना होती है, तो AI जानता है कि दुर्घटना की आवाज़ अंत में ही रखनी है, भले ही उसे केवल छोटे क्लिप्स पर प्रशिक्षित किया गया हो।

3. सीक्रेट सॉस: "स्मार्ट फ़िल्टर" (The "Smart Filter" - Hierarchical Routing)

लंबे वीडियो उबाऊ और दोहराव वाले क्षणों से भरे होते हैं। यदि आप 5 मिनट के वीडियो को फ्रेम-दर-फ्रेम प्रोसेस करने की कोशिश करते हैं, तो यह किसी एक विशिष्ट तथ्य को खोजने के लिए पूरी विश्वकोश (encyclopedia) को शब्द-दर-शब्द पढ़ने जैसा है। यह धीमा और अक्षम है।

MMHNet एक Hierarchical Network का उपयोग करता है जिसमें एक Smart Filter है।

  • उपमा: एक व्यस्त न्यूज़रूम एडिटर की कल्पना करें।
    • हर लेख के हर एक शब्द को पढ़ने के बजाय, एडिटर जल्दी से हेडलाइंस को स्कैन करता है।
    • यदि कोई पैराग्राफ सिर्फ "सूरज चमक रहा है" के बारे में है, तो एडिटर उसे अनदेखा कर देता है (क्योंकि वह अनावश्यक है)।
    • यदि कोई पैराग्राफ कहता है "इमारत में आग लग गई है," तो एडिटर उसे हाईलाइट करता है और तुरंत मुख्य लेखक को भेज देता है।
  • यह कैसे काम करता है: AI वीडियो और ऑडियो को स्कैन करता है। यह उन "उबाऊ" हिस्सों की पहचान करता है जहाँ कुछ भी नहीं बदलता और उन्हें कंप्रेस कर देता है। यह केवल "रोमांचक" हिस्सों को (जहाँ वास्तव में कोई ध्वनि होती है) भारी-भरकम गणना वाले हिस्से (brain) के पास भेजता है। यह भारी मात्रा में कंप्यूटिंग पावर बचाता है और आवाज़ को स्पष्ट रखता है।

4. जादू का कमाल: "छोटा प्रशिक्षण, लंबा परीक्षण" (The "Magic Trick: Train Short, Test Long")

इस शोध पत्र का सबसे प्रभावशाली हिस्सा यह है कि उन्हें लंबे वीडियो पर प्रशिक्षण (training) देने की आवश्यकता नहीं पड़ी

  • उपमा: एक संगीत के छात्र के बारे में सोचें जो स्केल (scales) का अभ्यास कर रहा है।
    • आमतौर पर, 1 घंटे का सिम्फनी सीखने के लिए, आप पूरा एक घंटा अभ्यास करते हैं।
    • यह नया AI एक ऐसे छात्र की तरह है जिसने केवल 10 सेकंड के स्केल का अभ्यास किया लेकिन संगीत के नियमों को इतनी अच्छी तरह सीख लिया कि वह बिना कभी सुने, तुरंत 5 घंटे का सिम्फनी बजा सकता है।
  • परिणाम: उन्होंने मॉडल को 8 सेकंड के क्लिप्स पर प्रशिक्षित किया। जब उन्होंने इसका परीक्षण 5 मिनट के वीडियो पर किया, तो यह पूरी तरह से काम कर गया। इसे Length Generalization कहा जाता है।

परिणामों का सारांश

अपने परीक्षणों में, इस नए मॉडल (MMHNet) ने सभी पिछले "चैंपियंस" (जैसे LoVA और HunyuanVideo-Foley) को पछाड़ दिया।

  • पुराने मॉडल: जब उन्होंने 5 मिनट का वीडियो बनाने की कोशिश की, तो ऑडियो या तो तालमेल खो देता था, रोबोटिक लगने लगता था, या वीडियो के साथ सिंक से बाहर हो जाता था।
  • MMHNet: इसने 5 मिनट का ऑडियो तैयार किया जो वीडियो के साथ पूरी तरह से सिंक में रहा, जिसमें उच्च गुणवत्ता वाली ध्वनि थी जो समय के साथ खराब नहीं हुई।

संक्षेप में: लेखकों ने एक नए प्रकार का AI मस्तिष्क बनाया जो कठोर मेमोरी पोजीशन पर निर्भर नहीं है। इसके बजाय, यह पूरी कहानी को समझने के लिए एक "ग्लोबल व्यू" का उपयोग करता है और उबाऊ हिस्सों को अनदेखा करने के लिए एक "स्मार्ट फ़िल्टर" का उपयोग करता है। यह उन्हें छोटे प्रशिक्षण सत्रों को लेकर किसी भी लंबाई की फिल्मों के लिए परफेक्ट साउंडट्रैक बनाने में सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →