← नवीनतम पेपर
💻 computer science

EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation

मौजूदा वीडियो-टेक्स्ट-टू-ऑडियो मॉडलों की प्रमुख सीमाओं को दूर करने के लिए, यह शोध पत्र इकोफ़ोली (EchoFoley) पेश करता है, जो पदानुक्रमित नियंत्रण (hierarchical control) के साथ एक नया इवेंट-केंद्रित कार्य है, जिसे इकोफ़ोली-6k (EchoFoley-6k) बेंचमार्क और इकोविडिया (EchoVidia) फ्रेमवर्क द्वारा समर्थित किया गया है, जो वीडियो-आधारित ध्वनि निर्माण में नियंत्रणीयता और संवेदी गुणवत्ता दोनों में महत्वपूर्ण सुधार करता है।

मूल लेखक: Bingxuan Li, Yiming Cui, Yicheng He, Yiwei Wang, Shu Zhang, Longyin Wen, Yulei Niu

प्रकाशित 2026-06-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bingxuan Li, Yiming Cui, Yicheng He, Yiwei Wang, Shu Zhang, Longyin Wen, Yulei Niu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके सामने एक स्क्रीन पर एक मूक फिल्म (silent movie) चल रही है। आप एक बिल्ली को चलते हुए, एक दरवाजा जोर से बंद होते हुए और एक कार को पास से गुजरते हुए देख सकते हैं। अब, कल्पना कीजिए कि आप इसमें साउंड इफेक्ट्स जोड़ना चाहते हैं, लेकिन कोई भी साधारण साउंड नहीं। आप चाहते हैं कि बिल्ली पहले धीरे से 'म्याऊं' करे, फिर अचानक एक शेर की तरह दहाड़े जब एक जादूगर मंत्र जपे, और आप चाहते हैं कि वह विशिष्ट दहाड़ ठीक 7वें सेकंड पर हो, जबकि यह भी सुनिश्चित करें कि 7वें सेकंड से पहले की सभी आवाजें उसके बाद की आवाजों से तेज हों।

वर्तमान AI टूल्स एक अनाड़ी साउंड इंजीनियर की तरह हैं जो "बिल्ली" शब्द सुनते ही पूरे वीडियो पर एक जेनेरिक "म्याऊं" की साउंड फाइल डाल देते हैं। वे आपके विशिष्ट, विस्तृत निर्देशों को समझने में संघर्ष करते हैं।

EchoFoley एक नया प्रोजेक्ट है जिसे इसे ठीक करने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:

1. समस्या: "विजुअल डोमिनेंस" (दृश्य प्रधानता) का जाल

अभी, यदि आप AI को कहते हैं, "दूसरी म्याऊं को शेर की दहाड़ जैसा बना दो," तो AI अक्सर भ्रमित हो जाता है। वह बिल्ली को देखता है (दृश्य) और सोचता है, "ठीक है, मैं एक बिल्ली की आवाज बना दूँगा।" वह आपके विशिष्ट टेक्स्ट निर्देशों को अनदेखा कर देता है क्योंकि वह आपके द्वारा कहे गए बजाय आपके द्वारा दिखाए गए दृश्यों पर बहुत अधिक निर्भर रहता है। यह एक ऐसे शेफ की तरह है जो केवल वही पकवान बनाता है जो वह प्लेट पर देखता है, आपकी इस रिक्वेस्ट को नजरअंदाज करते हुए कि "इसमें थोड़ा नमक और डाल दें।"

2. समाधान: एक "साउंड स्क्रिप्ट" (प्रतीकात्मक प्रतिनिधित्व)

शोधकर्ताओं ने AI से बात करने का एक नया तरीका बनाया है। केवल एक अस्पष्ट कमांड देने के बजाय, उन्होंने AI को एक "साउंड स्क्रिप्ट" लिखना सिखाया है।

इस स्क्रिप्ट को एक संगीत निर्देशक के स्कोर (musical score) की तरह समझें। यह केवल यह नहीं कहता कि "संगीत बजाएं"; यह ध्वनि को छोटे, विशिष्ट नोट्स में तोड़ देता है:

  • कब: ध्वनि ठीक किस सेकंड पर होती है?
  • क्या: क्या यह बिल्ली की म्याऊं है या शेर की दहाड़?
  • कैसे: क्या यह तेज है? क्या यह उच्च स्वर (high-pitched) वाली है? क्या यह बाईं ओर से आ रही है या दाईं ओर से?

AI को पहले यह स्क्रिप्ट लिखने के लिए मजबूर करके, यह जटिल अनुरोधों को संभाल सकता है जैसे, "दूसरी म्याऊं को शेर की दहाड़ में बदलें, लेकिन पहली वाली को सामान्य रहने दें।"

3. नया खेल का मैदान: EchoFoley-6k

AI को यह नया कौशल सिखाने के लिए, टीम ने एक विशाल प्रशिक्षण लाइब्रेरी बनाई जिसे EchoFadia-6k कहा जाता है।

  • कल्पना कीजिए कि एक लाइब्रेरी है जिसमें 6,000 मूक वीडियो हैं।
  • प्रत्येक वीडियो के लिए, उन्होंने केवल एक वाक्य नहीं लिखा; उन्होंने 6,000 विस्तृत निर्देश और 42,000 सूक्ष्म ध्वनि नोट्स लिखे।
  • उन्होंने विशेषज्ञों को यह लेबल करने के लिए काम पर रखा कि ध्वनि कब शुरू और समाप्त होती है, और इसके गुण क्या हैं। यह वह "पाठ्यपुस्तक" है जिससे AI सीखता है।

4. नया मस्तिष्क: EchoVidia (द "स्लो-फास्ट" थिंकर)

टीम ने एक नया AI सिस्टम बनाया है जिसे EchoVidia कहा जाता है। यह "स्लो-फास्ट थिंकिंग" (धीमी-तेज सोच) का उपयोग करता है, जो इस बात से प्रेरित है कि इंसान कैसे सोचते हैं:

  • तेज सोच (सिस्टम 1): AI वीडियो को जल्दी से देखता है (1 फ्रेम प्रति सेकंड) ताकि सामान्य माहौल समझ सके। "ओह, यह एक बिल्ली का वीडियो है।"
  • धीमी सोच (सिस्टम 2): इसके बाद AI वीडियो को बहुत धीमा कर देता है (स्लो मोशन में देखते हुए) ताकि बारीकी से देख सके। "रुको, मैं 00:04 पर बिल्ली का मुंह खुलते हुए देख रहा हूँ। उसी समय म्याऊं होती है। और 00:07 पर, जादूगर का हाथ हिलना दिखता है।"

एक त्वरित अवलोकन और एक विस्तृत निरीक्षण को मिलाकर, AI सटीक रूप से पहचान सकता है कि ध्वनि कब लगानी है और वह ध्वनि क्या होनी चाहिए, बजाय इसके कि वह केवल दृश्य के आधार पर अनुमान लगाए।

5. परिणाम: एक कुशल साउंड इंजीनियर

जब टीम ने अन्य शीर्ष AI मॉडलों के मुकाबले EchoVidia का परीक्षण किया:

  • नियंत्रण: यह विशिष्ट निर्देशों का पालन करने में 40% बेहतर था। यदि आपने किसी विशिष्ट समय पर ध्वनि मांगी, तो इसने वास्तव में वैसा ही किया।
  • गुणवत्ता: मानव श्रोताओं के लिए यह 12% अधिक स्वाभाविक और वास्तविक लगा।
  • संतुलन: अन्य मॉडलों के विपरीत जो वीडियो पर ध्यान केंद्रित करने के लिए आपके टेक्स्ट निर्देशों को अनदेखा कर देते थे, EchoVidia ने वीडियो और आपके विशिष्ट आदेशों दोनों को सफलतापूर्वक सुना।

सारांश में

यह पेपर एक नया तरीका पेश करता है जिससे AI वीडियो के लिए ध्वनि उत्पन्न कर सकता है। केवल चित्र के आधार पर AI को अनुमान लगाने देने के बजाय, उन्होंने इसे एक विस्तृत स्क्रिप्ट और एक स्लो-मोशन थिंकिंग प्रोसेस दिया है ताकि यह सुनिश्चित हो सके कि हर ध्वनि सही समय पर, सही टोन के साथ, ठीक वैसे ही हो जैसा उपयोगकर्ता ने मांगा है। यह एक अनाड़ी, अनुमान लगाने वाली प्रक्रिया को कहानी कहने के एक सटीक, रचनात्मक उपकरण में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →