← नवीनतम पेपर
⚡ electrical engineering

AudioX: A Unified Framework for Anything-to-Audio Generation

यह शोधपत्र AudioX को प्रस्तुत करता है, जो 'एनीथिंग-टू-ऑडियो' जनरेशन के लिए एक एकीकृत ढांचा है जो टेक्स्ट, वीडियो और ऑडियो जैसे विविध इनपुट्स को एकीकृत करने के लिए एक मल्टीमॉडल एडेप्टिव फ्यूजन मॉड्यूल का लाभ उठाता है, और विभिन्न मल्टीमॉडल जनरेशन कार्यों में बेहतर प्रदर्शन प्राप्त करने के लिए IF-caps नामक एक बड़े पैमाने के, उच्च-गुणवत्ता वाले डेटासेट पर प्रशिक्षित है।

मूल लेखक: Zeyue Tian, Zhaoyang Liu, Yizhu Jin, Ruibin Yuan, Liumeng Xue, Xu Tan, Qifeng Chen, Wei Xue, Yike Guo

प्रकाशित 2026-04-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zeyue Tian, Zhaoyang Liu, Yizhu Jin, Ruibin Yuan, Liumeng Xue, Xu Tan, Qifeng Chen, Wei Xue, Yike Guo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक फिल्म का साउंडट्रैक, एक वीडियो गेम का साउंड इफेक्ट, या बैकग्राउंड म्यूजिक बनाना चाहते हैं। अतीत में, आपको एक कंपोजर, एक साउंड इंजीनियर और एक फोली आर्टिस्ट (वह व्यक्ति जो कदमों की आहट या कांच टूटने जैसी आवाजें बनाता है) को काम पर रखना पड़ता। यह महंगा था, धीमा था, और इसके लिए बहुत विशिष्ट कौशल की आवश्यकता होती थी।

आधुनिक AI के साथ भी, उपकरण किसी विशेष स्विस आर्मी नाइफ की तरह थे: एक टूल टेक्स्ट-टू-साउंड के लिए, दूसरा वीडियो-टू-साउंड के लिए, और एक म्यूजिक के लिए। वे एक-दूसरे से बात नहीं कर सकते थे, और यदि आपने कुछ बहुत विशिष्ट मांगा, तो वे भ्रमित हो जाते थे।

पेश है, AudioX। AudioX को केवल एक टूल के रूप में नहीं, बल्कि एक "यूनिवर्सल साउंड शेफ" (Universal Sound Chef) के रूप में सोचें।

यहाँ यह पेपर इस 'शेफ' के निर्माण की व्याख्या करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. समस्या: "स्पेशलिस्ट" किचन

AudioX से पहले, AI ऑडियो मॉडल उन शेफ की तरह थे जो केवल एक चीज़ बनाना बखूबी जानते थे।

  • शेफ A केवल एक रेसिपी (टेक्स्ट) को सूप (साउंड) में बदल सकता था।
  • शेफ B केवल आग की वीडियो देख सकता था और जलती हुई लपटों की आवाज बना सकता था।
  • शेफ C केवल एक जैज़ गाना कंपोज़ कर सकता था।

यदि आप एक कुत्ते के भौंकने का वीडियो चाहते थे और चाहते थे कि कुत्ता ठीक तीन बार एक विशिष्ट क्रम में भौंके, तो इनमें से कोई भी शेफ यह नहीं कर पाता। वे बहुत सीमित थे।

2. समाधान: "यूनिवर्सल साउंड शेफ" (AudioX)

शोधकर्ताओं ने AudioX बनाया, जो एक एकल AI मॉडल है जो किसी भी ऑर्डर को ले सकता है और उसे किसी भी ध्वनि में बदल सकता है।

  • टेक्स्ट: "दो बार बिल्ली के म्याऊं करने के बाद, एक कुत्ता भौंकता है।"
  • वीडियो: एक कार के चलने का क्लिप, और AudioX इंजन की गड़गड़ाहट और टायर की रगड़ की आवाज जोड़ देता है।
  • ऑडियो: एक गाने का क्लिप जिसमें ड्रम बीट गायब है, और AudioX उस खाली जगह को पूरी तरह से भर देता है।
  • मिक्स: तूफान का एक वीडियो जिसमें टेक्स्ट प्रॉम्प्ट है, "बादलों की गड़गड़ाहट को तेज करें और बारिश की आवाज जोड़ें।"

AudioX एकमात्र ऐसा शेफ है जो इस एक ही किचन में इन सभी अनुरोधों को संभाल सकता है।

3. सीक्रेट सॉस: "स्मार्ट मिक्सर" (MAF मॉड्यूल)

AI कैसे जानता है कि बिना गड़बड़ी किए इन विभिन्न इनपुट्स को कैसे मिलाना है?
कल्पना कीजिए कि आप एक कंडक्टर हैं जो एक वायलिन वादक (वीडियो), एक गायक (टेक्स्ट), और एक ड्रमर (ऑडियो) को एक साथ बजाने की कोशिश कर रहे हैं। यदि वे सब एक साथ चिल्लाते हैं, तो वह शोर बन जाएगा।

शोधकर्ताओं ने Multimodal Adaptive Fusion (MAF) नामक एक विशेष घटक का आविष्कार किया। इसे एक स्मार्ट साउंड मिक्सर या ट्रैफिक पुलिस के रूप में सोचें।

  • यह वीडियो, टेक्स्ट और ऑडियो को देखता है।
  • यह कहता है, "ठीक है, वीडियो एक कार दिखा रहा है, इसलिए इंजन का शोर महत्वपूर्ण है। टेक्स्ट कहता है 'शांत', तो वॉल्यूम कम कर दें। ऑडियो इनपुट एक धुन है, इसलिए इसे स्पष्ट रखें।"
  • यह "शोर" को फ़िल्टर करता है और निर्देशों को पूरी तरह से मिलाता है ताकि अंतिम ध्वनि स्पष्ट हो और आपके सटीक आदेशों का पालन करे।

4. ट्रेनिंग डेटा: "विशाल लाइब्रेरी" (IF-caps)

इस यूनिवर्सल शेफ को सिखाने के लिए, आप केवल कुछ रेसिपी का उपयोग नहीं कर सकते। आपको उदाहरणों की एक विशाल लाइब्रेरी की आवश्यकता है।
शोधकर्ताओं ने महसूस किया कि मौजूदा डेटा बिखरा हुआ था—कुछ किताबों में केवल टेक्स्ट रेसिपी थीं, दूसरों में केवल वीडियो क्लिप।

  • समाधान: उन्होंने IF-caps (इंस्ट्रक्शन-फॉलोइंग कैप्शंस) नामक एक नई, विशाल लाइब्रेरी बनाई।
  • प्रक्रिया: उन्होंने एक सुपर-स्मार्ट AI (एक जीनियस लाइब्रेरियन की तरह) का उपयोग किया जिसने 7 मिलियन वीडियो-ऑडियो क्लिप्स को पढ़ा। इसने केवल "कार की आवाज" नहीं कहा। इसने विस्तृत नोट्स लिखे: "एक कार बाईं से दाईं ओर जाती है, इंजन दो बार रेस लेता है, फिर धीमा हो जाता है।"
  • इसके बाद उन्होंने दूसरे AI का उपयोग करके इन नोट्स को हजारों अलग-अलग तरीकों से फिर से लिखा ताकि मॉडल सीख सके कि "दो बार इंजन रेस लेना" और "दो इंजन की गड़गड़ाहट" का अर्थ एक ही है।

इस विशाल, विस्तृत लाइब्रेरी ने मॉडल को न केवल यह सिखाया कि क्या ध्वनियाँ बनानी हैं, बल्कि यह भी कि कितनी, कब, और किस क्रम में बनानी हैं।

5. परिणाम: एक प्रो की तरह निर्देशों का पालन करना

पेपर ने अन्य सभी "स्पेशलिस्ट" शेफों के मुकाबले AudioX का परीक्षण किया।

  • परीक्षण: उन्होंने इसे कठिन निर्देश दिए जैसे, "एक ड्रम बीट बजाएं, फिर एक गिटार, फिर 2 सेकंड के लिए शांति, फिर एक ट्रम्पेट।"
  • परिणाम: जबकि अन्य मॉडल भ्रमित हो गए या समय (timing) को अनदेखा कर दिया, AudioX ने निर्देशों का पूरी तरह से पालन किया। यह ध्वनियों को गिन सकता था, क्रम को सही रख सकता था और टाइमिंग को बिल्कुल सटीक बना सकता था।

यह क्यों महत्वपूर्ण है

यह एक बड़ी छलांग है क्योंकि यह हमें "AI जो आपके बारे में अनुमान लगाता है" से "AI जो आपके सटीक निर्देशों को सुनता है" की ओर ले जाता है।

  • फिल्म निर्माताओं के लिए: आप स्क्रीन पर होने वाली क्रिया के साथ पूरी तरह से मेल खाने वाले साउंड इफेक्ट्स बना सकते हैं, बिना किसी साउंड टीम को काम पर रखे।
  • गेमर्स के लिए: आप खिलाड़ी की गतिविधियों पर वास्तविक समय में प्रतिक्रिया देने वाले डायनेमिक साउंडस्केप बना सकते हैं।
  • क्रिएटर्स के लिए: आप अंततः कह सकते हैं, "एक ऐसा गाना बनाओ जो धीरे शुरू हो, तेज हो जाए और एक क्रैश के साथ समाप्त हो," और आपको बिल्कुल वही मिलेगा।

संक्षेप में, AudioX उस दुनिया की ओर पहला कदम है जहाँ आप कंप्यूटर से बात कर सकते हैं, अपनी कल्पना की किसी भी ध्वनि का वर्णन कर सकते हैं, और उसे तुरंत, पूरी तरह से और ठीक वैसे ही बना सकते हैं जैसा आपने मांगा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →