← नवीनतम पेपर
⚡ electrical engineering

Unified Audio Intelligence Without Regressing on Text Intelligence

यह शोधपत्र Audex को प्रस्तुत करता है, जो एक सुदृढ़ टेक्स्ट-ओनली MoE बैकबोन पर निर्मित एक एकीकृत 30B ऑडियो-टेक्स्ट LLM है, जो मूल मॉडल की उन्नत तर्क क्षमता और एजेंटिक क्षमताओं में बिना किसी महत्वपूर्ण गिरावट के, विविध ऑडियो और स्पीच कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim, Boxin Wang, Zihan Liu, Sungwon Kim, Yang Chen, Arushi Goel, Rajarshi Roy, Wenliang Dai, Zhuolin Yang, Yangyi Chen, Dongfu Jiang, Sreyan Ghosh, Tuomas Rintamak
प्रकाशित 2026-07-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim, Boxin Wang, Zihan Liu, Sungwon Kim, Yang Chen, Arushi Goel, Rajarshi Roy, Wenliang Dai, Zhuolin Yang, Yangyi Chen, Dongfu Jiang, Sreyan Ghosh, Tuomas Rintamaki, Andrew Tao, Jonathan Raiman, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: एक "स्विस आर्मी नाइफ" जैसा दिमाग जो सोचना नहीं भूलता

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली प्रोफेसर है जो निबंध लिखने, जटिल गणित की समस्याओं को हल करने और सॉफ्टवेयर कोडिंग में माहिर है। यह प्रोफेसर आपका केवल टेक्स्ट (text-only) वाला AI है। अब, कल्पना कीजिए कि आप इस प्रोफेसर को संगीत समझना, पक्षियों की चहचहाहट पहचानना और आपसे मानवीय आवाज़ में बात करना भी सिखाना चाहते हैं।

आमतौर पर, जब आप किसी जीनियस को कोई नया, कठिन कौशल (जैसे कि जगलिंग करना) सिखाते हैं, तो हो सकता है कि वे अपने मूल काम (जैसे लिखना) में थोड़े अनाड़ी हो जाएं। वे व्याकरण की गलतियाँ करने लग सकते हैं या तथ्य भूल सकते हैं क्योंकि उनका दिमाग नए हुनर को सीखने में बहुत व्यस्त है।

यह पेपर "Audex" पेश करता है, जो एक नया AI मॉडल है जो अपनी सोचने की क्षमता खोए बिना ऑडियो और स्पीच (भाषण) को संभालना सीखता है।

शोधकर्ताओं ने Audex को Nemotron-Cascade-2 नामक एक बहुत ही स्मार्ट टेक्स्ट-ओनली दिमाग पर बनाया है। उनका लक्ष्य सरल था: एक ऐसा AI बनाना जो सुन सके, बोल सके और ध्वनि को समझ सके, लेकिन अपनी तर्क करने, गणित हल करने या निर्देशों का पालन करने की क्षमता कभी न खोए।

यह कैसे काम करता है: "यूनिवर्सल ट्रांसलेटर" का तरीका

ध्वनि को संभालने वाले अधिकांश AI मॉडल दो अलग-अलग लोगों की तरह होते जो हाथ पकड़े हुए हैं: एक व्यक्ति सुनता है, और दूसरा बोलता है। यदि वे एक-दूसरे से ठीक से बात नहीं करते हैं, तो परिणाम गड़बड़ होता है।

Audex अलग है। यह एक एकल, एकीकृत मस्तिष्क (single, unified brain) है। यह सब कुछ एक साथ कैसे प्रबंधित करता है, यहाँ बताया गया है:

  1. कान (ऑडियो एनकोडर): जब Audex कोई आवाज़ सुनता है (जैसे कुत्ते का भौंकना या किसी का बोलना), तो यह तुरंत कच्ची ध्वनि तरंगों (raw sound waves) को समझने की कोशिश नहीं करता है। इसके बजाय, यह एक विशेष "अनुवादक" (ऑडियो एनकोडर) का उपयोग करता है ताकि ध्वनि को संख्याओं की एक ऐसी सूची में बदला जा सके जो बिल्कुल वैसी ही दिखे जैसे AI पहले से ही शब्दों को जानता है।
  2. दिमाग (LLM): ये संख्याएँ मुख्य दिमाग में भेजी जाती हैं। क्योंकि दिमाग इन्हें "टोकन्स" (शब्दों की तरह) के रूप में देखता है, इसलिए यह एक ध्वनि क्लिप के साथ बिल्कुल वैसा ही व्यवहार करता है जैसा कि यह टेक्स्ट के एक वाक्य के साथ करता है।
  3. मुँह (ऑडियो कोडेक): जब Audex बोलना या कोई आवाज़ निकालना चाहता है, तो वह केवल शब्दों के बारे में "सोचता" नहीं है; बल्कि वह वाक्य में अगले शब्द की भविष्यवाणी करने की तरह, क्रम में अगले "साउंड टोकन" की भविष्यवाणी करता है।

उपमा (Analogy): कल्पना कीजिए कि एक शेफ है जो आमतौर पर केवल टेक्स्ट रेसिपी के साथ खाना पकाता है। Audex उस शेफ को ध्वनि के अवयवों (ingredients) के साथ खाना पकाने के लिए सिखाने जैसा है। ध्वनि के लिए अलग रसोईघर की आवश्यकता होने के बजाय, Audex बस ध्वनि के अवयवों को उसी भाषा में अनुवादित कर देता है जिसे शेफ पहले से ही बोलता है। अब शेफ "टेक्स्ट केक" बनाना भूले बिना "साउंड सूप" पका सकता है।

गुप्त नुस्खा: दिमाग को खराब किए बिना प्रशिक्षण

शोधकर्ताओंों को एक बड़ी चुनौती का सामना करना पड़ा: यदि आप एक स्मार्ट टेक्स्ट AI को ऑडियो पर बहुत अधिक प्रशिक्षित करते हैं, तो यह स्मार्ट होना भूल सकता है। इसे रोकने के लिए, उन्होंने एक सावधानीपूर्वक, चरण-दर-चरण प्रशिक्षण विधि का उपयोग किया:

  • वार्म-अप (Warm-up): सबसे पहले, उन्होंने AI को यह सिखाया कि वह अपने मूल ज्ञान को बदले बिना "ध्वनि के अवयवों" (ऑडियो टोकन्स) को कैसे संभाले।
  • स्तरित सीखना (Layered Learning): उन्होंने सब कुछ एक साथ AI पर नहीं थोपा। उन्होंने पहले AI को ध्वनि उत्पन्न करना सिखाया, फिर उसे ध्वनि समझना सिखाया, और अंत में इन सबको मिला दिया। यह साइकिल चलाने के प्रशिक्षण पहियों (training wheels) के साथ साइकिल चलाना सीखने जैसा है, इससे पहले कि आप यूनिसाइकिल चलाने की कोशिश करें।
  • "नो-रिग्रेशन" (No-Regression) का वादा: सारा प्रशिक्षण पूरा होने के बाद, उन्होंने AI के पुराने कौशलों (गणित, तर्क, कोडिंग) का परीक्षण किया। परिणाम चौंकाने वाले थे: Audex इन कार्यों में मूल टेक्स्ट-ओनली संस्करण जितना ही अच्छा था। इसने अपनी ध्वनि समझने की क्षमता हासिल करते हुए अपनी "प्रतिभा" को नहीं खोया।

Audex वास्तव में क्या कर सकता है?

पेपर के अनुसार, Audex ऑडियो के लिए एक "स्विस आर्मी नाइफ" है। यह कर सकता है:

  • सुनना और समझना: यह जो सुन रहा है उसके बारे में सवालों के जवाब दे सकता है (जैसे, "क्या यह कुत्ता है या भेड़िया?" या "इस संगीत का मूड क्या है?")।
  • ट्रांसक्राइब और अनुवाद करना: यह बोले गए शब्दों को टेक्स्ट में बदल सकता है और शोर वाले कमरों में भी अन्य भाषाओं में अनुवाद कर सकता है।
  • बोलना और गाना: यह एक टेक्स्ट प्रॉम्प्ट ले सकता है और मानवीय भाषण या यहाँ तक कि संगीत और ध्वनि प्रभाव (जैसे "बारिश गिरना" या "पक्षियों का चहचहाना") उत्पन्न कर सकता है।
  • बात से बात करना: यह वॉयस इनपुट ले सकता है और एक अलग वॉयस आउटपुट (स्पीच-टू-स्पीच) उत्पन्न कर सकता है।

परिणाम: दोनों दुनियाओं का सर्वश्रेष्ठ

यह पेपर Audex की तुलना अन्य शीर्ष-स्तरीय AI मॉडलों से करता है।

  • टेक्स्ट पर: यह सबसे स्मार्ट टेक्स्ट-ओनली मॉडलों के समान प्रदर्शन करता है, जटिल गणित और तर्क पहेलियों को बिना किसी गिरावट के हल करता है।
  • ऑडियो पर: यह भाषण पहचानने और सामान्य ध्वनियों को समझने में कई अन्य मॉडलों को पछाड़ देता है।
  • "थिंकिंग" मोड: कुछ मॉडलों के विपरीत जो एक साथ सोचने और बोलने की कोशिश करते समय "मूर्ख" हो जाते हैं, Audex एक ध्वनि समस्या के बारे में "सोच" (तर्क) सकता है और फिर एक ही बार में ऑडियो में उत्तर उत्पन्न कर सकता है।

संक्षेप में

यह पेपर Audex को प्रस्तुत करता है, जो एक ऐसा मॉडल है जो साबित करता है कि आपको "स्मार्ट विचारक" और "अच्छा श्रोता/वक्ता" होने के बीच किसी एक को चुनने की आवश्यकता नहीं है। ध्वनि को एक अन्य प्रकार की भाषा के रूप में मानकर, शोधकर्ताओं ने एक एकल AI बनाया जो समान बुद्धिमत्ता के साथ सुन सकता है, बोल सकता है और तर्क कर सकता है, जिससे उसकी मूल बुद्धिमत्ता बरकरार रहती है और ध्वनि की दुनिया में महारत हासिल होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →