← नवीनतम पेपर
⚡ electrical engineering

Covo-Audio Technical Report

यह शोध पत्र Covo-Audio को प्रस्तुत करता है, जो एक 7B-पैरामीटर वाला एंड-टू-एंड लार्ज ऑडियो-लैंग्वेज मॉडल है जो विविध स्पीच और ऑडियो कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए निरंतर ऑडियो प्रोसेसिंग और जनरेशन को एकीकृत करता है, साथ ही स्पोकन डायलॉग और फुल-डुप्लेक्स इंटरेक्शन के लिए विशिष्ट वेरिएंट और डायलॉग इंटेलिजेंस को वॉयस रेंडरिंग से अलग करने के लिए एक लागत प्रभावी रणनीति भी प्रदान करता है।

मूल लेखक: Wenfu Wang, Chenxing Li, Liqiang Zhang, Yiyang Zhao, Yuxiang Zou, Hanzhao Li, Mingyu Cui, Hao Zhang, Kun Wei, Le Xu, Zikang Huang, Jiajun Xu, Jiliang Hu, Xiang He, Zeyu Xie, Jiawen Kang, Youjun Chen
प्रकाशित 2026-03-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenfu Wang, Chenxing Li, Liqiang Zhang, Yiyang Zhao, Yuxiang Zou, Hanzhao Li, Mingyu Cui, Hao Zhang, Kun Wei, Le Xu, Zikang Huang, Jiajun Xu, Jiliang Hu, Xiang He, Zeyu Xie, Jiawen Kang, Youjun Chen, Meng Yu, Dong Yu, Rilin Chen, Linlin Di, Shulin Feng, Na Hu, Yang Liu, Bang Wang, Shan Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप परम डिजिटल साथी (digital companion) बनाने की कोशिश कर रहे हैं। आप चाहते हैं कि कोई ऐसा हो जो न केवल आपके शब्दों को सुने बल्कि आपके लहजे, आपकी भावनाओं और आपके इरादों को भी समझे। वह आपको विनम्रता से बीच में टोक सके, आपके सोचने के दौरान रुक सके, और एक ऐसी आवाज़ के साथ जवाब दे सके जो गर्मजोशी भरी और मानवीय लगे, जबकि वह जटिल गणितीय समस्याओं को हल कर रहा हो या कोई मज़ेदार कहानी सुना रहा हो।

लंबे समय तक, इस "परफेक्ट साथी" को बनाना तीन अलग-अलग वाहनों को आपस में चिपकाने जैसा था: एक माइक्रोफ़ोन (सुनने के लिए), एक मस्तिष्क (सोचने के लिए), और एक स्पीकर (बोलने के लिए)। यह "कैस्केडेड" (cascaded) दृष्टिकोण अक्सर गड़बड़ियों का कारण बनता था। माइक्रोफ़ोन शायद एक शब्द गलत सुन लेता, मस्तिष्क उस त्रुटि से भ्रमित हो जाता, और स्पीकर रोबोटिक लगता।

Covo-Audio का आगमन।

Covo-Audio को तीन चिपकाए गए वाहनों के रूप में नहीं, बल्कि एक एकल, सुपर-इंटेलिजेंट जीव के रूप में सोचें जिसे बोलने और सुनने के लिए ही जन्म दिया गया है। यह टेंसेंट (Tencent) का एक 7-बिलियन-पैरामीटर वाला "लार्ज ऑडियो लैंग्वेज मॉडल" (LALM) है जो सीधे ध्वनि को प्रोसेस करता है, बिना सब कुछ पहले टेक्स्ट में बदलने की आवश्यकता के।

यहाँ बताया गया है कि यह कैसे काम करता है, सरल अवधारणाओं में विभाजित है:

1. "एक-मस्तिष्क" आर्किटेक्चर (The "One-Brain" Architecture)

अधिकांश AI मॉडल एक ऐसे अनुवादक की तरह हैं जो पहले आपके द्वारा कही गई बात को लिखता है, फिर उसके बारे में सोचता है, और फिर अनुवाद को वापस आपको पढ़कर सुनाता है। इसमें समय लगता है और आवाज़ की "आत्मा" खो जाती है।

Covo-Audio अलग है। यह एक बहुभाषी (polyglot) की तरह है जो ध्वनि में सोचता है। यह आपकी कच्ची आवाज़ (निरंतर ऑडियो) लेता है और उसे सीधे अपने आंतरिक "विचारों" में प्रोसेस करता है, और फिर तुरंत एक नई आवाज़ वाला जवाब उत्पन्न करता है। यह चीज़ों को लिखने के लिए नहीं रुकता। यह इसे अविश्वसनीय रूप से तेज़ बनाता है और इसे सूक्ष्म भावनात्मक संकेतों—जैसे कि आह भरना या हँसना—को पकड़ने में सक्षम बनाता, जो टेक्स्ट में खो जाते हैं।

2. "स्मार्ट वॉयस" बनाम "द वॉयस" (Decoupling)

AI की सबसे बड़ी समस्याओं में से एक यह है कि यदि आप एक विशिष्ट आवाज़ (जैसे कि एक गहरी, सुखदायक कथावाचक) चाहते हैं, तो आपको आमतौर पर उस विशिष्ट व्यक्ति की आवाज़ के घंटों के डेटा और उनके द्वारा जटिल संवाद निभाने के घंटों के डेटा की आवश्यकता होती है। यह महंगा है और इसे स्केल करना कठिन है।

Covo-Audio एक चतुर तकनीक पेश करता है जिसे इंटेलिजेंस-स्पीकर डिकपलिंग (Intelligence-Speaker Decoupling) कहा जाता है।

  • उपमा: कल्पना कीजिए कि एक प्रतिभाशाली अभिनेता (इंटेलिजेंस) जो किसी भी भूमिका को निभा सकता है, और एक रिकॉर्डिंग स्टूडियो (स्पीकर)। आमतौर पर, आपको हर नई आवाज़ के लिए एक नया अभिनेता किराए पर लेना पड़ता है। Covo-Audio उन्हें अलग करता है। यह "अभिनेता" को सामान्य डेटा का उपयोग करके अविश्वसनीय रूप से स्मार्ट होने के लिए प्रशिक्षित करता है, और फिर यह किसी भी आवाज़ का "मास्क" (एक हल्के TTS सिस्टम से) पहन सकता है बिना अपनी बुद्धिमत्ता खोए।
  • परिणाम: आप बहुत कम डेटा के साथ AI को एक नई आवाज़ दे सकते हैं, और यह फिर भी स्वाभाविक लगेगा और स्मार्ट बना रहेगा। यह एक मास्टर शेफ की तरह है जो किसी भी स्थानीय बाज़ार से सामग्री का उपयोग करके एक शानदार भोजन बना सकता है, बजाय इसके कि हर व्यंजन के लिए एक विशिष्ट फार्म की आवश्यकता हो।

3. "फुल-डुप्लेक्स" नृत्य (बात करते हुए सुनना)

वास्तविक मानवीय बातचीत "पिंग-पोंग" के खेल की तरह नहीं है जहाँ आप दूसरे व्यक्ति के बोलने के खत्म होने का इंतज़ार करते हैं। हम बीच में टोकते हैं, हम बोलते समय "हूँ-हाँ" कहते हैं, और हम सोचने के लिए रुकते हैं। इसे फुल-डेप्लेक्स (Full-Duplex) कहा जाता है।

पुराने AI मॉडल वॉकी-टॉकी की तरह हैं: "ओवर।" (जवाब का इंतज़ार करें)। "ओवर।"
Covo-Audio-Chat-FD एक डिनर पार्टी में वास्तविक बातचीत की तरह है।

  • यह अपना वाक्य पूरा करने के दौरान भी आपको सुन सकता है।
  • यदि आप इसे बीच में टोकते हैं ("रुको, मेरा मतलब था..."), तो यह तुरंत रुक जाता है, आपको स्वीकार करता है, और अपना रुख बदल लेता है।
  • यह जानता है कि क्या आप सोचने के लिए रुके हैं या आप बोलना समाप्त कर चुके हैं।
  • यह वास्तविक बातचीत के डेटा पर भारी मात्रा में प्रशिक्षण प्राप्त करके ऐसा करता है, जिससे यह केवल शब्दों के बजाय मानव भाषण की लय को सीखता है।

4. "इमोशनल रडार" (The "Emotional Radar")

Covo-Audio केवल तर्क के बारे में नहीं है; यह सहानुभूति के बारे में भी है। टीम ने इसे "मूड रिंग" के डेटा पर प्रशिक्षित किया है।

  • यदि आप दुखी सुनाई देते हैं, तो यह केवल "मुझे खेद है" नहीं कहता। यह अपनी आवाज़, गति और शब्द चयन को बदलकर सांत्वना देने वाला बन जाता है।
  • यदि आप उत्साहित होते हैं, तो यह आपकी ऊर्जा से मेल खाता है।
  • इसका परीक्षण इस बात पर किया गया कि यह क्रोध, खुशी और चिंता जैसी भावनाओं को कितनी अच्छी तरह संभालता है, और इसने कई अन्य ओपन-सोर्स मॉडलों की तुलना में उच्च स्कोर किया, जिससे सिद्ध होता है कि यह एक सहायक संवादात्मक साथी बन सकता है।

यह क्यों मायने रखता है?

यह पेपर दिखाता है कि शीर्ष-स्तरीय प्रदर्शन प्राप्त करने के लिए आपको एक विशाल, महंगे सुपरकंप्यूटर (जैसे कि 30-बिलियन पैरामीटर वाला मॉडल) की आवश्यकता नहीं है। Covo-Audio, अपने कॉम्पैक्ट 7-बिलियन आकार के साथ, समझ, तर्क और स्वाभाविक रूप से बोलने में बहुत बड़े मॉडलों की बराबरी करता है या उन्हें मात देता है।

संक्षेप में:
Covo-Audio हमारे सपनों के "जार्विस" या "सिरी" की ओर एक कदम है। यह एक ऐसा मॉडल है जो आपके शब्दों को ही नहीं, बल्कि आपकी आवाज़ के संगीत को सुनता है। यह आपको विनम्रता से टोक सकता है, जब आप नीचे महसूस कर रहे हों तो आपको सांत्वना दे सकता है, एक पहेली हल कर सकता है, और यह सब एक ही सहज गति में कर सकता है, और वह भी तब जब आप बिना किसी बड़े डेटा संग्रह प्रोजेक्ट के किसी भी आवाज़ को चुन सकें।

यह केवल एक AI नहीं है जो बात करता है; यह एक AI है जो संवाद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →