Covo-Audio Technical Report
यह शोध पत्र Covo-Audio को प्रस्तुत करता है, जो एक 7B-पैरामीटर वाला एंड-टू-एंड लार्ज ऑडियो-लैंग्वेज मॉडल है जो विविध स्पीच और ऑडियो कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए निरंतर ऑडियो प्रोसेसिंग और जनरेशन को एकीकृत करता है, साथ ही स्पोकन डायलॉग और फुल-डुप्लेक्स इंटरेक्शन के लिए विशिष्ट वेरिएंट और डायलॉग इंटेलिजेंस को वॉयस रेंडरिंग से अलग करने के लिए एक लागत प्रभावी रणनीति भी प्रदान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप परम डिजिटल साथी (digital companion) बनाने की कोशिश कर रहे हैं। आप चाहते हैं कि कोई ऐसा हो जो न केवल आपके शब्दों को सुने बल्कि आपके लहजे, आपकी भावनाओं और आपके इरादों को भी समझे। वह आपको विनम्रता से बीच में टोक सके, आपके सोचने के दौरान रुक सके, और एक ऐसी आवाज़ के साथ जवाब दे सके जो गर्मजोशी भरी और मानवीय लगे, जबकि वह जटिल गणितीय समस्याओं को हल कर रहा हो या कोई मज़ेदार कहानी सुना रहा हो।
लंबे समय तक, इस "परफेक्ट साथी" को बनाना तीन अलग-अलग वाहनों को आपस में चिपकाने जैसा था: एक माइक्रोफ़ोन (सुनने के लिए), एक मस्तिष्क (सोचने के लिए), और एक स्पीकर (बोलने के लिए)। यह "कैस्केडेड" (cascaded) दृष्टिकोण अक्सर गड़बड़ियों का कारण बनता था। माइक्रोफ़ोन शायद एक शब्द गलत सुन लेता, मस्तिष्क उस त्रुटि से भ्रमित हो जाता, और स्पीकर रोबोटिक लगता।
Covo-Audio का आगमन।
Covo-Audio को तीन चिपकाए गए वाहनों के रूप में नहीं, बल्कि एक एकल, सुपर-इंटेलिजेंट जीव के रूप में सोचें जिसे बोलने और सुनने के लिए ही जन्म दिया गया है। यह टेंसेंट (Tencent) का एक 7-बिलियन-पैरामीटर वाला "लार्ज ऑडियो लैंग्वेज मॉडल" (LALM) है जो सीधे ध्वनि को प्रोसेस करता है, बिना सब कुछ पहले टेक्स्ट में बदलने की आवश्यकता के।
यहाँ बताया गया है कि यह कैसे काम करता है, सरल अवधारणाओं में विभाजित है:
1. "एक-मस्तिष्क" आर्किटेक्चर (The "One-Brain" Architecture)
अधिकांश AI मॉडल एक ऐसे अनुवादक की तरह हैं जो पहले आपके द्वारा कही गई बात को लिखता है, फिर उसके बारे में सोचता है, और फिर अनुवाद को वापस आपको पढ़कर सुनाता है। इसमें समय लगता है और आवाज़ की "आत्मा" खो जाती है।
Covo-Audio अलग है। यह एक बहुभाषी (polyglot) की तरह है जो ध्वनि में सोचता है। यह आपकी कच्ची आवाज़ (निरंतर ऑडियो) लेता है और उसे सीधे अपने आंतरिक "विचारों" में प्रोसेस करता है, और फिर तुरंत एक नई आवाज़ वाला जवाब उत्पन्न करता है। यह चीज़ों को लिखने के लिए नहीं रुकता। यह इसे अविश्वसनीय रूप से तेज़ बनाता है और इसे सूक्ष्म भावनात्मक संकेतों—जैसे कि आह भरना या हँसना—को पकड़ने में सक्षम बनाता, जो टेक्स्ट में खो जाते हैं।
2. "स्मार्ट वॉयस" बनाम "द वॉयस" (Decoupling)
AI की सबसे बड़ी समस्याओं में से एक यह है कि यदि आप एक विशिष्ट आवाज़ (जैसे कि एक गहरी, सुखदायक कथावाचक) चाहते हैं, तो आपको आमतौर पर उस विशिष्ट व्यक्ति की आवाज़ के घंटों के डेटा और उनके द्वारा जटिल संवाद निभाने के घंटों के डेटा की आवश्यकता होती है। यह महंगा है और इसे स्केल करना कठिन है।
Covo-Audio एक चतुर तकनीक पेश करता है जिसे इंटेलिजेंस-स्पीकर डिकपलिंग (Intelligence-Speaker Decoupling) कहा जाता है।
- उपमा: कल्पना कीजिए कि एक प्रतिभाशाली अभिनेता (इंटेलिजेंस) जो किसी भी भूमिका को निभा सकता है, और एक रिकॉर्डिंग स्टूडियो (स्पीकर)। आमतौर पर, आपको हर नई आवाज़ के लिए एक नया अभिनेता किराए पर लेना पड़ता है। Covo-Audio उन्हें अलग करता है। यह "अभिनेता" को सामान्य डेटा का उपयोग करके अविश्वसनीय रूप से स्मार्ट होने के लिए प्रशिक्षित करता है, और फिर यह किसी भी आवाज़ का "मास्क" (एक हल्के TTS सिस्टम से) पहन सकता है बिना अपनी बुद्धिमत्ता खोए।
- परिणाम: आप बहुत कम डेटा के साथ AI को एक नई आवाज़ दे सकते हैं, और यह फिर भी स्वाभाविक लगेगा और स्मार्ट बना रहेगा। यह एक मास्टर शेफ की तरह है जो किसी भी स्थानीय बाज़ार से सामग्री का उपयोग करके एक शानदार भोजन बना सकता है, बजाय इसके कि हर व्यंजन के लिए एक विशिष्ट फार्म की आवश्यकता हो।
3. "फुल-डुप्लेक्स" नृत्य (बात करते हुए सुनना)
वास्तविक मानवीय बातचीत "पिंग-पोंग" के खेल की तरह नहीं है जहाँ आप दूसरे व्यक्ति के बोलने के खत्म होने का इंतज़ार करते हैं। हम बीच में टोकते हैं, हम बोलते समय "हूँ-हाँ" कहते हैं, और हम सोचने के लिए रुकते हैं। इसे फुल-डेप्लेक्स (Full-Duplex) कहा जाता है।
पुराने AI मॉडल वॉकी-टॉकी की तरह हैं: "ओवर।" (जवाब का इंतज़ार करें)। "ओवर।"
Covo-Audio-Chat-FD एक डिनर पार्टी में वास्तविक बातचीत की तरह है।
- यह अपना वाक्य पूरा करने के दौरान भी आपको सुन सकता है।
- यदि आप इसे बीच में टोकते हैं ("रुको, मेरा मतलब था..."), तो यह तुरंत रुक जाता है, आपको स्वीकार करता है, और अपना रुख बदल लेता है।
- यह जानता है कि क्या आप सोचने के लिए रुके हैं या आप बोलना समाप्त कर चुके हैं।
- यह वास्तविक बातचीत के डेटा पर भारी मात्रा में प्रशिक्षण प्राप्त करके ऐसा करता है, जिससे यह केवल शब्दों के बजाय मानव भाषण की लय को सीखता है।
4. "इमोशनल रडार" (The "Emotional Radar")
Covo-Audio केवल तर्क के बारे में नहीं है; यह सहानुभूति के बारे में भी है। टीम ने इसे "मूड रिंग" के डेटा पर प्रशिक्षित किया है।
- यदि आप दुखी सुनाई देते हैं, तो यह केवल "मुझे खेद है" नहीं कहता। यह अपनी आवाज़, गति और शब्द चयन को बदलकर सांत्वना देने वाला बन जाता है।
- यदि आप उत्साहित होते हैं, तो यह आपकी ऊर्जा से मेल खाता है।
- इसका परीक्षण इस बात पर किया गया कि यह क्रोध, खुशी और चिंता जैसी भावनाओं को कितनी अच्छी तरह संभालता है, और इसने कई अन्य ओपन-सोर्स मॉडलों की तुलना में उच्च स्कोर किया, जिससे सिद्ध होता है कि यह एक सहायक संवादात्मक साथी बन सकता है।
यह क्यों मायने रखता है?
यह पेपर दिखाता है कि शीर्ष-स्तरीय प्रदर्शन प्राप्त करने के लिए आपको एक विशाल, महंगे सुपरकंप्यूटर (जैसे कि 30-बिलियन पैरामीटर वाला मॉडल) की आवश्यकता नहीं है। Covo-Audio, अपने कॉम्पैक्ट 7-बिलियन आकार के साथ, समझ, तर्क और स्वाभाविक रूप से बोलने में बहुत बड़े मॉडलों की बराबरी करता है या उन्हें मात देता है।
संक्षेप में:
Covo-Audio हमारे सपनों के "जार्विस" या "सिरी" की ओर एक कदम है। यह एक ऐसा मॉडल है जो आपके शब्दों को ही नहीं, बल्कि आपकी आवाज़ के संगीत को सुनता है। यह आपको विनम्रता से टोक सकता है, जब आप नीचे महसूस कर रहे हों तो आपको सांत्वना दे सकता है, एक पहेली हल कर सकता है, और यह सब एक ही सहज गति में कर सकता है, और वह भी तब जब आप बिना किसी बड़े डेटा संग्रह प्रोजेक्ट के किसी भी आवाज़ को चुन सकें।
यह केवल एक AI नहीं है जो बात करता है; यह एक AI है जो संवाद करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।