← नवीनतम पेपर
⚡ electrical engineering

EntangleCodec: A Unified Discrete Audio Tokenizer via Semantic-Acoustic Entanglement

EntangleCodec एक एकीकृत डिस्क्रीट ऑडियो टोकेनाइज़र है जो ऑडियो को समृद्ध कैप्शन के साथ संरेखित करता है ताकि एक ही टोकन स्ट्रीम में सिमेंटिक और एकोस्टिक दोनों सूचनाओं को कैप्चर किया जा सके, जिससे ऑडियो समझ और पीढ़ी में अत्याधुनिक प्रदर्शन प्राप्त होता है और अत्यधिक पैरामीटर-कुशल ऑडियो लैंग्वेज मॉडल्स को सक्षम बनाया जाता है।

मूल लेखक: Hui Li, Yangfan Gao, Junlin Shang, Changhao Jiang, Tao Gui, Qi Zhang, Xuanjing Huang

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hui Li, Yangfan Gao, Junlin Shang, Changhao Jiang, Tao Gui, Qi Zhang, Xuanjing Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास ध्वनियों का एक विशाल पुस्तकालय है: लोगों की बातें, पक्षियों की चहचहाहट, पियानो का संगीत और कारों के इंजन। एक कंप्यूटर के लिए इन ध्वनियों को "समझने" या "बनाने" के लिए, इसे एक ऐसी भाषा में बदलने की आवश्यकता होती है जिसे वह पढ़ सके, जैसे कि संख्याओं या शब्दों की एक स्ट्रिंग। इस प्रक्रिया को टोकेनाइजेशन (tokenization) कहा जाता है।

यह पेपर एक नया टूल पेश करता है जिसे EntangleCodec कहा जाता है। इसे एक सुपर-स्मार्ट अनुवादक के रूप में समझें जो निरंतर ध्वनि तरंगों (continuous sound waves) को एक संक्षिप्त, डिस्क्रीट कोड (टोकन) में बदल देता है जो सुनने (समझने) और बोलने (बनाने) दोनों के लिए पूरी तरह से काम करता है।

यहाँ बताया गया है कि यह कैसे काम करता है और यह क्यों खास है:

1. समस्या: "एकतरफा" अनुवादक

इससे पहले, कंप्यूटर ध्वनियों को संभालने के दो अलग-अलग तरीके इस्तेमाल करते थे, और दोनों में से कोई भी अपने आप में पूर्ण नहीं था:

  • "हाई-फिडेलिटी" (High-Fidelity) अनुवादक: यह एक फोटोकॉपी करने वाली मशीन की तरह ध्वनियों की सटीक नकल करने में बहुत अच्छा था। यह किसी आवाज़ या गाने को बिल्कुल सही तरीके से फिर से बना सकता था, लेकिन यह वास्तव में यह नहीं समझ पाता था कि ध्वनि का अर्थ क्या है। यदि शब्द समान हों, तो भी यह नहीं बता सकता था कि आवाज़ खुश है या दुखी।
  • "सिमेंटिक" (Semantic) अनुवादक: यह अर्थ समझने में अच्छा था (एक मानव श्रोता की तरह)। यह जानता था कि कौन बोल रहा था और भावना क्या थी, लेकिन इसे ध्वनि को सटीक रूप से फिर से बनाने में अक्सर संघर्ष करना पड़ता था। यह ऐसा था जैसे कोई व्यक्ति किसी पेंटिंग का वर्णन तो पूरी तरह से कर सकता है लेकिन वह खुद पेंटिंग नहीं बना सकता।

मौजूदा अधिकांश उपकरण एक साथ दो अलग-अलग अनुवादकों (एक अर्थ के लिए, एक ध्वनि के लिए) का उपयोग करने की कोशिश करते थे और फिर उन्हें आपस में जोड़ देते थे। यह तरीका अव्यवस्थित, अनावश्यक था और अक्सर भ्रम पैदा करता था।

2. समाधान: "एंटैंगल्ड" (Entangled) अनुवादक

EntangleCodec अलग है क्योंकि यह एक ही चरण में एक साथ दोनों होने के बारे में सीखता है।

  • "रिच कैप्शन" (Rich Caption) सादृश्य: कल्पना कीजिए कि आप एक बच्चे को कुत्ता पहचानना सिखा रहे हैं।
    • पुराना तरीका: आप उसे एक तस्वीर दिखाते हैं और कहते हैं, "कुत्ता।" (यह केवल भाषण के टेक्स्ट ट्रांसक्रिप्ट का उपयोग करने जैसा है)।
    • EntangleCodec का तरीका: आप उसे तस्वीर दिखाते हैं और कहते हैं, "यह बस्टर नाम का एक गोल्डन रिट्रीवर है। वह खुश दिख रहा है और तेजी से भौंक रहा है और एक धूप वाले पार्क में है।"
    • यह पेपर हर ध्वनि के लिए ऐसे "रिच कैपशन्स" लिखने के लिए एक बड़े AI का उपयोग करता है। यह केवल यह नहीं बताता कि क्या शब्द बोले गए; यह वक्ता की आयु, उनकी भावना, बैकग्राउंड शोर और संगीत के मूड का भी वर्णन करता है। टोकेनाइज़र इन समृद्ध विवरणों और ध्वनि को एक एकीकृत कोड में "एंटैंगल" (मिश्रित) करने के लिए सीखता है।

3. यह कैसे काम करता है (दो-चरणीय प्रशिक्षण)

लेखकों ने इस टूल को दो चरणों में प्रशिक्षित किया, जैसे किसी एथलीट को प्रशिक्षित किया जाता है:

  1. चरण 1 (अर्थ सीखना): सिस्टम एक ध्वनि को देखता है और उसे उस विस्तृत कैप्शन से मिलाना सीखता है। यह सीखता है कि ध्वनि के "कौन", "क्या", "कहाँ" और "कैसे" को अपने आंतरिक कोड में कैसे पैक किया जाए।
  2. चरण 2 (ध्वनि को निखारना): एक बार जब यह अर्थ जान लेता है, तो वे इस हिस्से को फ्रीज कर देते हैं और केवल इस बात पर ध्यान केंद्रित करते हैं कि यह जो ध्वनि दोबारा बनाता है, वह कितनी स्पष्ट और प्राकृतिक सुनाई दे।

4. परिणाम: छोटा लेकिन शक्तिशाली

पेपर का दावा है कि EntangleCodec दो मुख्य कारणों से गेम-चेंजर है:

  • यह एक स्विस आर्मी नाइफ है: पिछले उपकरणों के विपरीत जिन्हें स्पीच, म्यूजिक या साउंड इफेक्ट्स के लिए अलग-अलग सेटिंग्स की आवश्यकता होती थी, यह एक ही "भाषा" के साथ उन सभी को संभाल सकता है। इसका उपयोग एक ऐसा कंप्यूटर बनाने के लिए किया जा सकता है जो एक गाना सुनता है और उस पर सवाल देता है, या एक ऐसा कंप्यूटर जो एक कहानी पढ़ता है और उसके लिए आवाज और साउंड इफेक्ट्स उत्पन्न करता है।
  • दक्षता ही सर्वोपरि है: सबसे आश्चर्यजनक खोज इसके आकार के बारे में है।
    • कल्पना कीजिए कि एक बहुत छोटा, 0.6-बिलियन-पैरामीटर वाला मॉडल (एक बहुत ही कुशल मस्तिष्क की तरह) EntangleCodec का उपयोग कर रहा है।
    • पेपर का दावा है कि यह छोटा मॉडल उन विशाल, विशिष्ट मॉडलों को पछाड़ देता है जो 22 गुना बड़े (13 बिलियन से अधिक पैरामीटर) हैं।
    • सादृश्य: यह एक कॉम्पैक्ट स्पोर्ट्स कार (EntangleCodec) के एक भारी-भरकम ट्रक (पुराने बड़े मॉडल) को दौड़ में हराने जैसा है, इसलिए नहीं कि कार बड़ी है, बल्कि इसलिए क्योंकि उसका इंजन (टोकेनाइज़र) बहुत अधिक कुशल है।

5. यह क्या कर सकता है (पेपर के आधार पर)

पेपर प्रदर्शित करता है कि यह टूल निम्नलिखित कार्यों के लिए अच्छी तरह से काम करता है:

  • समझना (Understanding): ऑडियो के बारे में सवालों के जवाब देना (जैसे, "क्या वक्ता क्रोधित है?" या "कौन सा वाद्य यंत्र बज रहा है?")।
  • स्पीच जनरेशन (Speech Generation): टेक्स्ट को प्राकृतिक लगने वाली आवाज़ में बदलना (Text-to-Speech)।
  • साउंड जनरेशन (Sound Generation): टेक्स्ट विवरणों को साउंड इफेक्ट्स या संगीत में बदलना (Text-to-Audio)।

सारांश

EntangleCodec एक नया तरीका है जिससे कंप्यूटर ध्वनि को कोड में बदलता है। "अर्थ" और "ध्वनि की गुणवत्ता" को अलग-अलग समस्याओं के रूप में मानने के बजाय, यह उन्हें समृद्ध विवरणों का उपयोग करके एक साथ मिला देता है। परिणाम एक ऐसा सिस्टम है जो अविश्वसनीय रूप से कुशल है, जिससे छोटे कंप्यूटर मॉडल बड़े, पुराने सिस्टम की तुलना में बेहतर या उनके बराबर ऑडियो को समझ और बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →