← नवीनतम पेपर
💬 NLP

UniAudio-Token: Empowering Semantic Speech Tokenizers with General Audio Perception

UniAudio-Token, संरचित पर्यवेक्षण (structured supervision) के लिए सिमेंटिक-अकॉस्टिक प्रिमिटिव्स (Semantic-Acoustic Primitives) और ध्वनिक विवरणों को पुनर्स्थापित करने के लिए एक सिमेंटिक-अकॉस्टिक इक्विलिब्रियम गेटिंग मैकेनिज्म (Semantic-Acoustic Equilibrium gating mechanism) को पेश करके सामान्य ऑडियो धारणा क्षमताओं के साथ सिमेंटिक स्पीच टोकनाइज़र को बढ़ाता है, जिससे यह समझ और निर्माण दोनों कार्यों में मौजूदा सिंगल-कोडबुक बेसलाइन से बेहतर प्रदर्शन करते हुए एक एकीकृत ऑडियो इंटरफ़ेस प्राप्त करता है।

मूल लेखक: Yuhan Song, Linhao Zhang, Aiwei Liu, Chuhan Wu, Sijun Zhang, Wei Jia, Yuan Liu, Houfeng Wang, Xiao Zhou

प्रकाशित 2026-06-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuhan Song, Linhao Zhang, Aiwei Liu, Chuhan Wu, Sijun Zhang, Wei Jia, Yuan Liu, Houfeng Wang, Xiao Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट (एक AI) को ध्वनि की दुनिया को समझने और बोलने के लिए सिखाने की कोशिश कर रहे हैं। इसे करने के लिए, रोबोट को एक "शब्दकोश" की आवश्यकता होगी जो ध्वनि तरंगों (sound waves) को उन शब्दों में बदल सके जिन्हें वह पढ़ सके। इस शब्दकोश को टोकेनाइज़र (tokenizer) कहा जाता है।

लंबे समय तक, इन शब्दकोशों के साथ एक बड़ी समस्या थी: वे ऐसे विशेषज्ञ अनुवादकों की तरह थे जो केवल "मानव भाषण" (Human Speech) ही बोल सकते थे। वे यह समझने में बहुत अच्छे थे कि किसी व्यक्ति ने क्या कहा, लेकिन यदि आप उन्हें कुत्ते के भौंकने, लहरों के टकराने या सायरन की रिकॉर्डिंग सुनाते, तो वे बहरे हो जाते। वे उन ध्वनियों को जबरदस्ती भाषण के पैटर्न में ढालने की कोशिश करते, जिससे वे अक्सर गलत हो जाते या विवरणों को पूरी तरह से अनदेखा कर देते। इसे ही पेपर में "ध्वनिक अंधापन" (acoustic blindness) कहा गया है।

दूसरी ओर, कुछ अन्य शब्दकोश ऐसे थे जो सब कुछ सुनने के लिए डिज़ाइन किए गए थे (एक हाई-फिडेलिटी माइक्रोफ़ोन की तरह), लेकिन वे शब्दों के पीछे के अर्थ को समझने में बहुत खराब थे। वे आवाज़ की सटीक पिच तो सुन सकते थे, लेकिन वे यह नहीं बता पाते थे कि व्यक्ति खुश था या दुखी, या वह वास्तव में क्या कह रहा था।

यूनिऑडियो-टोकेन (UniAudio-Token) वह नया, ऑल-इन-वन शब्दकोश है जो इसे ठीक करता है। लेखकों (बीजिंग यूनिवर्सिटी और टेनसेंट से) ने एक ऐसा सिस्टम बनाया है जो केवल मानव भाषण ही नहीं, बल्कि सभी ध्वनियों के लिए एक यूनिवर्सल ट्रांसलेटर के रूप में कार्य करता है।

उन्होंने इसे कैसे किया, इसके लिए उन्होंने दो मुख्य "सुपरपावर्स" का उपयोग किया:

1. "थ्री-लेयर सैंडविच" (सेमेंटिक-अकॉस्टिक प्रिमिटिव्स)

कल्पना कीजिए कि आप अपने मित्र को एक फिल्म के दृश्य का वर्णन कर रहे हैं।

  • पुराना तरीका: आप बस कहते हैं, "एक आदमी चल रहा है।" (यह भाषाई हिस्सा है)। आप इस बात को अनदेखा कर देते हैं कि वह बारिश में चल रहा है, लाल कोट पहने हुए है, और उदास दिख रहा है।
  • यूनिऑडियो-टोकेन का तरीका: उन्होंने ध्वनि को वर्णित करने का एक नया तरीका विकसित किया जिसे सेमेंटिक-अकॉस्टिक प्रिमिटिव्स (SAP) कहा जाता है। यह एक तीन-परत वाले सैंडविच की तरह है:
    • लेयर 1 (स्क्रिप्ट): क्या कहा जा रहा है? (शब्द)।
    • लेयर 2 (अभिनेता): इसे कैसे कहा जा रहा है? (क्या आवाज़ गहरी है? क्या व्यक्ति क्रोधित है? क्या यह एक बच्चा है या कोई बुजुर्ग?)।
    • लेयर 3 (मंच): उनके आसपास क्या हो रहा है? (क्या बारिश हो रही है? क्या कार का इंजन गूँज रहा है? क्या कोई दरवाज़ा ज़ोर से बंद हुआ?)।

AI को एक साथ इन तीनों परतों को सीखने के लिए मजबूर करके, यह "शोर" (जैसे बारिश या संगीत) को अनदेखा करना बंद कर देता है और इसे महत्वपूर्ण जानकारी के रूप में मानने लगता है।

2. "स्मार्ट मिक्सर" (सेमेंटिक-अकॉस्टिक इक्विलिब्रियम)

एक बेहतरीन विवरण के बावजूद, एक तकनीकी समस्या थी। जैसे-जैसे AI अपने मस्तिष्क में ध्वनि को गहराई से प्रोसेस करता है, यह मुख्य अर्थ पर ध्यान केंद्रित करने के लिए "बारीक विवरणों" (जैसे आवाज़ की बनावट या कमरे की गूँज) को त्याग देता है। यह एक किताब का सारांश इतनी तेज़ी से करने जैसा है कि आप परिदृश्य के सुंदर विवरणों को खो देते हैं।

इसे ठीक करने के लिए, उन्होंने एक स्मार्ट मिक्सर (जिसे SAE कहा जाता है) बनाया।

  • सोचिए कि AI एक फैक्ट्री असेंबली लाइन है। शुरुआती स्टेशन कच्ची, विस्तृत ध्वनि (उथले/shallow लेयर्स) देखते हैं। बाद के स्टेशन बड़े चित्र का अर्थ (गहरी/deep लेयर्स) देखते हैं।
  • आमतौर पर, गहरी परतें यह भूल जाती हैं कि शुरुआती परतों ने क्या देखा था।
  • स्मार्ट मिक्सर एक गेटकीपर है जो कंटेंट पर नज़र रखता है। यदि AI एक जटिल गाना या शोर भरी सड़क सुन रहा है, तो गेट चौड़ा हो जाता है ताकि "कच्ची ध्वनि" को "बड़े चित्र" के साथ मिक्स होने के लिए वापस अंदर आने दिया जा सके। यदि AI स्पष्ट भाषण सुन रहा है, तो गेट थोड़ा बंद हो जाता है ताकि शब्दों पर ध्यान केंद्रित किया जा सके।
  • यह प्रक्रिया स्वचालित और तात्कालिक होती है, जिससे यह सुनिश्चित होता है कि AI अर्थ को समझते हुए भी ध्वनि के "फ्लेवर" (स्वाद/अहसास) को कभी नहीं खोता।

परिणाम: एक स्विस आर्मी नाइफ

पेपर दिखाता है कि यह नया सिस्टम ऑडियो का एक "स्विस आर्मी नाइफ" है:

  • यह सब कुछ सुनता है: कुत्तों के भौंकने, बारिश गिरने या हेलीकॉप्टर उड़ने जैसी ध्वनियों पर परीक्षण करने पर, यह उन्हें पूरी तरह से वर्गीकृत करता है। पुराने सिस्टम इन्हें आपस में मिला देते या अनदेखा कर देते।
  • यह पूरी तरह से बोलता है: इन गैर-भाषण ध्वनियों को सुनने के बावजूद, यह मानव भाषण को समझने में कमज़ोर नहीं हुआ। वास्तव में, यह मानव भाषण उत्पन्न करने में बेहतर हो गया क्योंकि इसने उन सूक्ष्म विवरणों (जैसे लहजा और सांस लेना) को बनाए रखना सीख लिया जो भाषण को वास्तविक बनाते हैं।
  • यह बड़े मस्तिष्क की मदद करता है: जब उन्होंने इस टोकेनाइज़र को एक बड़े लैंग्वेज मॉडल (बड़े मस्तिष्क) में जोड़ा, तो वह मस्तिष्क संगीत, साउंड इफेक्ट्स और भाषण के बारे में सवालों के जवाब देने में बहुत स्मार्ट हो गया, और सभी पिछले सिंगल-डिक्शनरी सिस्टम से बेहतर प्रदर्शन किया।

संक्षेप में: यूनिऑडियो-टोकेन एक नया टूल है जो AI को ध्वनि की पूरी दुनिया को सुनने के लिए सिखाता—शब्दों, आवाजों और बैकग्राउंड शोर, सभी को—बिना स्पष्ट रूप से समझने या बोलने की क्षमता खोए। यह "सुनने" और "समझने" के बीच के अंतर को पाटता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →