← नवीनतम पेपर
⚡ electrical engineering

Throat and acoustic paired speech dataset for deep learning-based speech enhancement

यह शोध पत्र थ्रोट एंड एकॉस्टिक पेयर्ड स्पीच (TAPS) डेटासेट पेश करता है, जिसमें 60 कोरियाई वक्ताओं के युग्मित रिकॉर्डिंग और एक इष्टतम संरेखण विधि शामिल है, ताकि उच्च-शोर वाले वातावरण में थ्रोट माइक्रोफ़ोन का उपयोग करके डीप लर्निंग-आधारित स्पीच एन्हांसमेंट के लिए मानक संसाधनों की कमी को दूर किया जा सके।

मूल लेखक: Yunsik Kim, Yonghun Song, Yoonyoung Chung

प्रकाशित 2026-04-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yunsik Kim, Yonghun Song, Yoonyoung Chung

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक गरजती हुई सबवे ट्रेन या किसी व्यस्त फैक्ट्री के फर्श के बीच में बातचीत करने की कोशिश कर रहे हैं। बैकग्राउंड का शोर इतना तेज़ है कि एक-दूसरे को सुनना लगभग असंभव है।

इसे हल करने के लिए, वैज्ञानिकों ने एक विशेष प्रकार का माइक्रोफ़ोन विकसित किया है जिसे आप अपने गले पर पहनते हैं। हवा के माध्यम से यात्रा करने वाली ध्वनि तरंगों को सुनने के बजाय (एक सामान्य माइक्रोफ़ोन की तरह), यह "थ्रोट माइक" (गले का माइक्रोफ़ोन) आपकी त्वचा के विरुद्ध आपके वोकल कॉर्ड्स की कंपन को महसूस करता है। यह वैसा ही है जैसे बगल के कमरे में चल रही पार्टी को सुनने के लिए आप अपना कान दीवार से सटा देते हैं; आप संगीत को स्पष्ट रूप से महसूस कर सकते हैं भले ही गलियारा शोर से भरा हो।

समस्या: "मफल्ड" (दबी हुई) सिग्नल
हालाँकि, इसमें एक पेच है। जब ध्वनि आपके गले के माइक तक पहुँचने के लिए आपकी त्वचा और मांसपेशियों के माध्यम से यात्रा करती है, तो वह दबी हुई (muffled) हो जाती है। इसे एक मोटी, धुंधली खिड़की से देखने जैसा समझें। आप लोगों की आकृतियाँ देख सकते हैं, लेकिन बारीक विवरण (जैसे अक्षरों के तीखे किनारे या "s" और "f" जैसी स्पष्ट ध्वनियाँ) खो जाते हैं। थ्रोट माइक आपकी आवाज़ के "शरीर" को तो पकड़ लेता है लेकिन उन उच्च-पिच वाले, स्पष्ट विवरणों को मिस कर देता है जो भाषण को स्पष्ट और समझने योग्य बनाते हैं।

समाधान: एक नई रेसिपी बुक (TAPS डेटासेट)
लंबे समय तक, इस "मफल्ड" आवाज़ को ठीक करने के लिए आर्टिफिशियल इंटेलिजेंस (AI) का उपयोग करने वाले शोधकर्ता अटके हुए थे। उनके पास एक अच्छी "रेसिपी बुक" नहीं थी जो AI को यह सिखा सके कि एक दबी हुई गले की रिकॉर्डिंग को एक स्पष्ट, सामान्य आवाज़ में कैसे बदला जाए। वे बिना सामग्री की सूची या तैयार उत्पाद की तस्वीर के केक बनाने की कोशिश कर रहे थे।

यह पेपर एक नई, विशाल रेसिपी बुक पेश करता है जिसे TAPS डेटासेट कहा जाता है।

  • यह क्या है? यह 6,000 रिकॉर्डिंग जोड़ों का एक संग्रह है। हर वाक्य के लिए, उन्होंने इसे बिल्कुल एक ही समय में दो बार रिकॉर्ड किया: एक बार थ्रोट माइक के साथ (दबी हुई संस्करण) और एक बार एक उच्च-गुणवत्ता वाले सामान्य माइक्रोफ़ोन के साथ (स्पष्ट संस्करण)।
  • इसे किसने बनाया? 60 मूल कोरियाई वक्ताओं ने एक साउंडप्रूफ कमरे में 100 वाक्य प्रत्येक पढ़े।
  • यह विशेष क्यों है? शोधकर्ताओं ने केवल फ़ाइलों को एक साथ नहीं डाल दिया। उन्होंने महसूस किया कि थ्रोट माइक और सामान्य माइक हमेशा बिल्कुल एक ही मिलीसेकंड पर शुरू और समाप्त नहीं होते (जैसे दो धावक जो दौड़ की शुरुआत में थोड़े तालमेल से बाहर होते हैं)। उन्होंने दो रिकॉर्डिंग को पूरी तरह से संरेखित करने के लिए एक चतुर "सिंक्रोनाइज़ेशन डांस" विकसित किया।

प्रयोग: AI को सिखाना
शोधकर्ताओं ने इस नए डेटासेट का उपयोग तीन अलग-अलग प्रकार के AI "शेफ" को प्रशिक्षित करने के लिए किया ताकि यह देखा जा सके कि कौन सा खोई हुई आवाज़ के विवरणों को सबसे अच्छी तरह से बहाल कर सकता है।

  1. "मास्किंग" शेफ (TSTNN): इस शेफ ने मौजूदा दबी हुई आवाज़ को साफ करने की कोशिश की, खराब हिस्सों को ढककर। यह ठीक था, लेकिन यह गायब ध्वनियों का आविष्कार नहीं कर सका।
  2. "मैपिंग" शेफ (Demucs और SE-conformer): ये शेफ अधिक स्मार्ट थे। केवल सफाई करने के बजाय, उन्होंने दबे हुए स्वर के संदर्भ के आधार पर गायब उच्च-आवृत्ति वाली ध्वनियों (जैसे "s" और "sh" ध्वनियाँ) की भविdt (predict) और आविष्कार करना सीखा।

परिणाम
"मैपिंग" शेफ जीत गए। वे दबी हुई गले की रिकॉर्डिंग को लेकर एक स्पष्ट, प्राकृतिक लगने वाली आवाज़ को पुनर्गठित करने में सक्षम थे जो लगभग मूल सामान्य माइक्रोफ़ोन रिकॉर्डिंग जितनी ही अच्छी थी। AI ने "धुंधली खिड़की" को गायब विवरणों के साथ भरने का हुनर सीख लिया।

यह क्यों महत्वपूर्ण है
यह पेपर एक बड़ी बात है क्योंकि यह इस विशिष्ट तकनीक के लिए पहला मानक, उच्च-गुणवत्ता वाला "प्रशिक्षण मैदान" प्रदान करता है।

  • भविष्य के लिए: अब, दुनिया भर के शोधकर्ता इस विशेष डेटासेट का उपयोग बेहतर AI बनाने के लिए कर सकते हैं। इसका मतलब है कि जल्द ही हमारे पास ऐसे पहनने योग्य उपकरण हो सकते हैं जो आपको तूफान, निर्माण स्थल या भीड़भाड़ वाली ट्रेन में स्पष्ट रूप से बात करने की अनुमति दें, बिना किसी और को सुने।
  • भाषण से परे: यह तकनीक उन लोगों की भी मदद कर सकती है जिन्होंने अपनी आवाज़ खो दी है या जो ज़ोर से बोल नहीं सकते, ताकि वे केवल सोचकर (या अपने गले की कंपन के माध्यम से) चुपचाप संवाद कर सकें, और उन कंपनों को स्पष्ट भाषण में बदल सकें।

संक्षेप में, लेखकों ने एक आदर्श "जिम" (डेटासेट) और आदर्श "वेट्स" (एलाइनमेंट विधि) बनाया है ताकि AI को एक दबी हुई फुसफुसाहट को क्रिस्टल-क्लियर चिल्लाहट में बदलने के लिए प्रशिक्षित किया जा सके, यहाँ तक कि दुनिया की सबसे शोर भरी जगहों पर भी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →