Throat and acoustic paired speech dataset for deep learning-based speech enhancement
यह शोध पत्र थ्रोट एंड एकॉस्टिक पेयर्ड स्पीच (TAPS) डेटासेट पेश करता है, जिसमें 60 कोरियाई वक्ताओं के युग्मित रिकॉर्डिंग और एक इष्टतम संरेखण विधि शामिल है, ताकि उच्च-शोर वाले वातावरण में थ्रोट माइक्रोफ़ोन का उपयोग करके डीप लर्निंग-आधारित स्पीच एन्हांसमेंट के लिए मानक संसाधनों की कमी को दूर किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक गरजती हुई सबवे ट्रेन या किसी व्यस्त फैक्ट्री के फर्श के बीच में बातचीत करने की कोशिश कर रहे हैं। बैकग्राउंड का शोर इतना तेज़ है कि एक-दूसरे को सुनना लगभग असंभव है।
इसे हल करने के लिए, वैज्ञानिकों ने एक विशेष प्रकार का माइक्रोफ़ोन विकसित किया है जिसे आप अपने गले पर पहनते हैं। हवा के माध्यम से यात्रा करने वाली ध्वनि तरंगों को सुनने के बजाय (एक सामान्य माइक्रोफ़ोन की तरह), यह "थ्रोट माइक" (गले का माइक्रोफ़ोन) आपकी त्वचा के विरुद्ध आपके वोकल कॉर्ड्स की कंपन को महसूस करता है। यह वैसा ही है जैसे बगल के कमरे में चल रही पार्टी को सुनने के लिए आप अपना कान दीवार से सटा देते हैं; आप संगीत को स्पष्ट रूप से महसूस कर सकते हैं भले ही गलियारा शोर से भरा हो।
समस्या: "मफल्ड" (दबी हुई) सिग्नल
हालाँकि, इसमें एक पेच है। जब ध्वनि आपके गले के माइक तक पहुँचने के लिए आपकी त्वचा और मांसपेशियों के माध्यम से यात्रा करती है, तो वह दबी हुई (muffled) हो जाती है। इसे एक मोटी, धुंधली खिड़की से देखने जैसा समझें। आप लोगों की आकृतियाँ देख सकते हैं, लेकिन बारीक विवरण (जैसे अक्षरों के तीखे किनारे या "s" और "f" जैसी स्पष्ट ध्वनियाँ) खो जाते हैं। थ्रोट माइक आपकी आवाज़ के "शरीर" को तो पकड़ लेता है लेकिन उन उच्च-पिच वाले, स्पष्ट विवरणों को मिस कर देता है जो भाषण को स्पष्ट और समझने योग्य बनाते हैं।
समाधान: एक नई रेसिपी बुक (TAPS डेटासेट)
लंबे समय तक, इस "मफल्ड" आवाज़ को ठीक करने के लिए आर्टिफिशियल इंटेलिजेंस (AI) का उपयोग करने वाले शोधकर्ता अटके हुए थे। उनके पास एक अच्छी "रेसिपी बुक" नहीं थी जो AI को यह सिखा सके कि एक दबी हुई गले की रिकॉर्डिंग को एक स्पष्ट, सामान्य आवाज़ में कैसे बदला जाए। वे बिना सामग्री की सूची या तैयार उत्पाद की तस्वीर के केक बनाने की कोशिश कर रहे थे।
यह पेपर एक नई, विशाल रेसिपी बुक पेश करता है जिसे TAPS डेटासेट कहा जाता है।
- यह क्या है? यह 6,000 रिकॉर्डिंग जोड़ों का एक संग्रह है। हर वाक्य के लिए, उन्होंने इसे बिल्कुल एक ही समय में दो बार रिकॉर्ड किया: एक बार थ्रोट माइक के साथ (दबी हुई संस्करण) और एक बार एक उच्च-गुणवत्ता वाले सामान्य माइक्रोफ़ोन के साथ (स्पष्ट संस्करण)।
- इसे किसने बनाया? 60 मूल कोरियाई वक्ताओं ने एक साउंडप्रूफ कमरे में 100 वाक्य प्रत्येक पढ़े।
- यह विशेष क्यों है? शोधकर्ताओं ने केवल फ़ाइलों को एक साथ नहीं डाल दिया। उन्होंने महसूस किया कि थ्रोट माइक और सामान्य माइक हमेशा बिल्कुल एक ही मिलीसेकंड पर शुरू और समाप्त नहीं होते (जैसे दो धावक जो दौड़ की शुरुआत में थोड़े तालमेल से बाहर होते हैं)। उन्होंने दो रिकॉर्डिंग को पूरी तरह से संरेखित करने के लिए एक चतुर "सिंक्रोनाइज़ेशन डांस" विकसित किया।
प्रयोग: AI को सिखाना
शोधकर्ताओं ने इस नए डेटासेट का उपयोग तीन अलग-अलग प्रकार के AI "शेफ" को प्रशिक्षित करने के लिए किया ताकि यह देखा जा सके कि कौन सा खोई हुई आवाज़ के विवरणों को सबसे अच्छी तरह से बहाल कर सकता है।
- "मास्किंग" शेफ (TSTNN): इस शेफ ने मौजूदा दबी हुई आवाज़ को साफ करने की कोशिश की, खराब हिस्सों को ढककर। यह ठीक था, लेकिन यह गायब ध्वनियों का आविष्कार नहीं कर सका।
- "मैपिंग" शेफ (Demucs और SE-conformer): ये शेफ अधिक स्मार्ट थे। केवल सफाई करने के बजाय, उन्होंने दबे हुए स्वर के संदर्भ के आधार पर गायब उच्च-आवृत्ति वाली ध्वनियों (जैसे "s" और "sh" ध्वनियाँ) की भविdt (predict) और आविष्कार करना सीखा।
परिणाम
"मैपिंग" शेफ जीत गए। वे दबी हुई गले की रिकॉर्डिंग को लेकर एक स्पष्ट, प्राकृतिक लगने वाली आवाज़ को पुनर्गठित करने में सक्षम थे जो लगभग मूल सामान्य माइक्रोफ़ोन रिकॉर्डिंग जितनी ही अच्छी थी। AI ने "धुंधली खिड़की" को गायब विवरणों के साथ भरने का हुनर सीख लिया।
यह क्यों महत्वपूर्ण है
यह पेपर एक बड़ी बात है क्योंकि यह इस विशिष्ट तकनीक के लिए पहला मानक, उच्च-गुणवत्ता वाला "प्रशिक्षण मैदान" प्रदान करता है।
- भविष्य के लिए: अब, दुनिया भर के शोधकर्ता इस विशेष डेटासेट का उपयोग बेहतर AI बनाने के लिए कर सकते हैं। इसका मतलब है कि जल्द ही हमारे पास ऐसे पहनने योग्य उपकरण हो सकते हैं जो आपको तूफान, निर्माण स्थल या भीड़भाड़ वाली ट्रेन में स्पष्ट रूप से बात करने की अनुमति दें, बिना किसी और को सुने।
- भाषण से परे: यह तकनीक उन लोगों की भी मदद कर सकती है जिन्होंने अपनी आवाज़ खो दी है या जो ज़ोर से बोल नहीं सकते, ताकि वे केवल सोचकर (या अपने गले की कंपन के माध्यम से) चुपचाप संवाद कर सकें, और उन कंपनों को स्पष्ट भाषण में बदल सकें।
संक्षेप में, लेखकों ने एक आदर्श "जिम" (डेटासेट) और आदर्श "वेट्स" (एलाइनमेंट विधि) बनाया है ताकि AI को एक दबी हुई फुसफुसाहट को क्रिस्टल-क्लियर चिल्लाहट में बदलने के लिए प्रशिक्षित किया जा सके, यहाँ तक कि दुनिया की सबसे शोर भरी जगहों पर भी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।