A Comparative Study of Acoustic Feature Extraction Using CSL and Web Prototype of LIS-N Application
यह अध्ययन रिमोट वॉयस मॉनिटरिंग के लिए नैदानिक मानक CSL के एक व्यवहार्य ओपन-सोर्स विकल्प के रूप में LIS-N वेब-आधारित प्रोटोटाइप को मान्य करता है, जो फ्रीक्वेंसी-आधारित ध्वनिक विशेषताओं (एकुस्टिक फीचर्स) के लिए उत्कृष्ट सहमति और अनुदैर्ध्य निरंतरता (लॉन्जिट्यूडिनल कंसिस्टेंसी) प्रदर्शित करता है, साथ ही हार्डवेयर और सॉफ्टवेयर के अंतरों के कारण ऊर्जा और गड़बड़ी (परटर्बेशन) मापों में सीमाओं को रेखांकित करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
मानवीय स्वर केवल बोलने का एक माध्यम मात्र नहीं है; यह एक जैविक संकेत है जो किसी व्यक्ति के स्वास्थ्य के बारे में सूचनाओं का एक विशाल भंडार समेटे होता है। दशकों से, डॉक्टर और शोधकर्ता स्वर तंत्रिकाओं (वोकल कॉर्ड्स) की समस्याओं का पता लगाने के लिए आवाजों को सुनते आए हैं, लेकिन उस सुनने की प्रक्रिया को सटीक, वस्तुनिष्ठ डेटा में बदलना पारंपरिक रूप से केवल शांत, नियंत्रित क्लीनिकों में पाए जाने वाले महंगे, विशेष उपकरणों की मांग करता रहा है। ये मशीनें, जो अक्सर मालिकाना सॉफ्टवेयर और उच्च लागत के घेरे में बंद होती हैं, मरीज की आवाज को समय के साथ ट्रैक करना या उन्हें अपने घर के आराम से इसकी निगरानी करना कठिन बना देती हैं। जैसे-जैसे टेलीहेल्थ आधुनिक चिकित्सा का एक मानक बनता जा रहा है, वैज्ञानिक समुदाय इस उच्च-गुणवत्ता वाले विश्लेषण को क्लिनिक से बाहर डिजिटल दुनिया में लाने का तरीका खोज रहा है, जिसमें ऐसे उपकरणों का उपयोग हो जो सुलभ, किफायती हों और रोजमर्रा के उपकरणों पर चल सकें।
साउथ फ्लोरिडा विश्वविद्यालय के शोधकर्ताओं की एक टीम ने यह परीक्षण करने के लिए हाथ डाला कि क्या एक नया, ओपन-सोर्स दृष्टिकोण गोल्ड-स्टैंडर्ड क्लिनिकल उपकरणों के प्रदर्शन का मुकाबला कर सकता है। उन्होंने LIS-N नामक एक प्रोटोटाइप मोबाइल एप्लिकेशन विकसित किया, जो वॉयस रिकॉर्डिंग का विश्लेषण करने के लिए एक मुफ्त, ओपन-सोर्स सॉफ्टवेयर लाइब्रेरी का उपयोग करता है। यह देखने के लिए कि क्या यह नया उपकरण वास्तविक दुनिया के उपयोग के लिए तैयार है, उन्होंने इसकी तुलना सीधे 'कंप्यूटराइज्ड स्पीच लैब' से की, जो वर्षों से वॉयस क्लीनिकों में उपयोग किया जाने वाला एक स्थापित, मालिकाना सिस्टम है। इस अध्ययन में बीस स्वस्थ वयस्कों को शामिल किया गया जिन्होंने लगातार तीन दिनों तक अपनी आवाज रिकॉर्ड की। प्रत्येक प्रतिभागी ने तीन विशिष्ट कार्य किए: 'रेनबो पैसेज' नामक एक मानक पैराग्राफ को पढ़ना, एक एकल स्वर (vowel) ध्वनि को थामना, और दूसरे स्वर पर जितना संभव हो सके उतनी देर तक बोलना। एक निष्पक्ष परीक्षण सुनिश्चित करने के लिए, शोधकर्ताओं ने दोनों प्रणालियों का उपयोग करके प्रत्येक सत्र को एक साथ रिकॉर्ड किया, जिससे भाषण के ठीक उसी क्षण को कैप्चर किया जा सका।
परिणामों ने एक स्पष्ट तस्वीर पेश की कि यह नई तकनीक कहाँ सफल होती है और कहाँ इसे सुधार की आवश्यकता है। शोधकर्ताओं ने पाया कि नया सिस्टम आवाज की पिच (pitch) मापने में असाधारण रूप से अच्छा था, जो मूल रूप से यह है कि ध्वनि कितनी ऊँची या नीची है। दोनों प्रणालियों के बीच औसत पिच मानों की तुलना करते समय, संख्याएँ लगभग पूरी तरह से मेल खाती थीं, चाहे रिकॉर्डिंग क्लिनिकल माइक्रोफोन से की गई हो या हेडसेट से, और चाहे किसी भी सॉफ्टवेयर ने ध्वनि का विश्लेषण किया हो। यह सुझाव देता है कि आवाज के सामान्य स्वर को ट्रैक करने के लिए, नया ओपन-सोर्स टूल महंगे क्लिनिकल गियर का एक विश्वसनीय विकल्प है। हालांकि, कहानी तब बदल गई जब शोधकर्ताओं ने देखा कि उनकी आवाज कितनी तेज (loudness) थी। ऊर्जा माप (energy measurements) पर दोनों प्रणालियों के बीच सहमति पूरी तरह से उपयोग किए गए माइक्रोफोन पर निर्भर थी। जब दोनों प्रणालियों के लिए एक ही माइक्रोफोन का उपयोग किया गया, तो लाउडनेस रीडिंग अच्छी तरह से मेल खाती थी। जब अलग-अलग माइक्रोफोन का उपयोग किया गया, तो रीडिंग काफी भिन्न हो गई, जिससे सिद्ध हुआ कि ध्वनि को कैप्चर करने वाला हार्डवेयर आवाज के आयतन (volume) को मापने में एक प्रमुख कारक है।
सबसे महत्वपूर्ण सीमा तब सामने आई जब शोधकर्ताओं ने आवाज की स्थिरता को मापने की कोशिश की, विशेष रूप से पिच और लाउडनेस में होने वाले सूक्ष्म, तीव्र उतार-चढ़ाव को देखा जो अक्सर स्वर संबंधी तनाव या रोग का संकेत देते हैं। ये माप, जिन्हें 'परटर्बेशन' (perturbation) कहा जाता है, दोनों प्रणालियों के बीच खराब सामंज्य दिखाते हैं। कई मामलों में, दोनों मशीनों ने विपरीत दिशाओं में काम करने वाले आंकड़े दिए, जिसका अर्थ है कि उन्हें इन विशिष्ट प्रकार के विश्लेषणों के लिए एक-दूसरे के स्थान पर उपयोग नहीं किया जा सकता है। अध्ययन में यह भी पाया गया कि नया सिस्टम पिच के लिए क्लिनिकल सिस्टम की तरह ही तीन दिनों में व्यक्ति की आवाज में होने वाले परिवर्तनों को ट्रैक करने में सक्षम था, लेकिन स्थिरता के मापों के लिए संघर्ष करता रहा। यह इंगित करता है कि हालांकि यह टूल आवाज की सामान्य विशेषताओं की निगरानी के लिए उत्कृष्ट है, लेकिन यह अभी भी हर प्रकार के नैदानिक माप के लिए क्लिनिकल मशीन का स्थान नहीं ले सकता है।
अंततः, यह कार्य प्रमाण प्रदान करता है कि ओपन-सोर्स सॉफ्टवेयर कई वॉयस मॉनिटरिंग कार्यों के लिए एक व्यवहार्य, सुलभ विकल्प के रूप में काम कर सकता है, विशेष रूप से वे जिनमें आवाज की औसत पिच शामिल है। अध्ययन पुष्टि करता है कि रिमोट वॉयस मॉनिटरिंग और टेलीहेल्थ के लिए, नया सिस्टम दिनों या हफ्तों में आवाज कैसे बदलती है, इसे विश्वसनीय रूप से ट्रैक कर सकता है। हालांकि, शोधकर्ता चेतावनी देते हैं कि दोनों प्रणालियों को मिलाया नहीं जाना चाहिए; नए ऐप द्वारा मापा गया मान, पुराने क्लिनिकल मशीन के मान के साथ सीधे तुलना नहीं किया जाना चाहिए, विशेष रूप से जब आवाज की स्थिरता या लाउडनेस को देखा जा रहा हो। रिमोट वॉयस हेल्थ के भविष्य के लिए, अध्ययन सुझाव देता है कि जबकि सॉफ्टवेयर व्यापक उपयोग के लिए तैयार है, रिकॉर्डिंग करने का तरीका—विशेष रूप से उपयोग किया जाने वाला माइक्रोफोन—सटीक परिणाम सुनिश्चित करने के लिए मानकीकृत होना चाहिए। यह एक ऐसे भविष्य का मार्ग प्रशस्त करता है जहाँ मरीज अपने घर से उन उपकरणों के साथ अपने स्वर स्वास्थ्य की निगरानी कर सकते हैं जो विशेषज्ञ के कार्यालय में पाए जाने वाले उपकरणों जितने ही प्रभावी हों, बशर्ते सही प्रोटोकॉल का पालन किया जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।