← नवीनतम पेपर
💻 computer science

Speech Emotion Recognition Using MFCC Features and LSTM-Based Deep Learning Model

यह शोध पत्र एक स्पीच इमोशन रिकग्निशन सिस्टम प्रस्तुत करता है जो मेल-फ्रीक्वेंसी सेप्सट्रल कोएफिशिएंट (MFCC) फीचर एक्सट्रैक्शन को लॉन्ग शॉर्ट-टर्म मेमोरी (LSTM) डीप लर्निंग मॉडल के साथ जोड़ता है, जिससे TESS डेटासेट पर 99% सटीकता प्राप्त होती है और यह एक क्लासिकल SVM बेसलाइन से बेहतर प्रदर्शन करता है।

मूल लेखक: Adelekun Oluwademilade, Ademola Adedamola, Abiola Abdulhakeem, Akinpelu Azeezat, Eraiyetan Israel, Omotosho Oluwadunsin, Ibenye Ikechukwu, Ayuba Muhammad, Olusanya Olamide, Kamorudeen Amuda

प्रकाशित 2026-04-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Adelekun Oluwademilade, Ademola Adedamola, Abiola Abdulhakeem, Akinpelu Azeezat, Eraiyetan Israel, Omotosho Oluwadunsin, Ibenye Ikechukwu, Ayuba Muhammad, Olusanya Olamide, Kamorudeen Amuda

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप केवल किसी की आवाज़ सुनकर यह अनुमान लगाने की कोशिश कर रहे हैं कि आपका दोस्त कैसा महसूस कर रहा है। आपको उनके शब्दों को सुनने की ज़रूरत नहीं है; आपको बस उनकी टोन (स्वर), लय (ताल), और ऊर्जा को सुनने की ज़रूरत है। यदि उनकी आवाज़ कांप रही है, तो वे डरे हुए हो सकते हैं। यदि उनकी आवाज़ तीखी और तेज़ है, तो वे क्रोधित हो सकते हैं।

यह शोध पत्र कंप्यूटर को ठीक यही करने के लिए सिखाने के बारे में है। शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जो किसी व्यक्ति की आवाज़ सुन सकता है और यह पता लगा सकता है कि वह खुश है, दुखी है, क्रोधित है, या सामान्य (न्यूट्रल) है, बिना भाषा को समझे।

इसे सरल तरीके से यहाँ समझाया गया है:

1. सामग्री: "आवाज़ का फिंगरप्रिंट" (MFCC)

सबसे पहले, कंप्यूटर को ध्वनि तरंगों (sound waves) को ऐसी चीज़ में बदलने की आवश्यकता है जिसे वह पढ़ सके। शोधकर्ताओं ने MFCC (मेल-फ्रीक्वेंसी सेप्सट्रल कोएफिशिएंट्स) नामक एक टूल का उपयोग किया।

MFCC को एक आवाज़ के फिंगरप्रिंट की तरह समझें। जिस तरह आपके फिंगरप्रिंट की रेखाएं और पैटर्न आपको पहचानते हैं, उसी तरह MFCC एक आवाज़ को संख्याओं के एक विशिष्ट सेट में तोड़ देता है जो उसके पिच, टोन और बनावट का वर्णन करते हैं। कंप्यूटर इन नंबरों को देखता है ताकि वह ध्वनि के "आकार" को समझ सके।

2. शिक्षक: "समय की यात्रा करने वाला छात्र" (LSTM)

असली जादू उस प्रकार के कंप्यूटर मस्तिष्क के साथ होता है जिसे LSTM (लॉन्ग शॉर्ट-टर्म मेमोरी) कहा जाता है।

एक छात्र की कल्पना करें जो परीक्षा दे रहा है।

  • पुराने ज़माने के कंप्यूटर उन छात्रों की तरह हैं जो कहानी का अंत बताने के लिए केवल आखिरी वाक्य को देखते हैं। वे संदर्भ (context) को भूल जाते हैं।
  • LSTM उस छात्र की तरह है जो पूरी कहानी याद रखता है। वह जानता है कि यदि कोई आवाज़ शांत शुरू होती है और फिर अचानक तेज़ और तेज़ हो जाती है, तो समय के साथ होने वाला वह बदलाव गुस्से का संकेत है। यदि आवाज़ ऊँची होकर नीचे गिरती है, तो वह उदासी हो सकती है।

LSTM विशेष है क्योंकि यह याद रख सकता है कि कुछ सेकंड पहले क्या हुआ था जबकि वह अभी हो रही चीज़ों को सुन रहा है। यह महत्वपूर्ण है क्योंकि भावनाएँ केवल एक क्षणिक तस्वीर नहीं हैं; वे एक यात्रा हैं जो समय के साथ प्रकट होती हैं।

3. अभ्यास का मैदान: "एक्टिंग क्लास" (TESS डेटासेट)

इस कंप्यूटर को सिखाने के लिए, शोधकर्ताओं ने TESS (टोरंटो इमोशनल स्पीच सेट) नामक एक डेटासेट का उपयोग किया।

  • अभिनेता: उन्होंने दो पेशेवर महिला अभिनेत्रियों की रिकॉर्डिंग का उपयोग किया।
  • स्क्रिप्ट: अभिनेत्रियों ने शब्दों की एक ही सूची (जैसे "take up") को सात अलग-अलग भावनात्मक "पोशाकों" में पढ़ा: क्रोध (Angry), घृणा (Disgust), भय (Fear), खुशी (Happy), सुखद आश्चर्य (Pleasant Surprise), दुख (Sad), और सामान्य (Neutral)।
  • लक्ष्य: कंप्यूटर को इन रिकॉर्डिंग को सुनना था और यह सीखना था कि आवाज़ कौन सी "पोशाक" पहने हुए है।

4. प्रशिक्षण: पैटर्न सीखना

शोधकर्ताओं ने कंप्यूटर में हज़ारों वॉइस क्लिप डालीं।

  1. तैयारी: उन्होंने ऑडियो को 3-सेकंड के साफ टुकड़ों में विभाजित किया और उन्हें उन "आवाज़ के फिंगरप्रिंटों" (MFCCs) में बदल दिया।
  2. पाठ: कंप्यूटर ने फिंगरप्रिंट के क्रम को देखा। उसने सीखा, "ओह, जब नंबर इस पैटर्न में तेज़ी से ऊपर-नीचे होते हैं, तो इसका मतलब आमतौर पर 'खुशी' होता है।"
  3. परीक्षण: उन्होंने कंप्यूटर का परीक्षण उन वॉइस क्लिप्स पर किया जिन्हें उसने पहले कभी नहीं देखा था।

5. परिणाम: एक लगभग सटीक स्कोर

परिणाम प्रभावशाली थे:

  • पुराना तरीका: उन्होंने पहले एक सरल, पुराने तरीके (जिसे SVM कहा जाता है) का उपयोग किया जो केवल आवाज़ के फिंगरप्रिंट के औसत को देखता था, समय (timing) को अनदेखा करता था। इसने 98% सही परिणाम दिया। यह पहले से ही बहुत अच्छा है!
  • नया तरीका: नए LSTM सिस्टम ने, जिसने आवाज़ के समय और प्रवाह को याद रखा, 99% सही परिणाम दिया।

यह शोध पत्र दिखाता है कि आवाज़ के साथ समय के साथ कैसे बदलाव आता है (एक धुन की तरह) उस पर ध्यान देकर, कंप्यूटर आवाज़ की एक स्थिर तस्वीर देखने की तुलना में भावना का अनुमान लगाने में थोड़ा बेहतर हो गया।

6. इसका क्या अर्थ है (और क्या नहीं)

शोध पत्र निष्कर्ष निकालता है कि यह विशिष्ट सेटअप उस "एक्टिंग क्लास" डेटा के लिए बहुत अच्छी तरह काम करता है जिसका उन्होंने उपयोग किया है।

  • इसका उपयोग कहाँ किया जा सकता है (शोध पत्र के अनुसार): लेखक सुझाव देते हैं कि यह बेहतर वर्चुअल असिस्टेंट (जैसे सिरी या एलेक्सा जो यह जान सकें कि आप कब निराश हैं) और मानसिक स्वास्थ्य निगरानी उपकरण (आवाज़ में संकट का पता लगाने के लिए) बनाने में मदद कर सकता है।
  • चुनौती: शोध पत्र स्वीकार करता है कि यह एक नियंत्रित वातावरण में साफ रिकॉर्डिंग और पेशेवर अभिनेताओं के साथ किया गया था। वास्तविक दुनिया में, बैकग्राउंड शोर, विभिन्न लहजों या लोगों के स्वाभाविक रूप से बोलने के साथ, यह सिस्टम अभी उतना सटीक नहीं हो सकता है।

संक्षेप में: शोधकर्ताओं ने कंप्यूटर को शब्दों के बजाय आवाज़ की "संगीत" को सुनने के लिए सिखाया। समय के साथ होने वाले परिवर्तनों को ट्रैक करने वाले एक स्मार्ट मेमोरी सिस्टम का उपयोग करके, उन्होंने एक ऐसा टूल बनाया जो अपने टेस्ट डेटा पर 99% सटीकता के साथ मानवीय भावनाओं का अनुमान लगा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →