← नवीनतम पेपर
🤖 AI

Classification of systolic murmurs in heart sounds using multiresolution complex Gabor dictionary and vision transformer

यह शोध पत्र एक स्वचालित सिस्टोलिक मर्मर वर्गीकरण प्रणाली प्रस्तावित करता है जो फीचर निष्कर्षण के लिए मल्टीरेज़ोल्यूशन कॉम्प्लेक्स गैबोर डिक्शनरी के साथ कॉम्प्लेक्स ऑर्थोगोनल मैचिंग पजर्ट का उपयोग करता है और वर्गीकरण के लिए विजन ट्रांसफार्मर का उपयोग करता है, जिससे CirCor DigiScope डेटासेट पर 95.96% सटीकता प्राप्त होती है।

मूल लेखक: Mahmoud Fakhry, Abeer FathAllah Brery

प्रकाशित 2026-04-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mahmoud Fakhry, Abeer FathAllah Brery

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़ी तस्वीर: दिल की "गूँज" को सुनना

कल्पना कीजिए कि आपका हृदय एक व्यस्त ऑर्केस्ट्रा है। जब सब कुछ तालमेल में बजता है, तो संगीत एक स्थिर, लयबद्ध धुन होती है। लेकिन कभी-कभी, एक वाल्व थोड़ा ढीला हो जाता है या एक पाइप थोड़ा संकरा हो जाता है। इससे रक्त एक सुचारू प्रवाह के बजाय "शूश" या "हिस" की आवाज़ के साथ बहने लगता है। चिकित्सा विज्ञान में, इसे मर्मर (murmur) कहा जाता है।

डॉक्टर सदियों से स्टेथोस्कोप के साथ इन आवाज़ों को सुनते आ रहे हैं, लेकिन केवल सुनकर यह बताना मुश्किल होता है कि वास्तव में क्या गलत है। क्या यह "डायमंड" (हीरे) के आकार की ध्वनि है? एक "प्लेटो" (सपाट)? या "क्रेसेंडो" (बढ़ती हुई)? यह शोर भरी भीड़ में केवल सुनकर एक विशिष्ट वाद्य यंत्र की पहचान करने जैसा है।

यह शोध पत्र एक नया AI जासूस पेश करता है जो इन हृदय ध्वनियों को सुन सकता है, उन्हें छोटे-छोटे पहेली के टुकड़ों में तोड़ सकता है, और अविश्वसनीय सटीकता (लगभग 96%) के साथ यह पता लगा सकता है कि किस प्रकार का मर्मर है।


चरण 1: "जादुई शब्दकोश" (फीचर एक्सट्रैक्शन)

पहला मुद्दा जिसका शोधकर्ताओं ने सामना किया वह यह था कि हृदय की ध्वनियाँ बहुत अव्यवस्थित होती हैं। वे तेज़ी से बदलती हैं, और वे केवल साधारण तरंगें नहीं हैं। यदि आप मानक उपकरणों (जैसे एक बुनियादी रेडियो ट्यूनर) के साथ उनका विश्लेषण करने का प्रयास करते हैं, तो आप विवरण चूक जाते हैं।

समाधान: मल्टीरेज़ोल्यूशन गैबोर डिक्शनरी (Multiresolution Gabor Dictionary)
कल्पना कीजिए कि आपके पास "ध्वनि के निर्माण खंडों" (sound building blocks) का एक विशाल पुस्तकालय है। कुछ ब्लॉक छोटे और तीखे हैं (तेज़ बदलावों को पकड़ने के लिए अच्छे हैं), और कुछ लंबे और सुरीले हैं (गहरी ध्वनियों को पकड़ने के लिए अच्छे हैं)।

  • उपमा: इसे ध्वनि का स्विस आर्मी नाइफ (Swiss Army Knife) समझें। केवल एक उपकरण का उपयोग करने के बजाय, इस प्रणाली में 8 अलग-अलग "आकार" के उपकरण हैं। यह कॉम्प्लेक्स ऑर्थोगोनल मैचिंग पजर्ट (Complex Orthogonal Matching Pursuit) नामक एक गणितीय तकनीक का उपयोग करता है (जो "स्मार्ट मैचिंग" कहने का एक फैंसी तरीका है) ताकि उन ब्लॉक्स का सही संयोजन पाया जा सके जो हृदय की ध्वनि का पुनर्निर्माण कर सकें।
  • ट्विस्ट: शोधकर्ताओं ने केवल एक साउंड क्लिप नहीं देखी। उन्होंने एक ही हृदय रिकॉर्डिंग से कई क्लिप्स देखीं। उन्होंने सिस्टम को सभी के लिए एक ही सेट के निर्माण खंडों का उपयोग करने के लिए मजबूर किया।
  • यह क्यों मायने रखता है: कल्पना कीजिए कि आप अपने दोस्त की आवाज़ पहचानने की कोशिश कर रहे हैं। यदि आप उन्हें एक बार फुसफुसाते हुए और एक बार चिल्लाते हुए सुनते हैं, तो यह अलग लगता है। लेकिन यदि आप महसूस करते हैं, "ओह, वे दोनों मामलों में एक ही शब्दावली का उपयोग कर रहे हैं," तो आप उन्हें बेहतर तरीके से पहचान सकते हैं। यह "साझा शब्दकोश" वाला तरीका AI को शोर को अनदेखा करने और मर्मर के वास्तविक आकार पर ध्यान केंद्रित करने में मदद करता है।

चरण 2: ध्वनि को "मानचित्र" में बदलना (रीशेपिंग)

एक बार जब AI ने ध्वनि को उसके निर्माण खंडों के साथ मिला लिया, तो उसके पास संख्याओं की एक लंबी सूची होती है। वह उबाऊ है और कंप्यूटर के लिए उसे विज़ुअलाइज़ करना कठिन है।

समाधान: टाइम-फ्रीक्वेंसी मैप (Time-Frequency Map)
शोधकर्ताओं ने उन संख्याओं को लिया और उन्हें 2D चित्रों (मैट्रिक्स) के रूप में पुनर्गठित किया।

  • उपमा: कल्पना कीजिए कि आप फिल्म की एक लंबी पट्टी को एक ग्रिड में मोड़ रहे हैं। अब, एक रेखा के बजाय, आपके पास एक मानचित्र है। इस मानचित्र पर, क्षैज़ अक्ष (horizontal axis) समय (Time) है (ध्वनि कब हुई) और ऊर्ध्वाधर अक्ष (vertical axis) आवृत्ति (Frequency) है (पिच कितनी ऊँची या नीची थी)।
  • क्योंकि उन्होंने चरण 1 से प्राप्त "8 अलग-अलग आकारों" के उपकरणों का उपयोग किया, इसलिए उनके पास प्रत्येक हृदय ध्वनि के लिए 8 अलग-अलग मानचित्र थे। कुछ मानचित्र समय पर ज़ूम इन करते हैं (तेज़ स्पाइक्स देखना), और अन्य आवृत्ति पर ज़ूम इन करते हैं (गहरी ध्वनियों को देखना)।

चरण 3: "सुपर-रीडर" (विज़न ट्रांसफॉर्मर)

अब AI के पास 8 अलग-अलग मानचित्र हैं। वह उन्हें कैसे पढ़ता है?

समाधान: विज़न ट्रांसफॉर्मर (Vision Transformer - ViT)
आमतौर पर, कंप्यूटर छवियों को देखने के लिए "कन्वोल्यूशनल न्यूरल नेटवर्क" (CNN) का उपयोग करते हैं। ये किनारों और आकारों को पहचानने में बेहतरीन हैं, लेकिन इन्हें "टनल विजन" हो सकता है—यानी ये बड़ी तस्वीर को मिस कर सकते हैं।

  • उपमा: एक CNN को एक ऐसे व्यक्ति के रूप में सोचें जो एक छोटी नली के माध्यम से पेंटिंग को देख रहा है। वे एक छोटे से विवरण को बहुत स्पष्ट रूप से देखते हैं लेकिन उन्हें नहीं पता कि वह बाकी पेंटिंग के साथ कैसे फिट बैठता है।
  • विज़न ट्रांसफॉर्मर पूरी पेंटिंग को एक साथ देखते हुए खड़े व्यक्ति की तरह है। यह सेल्फ-अटेंशन (Self-Attention) नामक तंत्र का उपयोग करता है।
  • यह कैसे काम करता है: AI एक मानचित्र पर "डायमंड" आकार को देखता है और तुरंत पूछता है, "क्या यह दूसरे मानचित्र पर 'प्लेटो' आकार से जुड़ता है?" यह पूरी छवि में बिंदुओं को जोड़ता है, वैश्विक संदर्भ (global context) को समझता है। यह एक ऐसे जासूस की तरह है जो केवल एक सुराग को नहीं देखता बल्कि यह देखता है कि कमरे में हर सुराग दूसरे सुराग से कैसे संबंधित है।

परिणाम: एक उच्च स्कोर करने वाला जासूस

शोधकर्ताओं ने इस प्रणाली का परीक्षण हृदय ध्वनियों के एक विशाल डेटाबेस (CirCor DigiScope डेटासेट) पर किया जिसमें चार प्रकार के मर्मर शामिल थे:

  1. डायमंड (Diamond): धीरे शुरू होता है, तेज़ होता है, फिर धीरे होता है।
  2. प्लेटो (Plateau): तेज़ और स्थिर रहता है।
  3. डिक्रिसेंडो (Decrescendo): तेज़ शुरू होता है और फिर कम होता जाता है।
  4. क्रेसेंडो (Crescendo): धीरे शुरू होता है और तेज़ होता जाता है।

स्कोर:
सिस्टम ने 95.96% बार सही पहचान की।

  • यह विशेष रूप से "डायमंड" और "प्लेटो" प्रकारों को पहचानने में बहुत अच्छा था (98% से अधिक सटीकता)।
  • दुर्लभ और कठिन "क्रेसेंडो" प्रकार के लिए भी (जिसके डेटा में बहुत कम उदाहरण थे), यह आधे से अधिक बार सही होने में सफल रहा, जो दुर्लभ बीमारियों से निपटने वाले AI के लिए एक बड़ी जीत है।

यह क्यों मायने रखता है

  1. यह मजबूत (Robust) है: "साझा शब्दकोश" वाले तरीके का उपयोग करके, सिस्टम इस तथ्य को संभालता है कि हृदय की ध्वनियाँ व्यक्ति दर व्यक्ति भिन्न होती हैं।
  2. यह स्मार्ट है: CNN की "स्थानीय विवरण" क्षमता को ट्रांसफॉर्मर के "बड़ी तस्वीर" वाले दृष्टिकोण के साथ जोड़कर, यह जंगल और पेड़ों दोनों को देखता है।
  3. भविष्य: इससे एक स्मार्टफोन ऐप या एक सरल उपकरण बन सकता है जिसका उपयोग दूरदराज के गाँव में रहने वाला डॉक्टर हृदय के वाल्व की समस्याओं का तुरंत निदान करने के लिए कर सकता है, जिससे शुरुआती चरणों में समस्याओं को पकड़कर जीवन बचाया जा सकता है।

संक्षेप में: शोधकर्ताओं ने एक सुपर-स्मार्ट AI बनाया है जो अव्यवस्थित हृदय ध्वनियों को विस्तृत 8-स्तरीय मानचित्रों में अनुवाद करता है, और फिर एक "सुपर-रीडर" का उपयोग करके एक साथ पूरी तस्वीर को देखता है, जिससे लगभग पूर्ण सटीकता के साथ हृदय की समस्याओं की पहचान होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →