← नवीनतम पेपर
🤖 AI

Lung-SRAD: Spectral-Aware Regularized Audio DASS with Dual-Axis Patch-Mix Contrastive Learning for Respiratory Sound Classification

यह शोधपत्र Lung-SRAD को प्रस्तुत करता है, जो एक श्वसन ध्वनि वर्गीकरण ढांचा (framework) है जो पारंपरिक ट्रांसफार्मर-आधारित दृष्टिकोणों की लो-पास फ़िल्टरिंग सीमाओं को दूर करने के लिए स्पेक्ट्रल-अवेयर रेगुलराइजेशन और ड्यूल-एक्सिस पैच-मिक्स कंट्रास्टिव लर्निंग के साथ स्टेट स्पेस मॉडल्स का लाभ उठाता है, जिससे ICBHI बेंचमार्क पर 64.48% का स्कोर प्राप्त होता है।

मूल लेखक: Hemansh Shridhar, Miika Toikkanen, June-Woo Kim

प्रकाशित 2026-06-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hemansh Shridhar, Miika Toikkanen, June-Woo Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़ी तस्वीर: फेफड़ों की आवाज़ सुनना

कल्पना कीजिए कि एक डॉक्टर मरीज की सांसों को सुनकर उसका निदान करने की कोशिश कर रहा है। डॉक्टर कुछ विशिष्ट, पेचीदा आवाजों की तलाश में है जैसे कि क्रैकल्स (जैसे वेल्क्रो को अलग करने की आवाज़) या व्हीज़ (एक उच्च-पिच वाली सीटी जैसी आवाज़)। ये आवाजें छोटी, तीखी होती हैं और बहुत ही विशिष्ट स्थानों पर होती हैं।

लंबे समय से, कंप्यूटरों ने यह काम करने की कोशिश की है, जिसमें एक प्रकार के AI का उपयोग किया जाता है जिसे ट्रांसफॉर्मर (विशेष रूप से ऑडियो स्पेक्ट्रोग्राम ट्रांसफॉर्मर, या AST) कहा जाता है। ट्रांसफॉर्मर को एक बहुत ही बुद्धिमान श्रोता के रूप में समझें जो ध्वनि के "बड़े चित्र" (big picture) पर ध्यान केंद्रित करता है। यह ध्वनि के समग्र मिजाज को समझने में बहुत अच्छा है, लेकिन यह अक्सर सूक्ष्म, तीखे विवरणों को धुंधला (smooth out) कर देता है।

समस्या: पेपर का तर्क है कि यह "स्मूथिंग" (धुंधलापन) एक विशेषता नहीं, बल्कि एक खामी है। जब AI एक साथ पूरे कमरे को सुनने की कोशिश करता है, तो वह अनजाने में उन तीखी, स्थानीय क्रैकल्स और व्हीज़ को फिल्टर कर देता है, और उन्हें बैकग्राउंड शोर समझकर छोड़ देता है।

समाधान: एक नए प्रकार का श्रोता (SSM)

लेखकों ने एक अलग प्रकार के AI बैकबोन को आज़माने का निर्णय लिया जिसे स्टेट स्पेस मॉडल (SSM) कहा जाता है, विशेष रूप से DASS नामक एक संस्करण।

  • उपमा (Analogy): यदि ट्रांसफॉर्मर एक हेलीकॉप्टर से नक्शे को देखने जैसा है (जो पूरे जंगल को देख सकता है लेकिन व्यक्तिगत पत्तियों को मिस कर देता है), तो SSM जंगल में पैदल चलने वाले एक हाइकर (हाइकर) की तरह है। हाइकर गुजरते समय हर एक टहनी और पत्ते पर ध्यान देता है।
  • खोज: शोधकर्ताओं ने विश्लेषण किया कि SSM ध्वनि को कैसे "सुनता" है। उन्होंने पाया कि ट्रांसफॉर्मर के विपरीत, SSM उन तीखी, उच्च-आवृत्ति (high-frequency) वाली बारीकियों को अनदेखा नहीं करता है। यह असामान्य ध्वनियों की "क्रंची" बनावट को बरकरार रखता है।

दो अपग्रेड (उन्होंने इसे बेहतर कैसे बनाया)

भले ही SSM एक अच्छा श्रोता था, लेखकों को एहसास हुआ कि यह सूक्ष्म विवरणों को लेकर बहुत अधिक उत्साहित हो सकता है, जिससे कभी-कभी यह रैंडम शोर से भी भ्रमित हो जाता है। इसे ठीक करने के लिए उन्होंने दो विशेष उपकरण जोड़े:

1. विशिष्ट परतों (Layers) के लिए "गौसियन ब्लर"

  • समस्या: कभी-कभी SSM तीखे किनारों पर बहुत अधिक ध्यान केंद्रित करता है, जिससे उसे लगता है कि एक रैंडम खांसी भी कोई बीमारी है।
  • समाधान: उन्होंने एक "गौसियन स्मूथिंग" फ़िल्टर लागू किया, लेकिन केवल AI के मस्तिष्क के विशिष्ट हिस्सों (मध्यम परतों) पर।
  • उपमा: कल्पना कीजिए कि आप एक बहुत ही दानेदार (grainy), हाई-कॉन्ट्रास्ट ब्लैक-एंड-व्हाइट फोटो देख रहे हैं। यह इतना शार्प है कि आपकी आँखों में चुभ रहा है। लेखकों ने एक नरम, स्पष्ट कांच लिया और उसे केवल फोटो के उन हिस्सों पर रखा जो बहुत अधिक दानेदार थे। इसने महत्वपूर्ण विवरणों को धुंधला किए बिना शोर को स्मूथ कर दिया। इससे AI को गलत अनुमान लगाने से रोकने में मदद मिली (जिससे "विशिष्टता" या Specificity में सुधार हुआ)।

2. "डुअल-एक्सिस पैच-मिक्स" गेम

  • समस्या: AI को मजबूत बनाने के लिए, आप आमतौर पर ध्वनि के हिस्सों को मिला देते हैं (जैसे ताश के पत्तों को फेंटना) ताकि वह जंबल होने पर भी ध्वनि को पहचानना सीख सके। लेकिन SSM एक ट्रैक पर चलने वाली ट्रेन की तरह है; यदि आप ट्रैक को रैंडम तरीके से इधर-उधर करते हैं, तो ट्रेन पटरी से उतर जाएगी।
  • समाधान: उन्होंने डुअल-एक्सिस पैच-मिक्स नामक एक नया मिक्सिंग गेम बनाया।
  • उपमा: ध्वनि का प्रतिनिधित्व करने वाली टाइल्स के ग्रिड की कल्पना करें।
    • पुराने तरीके कहीं से भी रैंडम टाइल्स उठाते और बदलते थे, जिससे ट्रेन के ट्रैक टूट जाते थे।
    • नया तरीका केवल क्षैतिज पट्टियों (समय/time) या लंबवत पट्टियों (आवृत्ति/frequency) को बदलता है। यह टाइल्स की एक पंक्ति को बाएं या दाएं खिसकाने, या एक कॉलम को ऊपर या नीचे खिसकाने जैसा है। "ट्रैक" जुड़े रहते हैं, लेकिन फिर भी AI को यह समझने के लिए कड़ी मेहनत करनी पड़ती है कि ध्वनि क्या है। यह AI को बहुत स्मार्ट और विश्वसनीय बनाता है।

परिणाम

टीम ने अपने नए सिस्टम, जिसे Lung-SRAD कहा जाता है, का परीक्षण सांस लेने की आवाजों के एक मानक डेटासेट (ICBHI) पर किया।

  • स्कोर: उन्होंने 64.48% का स्कोर प्राप्त किया।
  • तुलना: इसने पिछले सर्वश्रेष्ठ तरीके (ट्रांसफॉर्मर-आधारित) को 5% से पीछे छोड़ दिया।
  • यह क्यों मायने रखता है: उन्होंने केवल उच्च स्कोर ही नहीं प्राप्त किया; उन्होंने एक बेहतर संतुलन भी पाया। AI बीमार फेफड़ों की सही पहचान करने और स्वस्थ फेफड़ों की सही पहचान करने, दोनों में बेहतर हो गया, बिना शोर से भ्रमित हुए।

सारांश

पेपर कहता है: "हमने पाया कि पुराने AI मॉडल दुनिया को बहुत अधिक स्मूथ (धुंधला) करने में बहुत अच्छे थे, जिससे वे फेफड़ों की बीमारियों की सूक्ष्म, महत्वपूर्ण आवाजों को मिस कर देते थे। हमने एक नए मॉडल (SSM) पर स्विच किया जो विवरणों को बेहतर देखता है, शोर से भ्रमित होने से बचने के लिए एक 'सॉफ्टनर' जोड़ा, और एक नया प्रशिक्षण तरीका बनाया जो ध्वनि के प्रसंस्करण का सम्मान करता है। परिणाम एक स्मार्ट, अधिक सटीक लंग क्लासिफायर है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →