Explainable machine learning-assisted differentiation of brucellosis from tuberculosis via routine blood biomarkers
इस अध्ययन ने प्राथमिक देखभाल सेटिंग्स में ब्रुसेलोसिस और तपेदिक (तपेदिक) के बीच सटीक अंतर करने के लिए व्यवसाय इतिहास, ALT और GGT स्तरों का उपयोग करते हुए एक लागत प्रभावी, तीन-चरणीय रैंडम फॉरेस्ट मॉडल विकसित और मान्य किया है, जिसने अधिक जटिल मॉडलों के तुलनीय मजबूत प्रदर्शन हासिल किया है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
दुनिया के कई हिस्सों में, विशेष रूप से मध्य एशिया के पशुपालक क्षेत्रों में, दो अलग-अलग जीवाणु संक्रमण अक्सर क्लिनिक के दरवाजे पर बिल्कुल एक जैसे दिखते हुए आते हैं। एक ब्रुसेलोसिस (brucellosis) है, जो भेड़ और मवेशियों जैसे जानवरों से होने वाली बीमारी है, और दूसरा तपेदिक (tuberculosis) है, जो एक श्वसन संक्रमण है जिसने सदियों से मानवता को परेशान किया है। दोनों ही मामलों में रोगी को बुखार, रात में पसीना आना, जोड़ों का दर्द और वजन घटने जैसे लक्षण महसूस हो सकते हैं। चूंकि उनके लक्षण बहुत अधिक मिलते-जुलते हैं, इसलिए प्राथमिक चिकित्सा केंद्रों में डॉक्टरों को उनके बीच अंतर करने में अक्सर संघर्ष करना पड़ता है। निदान की पुष्टि करने के तरीके, जैसे कि लैब में बैक्टीरिया को उगाना, उन्हें विकसित करने में हफ्तों या महीनों लग सकते हैं, और ये परीक्षण हमेशा सफल नहीं होते हैं। यह देरी खतरनाक है; गलत बीमारी का इलाज करने से गंभीर जटिलताएं हो सकती हैं, और बहुत अधिक प्रतीक्षा करने से संक्रमण शरीर में गहराई तक घर कर सकता है। उन स्थानों पर जहां उन्नत चिकित्सा उपकरण दुर्लभ हैं, इन दोनों बीमारियों के बीच अंतर करने के लिए एक त्वरित, सस्ता और विश्वसनीय तरीका खोजना एक महत्वपूर्ण आवश्यकता है।
इस चुनौती का समाधान करने के लिए, शिनजियांग, चीन के शोधकर्ताओं की एक टीम ने कंप्यूटर विज्ञान के एक क्षेत्र, जिसे मशीन लर्निंग (machine learning) कहा जाता है, की ओर रुख किया। यह दृष्टिकोण कंप्यूटर को डेटा के बड़े सेट में उन जटिल पैटर्न को खोजने की अनुमति देता है जिन्हें मानवीय आँखें नहीं देख पाती हैं। शोधकर्ताओं ने सैकड़ों रोगियों के मेडिकल रिकॉर्ड एकत्र किए जिन्हें या तो ब्रुसेलोसिस या तपेदिक से निदान किया गया था। उन्होंने उस जानकारी पर ध्यान केंद्रित किया जो लगभग हर अस्पताल में पहले से उपलब्ध है: नियमित रक्त परीक्षण और रोगी के व्यवसाय के बारे में एक सरल प्रश्न। वे यह देखना चाहते थे कि क्या एक कंप्यूटर उन रोजमर्रा के नंबरों में सूक्ष्म अंतरों को पहचान सकता है जो संकेत देते हैं कि रोगी को कौन सी बीमारी है, बिना किसी महंगे या समय लेने वाले विशेष परीक्षणों के।
टीम ने 273 रोगियों का डेटा एकत्र करके शुरुआत की, यह सुनिश्चित करते हुए कि ब्रुसेलोसिस वाले समूह और तपेदिक वाले समूह की आयु और लिंग समान हो ताकि तुलना निष्पक्ष हो सके। उन्होंने पैंतीस अलग-अलग जानकारियों को देखा, जिसमें सफेद रक्त कोशिकाओं की संख्या से लेकर यकृत (liver) के विभिन्न प्रोटीनों के स्तर तक शामिल थे। फिर उन्होंने इस डेटा को चार अलग-अलग प्रकार के मशीन लर्निंग एल्गोरिदम में डाला, जो वास्तव में पैटर्न खोजने के अलग-अलग गणितीय तरीके हैं। लक्ष्य यह देखना था कि कौन सा तरीका रोगियों को सही बीमारी की श्रेणी में सबसे सटीक रूप से वर्गीकृत कर सकता है। मॉडलों के परीक्षण और सुधार के बाद, शोधकर्ताओं ने पाया कि एक विशिष्ट एल्गोरिदम, जिसे रैंडम फॉरेस्ट (random forest) के रूप में जाना जाता है, सबसे अच्छा प्रदर्शन करता है। इसने अन्य तरीकों की तुलना में उच्च सटीकता के साथ दोनों बीमारियों के बीच सफलतापूर्वक अंतर किया।
हालाँकि, एक कंप्यूटर मॉडल जो अच्छा काम करता है, वह तब तक पर्याप्त नहीं है जब तक कि डॉक्टर यह न समझ सकें कि वह एक निश्चित निर्णय क्यों ले रहा है। इसे हल करने के लिए, शोधकर्ताओं ने SHAP विश्लेषण नामक एक तकनीक का उपयोग किया, जो एक स्पॉटलाइट की तरह काम करता है और यह दिखाता है कि कंप्यूटर के चुनाव के लिए कौन सी विशिष्ट जानकारियां सबसे महत्वपूर्ण थीं। उन्होंने पाया कि मॉडल मुख्य रूप से तीन कारकों पर निर्भर था: रोगी का व्यवसाय, और उनके रक्त में दो विशिष्ट लिवर एंजाइमों का स्तर। पहला कारक यह था कि क्या रोगी किसान या चरवाहा था। अन्य दो कारक एलेनिन एमिनोट्रांस्फेरेज (alanine aminotransferase), जिसे अक्सर ALT कहा जाता है, और गामा-ग्लूटामिल ट्रांसफेरेज (gamma-glutamyl transferase), या GGT के स्तर थे। विश्लेषण से पता चला कि जो रोगी पशुधन के साथ काम करते थे और जिनमें इन दो लिवर एंजाइमों का स्तर अधिक था, उनमें ब्रुसेलोसिस होने की संभावना बहुत अधिक थी। इसके विपरीत, जिन रोगियों में इन एंजाइमों का स्तर कम था और जिनका खेती-बाड़ी से कोई संबंध नहीं था, उनमें तपेदिक होने की संभावना अधिक थी।
शोधकर्ताओं ने केवल इन तीन कारकों का उपयोग करके अपने मॉडल का एक सरल संस्करण बनाया। वे यह सिद्ध करना चाहते थे कि उन्हें अच्छे परिणाम प्राप्त करने के लिए पैंतीस चरों की जटिल सूची की आवश्यकता नहीं है। जब उन्होंने इस सुव्यवस्थित मॉडल का परीक्षण किया, तो इसने अपने पूर्ण, जटिल संस्करण की सटीकता का नब्बे प्रतिशत से अधिक हिस्सा बनाए रखा। इसका अर्थ यह है कि एक डॉक्टर यकृत कार्य के लिए एक मानक रक्त परीक्षण देखकर और रोगी से उसके काम के बारेв बारे में पूछकर संभावित रूप से एक अत्यधिक सूचित अनुमान लगा सकता है। यह सुनिश्चित करने के लिए कि यह खोज कोई संयोग नहीं है, टीम ने एक अलग समय अवधि के रोगियों के एक नए समूह पर अपने सरल मॉडल का परीक्षण किया। मॉडल ने इस नए समूह पर भी उतना ही अच्छा प्रदर्शन किया, और अधिकांश मामलों में बीमारी की सही पहचान की, जिससे यह सिद्ध हुआ कि नए डेटा पर लागू होने पर भी इस पर भरोसा किया जा सकता है।
इन निष्कर्षों के पीछे का जैविक कारण इस बात को देखते हुए समझ में आता है कि ये दोनों बैक्टीरिया मानव शरीर के भीतर कैसे व्यवहार करते हैं। ब्रुसेला, जो ब्रुसेलोसिस का कारण बनता है, में यकृत और उसके भीतर की प्रतिरक्षा कोशिकाओं पर आक्रमण करने की प्रबल प्रवृत्ति होती है, जिससे सूजन और क्षति होती है जो रक्त में ALT और GGT के स्तर को बढ़ा देती है। दूसरी ओर, तपेदिक मुख्य रूप से फेफड़ों को प्रभावित करता है और यकृत को कम सीधा नुकसान पहुँचाता है, जिसके परिणामस्वरूप इन विशिष्ट एंजाइमों का स्तर कम रहता है। खेती और पशुपालन से जुड़ाव भी स्पष्ट है, क्योंकि इन व्यवसायों में उन जानवरों के साथ निकट संपर्क शामिल है जो इस बैक्टीरिया को वहन करते हैं। मशीन लर्निंग की शक्ति को इस जैविक वास्तविकता के साथ जोड़कर, शोधकर्ताओं ने एक ऐसा उपकरण बनाया जो वैज्ञानिक रूप से सुदृढ़ और व्यावहारिक रूप से उपयोगी है।
यह अध्ययन प्रदर्शित करता है कि सीमित संसाधनों वाले क्षेत्रों के लिए एक कम लागत वाला, आसानी से उपयोग किया जाने वाला नैदानिक सहायक उपकरण संभव है। इस उपकरण के लिए किसी नए उपकरण या महंगे अभिकर्मकों (reagents) की आवश्यकता नहीं है; यह केवल नियमित रक्त कार्य की पुनर्व्याख्या करता है जो पहले से ही किया जा रहा है। शोधकर्ताओं ने पुष्टि की कि उनका सरल मॉडल न केवल सटीक है बल्कि स्थिर भी है, जिसका अर्थ है कि यह निरंतर परिणाम देता है। हालांकि यह अध्ययन एक एकल अस्पताल में किया गया था और इसे पूरी तरह से सिद्ध करने के लिए अन्य स्थानों पर और अधिक परीक्षण की आवश्यकता है, लेकिन इसके परिणाम एक आशाजनक मार्ग प्रदान करते हैं। प्राथमिक देखभाल के डॉक्टरों के लिए, यह दृष्टिकोण एक मरीज को सही उपचार जल्दी मिलने या निदान में देरी के कारण कष्ट सहने के बीच का अंतर हो सकता है। यह एक जटिल चिकित्सा समस्या को रोजमर्रा के तथ्यों पर आधारित एक सरल गणना में बदल देता है, जो उन क्षेत्रों में सार्वजनिक स्वास्थ्य की रक्षा करने का एक नया तरीका प्रदान करता है जहाँ ये दोनों बीमारियाँ आम हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।