← नवीनतम पेपर
📄 medicine

Accelerating Machine Learning in Healthcare: Addressing the Labelling Bottleneck

यह अध्ययन प्रदर्शित करता है कि विशेषज्ञ-लेबल वाले सीड सेट्स और एक्टिव लर्निंग का लाभ उठाने वाला एक चरणबद्ध, सेल्फ-बूटस्ट्रैपिंग लेबलिंग पाइपलाइन, रैंडम सैंपलिंग की तुलना में दुर्लभ पेडियाट्रिक जंक्शनल एक्टोपिक टैकीकार्डिया मामलों को लगभग 15 गुना समृद्ध कर सकता है, जिससे स्वास्थ्य सेवा में मशीन लर्निंग के लिए दुर्लभ नैदानिक एनोटेशन संसाधनों का उपयोग महत्वपूर्ण रूप से अनुकूलित किया जा सकता है।

मूल लेखक: Spencer Vecile, William Dixon, Azadeh Assadi, Michael Kim, Robert Greer, Asad Siddiqui, Daniel Ehrmann, Andrew Goodwin, Danny Eytan, Mjaye Mazwi, Anica Bulic, Sebastian D. Goodfellow

प्रकाशित 2026-09-10
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Spencer Vecile, William Dixon, Azadeh Assadi, Michael Kim, Robert Greer, Asad Siddiqui, Daniel Ehrmann, Andrew Goodwin, Danny Eytan, Mjaye Mazwi, Anica Bulic, Sebastian D. Goodfellow

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बाल चिकित्सा गहन देखभाल इकाई (पीडियाट्रिक इंटेंसिव केयर यूनिट) के उच्च-जोखिम वाले वातावरण में, जहाँ बच्चे जटिल हृदय सर्जरी से उबरते हैं, समय सबसे महत्वपूर्ण संसाधन है। हृदय की लय अचानक बदल सकती है, और जब ऐसा होता है, तो इसके परिणाम गंभीर हो सकते हैं। डॉक्टर इन खतरनाक परिवर्तनों को जल्दी पकड़ने के लिए निरंतर निगरानी पर भरोसा करते हैं, लेकिन बेडसाइड मॉनिटरों द्वारा उत्पन्न डेटा की विशाल मात्रा अत्यधिक बोझिल होती है। दशकों से, शोधकर्ताओं ने कंप्यूटर को इन अनियमित धड़कनों को स्वचालित रूप से पहचानने के लिए प्रशिक्षित करने की कोशिश की है, इस उम्मीद में कि वे चिकित्सकों को एक ऐसी दूसरी जोड़ी आँखें दे सकें जो कभी झपकती नहीं। हालाँकि, एक बड़ी बाधा हमेशा रास्ते में खड़ी रही है: कंप्यूटर को सिखाने के लिए, आपको पहले उसे उदाहरण दिखाने होंगे, और उन उदाहरणों को खोजना अविश्वसनीय रूप से कठिन है। अधिकांश मौजूदा कंप्यूटर प्रोग्राम वयस्कों के डेटा पर प्रशिक्षित थे, जो बच्चों की अद्वितीय हृदय लय से मेल नहीं खाता है, और वे जटिल, बारह-लीड (twelve-lead) हृदय रिकॉर्डिंग पर निर्भर करते हैं जिनका उपयोग बीमार बच्चे की निरंतर, वास्तविक समय की निगरानी में शायद ही कभी किया जाता है। सबसे खतरनाक हृदय लय भी सबसे दुर्लभ होती हैं, जिसका अर्थ है कि यदि कोई डॉक्टर हृदय मॉनिटर रिकॉर्डिंग के हजारों घंटों को बेतरतीब ढंग से स्कैन करता है, तो वे उस विशिष्ट समस्या के केवल कुछ मिनटों को खोजने के लिए कई दिन बिता सकते हैं जिसका उन्हें अध्ययन करने की आवश्यकता है।

टोरंटो में 'द हॉस्पिटल फॉर सिक चिल्ड्रन' के शोधकर्ताओं की एक टीम ने, सिएटल, मिशिगन और इज़राइल के सहयोगियों के साथ मिलकर, इस समस्या को हल करने का प्रयास किया कि कैसे इस घास के ढेर में सुई को खोजा जाए। उन्होंने केवल अधिक डेटा एकत्र नहीं किया; इसके बजाय, उन्होंने उस विशिष्ट हृदय लय को खोजने का एक स्मार्ट तरीका बनाया जिसकी उन्हें अध्ययन करने की आवश्यकता थी। उन्होंने एक विशाल डिजिटल संग्रह से शुरुआत की जिसमें 9,000 से अधिक बच्चों के हृदय मॉनिटर रिकॉर्डिंग के 1.6 मिलियन घंटों से अधिक के घंटे शामिल थे। यह संग्रह, जिसे 'एट्रियमडीबी' (AtriumDB) के रूप में जाना जाता है, जानकारी का एक खजाना था, लेकिन इसमें से लगभग सभी अनलेबल (unlabeled) थे, जिसका अर्थ था कि अभी तक किसी ने कंप्यूटर को यह नहीं बताया था कि प्रत्येक धड़कन क्या दर्शाती है। शोधकर्ताओं के सामने एक विकल्प था: वे व्यस्त डॉक्टरों से इस डेटा को बेतरतीब ढंग से स्कैन करने के लिए कह सकते थे, जो एक धीमी और अक्षम प्रक्रिया थी, या वे एक ऐसी प्रणाली बना सकते थे जो डॉक्टरों को दुर्लभ, खतरनाक लय को बहुत तेज़ी से खोजने में मदद करे। उन्होंने दूसरा रास्ता चुना, एक चरण-दर-चरण प्रक्रिया विकसित की जो मानव विशेषज्ञों से शुरू हुई और धीरे-धीरे एक कंप्यूटर सहायक को खोज का मार्गदर्शन करने के लिए पेश किया गया।

प्रक्रिया की शुरुआत सबसे पारंपरिक तरीके से हुई: पुराने मेडिकल रिकॉर्ड्स को देखना। टीम ने ऐसे उदाहरण खोजे जहाँ एक बच्चे का अस्पताल की लैब में औपचारिक, बारह-लीड हृदय परीक्षण किया गया था, जिसने एक पुष्ट निदान प्रदान किया था। उन्होंने इन ज्ञात निदानों को उसी समय के निरंतर हृदय मॉनिटर रिकॉर्डिंग के साथ मिलाया। इसने उन्हें एक छोटा, विश्वसनीय शुरुआती उदाहरण सेट दिया। हालाँकि, इस पद्धति में एक दोष था; अस्पताल के रिकॉर्ड अक्सर सामान्य, स्वस्थ धड़कनों से भरे होते थे, और लैब टेस्ट और निरंतर मॉनिटर के बीच का समय हमेशा सटीक नहीं होता था, जिससे डॉक्टरों को लेबल को सत्यापित करने या सुधारने में बहुत समय बिताना पड़ता था। इसे बेहतर बनाने के लिए, टीम ने दूसरा कदम जोड़ा जहाँ गहन देखभाल इकाई के डॉक्टर और नर्स वास्तविक समय में हृदय लय की समस्याओं को होते हुए देख सकते थे और उनकी रिपोर्ट कर सकते थे। इसने ताज़ा, प्रासंगिक उदाहरण प्रदान किए, लेकिन यह इस बात से सीमित था कि एक डॉक्टर कितनी बार किसी समस्या को नोटिस करता और रिपोर्ट करता था।

एक बार जब टीम के पास एक बुनियादी कंप्यूटर मॉडल को प्रशिक्षित करने के लिए इन पहले दो चरणों से पर्याप्त उदाहरण मिल गए, तो उन्होंने तीसरे और चौथे चरण को पेश किया, जो भारी काम करने के लिए कंप्यूटर पर निर्भर थे। उन्होंने कंप्यूटर को अनलेबल डेटा को देखने और उन हिस्सों की पहचान करने के लिए प्रशिक्षित किया जिनके बारे में वह अनिश्चित था। इसे 'अनसर्टेन्टी सैंपलिंग' (uncertainty sampling) कहा जाता है। अनुमान लगाने के बजाय, कंप्यूटर ने उन धड़कनों को फ्लैग किया जो उसके लिए भ्रमित करने वाली थीं, और उन विशिष्ट खंडों को समीक्षा के लिए डॉक्टरों के पास भेज दिया। यह रैंडम सर्चिंग की तुलना में बहुत अधिक कुशल था क्योंकि कंप्यूटर अनिवार्य रूप से कह रहा था, "मुझे नहीं पता कि यह क्या है, कृपया मुझे बताएं।" जैसे-जैसे डॉक्टरों ने इन भ्रमित करने वाले उदाहरणों को लेबल किया, कंप्यूटर स्मार्ट होता गया। अंत में, टीम ने 'एम्बेडिंग सर्च' (embedding search) नामक तकनीक का उपयोग किया। इसने कंप्यूटर को उन हृदय धड़कनों को खोजने की अनुमति दी जो पहले से सीखी गई दुर्लभ, खतरनाक लय के रूपात्मक रूप से समान (morphologically similar) थीं, भले ही वे अलग-अलग बच्चों की हों। यह कंप्यूटर से यह पूछने जैसा था कि उन खतरनाक धड़कनों को खोजो जो उसे अभी सिखाई गई हैं, और पूरे संग्रह को उन्हीं समस्याओं के नए रूपों के लिए स्कैन करो।

इस चरणबद्ध दृष्टिकोण के परिणाम आश्चर्यजनक थे। जब शोधकर्ताओं ने परीक्षण किया कि वे केवल संग्रह से यादृच्छिक (random) खंड चुनकर कितनी दुर्लभ, खतरनाक धड़कनों को खोज सकते हैं, तो उन्होंने पाया कि हर 200 खंडों में केवल दो मामले मिले, जो मात्र एक प्रतिशत की दर थी। इसके विपरीत, उनकी नई, बहु-चरणीय पाइपलाइन ने लेबल किए गए कुल समय में 14.7 प्रतिशत मामलों में और समीक्षा किए गए अद्वितीय रोगियों में 24.7 प्रतिशत मामलों में दुर्लभ धड़कनों को पाया। इसका मतलब है कि उनकी पाइपलाइन रैंडम सर्चिंग की तुलना में प्रति घंटे दुर्लभ धड़कनों को खोजने में लगभग पंद्रह गुना अधिक कुशल थी, और रोगियों की संख्या के आधार पर पच्चीस गुना अधिक कुशल थी। प्रत्येक चरण के साथ दक्षता बढ़ती गई। प्रारंभिक, मैनुअल चरणों ने आधार प्रदान किया, लेकिन कंप्यूटर-निर्देशित चरणों ने, विशेष रूप से समान दिखने वाली धड़कनों की अंतिम खोज ने, उच्चतम रिटर्न दिया। अंतिम चरण में, जब कंप्यूटर ने उन धड़कनों को खोजा जो दुर्लभ लय के समान थीं, तो एक डॉक्टर द्वारा समीक्षा किए जाने पर साठ प्रतिशत से अधिक खंडों की पुष्टि लक्षित लय के रूप में हुई।

अध्ययन ने यह दावा नहीं किया कि कंप्यूटर मॉडल खुद मरीजों का निदान करने के लिए तैयार है; वह एक अलग चुनौती है। इसके बजाय, इस कार्य ने यह सिद्ध किया कि एक स्मार्ट, सहयोगात्मक वर्कफ़्लो डेटा लेबलिंग की बाधा को दूर कर सकता है। डॉक्टरों को डेटा के सबसे दिलचस्प और दुर्लभ हिस्सों तक जाने के लिए कंप्यूटर का मार्गदर्शन करने के देकर, टीम ने 1,447 बच्चों के लगभग 190 घंटों के विशेषज्ञ-लेबल वाले हृदय धड़कनों का एक उच्च-गुणवत्ता वाला डेटासेट तैयार किया। यह डेटासेट अब उन दुर्लभ, खतरनाक लय से समृद्ध है जो भविष्य के चिकित्सा उपकरणों को प्रशिक्षित करने के लिए आवश्यक हैं। शोधकर्ताओं ने पाया कि इस पद्धति ने उन्हें नवजात शिशुओं से लेकर किशोरों तक, सभी उम्र के बच्चों की विविध धड़कनों का संग्रह बनाने की अनुमति दी, जिसके लिए व्यस्त चिकित्सा कर्मचारियों के अत्यधिक समय की आवश्यकता नहीं पड़ी। यह दृष्टिकोण दर्शाता है कि चिकित्सा कृत्रिम बुद्धिमत्ता (मेडिकल एआई) के क्षेत्र में, प्रगति की कुंजी केवल अधिक डेटा होना नहीं है, बल्कि उसके भीतर सही डेटा खोजने का एक बेहतर तरीका होना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →