CaresAI at SMM4H-HeaRD 2026: Predicting TNM Staging
यह शोध पत्र SMM4H-HeaRD 2026 चुनौती के लिए CaresAI प्रणाली प्रस्तुत करता है, जो TNM स्टेजिंग की भविष्यवाणी करने के लिए TCGA पैथोलॉजी रिपोर्टों पर विभिन्न मशीन लर्निंग और डीप लर्निंग मॉडलों का उपयोग करता है, जो प्रशिक्षण के दौरान मजबूत प्रदर्शन प्राप्त करता है लेकिन परीक्षण सेटों पर मूल्यांकन के दौरान महत्वपूर्ण सामान्यीकरण चुनौतियों और वर्ग असंतुलन के प्रति संवेदनशीलता को प्रकट करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जटिल चिकित्सा रहस्य को सुलझाने की कोशिश कर रहे हैं एक जासूस के रूप में। सुराग उन लंबे, अव्यवस्थित, हस्तलिखित शैली की रिपोर्टों के अंदर छिपे हुए हैं जो रोगविज्ञानी (pathologists - वे डॉक्टर जो ऊतकों के नमूनों की जांच करते हैं) द्वारा लिखी गई हैं। ये रिपोर्टें मरीज के कैंसर का वर्णन करती हैं, लेकिन वे हमेशा उत्तर स्पष्ट रूप से नहीं बताती हैं। आपका काम कैंसर के बारे में तीन विशिष्ट चीजों का पता लगाना है:
- T (Tumor/ट्यूमर): मुख्य गांठ कितनी बड़ी है, और इसने पास के ऊतकों में कितनी गहराई तक पैठ बनाई है?
- N (Node/नोड): क्या कैंसर पास के लिम्फ नोड्स (शरीर के सुरक्षा चेकपॉइंट्स) में फैल गया है?
- M (Metastasis/मेटास्टेसिस): क्या कैंसर शरीर के अन्य हिस्सों में पूरी तरह से निकल चुका है?
इसे TNM स्टेजिंग कहा जाता है, और यह डॉक्टरों द्वारा मरीज के इलाज का निर्णय लेने के लिए उपयोग किया जाने वाला एक "स्कोरकार्ड" है। CaresAI की टीम ने एक प्रतियोगिता (SMM4H-HeaRD 2026) में भाग लिया ताकि वे एक कंप्यूटर प्रोग्राम बना सकें जो इन अस्त-व्यस्त रिपोर्टों को पढ़ सके और स्वचालित रूप से T, N और M स्कोर का अनुमान लगा सके।
यहाँ बताया गया है कि उन्होंने यह कैसे किया, सरल शब्दों में:
1. चुनौती: "बारीक अक्षरों" को पढ़ना
जिन रिपोर्टों का उन्होंने उपयोग किया, वे TCGA नामक एक विशाल डेटाबेस से आई थीं। इन रिपोर्टों को अलग-अलग लेखकों द्वारा लिखे गए हजारों अलग-अलग उपन्यासों के रूप में समझें। कुछ छोटी हैं, कुछ बहुत बड़ी हैं, कुछ में भारी चिकित्सा शब्दावली (jargon) का उपयोग किया गया है, और कुछ अस्पष्ट हैं।
- समस्या: डेटा "असंतुलित" था। एक बैग में कंचों की कल्पना करें जहाँ 93% सफेद हैं (कैंसर का प्रसार नहीं) और केवल 7% काले हैं (कैंसर का प्रसार)। यदि आप हर बार "सफेद" का अनुमान लगाते हैं, तो आप अधिकांश समय सही होंगे, लेकिन आप दुर्लभ, खतरनाक काले कंचों को मिस कर देंगे। कंप्यूटर को उन दुर्लभ, खतरनाक सुरागों को पहचानना सीखना था।
2. उपकरण: "पढ़ने" के दो अलग तरीके
टीम ने कंप्यूटर को पाठ (text) समझने के लिए सिखाने के दो मुख्य तरीके आजमाए:
तरीका A: "कीवर्ड काउंटर" (TF-IDF और LightGBM)
इसे एक ऐसे लाइब्रेरियन की तरह समझें जो गिनता है कि विशिष्ट शब्द कितनी बार आते हैं। यदि कोई रिपोर्ट बार-बार "metastasis" या "spread" का उल्लेख करती है, तो कंप्यूटर उसे फ्लैग करता है। उन्होंने LightGBM नामक एक स्मार्ट एल्गोरिदम का उपयोग किया (जो एक सुपर-फास्ट, व्यवस्थित निर्णय वृक्ष की तरह है) जो इन शब्द गणनाओं को देखने के लिए है।- परिणाम: यह विजेता था। यह टेक्स्ट में पैटर्न को पहचानने में बहुत अच्छा था, लगभग एक अनुभवी जासूस की तरह जो जानता है कि किन शब्दों को खोजना है।
तरीका B: "गहरा विचारक" (BERT मॉडल और न्यूरल नेटवर्क)
इस दृष्टिकोण ने उन्नत AI मॉडल (ClinicalBERT, BioBERT) का उपयोग किया जिन्होंने पहले ही लाखों चिकित्सा पुस्तकों को पढ़ा है। शब्दों को केवल गिनने के बजाय, ये मॉडल वाक्यों के अर्थ और संदर्भ को समझने की कोशिश करते हैं। फिर उन्होंने इस "समझ" को एक Wide Residual Network (WRN) में फीड किया, जो एक मस्तिष्क जैसी कंप्यूटर नेटवर्क का प्रकार है जिसे जटिल पैटर्न पहचानने के लिए डिज़ाइन किया गया है।- परिणाम: यह थोड़ा मिला-जुला रहा। हालांकि यह टेक्स्ट के "भाव" (vibe) को अच्छी तरह समझता था, लेकिन यह कीवर्ड काउंटर की तुलना में विशिष्ट विवरणों में कभी-कभी भ्रमित हो जाता था।
3. परिणाम: उन्होंने कैसा प्रदर्शन किया?
टीम ने अपने "जासूसों" का परीक्षण रिपोर्टों के दो अलग-अलग नए, अनदेखे सेटों (Test Set 1 और Test Set 2) पर किया।
- अच्छी खबर: पहले टेस्ट सेट पर, कंप्यूटर अविश्वसनीय रूप से सटीक था। इसने ट्यूमर स्टेज के लिए 0.978 (1.0 में से) और नोड स्टेज के लिए 0.957 का स्कोर प्राप्त किया। यह एक ऐसे जासूस की तरह था जिसने लगभग हर केस को पूरी तरह से सुलझा लिया।
- बुरी खबर: जब वे दूसरे टेस्ट सेट पर गए, तो स्कोर गिर गया (लगभग 0.80 तक)।
- क्यों? पेपर बताता है कि कंप्यूटर पहले सेट के डेटा से "बिगड़" गया था। इसने ट्रेनिंग डेटा के विशिष्ट पैटर्न को बहुत अच्छी तरह से सीख लिया था (एक समस्या जिसे overfitting कहा जाता है)। जब इसने कोई ऐसी रिपोर्ट देखी जो सामान्य से थोड़ी अलग या लंबी थी, तो यह भ्रमित हो गया। साथ ही, क्योंकि ट्रेनिंग डेटा में "खतरनाक" मामले (जैसे कैंसर का प्रसार) इतने दुर्लभ थे, इसलिए कंप्यूटर उन्हें पहचानने में संघर्ष करता रहा।
4. सीमाएं: यह अभी अस्पताल के लिए तैयार क्यों नहीं है?
लेखक अपने टूल के बारे में बहुत ईमानदार हैं कि यह अभी क्या नहीं कर सकता:
- "पेज लिमिट" की समस्या: उनके द्वारा उपयोग किए गए AI मॉडल एक बार में केवल 512 शब्द पढ़ सकते हैं। इनमें से कई चिकित्सा रिपोर्ट बहुत लंबी होती हैं। यह एक पूरे उपन्यास को पढ़ने की कोशिश करने जैसा है लेकिन आपको केवल पहले कुछ पन्ने पढ़ने की अनुमति है; कंप्यूटर अंत और महत्वपूर्ण सुरागों को मिस कर देता है।
- "दुर्लभ घटना" की समस्या: चूंकि ट्रेनिंग डेटा में "कैंसर प्रसार" के मामले इतने दुर्लभ थे, इसलिए कंप्यूटर अभी भी थोड़ा पक्षपाती है। वास्तविक मामलों को पहचानने के बजाय "कोई प्रसार नहीं" कहना अधिक सुरक्षित है, जिसका अर्थ है कि यह कुछ वास्तविक मामलों को मिस कर सकता है।
- डॉक्टर नहीं है: पेपर स्पष्ट रूप से कहता है कि हालांकि यह एक बेहतरीन "बेसलाइन" (एक शुरुआती बिंदु) है, लेकिन यह अभी इतना विश्वसनीय नहीं है कि जीवन-मृत्यु के निर्णय लेने के लिए वास्तविक अस्पताल में उपयोग किया जा सके। इसे लंबे दस्तावेजों को संभालने के लिए और अधिक प्रशिक्षण और बेहतर प्रबंधन की आवश्यकता है।
निष्कर्ष
CaresAI टीम ने एक ऐसा कंप्यूटर प्रोग्राम बनाया है जो कैंसर रिपोर्ट को पढ़ सकता है और बीमारी के चरण का अनुमान लगा सकता है, परिचित डेटा पर प्रभावशाली सटीकता के साथ। उन्होंने पाया कि एक सरल "कीवर्ड काउंटिंग" विधि (LightGBM) वास्तव में इस विशिष्ट कार्य के लिए फैंसी "डीप थिंकिंग" AI की तुलना में बेहतर काम करती है।
हालांकि, ठीक वैसे ही जैसे एक छात्र जो अभ्यास परीक्षा में उत्कृष्ट प्रदर्शन करता है लेकिन वास्तविक परीक्षा में संघर्ष करता है क्योंकि प्रश्न थोड़े अलग थे, इस AI को वास्तविक दुनिया में पाए जाने वाले अस्त-व्यस्त, लंबे और दुर्लभ मामलों को संभालने के लिए और अधिक काम करने की आवश्यकता है। फिलहाल, यह अनुसंधान के लिए एक शक्तिशाली उपकरण और भविष्य के सुधारों के लिए एक बेहतरीन शुरुआती बिंदु है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।