Enhanced Classifications of Skin Melanoma, Actinic Keratosis, and Basal Cell Carcinoma Tumors Versus Normal Tissues Utilizing YOLOv11 and EfficientNetV2M Deep Learning Models
यह शोध पत्र त्वचा ट्यूमर वर्गीकरण के लिए असंतुलित HAM10000 डेटासेट पर YOLOv11 और EfficientNetV2M मॉडलों का मूल्यांकन करता है, जो यह प्रदर्शित करता है कि YOLOv11 उच्च-संवेदनशीलता स्क्रीनिंग के लिए बेहतर रिकॉल (86.5%) प्राप्त करता है जबकि EfficientNetV2M को SVM क्लासिफायर के साथ मिलाने से सटीक ट्राइएज के लिए उच्च विशिष्टता (96.8%) प्राप्त होती है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपकी त्वचा एक व्यस्त शहर है, और कभी-कभी, छोटे शरारती तत्व (ट्यूमर) वहां उभरने लगते हैं। कुछ हानिरहित कब्जा करने वाले (बेनाइन/benign) होते हैं, जबकि अन्य मेलानोमा, एक्टिनिक केराटोसिस और बेसल सेल कार्सिनोमा जैसे खतरनाक अपराधी (मैलिग्नेंट/malignant) होते हैं। डॉक्टरों के लिए बड़ी चुनौती इन बुरे लोगों को बिना हानिरहित वालों के झांसे में आए, जल्दी से पहचानना है।
इस अध्ययन में, शोधकर्ताओं सलाह अली और अला अवाद ने दो अलग-अलग उच्च-तकनीकी "स्कॉड कार्स" (सर्च गाड़ियों) का परीक्षण करने के लिए डिटेक्टिव की भूमिका निभाई, यह देखने के लिए कि इन त्वचा के शरारती तत्वों को पकड़ने में कौन सा सबसे अच्छा है। उन्होंने HAM10000 नामक एक विशाल डिजिटल फोटो एल्बम का उपयोग किया, जिसमें त्वचा के धब्बों की 10,000 से अधिक तस्वीरें हैं। इसे वास्तविक बनाने के लिए, उन्होंने डेटा को अस्त-व्यस्त रखा: हर 4 अच्छे लोगों के लिए, केवल 1 बुरा आदमी था, बिल्कुल वास्तविक दुनिया की तरह।
दो दावेदार
सबसे पहले, वे YOLOv11 को लेकर आए। YOLOv11 को एक सुपर-फास्ट, अत्यधिक सतर्क सुरक्षा गार्ड के रूप में समझें जो कभी पलक नहीं झपकाता। इसे भीड़ को स्कैन करने और तुरंत चिल्लाने के लिए डिज़ाइन किया गया है, "मुझे कुछ संदिग्ध दिख रहा है!" शोधकर्ता यह देखना चाहते थे कि क्या यह नया गार्ड, जिसे पहले त्वचा के धब्बों पर टेस्ट नहीं किया गया था, इस काम को संभाल सकता है।
दूसher, उन्होंने EfficientNetV2M का परीक्षण किया। कल्पना कीजिए कि यह एक प्रतिभाशाली जासूस है जो एक फोटो लेता है, उसका बारीकी से अध्ययन करता है, और फिर उसे एक विशेष न्यायाधीश को सौंप देता है। उन्होंने दो प्रकार के न्यायाधीशों का परीक्षण किया: एक मानक न्यूरल नेटवर्क (एक डिजिटल मस्तिष्क) और एक SVM (एक बहुत ही सख्त, तार्किक नियम-पालन करने वाला)।
बड़ा मुकाबला
जब परीक्षण किए गए, तो परिणाम स्पष्ट थे, लेकिन वे इस बात पर निर्भर करते हुए दो अलग-अलग कहानियाँ बताते थे कि आपको किस चीज़ की आवश्यकता है।
YOLOv11 गार्ड "हर किसी को पकड़ने" का चैंपियन था। इसने 92.8% बार सही उत्तर दिया। इससे भी महत्वपूर्ण बात यह है कि इसने वास्तव में बुरे लोगों में से 86.5% को पकड़ा (रिकॉल/Recall)। इसका मतलब है कि इसने शायद ही कभी किसी अपराधी को छोड़ा। हालाँकि, यह थोड़ा अधिक उत्साही था, कभी-कभी हानिरक धब्बों को भी संदिग्ध बता देता था (कम प्रिसिजन/Precision)। शोधकर्ता सुझाव देते हैं कि यह इसे पहली रक्षा पंक्ति के लिए आदर्श बनाता है: एक स्क्रीनिंग टूल के रूप में जहाँ किसी बुरे व्यक्ति को छोड़ देना सबसे बड़ी गलती हो सकती है।
EfficientNetV2M की टीम, विशेष रूप से सख्त SVM न्यायाधीश के साथ, एक अलग खेल खेल रही थी। इसने 85.0% बार सही उत्तर दिया। हालांकि इसने YOLOv11 की तुलना में कुछ बुरे लोगों को छोड़ा, लेकिन यह यह जानने में अविश्वसनीय रूप से अच्छा था कि क्या सुरक्षित है। इसने हानिरहित धब्बों को 96.8% बार सही ढंग से पहचाना (स्पेसिफिसिटी/Specificity)। शोधकर्ताओं ने पाया कि यह संस्करण एक "क्लिनिकली कंजर्वेटिव" (नैदानिक रूप से रूढ़िवादी) संतुलन प्रदान करता है, जिसका अर्थ है कि यह ट्राइएज (छंटनी) के लिए बेहतरीन है—यह तय करने के लिए कि किसे निश्चित रूप से डॉक्टर को देखने की आवश्यकता है और कौन बिना घबराहट के सुरक्षित घर जा सकता है।
उन्होंने क्या नहीं किया
यह ध्यान रखना महत्वपूर्ण है कि इस अध्ययन ने क्या नहीं किया। शोधकर्ताओं ने यह दावा नहीं किया कि उन्होंने त्वचा के कैंसर के निदान को हमेशा के लिए हल कर दिया है। उन्होंने स्कोर बढ़ाने के लिए अन्य प्रकार के डेटा (जैसे रोगी की आयु या आनुवंशिकी) को मिश्रित नहीं किया, और न ही उन्होंने जटिल "नॉलेज डिस्टिलेशन" के तरीकों का उपयोग किया जहाँ एक मॉडल दूसरे को सिखाता है। वे केवल मॉडलों की कच्ची शक्ति पर टिके रहे।
साथ ही, जबकि उन्होंने ResNet50 और RegNetY-320 जैसे अन्य प्रसिद्ध मॉडलों के साथ अपने परिणामों की तुलना की, उन्होंने यह दावा नहीं किया कि उनकी पद्धति हर एकल परिदृश्य में पूर्ण रूप से "सर्वश्रेष्ठ" है। उन्होंने केवल यह दिखाया कि YOLOv11 ने बिना किसी अतिरिक्त मदद के उन पुराने मॉडलों की बराबरी की या उन्हें पीछे छोड़ा, और यह भी कि EfficientNet+SVM संयोजन एक अलग, मूल्यवान प्रकार की सटीकता प्रदान करता है।
निष्कर्ष
पेपर सुझाव देता है कि केवल एक "परफेक्ट" रोबोट डॉक्टर नहीं होता है। यदि आप एक विशाल स्क्रीनिंग कैंप चला रहे हैं और कैंसर के एक भी मामले को छोड़ने का जोखिम नहीं उठा सकते, तो YOLOv11 मॉडल आपका सबसे अच्छा विकल्प है क्योंकि यह लगभग सब कुछ पकड़ लेता है। लेकिन यदि आपको किसी को डरावने फॉलो-अप टेस्ट के लिए भेजने से पहले बहुत सुनिश्चित होना है, तो EfficientNetV2M + SVM मॉडल अधिक सुरक्षित, सटीक विकल्प है।
लेखक स्वीकार करते हैं कि हालांकि ये संख्याएँ प्रभावशाली हैं, असली परीक्षण अभी आना बाकी है। वे सुझाव देते हैं कि भविष्य के कार्यों में इन मॉडलों को रोगियों के नए, स्वतंत्र समूहों पर परखने की आवश्यकता है ताकि यह देखा जा सके कि क्या वे इस विशिष्ट फोटो एल्बम के बाहर भी उतने ही अच्छे से काम करते हैं। फिलहाल, उन्होंने एक ठोस, पुनरुत्पादित बेंचमार्क प्रदान किया है जो दिखाता है कि ये आधुनिक AI उपकरण मदद करने के लिए तैयार हैं, बशर्ते हम विशिष्ट कार्य के लिए सही उपकरण का चुनाव करें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।