← नवीनतम पेपर
💻 computer science

Cross-cohort evaluation of thyroid ultrasound deep learning across different outcome definitions: a duplicate-controlled benchmark

यह अध्ययन प्रदर्शित करता है कि फ्रोजन थायराइड अल्ट्रासाउंड डीप लर्निंग मॉडल विभिन्न कोहॉर्ट्स और परिणाम परिभाषाओं के बीच काफी भिन्न प्रदर्शन प्रदर्शित करते हैं, जो लेबल प्रोवेनेंस (लेबल की उत्पत्ति) के स्पष्ट रिपोर्टिंग और क्रॉस-कोहॉर्ट बेंचमार्क की सतर्क व्याख्या की महत्वपूर्ण आवश्यकता को रेखांकित करता है।

मूल लेखक: Behnam Kiani Kalejahi, Mohammad Javad Rajabi

प्रकाशित 2026-09-15
📖 1 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Behnam Kiani Kalejahi, Mohammad Javad Rajabi

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

तकनीकी सारांश: विभिन्न परिणाम परिभाषाओं के माध्यम से थायराइड अल्ट्रासाउंड डीप लर्निंग का क्रॉस-कोहॉर्ट मूल्यांकन

समस्या विवरण
थायराइड अल्ट्रासाउंड व्याख्या के लिए आर्टिफिशियल इंटेलिजेंस (AI) मॉडल का प्रदर्शन कोहॉर्ट की विशेषताओं और उपयोग किए गए विशिष्ट मूल्यांकन एंडपॉइंट (evaluation endpoint) पर अत्यधिक निर्भर करता है। इस क्षेत्र में एक महत्वपूर्ण चुनौती विभिन्न नैदानिक एंडपॉइंट्स की विनिमेयता (interchangeability) है: पोस्टऑपरेटिव पैथोलॉजी (एक निश्चित नैदानिक परिणाम) बनाम रेडियोलॉजिस्ट द्वारा निर्धारित जोखिम श्रेणियाँ जैसे कि अमेरिकन कॉलेज ऑफ रेडियोलॉजी थायराइड इमेजिंग रिपोर्टिंग एंड डेटा सिस्टम (TI-RADS) (एक प्रबंधन-उन्मुख संदिग्ध स्कोर)। ये एंडपॉइंट्स नैदानिक मार्ग के अलग-अलग चरणों का प्रतिनिधित्व करते हैं और आपस में विनिमेय नहीं हैं। इसके अलावा, एक डेटासेट पर प्रशिक्षित डीप लर्निंग मॉडल अक्सर स्वतंत्र कोहॉर्ट्स में विफल हो जाते हैं क्योंकि जनसंख्या, उपकरण, अधिग्रहण प्रोटोकॉल और लेबल परिभाषाओं में बदलाव आता है। यह अध्ययन थायराइड अल्ट्रासाउंड क्लासिफायर के बेंचमार्किंग की आवश्यकता को संबोधित करता है, जबकि इमेज-लेवल डेटा लीकेज को नियंत्रित करते हुए, मैलिग्नेंसी परिणामों के विरुद्ध मूल्यांकन और TI-RADS-व्युत्पन्न जोखिम श्रेणियों के साथ सहमति को स्पष्ट रूप से अलग करता है।

कार्यप्रणाली (Methodology)
अध्ययन ने एक निश्चित विश्लेषण वातावरण (Python 3.10, PyTorch 2.5.1) का उपयोग करके एक डुप्लिकेट-नियंत्रित, इमेज-लेवल बेंचमार्किंग पाइपलाइन का उपयोग किया।

  • डेटासेट्स:

    • डेवलपमेंट आर्काइव (Development Archive): एक सार्वजनिक मेंडले डेटा (Mendeley Data) रिलीज़ जिसमें 385 सोर्स केसेस से प्राप्त 387 B-मोड अल्ट्रासाउंड इमेज और 1,332 फाइन-नीडल एस्पिरेशन साइटोलॉजी (FNA) ब्लॉक्स शामिल हैं। लेबल बाइनरी (पैपिलरी थायराइड कार्सिनोमा [PTC] बनाम बेनाइन) थे, जो पोस्टऑपरेटिव निदान पर आधारित थे। पेशेंट-लेवल आइडेंटिफायर उपलब्ध नहीं थे, जिससे सत्यापित पेशेंट-लेवल स्प्लिट्स संभव नहीं हो सके।
    • एक्सटर्नल कोहॉर्ट्स (External Cohorts): दो फ्रोजन मॉडल्स का बिना रिट्रेनिंग या थ्रेशोल्ड एडजस्टमेंट के मूल्यांकन किया गया:
      1. TN3K: 1,228 इमेज का एक सबसेट जिसमें डेटासेट-प्रदत्त बेनाइन/मैलिग्नेंट लेबल थे।
      2. DDTI: 637 इमेज जिनका मूल्यांकन रेडियोलॉजिस्ट TI-RADS श्रेणियों (लो-सस्पिशन TI-RADS 2–3 बनाम हाई-सस्पिशन TI-RADS 4–5 का समूह) से प्राप्त बाइनरी एंडपॉइंट के विरुद्ध किया गया।
  • डेटा प्रीप्रोसेसिंग और लीकेज नियंत्रण:

    • डुप्लिकेट कंट्रोल: इमेज को MD5 हैश (सटीक डुप्लिकेट) और पर्सेप्टुअल हैश (लगभग समान इमेज) का उपयोग करके ग्रुप किया गया। इन समूहों को डेटा लीकेज को रोकने के लिए सिंगल पार्टीशन (train, validation, test) के भीतर रखा गया।
    • प्रीप्रोसेसिंग: इमेज को 224×224 पिक्सेल में रीसाइज किया गया। एक एक्सप्लोरेटरी एक्सपेरिमेंट में पेरिफेरल इंटरफेस आर्टिफैक्ट्स को दबाने के लिए ऑटोमैटिक टेक्सचर-आधारित रीजन ऑफ इंटरेस्ट (ROI) क्रॉपिंग का परीक्षण किया गया।
  • मॉडल आर्किटेक्चर और ट्रेनिंग:

    • पांच बैकबोन आर्किटेक्चर को प्रशिक्षित किया गया: ConvNeXt-Small, EfficientNet-B3, Swin-Tiny, ResNet-50, और DenseNet-121।
    • मॉडल्स को ImageNet वेट्स के साथ इनिशियलाइज़ किया गया और AdamW ऑप्टिमाइज़ेशन के साथ क्लास-वेटेड बाइनरी क्रॉस-एंट्रॉपी लॉस का उपयोग करके फाइन-ट्यून किया गया।
    • एक एन्सेम्बल (Ensemble) बनाया गया जिसमें ConvNexT-Small, EfficientNet-B3, Swin-Tiny, और ResNet-50 के सिग्मॉइड प्रोबेबिलिटी के औसत का उपयोग किया गया।
    • कैलिब्रेशन का मूल्यांकन टेम्परेचर स्केलिंग, ब्रियर स्कोर (Brier score), और एक्सपेक्टेड कैलिब्रेशन एरर (ECE) का उपयोग करके किया गया।
  • मूल्यांकन रणनीति:

    • प्रदर्शन को AUROC, AUPRC, सटीकता (accuracy), संवेदनशीलता (sensitivity), विशिष्टता (specificity), और F1 स्कोर का उपयोग करके मापा गया।
    • कॉन्फिडेंस इंटरवल को नॉन-पैरामीट्रिक बूटस्ट्रैप रिसेम्पलिंग (2,000 रेप्लिकेट्स) के माध्यम से जनरेट किया गया।
    • साइटोलॉजी और अल्ट्रासाउंड मोडैलिटीज का विश्लेषण अलग-अलग, नॉन-पेयर्ड इमेज डिस्ट्रीब्यूशन के रूप में किया गया; कोई विदिन-पेशेंट तुलनात्मक सटीकता अनुमानित नहीं की गई।

प्रमुख योगदान

  1. एंडपॉइंट प्रोवेनेंस सेपरेशन (Endpoint Provenance Separation): अध्ययन स्पष्ट रूप से मैलिग्नेंसी की भविष्यवाणी करने की मॉडल की क्षमता (पैथोलॉजी लेबल के विरुद्ध) और रेडियोलॉजिकल रिस्क स्ट्रैटिफिकेशन (TI-RADS) के साथ सहमति के बीच अंतर करता है।
  2. डुप्लिकेट-नियंत्रित बेंचमार्किंग: पब्लिक मेडिकल इमेज आर्काइव्स में एक सामान्य समस्या, इमेज-लेवल डेटा लीकेज को रोकने के लिए सटीक और पर्सेप्टुअल हैशिंग का कार्यान्वयन।
  3. क्रॉस-कोहॉर्ट फ्रोजन इवैल्यूएशन: बिना रिट्रेनिंग के दो अलग-अलग एक्सटर्नल कोहॉर्ट्स (TN3K और DDTI) पर फ्रोजन मॉडल्स का मूल्यांकन, जो यह दर्शाता है कि प्रदर्शन अधिग्रहण और एंडपॉइंट परिभाषा के आधार पर कैसे बदलता है।
  4. डिस्क्रिप्टिव मोडैलिटी कंट्रास्ट: डेवलपमेंट आर्काइव के भीतर अल्ट्रासाउंड बनाम साइटोलॉजी प्रदर्शन का एक नॉन-पेयर्ड तुलनात्मक विश्लेषण, जो स्पष्ट करता है कि ऐसे तुलनात्मक अध्ययन इमेज डिस्ट्रीब्यूशन का वर्णन करते हैं, न कि क्लिनिकल श्रेष्ठता को स्थापित करते हैं।

परिणाम

  • आंतरिक प्रदर्शन (डेवलपमेंट आर्काइव):

    • साइटोलॉजी: ConvNeXt-Small मॉडल ने 0.988 का AUROC (95% CI 0.976–0.998) प्राप्त किया, और एन्सेम्बल ने 0.986 प्राप्त किया।
    • अल्ट्रासाउंड: EfficientNet-B3 मॉडल ने 0.745 का AUROC (95% CI 0.612–0.865) प्राप्त किया, और एन्सेम्बल ने 0.733 प्राप्त किया।
    • ROI क्रॉपिंग: ऑटोमैटिक ROI क्रॉपिंग ने अल्ट्रासाउंड एन्सेम्बल के AUROC को 0.745 से सुधार कर 0.817 कर दिया।
    • कैलिब्रेशन: टेम्परेचर स्केलिंग ने रैंक-आधारित मेट्रिक्स को बदले बिना प्रोबेबिलिटी विश्वसनीयता में सुधार किया (ECE 0.032 से घटकर 0.014 हो गया)।
  • एक्सटर्नल कोहॉर्ट मूल्यांकन (फ्रोजन मॉडल्स):

    • TN3K (मैलिग्नेंसी लेबल्स): अल्ट्रासाउंड एन्सेम्बल ने 0.825 का AUROC प्राप्त किया, और ResNet-50 ने 0.888 प्राप्त किया। ये परिणाम इस डेटासेट के वितरित बेनाइन/मैलिग्नेंट लेबल्स के विरुद्ध अच्छी भेदभाव क्षमता दर्शाते हैं।
    • DDTI (TI-RADS एंडपॉइंट): TI-RADS-व्युत्पन्न एंडपॉइंट के विरुद्ध, एन्सेम्बल ने 0.477 का AUROC और ResNet-50 ने 0.437 का AUROC प्राप्त किया। यह TI-RADS वर्गीकरण के साथ बहुत कम या शून्य सहमति को दर्शाता है।
    • व्याख्या: लेखक नोट करते हैं कि TN3K और DDTI के परिणामों के बीच का अंतर केवल लेबल परिभाषा के कारण नहीं लगाया जा सकता, क्योंकि कोहॉर्ट, उपकरण, अधिग्रहण और रोग स्पेक्ट्रम भी एक साथ बदल गए थे।
  • मोडैलिटी तुलना: एक डिस्क्रिप्टिव, नॉन-पेयर्ड बूटस्ट्रैप विश्लेषण ने साइटोलॉजी-माइनस-अल्ट्रासाउंड AUROC अंतर 0.247 (95% CI 0.120–0.384) दिखाया। लेखक इस बात पर जोर देते हैं कि यह साइटोलॉजी की क्लिनिकल श्रेष्ठता को सिद्ध नहीं करता है, क्योंकि इमेज सेट्स पेशेंट-मैच्ड नहीं थे।

महत्व और दावे
पेपर का दावा है कि फ्रोजन थायराइड अल्ट्रासाउंड मॉडल उन कोहॉर्ट्स में अलग तरह से प्रदर्शन करते हैं जो अधिग्रहण और परिणाम परिभाषा में भिन्न होते हैं। TN3K (मैलिग्नेंसी लेबल्स) पर उच्च प्रदर्शन और DDTI (TI-RADS लेबल्स) पर लगभग चांस-लेवल प्रदर्शन के बीच का तीव्र अंतर यह रेखांकित करता है कि ये एंडपॉइंट्स विनिमेय नहीं हैं।

यह अध्ययन भविष्य के अनुसंधान के लिए तीन प्राथमिक निहितार्थों का समर्थन करता है:

  1. स्पष्ट रिपोर्टिंग: लेबल प्रोवेनेंस (जैसे, पोस्टऑपरेटिव निदान बनाम TI-RADS) को स्पष्ट रूप से रिपोर्ट किया जाना चाहिए।
  2. सतर्क व्याख्या: क्रॉस-कोहॉर्ट प्रदर्शन के अंतरों की व्याख्या सावधानी से की जानी चाहिए, क्योंकि वे एकल कारण कारक के बजाय वितरण शिफ्ट और एंडपॉइंट परिभाषाओं के संगम को दर्शाते हैं।
  3. पेशेंट-लेवल वैलिडेशन: भविष्य के अध्ययनों के लिए एक क्लिनिकली उपयुक्त रेफरेंस स्टैंडर्ड के विरुद्ध पेशेंट-लेवल एक्सटर्नल इवैल्यूएशन की आवश्यकता है ताकि ट्रांसपोर्टेबिलिटी सुनिश्चित की जा सके।

लेखक विनम्रतापूर्वक निष्कर्ष निकालते हैं कि उनके निष्कर्ष थायराइड AI में जनरलाइजेशन समस्या के निश्चित समाधान का दावा करने के बजाय, सत्यापित पेशेंट-लेवल स्प्लिट्स और सुसंगत रेफरेंस स्टैंडर्ड विवरणों की आवश्यकता का समर्थन करते हैं। यह अध्ययन DDTI पर मैलिग्नेंसी डायग्नोसिस को वैलिडेट नहीं करता है, क्योंकि TI-RADS एंडपॉइंट एक मैलिग्नेंसी रेफरेंस स्टैंडर्ड नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →