← नवीनतम पेपर
💻 computer science

A Unified 2D Framework for DeepLesion Detection, Segmentation and Short Report Generation

यह शोध पत्र एक एकीकृत 2D फ्रेमवर्क प्रस्तुत करता है जो DeepLesion डेटासेट पर LLM-आधारित तर्क (reasoning) को लीजन डिटेक्शन, सेगमेंटेशन और संक्षिप्त रिपोर्ट जनरेशन के साथ एकीकृत करता है, जो nnUNet जैसे मौजूदा मॉडलों की तुलना में महत्वपूर्ण प्रदर्शन सुधार प्राप्त करता है और अपने कोड, डेटा और मॉडल्स को एक ओपन-सोर्स फाउंडेशन के रूप में जारी करता है।

मूल लेखक: Ruida Cheng, Tejas S. Mathai, Benjamin Hou, Qingqing Zhu, Zhiyong Lu, Matthew McAuliffe, Ronald M. Summers

प्रकाशित 2026-08-05
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruida Cheng, Tejas S. Mathai, Benjamin Hou, Qingqing Zhu, Zhiyong Lu, Matthew McAuliffe, Ronald M. Summers

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ कंप्यूटर किसी तस्वीर को देख सकते हैं और तुरंत बता सकते हैं कि उसके भीतर क्या हो रहा है। यह मेडिकल आर्टिफिशियल इंटेलिजेंस का रोमांचक क्षितिज है, एक ऐसा क्षेत्र जहाँ मशीनें डॉक्टरों की तरह "देखना" सीख रही हैं। इस नए अध्ययन को समझने के लिए, आपको पहले उन तीन विशेष उपकरणों के बारे में जानना होगा जिनका वैज्ञानिक उपयोग करते हैं। पहला, लार्ज लैंग्वेज मॉडल्स (LLMs) हैं, जो सुपर-स्मार्ट रोबोट की तरह हैं जिन्होंने दुनिया की लगभग हर किताब और लेख को पढ़ा है, जिससे वे मानव भाषा को लिखने और समझने में उत्कृष्ट हैं। दूसरा, विज़न-लैंग्वेज मॉडल्स हैं, जो उन चश्मों की तरह हैं जो उन भाषा-पढ़ने वाले रोबोटों को वास्तव में चित्र देखने की अनुमति देते हैं, जिससे वे जो देखते हैं उसे जो वे जानते हैं उससे जोड़ पाते हैं। अंत में, यूनिफाइड फ्रेमवर्क (एकीकृत ढांचा) की अवधारणा है, जो एक ही 'स्विस आर्मी नाइफ' बनाने जैसा है जिसमें चाकू, पेचकस और हथौड़ा सब एक साथ होते हैं, बजाय इसके कि हर काम के लिए अलग-अलग चीजें ले जानी पड़ें। यह क्यों मायने रखता है? क्योंकि अस्पतालों में, डॉक्टर जटिल स्कैन को देखने, उनमें छिपी छोटी समस्याओं को खोजने, उन्हें मापने और रिपोर्ट लिखने में घंटों बिताते हैं। यदि एक कंप्यूटर यह तीनों चरण—समस्या को खोजना, उसे मापना और रिपोर्ट लिखना—स्वचालित रूप से और सटीकता से कर सके, तो यह डॉक्टरों का समय बचा सकता है और मरीजों को तेजी से उपचार दिलाने में मदद कर सकता है।

अब, आइए उस नए शोध दल की कहानी की ओर बढ़ें जिन्होंने एक विशिष्ट चिकित्सा पहेली, जिसे डीपलीजन (DeepLesion) कहा जाता है, के लिए वह परम स्विस आर्मी नाइफ बनाने का निर्णय लिया।

बड़ी समस्या: घास के ढेर में सुई

डीपलीजन डेटासेट सीटी (CT) स्कैन छवियों का एक विशाल संग्रह है, जो मानव शरीर के 3D स्लाइस की तरह हैं। समस्या यह है कि "सुइयां" (वे छोटे घाव या गांठें जिन्हें डॉक्टरों को ढूंढना होता है) अविश्वसनीय रूप से छोटी और विशाल "घास के ढेरों" (512x512 पिक्सेल की छवियों) में बिखरी हुई हैं।

इसे एक विशाल समुद्र तट पर रेत के एक अकेले कण को खोजने जैसा समझें। यदि आप पूरे समुद्र तट को देखने के लिए ज़ूम आउट करने वाले मानक कैमरे का उपयोग करते हैं, तो वह रेत का कण गायब हो जाता है। यदि आप बहुत अधिक ज़ूम इन करते हैं, तो आप समुद्र तट का संदर्भ खो देते हैं। पिछले कंप्यूटर प्रोग्रामों ने इन कणों को खोजने की कोशिश की, लेकिन वे अक्सर उन्हें मिस कर देते थे क्योंकि कंप्यूटर ने छवि को बहुत अधिक "डाउनसाइज" (छोटा) कर दिया था, जिससे अनजाने में सूक्ष्म विवरण मिट गए। इसके अलावा, अधिकांश प्रोग्रामों ने स्थान खोजने, उसे काटने और रिपोर्ट लिखने को तीन पूरी तरह से अलग कार्यों के रूप में माना, जैसे कि तीन अलग-अलग लोग जो आपस में कभी बात नहीं करते।

समाधान: विशेषज्ञ जासूसों की एक टीम

शोधकर्ताओं ने एक यूनिफाइड 2D फ्रेमवर्क बनाया, जो एक एकल प्रणाली है जो तीनों कार्यों को संभालती है: डिटेक्शन (घाव का पता लगाना), सेगमेंटेशन (उसके चारों ओर एक सटीक रूपरेखा बनाना), और रिपोर्ट जनरेशन (एक संक्षिप्त सारांश लिखना)। उन्होंने सब कुछ केवल एक बर्तन में नहीं डाला; उन्होंने एक चतुर वर्कफ़्लो बनाया जहाँ प्रत्येक चरण अगले चरण की मदद करता है।

1. जासूस: YOLO-TLP-MOE
सबसे पहले, सिस्टम को घाव का पता लगाने की आवश्यकता है। टीम ने YOLO-TLP-MOE नामक एक नया डिटेक्टर बनाया। एक ऐसे जासूस की कल्पना करें जो आँखें सिकोड़ने से इनकार कर देता है। विवरण खोने के लिए छवि को छोटा करने के बजाय, यह जासूस "लॉसलेस स्पेशियल डाउनसैंपलिंग" (SPDConv) नामक एक विशेष ट्रिक का उपयोग करता है ताकि बड़े चित्र को देखते हुए भी घाव का हर एक छोटा पिक्सेल सुरक्षित रहे। उन्होंने इसमें एक "मिक्सचर ऑफ एक्सपर्ट्स" (MoE) सिस्टम भी जोड़ा। इसे विशेषज्ञों की एक टीम के रूप में समझें: एक विशेषज्ञ गोल धब्बों को पहचानने में माहिर है, दूसरा लंबी रेखाओं को पहचानने में, और तीसरा अजीब आकृतियों को पहचानने में। एक स्मार्ट मैनेजर (गेटिंग नेटवर्क) तय करता है कि किस विशेषज्ञ को छवि के किस हिस्से को देखना चाहिए। इसने सिस्टम को 70.1% की सटीकता (mAP50) के साथ घाव खोजने में मदद की, जो पुराने तरीकों की तुलना में एक महत्वपूर्ण सुधार है।

2. सर्जन: सर्च-एंड-सेगमेंट
एक बार जब जासूस स्थान ढूंढ लेता है, तो सिस्टम को उसे सटीक रूप से मापने की आवश्यकता होती है। शोधकर्ताओं ने महसूस किया कि पूरे समुद्र तट पर रेत के एक छोटे कण को मापना कठिन है। इसलिए, उन्होंने एक "सर्च-एंड-सेगमेंट" रणनीति विकसित की। सिस्टम जासूस के निष्कर्ष को लेता है, उस छोटे से क्षेत्र को काटता है, और फिर Swin-UMamba नामक एक शक्तिशाली उपकरण का उपयोग करके रूपरेखा बनाता है। यह केवल उस स्थान पर आवर्धक लेंस (मैग्नीफाइंग ग्लास) के साथ ज़ूम करने जैसा है जिसे जासूस ने पाया था। इस दृष्टिकोण ने "छोटे घाव" के खो जाने की समस्या को हल कर दिया। परिणाम? सिस्टम ने 62.6% का डाइस स्कोर (Dice score) प्राप्त किया। इसे समझने के लिए, एक मानक टूल जिसे nnUNet कहा जाता है, जिसने पूरी छवि को एक साथ मापने की कोशिश की थी, केवल 34.1% का स्कोर प्राप्त कर सका। नए तरीके ने सटीकता में भारी 28.5% का सुधार किया।

3. रिपोर्टर: कहानीकार
अंत में, सिस्टम को एक रिपोर्ट लिखने की आवश्यकता है। पिछले एआई रिपोर्टर अक्सर पूरी तस्वीर को देखते थे और अनुमान लगाते थे कि क्या गलत है, जिससे कभी-कभी विशिष्ट विवरण छूट जाते थे। यह नया सिस्टम, जिसे R2Gen-Mamba-Semantic-Aware कहा जाता है, बहुत अधिक स्मार्ट है। यह केवल छवि को नहीं देखता है; यह ठीक कहाँ देखना है, यह जानने के लिए "जासूस" के स्थान (बाउंडिंग बॉक्स) और "सर्जन" की रूपरेखा का उपयोग करता है। यह यह भी पूछता है, "यह शरीर का कौन सा हिस्सा है?" (जैसे फेफड़ा या लिवर) और "यह किस प्रकार की वृद्धि है?" (जैसे नोड्यूल या सिस्ट)। यह इस सभी जानकारी को जोड़ता है—यह कहाँ है, यह कैसा दिखता है, और यह क्या हो सकता है—एक संक्षिप्त, सटीक रिपोर्ट लिखने के लिए।

परिणाम: एक नया हाई स्कोर

जब टीम ने अपने नए फ्रेमवर्क का परीक्षण किया, तो परिणाम प्रभावशाली थे।

  • डिटेक्शन: उन्होंने 70.1% के mAP50 और 46.4% के mAP50-95 के साथ घावों को खोजा।
  • सेगमेंटेशन: उन्होंने 62.6% के डाइस स्कोर के साथ रूपरेखाएँ बनाईं, जो पिछले सर्वोत्तम प्रयासों को बड़े अंतर से पीछे छोड़ देती हैं।
  • रिपोर्टिंग: उनके द्वारा तैयार की गई संक्षिप्त रिपोर्ट बहुत सटीक थीं, जिन्होंने BLEU_1 पर 64.3% और BLEU_4 पर 49.6% का स्कोर प्राप्त किया। उन्होंने METEOR पर 34.7% और ROUGE_L पर 60.1% का स्कोर भी प्राप्त किया।

शोधकर्ताओं ने पाया कि "एनाटॉमी और लीजन टाइप" के संकेतों को जोड़ने से रिपोर्टिंग सिस्टम को काफी मदद मिली। उदाहरण के लिए, जब उन्होंने इन संकेतों को MedGemma 1.5 और Qwen3-VL जैसे अन्य प्रसिद्ध मॉडल्स में जोड़ा, तो वे मॉडल भी बेहतर हुए, लेकिन उनका अपना नया मॉडल शीर्ष पर रहा।

सीमाएं: अभी भी पूर्ण नहीं है

हालाँकि परिणाम मजबूत हैं, लेखक सावधानी से यह भी बताते हैं कि यह कोई जादू की छड़ी नहीं है जो सब कुछ हल कर देगी। सिस्टम का "सर्जन" वाला हिस्सा "जासूस" द्वारा पहले घाव खोजने पर निर्भर करता है। यदि जासूस किसी स्थान को मिस कर देता है (जो कुछ परीक्षण मामलों में हुआ), तो सर्जन उसे माप नहीं पाएगा, और रिपोर्टर उसके बारे में नहीं लिखेगा। इसके अलावा, "सर्जन" को एक कंप्यूटर प्रोग्राम (GrabCut) द्वारा बनाई गई रूपरेखाओं का उपयोग करके प्रशिक्षित किया गया था, न कि मानव डॉक्टरों द्वारा, जो शायद मानव द्वारा खींची गई रूपरेखा जितनी सटीक न हो।

टीम का सुझाव है कि अगला कदम इन 2D स्लाइस से पूर्ण 3D वॉल्यूम की ओर बढ़ना है, ताकि कंप्यूटर केवल एक सपाट स्लाइस के बजाय सभी कोणों से घाव को देख सके। वे प्रशिक्षण को और भी बेहतर बनाने के लिए विशेषज्ञ द्वारा खींची गई रूपरेखाओं का उपयोग करने की भी योजना बना रहे हैं।

संक्षेप में, यह शोध पत्र दिखाता है कि खोजने, मापने और रिपोर्ट करने के बीच के बिंदुओं को जोड़कर, और उन स्मार्ट ट्रिक्स का उपयोग करके जो सूक्ष्म विवरणों को गायब होने से रोकती हैं, हम एक ऐसा कंप्यूटर सिस्टम बना सकते हैं जो काफी हद तक एक मानव डॉक्टर की तरह सोचता है। यह एक एकीकृत ढांचा है जो बताता है कि हम इन जटिल कार्यों को पहले की तुलना में अधिक प्रभावी ढंग से स्वचालित कर सकते हैं, जो अधिक तेज़ और सुसंगत चिकित्सा विश्लेषण का मार्ग प्रशस्त करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →