← नवीनतम पेपर
💻 computer science

Fine-Tuned Foundation Models for Multi-Category Segmentation and Triplet Recognition in Gastric Cancer Surgery

यह अध्ययन एक फाइन-ट्यून्ड फाउंडेशन मॉडल दृष्टिकोण प्रस्तुत करता है जो गैस्ट्रिक कैंसर सर्जरी में इंट्राऑपरेटिव मार्गदर्शन और स्वचालित कौशल मूल्यांकन को उन्नत करने के लिए, सर्जिकल उपकरणों और शरीर रचना विज्ञान के उच्च-सटीक सिमेंटिक सेगमेंटेशन के साथ-साथ सर्जिकल एक्शन ट्रिपलेट्स की सुदृढ़ पहचान प्राप्त करने हेतु 2,909 एनोटेटेड फ्रेम्स के एक नए क्यूरेटेड डेटासेट का लाभ उठाता है।

मूल लेखक: Xiaopeng Wang, Youdong Liu, Yi Wang, Rongyu Ma, Jie Chen, Jingzhe Qian, Zikai Wang, Yuanyuan Lin, Jiansen Song, Keyuan Hu, Hongda Pan, Fenglin Liu, Jun Lu

प्रकाशित 2026-09-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaopeng Wang, Youdong Liu, Yi Wang, Rongyu Ma, Jie Chen, Jingzhe Qian, Zikai Wang, Yuanyuan Lin, Jiansen Song, Keyuan Hu, Hongda Pan, Fenglin Liu, Jun Lu

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मानव शरीर के भीतर, पेट कोमल ऊतकों, रक्त वाहिकाओं और नाजुक अंगों का एक जटिल परिदृश्य है, जो एक तंग जगह में भरे हुए हैं। जब सर्जन कैंसरयुक्त पेट को निकालते हैं, तो उन्हें अत्यंत सटीकता के साथ इस जटिल वातावरण में नेविगेट करना होता है, जिसमें अक्सर छोटे चीरों के माध्यम से डाले गए लंबे, पतले उपकरणों का उपयोग किया जाता है। यह एक उच्च जोखिम वाला कार्य है जहाँ एक भी चूक गंभीर नुकसान पहुंचा सकती है। दशकों तक, इसका समाधान पूरी तरह से सर्जन की आँखों और अनुभव पर निर्भर रहा है, लेकिन विज्ञान का एक नया क्षेत्र उन्हें डिजिटल दूसरी जोड़ी आँखें देने का प्रयास कर रहा है। यह क्षेत्र सर्जिकल वीडियो को देखने और वास्तविक समय में क्या हो रहा है इसे पहचानने के लिए आर्टिफिशियल इंटेलिजेंस (कृत्रिम बुद्धिमत्ता) का उपयोग करता है। मूल विचार सरल है: यदि कंप्यूटर को सर्जिकल उपकरण और एक महत्वपूर्ण अंग के बीच अंतर देखना सिखाया जा सके, या यह समझना सिखाया जा सके कि किसी दिए गए क्षण में सर्जन वास्तव में क्या कर रहा है, तो यह अंततः गलत होने से पहले उन्हें खतरे के प्रति सचेत कर सकता है। इसके लिए मशीनों को न केवल आकृतियों को देखना, बल्कि सर्जरी के दौरान विकसित होने वाली कहानी को समझना सिखाना आवश्यक है।

शोधकर्ताओं की एक टीम ने एक विशेष लाइब्रेरी (पुस्तकालय) बनाकर और कंप्यूटर को उन्हें पढ़ना सिखाकर इस लक्ष्य की ओर एक महत्वपूर्ण कदम उठाया है। उन्होंने गैस्ट्रिक कैंसर सर्जरी पर ध्यान केंद्रित किया, जो एक ऐसी प्रक्रिया है जिसे कठिन और जटिलताओं के उच्च जोखिम वाली प्रक्रिया माना जाता है। टीम ने वास्तविक ऑपरेशनों से लगभग तीन हजार वीडियो फ्रेम एकत्र किए, जिसमें पारंपरिक लैप्रोस्कोपिक विधियों और नई रोबोट-सहायता प्राप्त तकनीकों, दोनों को कैद किया गया। इन छवियों से, उन्होंने हर सर्जिकल उपकरण और हर दृश्यमान शारीरिक संरचना, जैसे कि पेट, रक्त वाहिकाओं और लिम्फ नोड्स के चारों ओर विस्तृत रूपरेखा (आउटलाइन) को मैन्युअल रूप से खींचा। उन्होंने उनके बीच की अंतःक्रियाओं को भी लेबल किया, जिससे एक संरचित रिकॉर्ड बना कि किस उपकरण का उपयोग किया गया था, उसने क्या क्रिया की थी, और वह किस ऊतक को छू रहा था। इस विशाल प्रयास के परिणामस्वरूप लगभग उन्नीस हजार विशिष्ट एनोटेशन (विवरण) वाला एक डेटासेट प्राप्त हुआ, जो सर्जिकल क्षेत्र का एक समृद्ध, विस्तृत मानचित्र प्रदान करता है जो पहले गायब था।

इस नई लाइब्रेरी के साथ, शोधकर्ताओं ने एक शक्तिशाली प्रकार के आर्टिफिशियल इंटेलिजेंस का परीक्षण किया जिसे 'फाउंडेशन मॉडल' कहा जाता है। इस मॉडल को एक ऐसे छात्र के रूप में समझें जिसने पहले से ही लाखों मेडिकल इमेज का अध्ययन किया है और चिकित्सा छवियों के बारे में सामान्य नियम सीख लिए हैं, बजाय इसके कि वह शून्य से शुरुआत करने वाला छात्र हो। शोधकर्ताओं ने इस पूर्व-प्रशिक्षित छात्र को विशेष रूप से पेट की सर्जरी के वीडियो पर ध्यान केंद्रित करने के लिए फाइन-ट्यून किया। उन्होंने कंप्यूटर को दो कार्य करने के लिए कहा: पहला, उपकरणों और अंगों के चारों ओर सटीक सीमाएं खींचना, और दूसरा, वीडियो में हो रही उपकरणों, क्रियाओं और लक्ष्यों के विशिष्ट संयोजनों की पहचान करना। उन्होंने इस उन्नत दृष्टिकोण की तुलना एक अधिक पारंपरिक, सरल कंप्यूटर विज़न पद्धति से की ताकि यह देखा जा सके कि कौन सा वास्तविक दुनिया की जटिलता को बेहतर ढंग से संभाल सकता है।

परिणामों ने दिखाया कि उन्नत फाउंडेशन मॉडल देखने और रूपरेखा बनाने के कार्य में कहीं अधिक श्रेष्ठ था। जब सर्जिकल उपकरणों की पहचान करने के लिए कहा गया, तो मॉडल ने नब्बे प्रतिशत से अधिक मामलों में उपकरण के आकार को छवि के साथ सही ढंग से मिलाया। पेट या रक्त वाहिकाओं जैसी शारीरिक संरचनाओं की पहचान करते समय, इसने लगभग नब्बे प्रतिशत की सफलता दर हासिल की। इसके विपरीत, पारंपरिक पद्धति संघर्ष करती दिखी, जो अक्सर खंडित या अपूर्ण रूपरेखा बनाती थी और महत्वपूर्ण विवरणों को छोड़ देती थी। शोधकर्ताओं ने पाया कि उन्नत मॉडल सर्जरी की अव्यवस्थित वास्तविकता को—जहाँ उपकरण कभी-कभी रक्त या धुएं से छिपे होते हैं—पुरानी तकनीक की तुलना में बहुत बेहतर तरीके से संभाल सकता है। यह सुझाव देता है कि फाउंडेशन मॉडल के चिकित्सा छवियों के पूर्व ज्ञान ने उसे पेट की सर्जरी की विशिष्ट बारीकियों को तेजी से और सटीक रूप से सीखने में स्पष्ट लाभ दिया।

दूसरा कार्य, जो हो रही विशिष्ट क्रियाओं को पहचानना था, अधिक चुनौतीपूर्ण लेकिन आशाजनक साबित हुआ। शोधकर्ताओं ने कंप्यूटर से प्रत्येक घटना के "ट्रिपलेट" (तिगुनी पहचान) की भविष्यवाणी करने के लिए कहा: उपकरण, क्रिया और लक्ष्य। उदाहरण के लिए, सिस्टम को यह समझने की आवश्यकता थी कि एक विशिष्ट उपकरण वसायुक्त ऊतक के टुकड़े को काट रहा है। हालांकि कंप्यूटर अभी भी पूर्ण नहीं था, फिर भी इसने समान कार्यों के पिछले प्रयासों की तुलना में काफी बेहतर प्रदर्शन किया। विश्लेषण से पता चला कि कंप्यूटर क्रिया को पहचानने में सबसे विश्वसनीय था, जैसे कि काटना या खींचना, जबकि यह सटीक रूप से यह पहचानने में थोड़ा कम सटीक था कि कौन सा उपकरण या कौन सा विशिष्ट अंग शामिल था। ऐसा इसलिए है क्योंकि इस डेटासेट में कई सामान्य क्रियाएं थीं लेकिन दुर्लभ, जटिल युक्तियों के बहुत कम उदाहरण थे। शोधकर्ताओं ने नोट किया कि सबसे कठिन मामले दुर्लभ उपकरणों या विशिष्ट शारीरिक लक्ष्यों से जुड़े थे जो डेटा में केवल कुछ ही बार दिखाई दिए, जो यह दर्शाता है कि सिस्टम को पूरी तरह से सुदृढ़ होने के लिए अभी भी इन असामान्य परिदृश्यों के संपर्क की आवश्यकता है।

अध्ययन यह निष्कर्ष निकालता है कि हालांकि यह तकनीक अभी स्वयं सर्जरी चलाने के लिए तैयार नहीं है, लेकिन इसने सटीकता का एक ऐसा स्तर प्राप्त कर लिया है जो भविष्य के सुरक्षा उपकरणों के लिए एक व्यवहार्य आधार बनाता है। शोधकर्ता इस बात पर जोर देते हैं कि इस कार्य का वास्तविक मूल्य केवल आंकड़ों में नहीं है, बल्कि इसमें है कि वे क्या सक्षम बनाते हैं: एक ऐसा सिस्टम जो एक दिन सर्जरी देख सकता है और सर्जन को सचेत कर सकता है कि कोई उपकरण महत्वपूर्ण धमनी के बहुत करीब है या कोई महत्वपूर्ण चरण गलत तरीके से किया जा रहा है। टीम स्वीकार करती है कि उनका कार्य एक एकल अस्पताल के डेटा पर आधारित है और मॉडलों को विभिन्न सर्जनों और उपकरणों पर परीक्षण करने की आवश्यकता है ताकि यह सुनिश्चित हो सके कि वे हर जगह काम करें। हालांकि, यह सिद्ध करके कि ये उन्नत मॉडल पेट की सर्जरी की जटिल दृश्य भाषा को समझ सकते हैं, यह अध्ययन अगली पीढ़ी के सर्जिकल मार्गदर्शन प्रणालियों के निर्माण के लिए आवश्यक तकनीकी आधार प्रदान करता है जो एक दिन गलतियों को रोकने के माध्यम से जीवन बचा सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →