← नवीनतम पेपर
💻 computer science

Toward Mask Annotation-Free Surgical Instrument Segmentation from Endoscopic Images Using Text-Prompted Segment Anything Model 3 (SAM3)

यह शोध पत्र एक दो-चरणीय, एनोटेशन-मुक्त ढांचे का प्रस्ताव करता है जो इंस्टेंस-स्तर के सर्जिकल इंस्ट्रूमेंट सेगमेंटेशन को प्राप्त करने के लिए सेगमेंट एनीथिंग मॉडल 3 (SAM3) की ज़ीरो-शॉट क्षमताओं को एक फाइन-ट्यून्ड विजन-लैंग्वेज मॉडल के साथ जोड़ता है, जो सीधे टेक्स्ट-प्रॉम्प्टेड SAM3 अनुप्रयोग की तुलना में महत्वपूर्ण सुधार प्रदर्शित करता है, हालांकि यह पूरी तरह से सुपरवाइज्ड विधियों से पीछे रह जाता है।

मूल लेखक: Nakul Poudel, Richard Simon, Cristian A. Linte

प्रकाशित 2026-08-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Nakul Poudel, Richard Simon, Cristian A. Linte

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सर्जरी करना सिखाने की कोशिश कर रहे हैं। इसे सुरक्षित रूप से करने के लिए, रोबोट को वीडियो फीड में यह सटीक रूप से पता होना चाहिए कि सर्जिकल उपकरण कहाँ हैं, और उसे कैंची और ऊतक (tissue) या छाया के बीच अंतर करना आना चाहिए। इसे "सर्जिकल इंस्ट्रूमेंट सेगमेंटेशन" कहा जाता है। लंबे समय तक, रोबोट को यह कौशल सिखाने का एकमात्र तरीका यह था कि मानव विशेषज्ञों को हजारों घंटों के वीडियो में हर उपकरण के चारों ओर पिक्सेल-दर-पिक्सेल रूपरेखा (outlines) खींचने के लिए काम पर रखा जाए। यह एक बच्चे को कुत्ते को पहचानना सिखाने जैसा है, जहाँ उसे लाखों ऐसी तस्वीरें दिखाई जाती हैं जिनमें किसी ने बड़ी मेहनत से हर एक कुत्ते के बालों को रंगकर दिखाया हो। यह काम करता है, लेकिन यह धीमा, महंगा और बड़े पैमाने पर करना कठिन है।

हाल ही में, "सेगमेंट एनीथिंग मॉडल" (या SAM) नामक एक नए प्रकार का AI सामने आया है। SAM को एक सुपर-पावर्ड हाइलाइटर के रूप में समझें जो किसी तस्वीर में किसी भी वस्तु को तुरंत रंग सकता है, यदि आप बस उसकी ओर इशारा करें या "टूल" जैसा एक सरल टेक्स्ट कमांड दें। इसे लाखों रोज़मर्रा की तस्वीरों पर प्रशिक्षित किया गया था, इसलिए यह वास्तविक दुनिया में चीजों को खोजने में बहुत कुशल है। हालाँकि, जब शोधकर्ताओं ने इस हाइलाइटर को शरीर के अंदर की सर्जरी के अजीब, चमकदार और भ्रमित करने वाले वीडियो की दुनिया में इस्तेमाल करने की कोशिश की, तो यह उलझ गया। रोबोट यह नहीं समझ पाया कि सर्जरी के वीडियो में "ग्रैस्पर" (grasper) या "कैंची" का वही अर्थ है जो रसोई की फोटो में होता है। रोबोट के प्रशिक्षण और सर्जिकल वास्तविकता के बीच का अंतर बहुत बड़ा था, और केवल उपकरण का नाम चिल्लाने से काम नहीं चला।

नकुल पौडेल और उनके सहयोगियों का यह शोध पत्र ठीक इसी समस्या का समाधान करता है। वे यह देखना चाहते थे कि क्या वे रोबोट को बिना किसी मानव-निर्मित रूपरेखा (मास्क) या मैन्युअल पॉइंटिंग के सर्जिकल उपकरणों को खोजने और पहचानने के योग्य बना सकते हैं। उन्होंने केवल रोबोट को विशिष्ट उपकरणों के नाम समझने के लिए मजबूर नहीं किया; इसके बजाय, उन्होंने एक दो-चरणीय "जासूसी टीम" बनाई। पहले, उन्होंने हाइलाइटर (एक नया संस्करण जिसे SAM3 कहा गया) का उपयोग एक बहुत ही सरल, सामान्य कमांड के साथ किया: "टूल"। इसने सफलतापूर्वक उपकरणों के आकार को खोज लिया, भले ही वह अभी तक उनके नाम न जानता हो। फिर, उन्होंने इन आकारों को एक दूसरे AI, "क्यूवेन" (Qwen) नामक एक "मस्तिष्क" को सौंपा, जिसे इन हाइलाइट किए गए आकारों को देखने और यह अनुमान लगाने के लिए सिखाया गया था कि वह किस प्रकार का उपकरण है।

परिणाम "अभी पूरी तरह से सटीक नहीं" और "बहुत आशाजनक" का मिश्रण थे। टीम ने पाया कि हालांकि उनकी नई दो-चरणीय विधि उन सर्वश्रेष्ठ रोबोटों से बेहतर नहीं थी जिन्हें हजारों मानव-निर्मित रूपरेखाओं के साथ प्रशिक्षित किया गया था, लेकिन यह सीधे टूल के नामों के साथ हाइलाइटर का उपयोग करने की तुलना में एक बहुत बड़ा सुधार था। वास्तव में, सीधा तरीका अक्सर पूरी तरह से विफल हो जाता था, या तो उपकरणों को पूरी तरह से छोड़ देता था या उनके नाम गलत बताता था। नई विधि ने कई मामलों में उपकरणों की सफलतापूर्वक पहचान की, जिससे यह सिद्ध हुआ कि आप बिना भारी मैन्युअल ड्राइंग के बोझ के एक रोबोट को सर्जिकल उपकरणों को "देखने" के योग्य बना सकते हैं। हालाँकि, लेखक सावधानीपूर्वक यह नोट करते हैं कि सिस्टम अभी भी गलतियाँ करता है, विशेष रूप से तब जब उपकरण छिपे हुए हों या जब हाइलाइटर अव्यवस्थित आकार बनाता हो। वे सुझाव देते हैं कि भले ही यह कोई जादुई समाधान नहीं है जो आज सब कुछ हल कर दे, लेकिन यह एक ऐसे भविष्य के द्वार खोलता है जहाँ सर्जिकल रोबोट बहुत तेज़ी से और कम लागत में सीख सकते हैं, बिना हर एक तस्वीर को चित्रित करने के लिए इंसानों की सेना की आवश्यकता के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →