← नवीनतम पेपर
🤖 machine learning

S3-Tracker: Self-Supervised Surgical Tissue Tracking With Contrastive Random Walks

यह शोधपत्र S3-Tracker को प्रस्तुत करता है, जो एक स्व-पर्यवेक्षित (self-supervised) विधि है जो अनलेबल एंडोस्कोपिक वीडियो पर कंट्रास्टिव रैंडम वॉक का लाभ उठाकर मजबूत सर्जिकल टिश्यू ट्रैकिंग प्राप्त करती है जो अर्ध-पर्यवेक्षित दृष्टिकोणों के तुलनीय है, जिससे कंप्यूटर-सहायता प्राप्त हस्तक्षेप के लिए बड़े एनोटेटेड डेटासेट प्राप्त करने की चुनौती पर विजय मिलती है।

मूल लेखक: Jiaming Zhang, Zijian Wu, Mehran Armand, Septimiu Salcudean

प्रकाशित 2026-09-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiaming Zhang, Zijian Wu, Mehran Armand, Septimiu Salcudean

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मानव शरीर के भीतर, एक सर्जिकल कैमरे का दृश्य अक्सर कोमल, गीले ऊतकों का एक बदलता हुआ परिदृश्य होता है जो उपकरणों के दबाव में खिंचते, मुड़ते और फिसलते रहते हैं। सर्जनों और उनकी सहायता करने वाले रोबोटों के लिए, यह समझना कि ऊतक का हर हिस्सा कहाँ स्थित है, एक निरंतर चुनौती होती है। यदि किसी सर्जन को स्क्रीन पर दिखने वाली चीज़ को प्री-ऑपरेटिव स्कैन, जैसे कि सीटी (CT) या एमआरआई (MRI) के साथ मिलाना हो, तो यह कार्य लगभग असंभव हो जाता है जब ऊतक वास्तविक समय में विकृत (deform) होते हैं। इसे हल करने के लिए, कंप्यूटरों को एक वीडियो फ्रेम से दूसरे फ्रेम तक ऊतक के विशिष्ट बिंदुओं को ट्रैक करने की आवश्यकता होती है, ताकि लाइव दृश्य और रोगी की आंतरिक शारीरिक संरचना के बीच एक निरंतर संबंध बना रहे। हालाँकि आधुनिक आर्टिफिशियल इंटेलिजेंस मानक वीडियो में वस्तुओं का पीछा करने में काफी कुशल हो गया है, लेकिन सर्जरी की अव्यवस्थित वास्तविकता—जो रक्त, धुएं और अत्यधिक परावर्तक सतहों से भरी होती है—ने कंप्यूटर को बिना भारी मात्रा में मानव-लेबल वाले डेटा के इसे विश्वसनीय रूप से करना सिखाना कठिन बना दिया है।

शोधकर्ताओं की एक टीम ने कंप्यूटर को बिना उन कठिन-से-प्राप्त होने वाले लेबल की आवश्यकता के, सर्जिकल ऊतक को ट्रैक करना सिखाने का एक नया तरीका विकसित किया है। कंप्यूटर को हजारों वीडियो दिखाने के बजाय, जिनमें मनुष्यों ने गति दिखाने के लिए बड़ी मेहनत से बिंदु और रेखाएं खींची हों, यह नई विधि स्वयं वीडियो को देखकर और अपने काम की जांच करके सीखती है। यह प्रणाली वीडियो को जुड़े हुए क्षणों की एक श्रृंखला के रूप में मानती है और एक सरल प्रश्न पूछती है: यदि मैं एक फ्रेम में बिंदु A से बिंदु B तक जाता हूँ, और फिर B से वापस A पर जाने की कोशिश करता हूँ, तो क्या मैं ठीक वहीं पहुँचता हूँ जहाँ से मैंने शुरुआत की थी? कंप्यूटर को इस प्रश्न का बार-बार सही उत्तर देने के लिए मजबूर करके, यह समझ जाता है कि पिक्सेल कैसे चलते हैं और विकृत होते हैं, भले ही एक क्षण से दूसरे क्षण में ऊतक बहुत अलग दिखाई दे। यह दृष्टिकोण सिस्टम को बिना किसी मानव विशेषज्ञ द्वारा प्रत्येक फ्रेम को एनोटेट (annotate) करने की बाधा के, बिना लेबल वाले विशाल सर्जिकल फुटेज से सीखने की अनुमति देता है।

शोधकर्ताओं ने अपने सिस्टम को वीडियो फ्रेम के जोड़ों को देखने और यह समझने के लिए बनाया है कि एक फ्रेम के पिक्सेल दूसरे से कैसे संबंधित हैं। वे एक ऐसी प्रक्रिया का उपयोग करते हैं जो इन बिंदुओं के बीच संबंधों का एक मानचित्र बनाती है, जो अनिवार्य रूप से कंप्यूटर को यह अनुमान लगाने के लिए कहती है कि ऊतक के एक टुकड़े ने सबसे संभावित पथ कौन सा लिया होगा। यह सुनिश्चित करने के लिए कि कंप्यूटर केवल रैंडम अनुमान नहीं लगा रहा है, सिस्टम आगे और फिर पीछे की ओर गति चलाकर अपने तर्क की जांच करता है। यदि आगे का पथ और पीछे का पथ एक ही स्थान पर नहीं मिलते हैं, तो सिस्टम जान जाता है कि उसने गलती की है और अपनी समझ को समायोजित करता है। यह स्व-जांच तंत्र, जिसे लेखक 'कॉन्ट्रास्टिव रैंडम वॉक' (contrastive random walk) कहते हैं, मॉडल को बिना किसी मानव द्वारा दिए गए एक भी सही उत्तर को देखे, ऊतक के खिंचाव और मुड़ने के जटिल तरीकों को सीखने में सक्षम बनाता है। सिस्टम में यह निर्णय लेने का एक तरीका भी शामिल है कि कोई बिंदु अब दृश्यमान नहीं है, शायद इसलिए क्योंकि वह रक्त या किसी उपकरण से ढक गया है, और वह तब तक ट्रैकिंग रोक देता है जब तक कि वह पुन: प्रकट न हो जाए, जिससे कंप्यूटर भ्रमित होकर अपने मार्ग से भटकने से बच जाता है।

वास्तविक सर्जिकल वीडियो डेटासेट पर परीक्षण किए जाने पर, यह नई विधि मौजूदा प्रणालियों के मुकाबले एक मजबूत दावेदार साबित हुई जो आंशिक मानव लेबलिंग पर निर्भर करती हैं। शोधकर्ताओं ने पाया कि उनका स्व-पर्यवेक्षित (self-supervised) दृष्टिकोण उन तरीकों की बराबरी कर सकता है जिन्हें कुछ मानव मार्गदर्शन के साथ प्रशिक्षित किया गया है, जबकि यह वास्तविक समय में चलने में काफी तेज़ है। उन परीक्षणों में जो अनुमानित बिंदुओं और वास्तविक ग्राउंड ट्रुथ (ground truth) के बीच की दूरी को मापते हैं, सिस्टम ने विभिन्न त्रुटि थ्रेशोल्ड के माध्यम से 0.708 का औसत सटीकता स्कोर प्राप्त करते हुए अच्छा प्रदर्शन किया, जो इसे नैदानिक उपयोग के लिए व्यवहार्य बनाता है। हालांकि पूरी तरह से सुपरवाइज्ड (supervised) मॉडल, जो पूर्ण मानव लेबल का उपयोग करते हैं, कभी-कभी कच्चे त्रुटि अंतर के मामले में थोड़े अधिक सटीक हो सकते हैं, लेकिन वे अक्सर लाइव सर्जरी के दौरान फ्रेम-दर-फ्रेम काम करने के लिए बहुत धीमे होते हैं। इसके विपरीत, यह नई विधि वीडियो स्ट्रीम के साथ तालमेल बिठाने के लिए पर्याप्त कुशल है, जो प्रति सेकंड तीन बार फ्रेम को प्रोसेस करती है। यह गति, और बिना पूर्व-लेबल वाले डेटा के सर्जरी की दृश्य अराजकता को संभालने की इसकी क्षमता, यह सुझाव देती है कि स्व-पर्यवेक्षित ट्रैकिंग रोबोटिक सर्जरी को निर्देशित करने और मानव शरीर के जटिल, चलते हुए परिदृश्य में सर्जनों को नेविगेट करने में मदद करने के लिए एक व्यावहारिक उपकरण बन सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →