← नवीनतम पेपर
💻 computer science

Surgical WAM: A World-Action Model for Data-Efficient Surgical Robot Learning

यह शोध पत्र सर्जिकल WAM को प्रस्तुत करता है, जो एक जनरेटिव मॉडल है जो विजुअल डायनेमिक्स प्रायर्स (visual dynamics priors) सीखने के लिए प्रचुर मात्रा में एक्शन-मुक्त एंडोस्कोपिक वीडियो का लाभ उठाता है, जो सीमित एक्शन-लेबल वाले प्रदर्शनों पर फाइन-ट्यून किए जाने पर सर्जिकल रोबोट कार्यों में डेटा दक्षता और क्लोज्ड-लूप नियंत्रण प्रदर्शन में महत्वपूर्ण सुधार करता है।

मूल लेखक: Wenrui Bao, Tianyun Jiang, Zhiben Chen, Ser-Nam Lim, Peter D. Peng, Yuzhang Shang

प्रकाशित 2026-08-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenrui Bao, Tianyun Jiang, Zhiben Chen, Ser-Nam Lim, Peter D. Peng, Yuzhang Shang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सूक्ष्म सर्जरी करना सिखाने की कोशिश कर रहे हैं, जैसे कि सुई में धागा पिरोना या मानव शरीर के भीतर गांठ बांधना। यह केवल एक यांत्रिक हाथ को हिलाने के बारे में नहीं है; यह इस बारे में है कि जब कोमल, लचीला ऊतक (tissue) स्पर्श किया जाता है तो वह कैसे प्रतिक्रिया देता है, उपकरण एक-दूसरे के विरुद्ध कैसे फिसलते हैं, और दो हाथों को पूरी तरह से तालमेल में काम करने के लिए कैसे समन्वयित किया जाता है। रोबोटिक्स की दुनिया में, यह स्वचालन (automation) का "पवित्र लक्ष्य" (Holy Grail) है: ऐसी मशीनें बनाना जो एक मास्टर सर्जन की स्थिरता और सटीकता के साथ जटिल, जीवन रक्षक कार्य कर सकें।

रोबोट को ये कौशल सिखाने के लिए, वैज्ञानिकों को आमतौर पर "प्रदर्शनों" (demonstrations) की आवश्यकता होती है। इन्हें प्रशिक्षण वीडियो के रूप में समझें जहाँ एक मानव विशेषज्ञ कार्य को करता है जबकि रोबोट का कंप्यूटर उसके हाथों और बाहों की हर सूक्ष्म गति को रिकॉर्ड करता है। हालाँकि, इन विशिष्ट, सिंक्रनाइज़ किए गए वीडियो को एकत्र करना अत्यंत कठिन, महंगा और धीमा है। इसके लिए विशेष सर्जिकल रोबोट, विशेषज्ञ सर्जन और स्टरिल ऑपरेटिंग रूम की आवश्यकता होती है। परिणामस्वरूप, रोबोटों के पास सीखने के लिए बहुत कम उदाहरण होते हैं, जिससे वे अनाड़ी या असुरक्षित हो जाते हैं। दूसरी ओर, "एक्शन-फ्री" (action-free) वीडियो का एक विशाल भंडार उपलब्ध है—शरीर के अंदर के कैमरों से रिकॉर्ड किए गए सर्जिकल फुटेज के हजारों घंटे, लेकिन बिना इस डेटा के कि वास्तव में रोबोट के हाथ कैसे हिले थे। बड़ा सवाल वैज्ञानिकों ने पूछा है: क्या हम सभी सस्ते वीडियो का उपयोग करके रोबोट को सर्जरी की दृश्य (visual) दुनिया को समझना सिखा सकते हैं, और फिर उस ज्ञान का उपयोग वास्तविक गतिविधियों को बहुत कम उदाहरणों के साथ सीखने के लिए कर सकते हैं?

यह शोध पत्र इस प्रश्न का उत्तर देने के लिए सर्जिकल WAM (वर्ल्ड-एक्शन मॉडल) नामक एक चतुर नई विधि पेश करता है। शोधकर्ता रोबोट की सीखने की प्रक्रिया को दो-चरणीय कुकिंग रेसिपी (व्यंजन विधि) की तरह मानते हैं। पहले, वे रोबोट को एक्शन-फ्री सर्जिकल वीडियो का एक विशाल "सूप" खिलाते हैं। इस चरण के दौरान, रोबोट अपने हाथ कैसे चलाए, यह नहीं सीखता है; इसके बजाय, वह वीडियो के अगले फ्रेम को कैसा दिखना चाहिए, इसकी भविष्यवाणी करना सीखता है। वह दृश्य के "भौतिक विज्ञान" (physics) को सीखता है: सुई कैसे मुड़ती है, ऊतक कैसे खिंचते हैं, और गीली सतहों से प्रकाश कैसे परावर्तित होता है। यह एक छात्र की तरह है जो खाना पकाने के तरीकों को समझने के लिए घंटों तक कुकिंग शो देखता है, बिना कभी चूल्हा छुए।

एक बार जब रोबोट ने सर्जिकल दुनिया का यह मजबूत मानसिक मॉडल बना लिया, तो दूसरा चरण शुरू होता है। शोधकर्ता उसे एक छोटा, निश्चित मात्रा में "एक्शन-लेबल वाला" डेटा देते है—वास्तविक रोबोटिक गतिविधियों के महंगे, सिंक्रनाइज़ किए गए वीडियो। क्योंकि रोबोट पहले चरण से दृश्य गतिशीलता (visual dynamics) को पहले से ही समझ चुका है, वह वास्तविक गतिविधियों को बहुत तेज़ी से और अधिक सटीकता से सीख लेता है। यह मॉडल एक "क्लोज्ड-लूप" कंट्रोलर के रूप में कार्य करता है, जिसका अर्थ है कि यह लगातार भविष्य की भविष्यवाणी करता है, यह जाँचता है कि क्या उसकी भविष्यवाणी वास्तविकता से मेल खाती है, और वास्तविक समय में अपनी योजना को समायोजित करता है, ठीक वैसे ही जैसे एक मानव सर्जन जो अपने हाथ को देखते हुए और अपनी पकड़ को तुरंत सुधारते हुए काम करता है।

एक सिम्युलेटेड सर्जिकल वातावरण में उनके प्रयोगों के परिणाम उत्साहजनक हैं। जब उन्होंने चार अलग-अलग कार्यों पर रोबोट का परीक्षण किया, तो वीडियो प्री-ट्रेनिंग का उपयोग करने वाले संस्करण ने 77.8% बार सफलता प्राप्त की, जबकि वीडियो ट्रेनिंग को छोड़ने वाले संस्करण की सफलता दर केवल 63.5% थी। सबसे कठिन कार्यों पर यह सुधार और भी नाटकीय था, जैसे कि दो बिंदुओं के बीच एक पेग (peg) को स्थानांतरित करना, जहाँ सफलता दर 20 प्रतिशत अंक बढ़ गई। यह शोध पत्र बताता है कि यह विधि रोबोट को तब भी प्रभावी ढंग से सीखने की अनुमति देती है जब "महंगा" मूवमेंट डेटा कम हो। हालाँकि, यह ध्यान देना महत्वपूर्ण है कि ये परिणाम एक सिमुलेशन में प्राप्त किए गए थे, अभी तक वास्तविक मानव रोगियों या भौतिक रोबोटों पर नहीं। लेखकों ने अपने तरीके का परीक्षण एक सार्वजनिक डेटासेट (JIGSAWS) से वास्तविक दुनिया के वीडियो रिकॉर्डिंग पर भी किया और पाया कि वही रुझान बना रहा, जो यह दर्शाता है कि रोब सहित वास्तविक सर्जिकल डायनेमिक्स सीखा, न कि केवल एक वीडियो गेम को याद किया।

यह शोध पत्र स्पष्ट रूप से इस विचार का खंडन करता है कि रोबोट को सीखने के लिए लाखों महंगे, सिंक्रनाइज़ किए गए मूवमेंट रिकॉर्डिंग की आवश्यकता है। इसके बजाय, यह सुझाव देता है कि बाधा मूवमेंट डेटा की कमी नहीं है, बल्कि हमारे पास मौजूद प्रचुर मात्रा में वीडियो डेटा का उपयोग करने के तरीके की कमी है। "दुनिया कैसी दिखती है" को "कैसे हिलना है" से अलग करके, शोधकर्ता दिखाते हैं कि हम समान मात्रा में महंगे डेटा के साथ बहुत बेहतर परिणाम प्राप्त कर सकते हैं। उन्होंने यह भी पाया कि यह दृष्टिकोण उन कार्यों के लिए सबसे अधिक सहायक है जिनमें बहुत अधिक शारीरिक संपर्क शामिल है या जिनमें दो हाथों को मिलकर काम करने की आवश्यकता होती है, जो कि वे कार्य हैं जिन्हें मास्टर करना रोबोट के लिए सबसे कठिन होता है।

संक्षेप में, यह शोध प्रस्तावित करता है कि यदि हम चाहते हैं कि रोबोट विशेषज्ञ सर्जन बनें, तो हमें उन्हें केवल कुछ महंगी ट्रेनिंग टेप दिखाने के लिए मजबूर नहीं करना चाहिए। इसके बजाय, हमें उन्हें दुनिया को समझने के लिए हजारों घंटों के सर्जरी वीडियो देखने देना चाहिए, और फिर उन्हें हिलने-डुलने का एक छोटा, केंद्रित पाठ देना चाहिए। लेखकों का सुझाव है कि यह दृष्टिकोण सर्जिकल रोबोट लर्निंग को बढ़ाने की कुंजी हो सकता है, बिना डेटा रिकॉर्ड करने के लिए हजारों अतिरिक्त सर्जनों को नियुक्त किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →