← नवीनतम पेपर
💻 computer science

NVIDIA Cosmos-H-Dreams: Real-Time Generative Physics Simulation for Surgical Robotics

यह शोध पत्र Cosmos-H-Dreams को पेश करता है, जो एक रियल-टाइम, कंट्रोलर-अज्ञेय (controller-agnostic) जनरेटिव वर्ल्ड मॉडल है जो 160 FPS पर इंटरैक्टिव, फोटो-रियलिस्टिक सर्जिकल सिमुलेशन को सक्षम करने के लिए टीचर-स्टूडेंट डिस्टिलेशन और सेल्फ फोर्सिंग का लाभ उठाता है, जो शिक्षा, सिंथेटिक डेटा जनरेशन और निर्णय समर्थन के लिए महंगी भौतिक प्रयोगों और क्लासिकल सिम्युलेटर्स के बीच के अंतर को पाटता है।

मूल लेखक: Javier Gamazo Tejero, Lukas Zbinden, Keyur Sheth, Raghavendra K M, Nadim Daher, Diego Granero Maraña, Filip Binkiewicz, Patrick Thornycroft, Mahdi Azizian, Sean D. Huver

प्रकाशित 2026-08-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Javier Gamazo Tejero, Lukas Zbinden, Keyur Sheth, Raghavendra K M, Nadim Daher, Diego Granero Maraña, Filip Binkiewicz, Patrick Thornycroft, Mahdi Azizian, Sean D. Huver

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

ऑपरेटिंग रूम में, एक सफल प्रक्रिया और एक जटिलता के बीच का अंतर मिलीमीटर और मिलीसेकंड में मापा जा सकता है। सर्जन रक्त वाहिकाओं को सिलने या अंगों को निकालने जैसे नाजुक कार्यों को करने के लिए रोबोटिक सिस्टम पर भरोसा करते हैं, लेकिन इन क्षणों के लिए प्रशिक्षण ऐतिहासिक रूप से एक धीमी, महंगी और अक्सर खतरनाक प्रक्रिया रही है। सीखने के लिए, एक प्रशिक्षु पशु ऊतकों या एक शव (cadaver) पर अभ्यास कर सकता है, जो ऐसे संसाधन हैं जो सीमित हैं और जिन्हें दोबारा उपयोग नहीं किया जा सकता। वैकल्पिक रूप से, वे कंप्यूटर सिमुलेशन का उपयोग कर सकते हैं, लेकिन ये लंबे समय से वास्तविक चीज़ों की तरह दिखने और व्यवहार करने के लिए संघर्ष करते रहे हैं; ये अक्सर यह पकड़ने में विफल रहते हैं कि सॉफ्ट टिश्यू (कोमल ऊतक) कैसे लहरें पैदा करते हैं, रक्तस्राव करते हैं, या सर्जिकल टूल की गर्मी के प्रति कैसे प्रतिक्रिया करते हैं। दशकों से, डिजिटल प्रशिक्षण मैदान और भौतिक ऑपरेटिंग थिएटर के बीच की खाई चौड़ी बनी हुई है, जिससे सर्जन काफी हद तक अंतर्ज्ञान और सीमित अभ्यास घंटों पर निर्भर रहने को मजबूर हैं।

NVIDIA और CMR Surgical की एक शोध टीम ने अब इस अंतर को पाटने के लिए एक प्रणाली बनाई है, जो एक ऐसी डिजिटल दुनिया का निर्माण करती है जहाँ सर्जिकल रोबोट को वास्तविक समय में प्रशिक्षित और परीक्षण किया जा सकता है। वे अपनी इस रचना को 'Cosmos-H-Dreams' कहते हैं। पिछले सिमुलेशन के विपरीत, जो केवल पूर्व-रिकॉर्ड किए गए वीडियो चलाते हैं या कठोर भौतिक इंजन (physics engines) पर निर्भर करते हैं जो सख्त और कृत्रिम दिखते हैं; यह प्रणाली वास्तविक समय में नए वीडियो फ्रेम उत्पन्न करती है, जो सर्जन या कंप्यूटर प्रोग्राम की गतिविधियों के प्रति तुरंत प्रतिक्रिया देती है। यह एक जनरेटिव मॉडल है, जो एक प्रकार का आर्टिफिशियल इंटेलिजेंस है जो हजारों घंटों के वास्तविक सर्जिकल फुटेज को देखकर भौतिकी के नियमों और सर्जरी के दृश्य स्वरूप को सीखता है। इसका परिणाम एक ऐसा सिम्युलेटर है जो लाइव इंटरैक्शन की तरह महसूस होने के लिए पर्याप्त तेज़ चलता है, जिससे एक इंसान कीबोर्ड या हेडसेट के साथ एक वर्चुअल रोबोट को नियंत्रित कर सकता है, या एक कंप्यूटर एल्गोरिदम को बिना किसी भौतिक उपकरण को छुए गांठ बांधना सीख सकता है।

इस उपलब्धि का मूल आधार एक दो-भाग वाली रणनीति है जो उच्च गुणवत्ता वाले दृश्यों की आवश्यकता और गति की आवश्यकता के बीच संतुलन बनाती है। शोधकर्ताओं ने पहले नौ अलग-अलग प्रकार के रोबोटिक सिस्टम के विशाल संग्रह से प्राप्त व्यापक सर्जिकल डेटा पर एक विशाल "टीचर" (शिक्षक) मॉडल को प्रशिक्षित किया। इस टीचर ने उच्च सटीकता के साथ भविष्यवाणी करना सीखा कि सर्जिकल दृश्य में आगे क्या होगा, लेकिन यह लाइव इंटरैक्शन के लिए बहुत धीमा था; प्रत्येक नया फ्रेम कैलकुलेट करने में इसे बहुत अधिक समय लगता था। इसे हल करने के लिए, उन्होंने एक छोटा, तेज़ "स्टूडेंट" (छात्र) मॉडल बनाया। उन्होंने 'डिस्टिलेशन' (distillation) नामक तकनीक का उपयोग किया, जहाँ स्टूडेंट टीचर की भविष्यवाणियों की नकल करना सीखता है लेकिन वह बहुत अधिक कुशल तरीके से करता है। स्टूडेंट को दर्जनों के बजाय केवल दो चरणों में वीडियो फ्रेम के छोटे विस्फोट उत्पन्न करने के लिए सिखाकर, और सॉफ्टवेयर को एक एकल शक्तिशाली कंप्यूटर चिप पर चलाने के लिए अनुकूलित करके, टीम ने गति में एक बड़ी सफलता हासिल की। सिस्टम अब एक सिंगल वर्कस्टेशन पर लगभग 160 फ्रेम प्रति सेकंड की दर से निरंतर यथार्थवादी सर्जिकल वीडियो का प्रवाह उत्पन्न कर सकता है, जो उस अंतराल (lag) को खत्म करने के लिए पर्याप्त है जो आमतौर पर वर्चुअल रियलिटी को विखंडित महसूस कराता है।

जो इस प्रणाली को वास्तव में अद्वितीय बनाता है, वह है किसी भी स्रोत से नियंत्रण स्वीकार करने की इसकी क्षमता। शोधकर्ताओं ने प्रदर्शित किया कि सिम्युलेटर को कीबोर्ड पर टाइप करने वाले व्यक्ति, वर्चुअल रियलिटी हेडसेट पहने हुए एक सर्जन, या यहाँ तक कि 'Versius' जैसे एक कमर्शियल सर्जिकल रोबोट कंसोल द्वारा संचालित किया जा सकता है। इसे एक आर्टिफिशियल इंटेलिजेंस पॉलिसी द्वारा भी नियंत्रित किया जा सकता है जो अपने आप कार्यों को करने के लिए सीख रही है। इन प्रयोगों में, AI अपने द्वारा उत्पन्न वीडियो को देखता है, एक गति का निर्णय लेता है, और फिर उस गति के तत्काल दृश्य परिणाम को देखता है, जिससे सीखने का एक क्लोज्ड लूप (closed loop) बन जाता है। यह पहली बार है जब ऐसे इंटरैक्टिव, रियल-टाइम वर्ल्ड मॉडल को सर्जरी में लागू किया गया है, जिससे मनुष्य और मशीन दोनों एक सिंथेसाइज्ड वातावरण के भीतर कार्य कर सकते हैं और परिणामों को तुरंत देख सकते हैं।

शोधकर्ताओं ने इस डिजिटल दुनिया के व्यवहार का परीक्षण करने के लिए सिस्टम का कड़ाई से परीक्षण किया कि क्या यह वास्तविक दुनिया की तरह व्यवहार करती है। उन्होंने सिम्युलेटर को हजारों स्यूटिंग (टांके लगाने के) कार्यों के माध्यम से चलाया और परिणामों की तुलना उन कार्यों से की जो एक भौतिक रोबोट पर किए गए थे। परिणामों ने सिमुलेशन और वास्तविक दुनिया के परिणामों के बीच मध्यम समग्र सहमति दिखाई, जिसमें कार्यों के बीच 0.696 का पियर्सन सहसंबंध (Pearson correlation) रहा। हालांकि, विशिष्ट प्रक्रियाओं के आधार पर प्रदर्शन काफी भिन्न था। सिस्टम ने वस्तुओं को उठाने और फेंकने जैसे कार्यों के लिए अपेक्षाकृत मजबूत सहमति दिखाई, लेकिन गांठ बांधने जैसे अधिक जटिल कार्यों के लिए, सहसंबंध नकारात्मक था, जो यह दर्शाता है कि सिम्युलेटर कभी-कभी वहां सफलता की भविष्यवाणी करता है जहां वास्तविक रोबोट विफल हो जाता है, या इसके विपरीत। सिस्टम ने अधिकांश परिदृश्यों में सॉफ्ट टिश्यू के भौतिक विज्ञान और सर्जिकल टूल्स के व्यवहार को सटीक रूप से कैप्चर किया। हालांकि, अध्ययन ने इस तकनीक की सीमाओं को भी उजागर किया। जब सिमुलेशन में अत्यंत सूक्ष्म, ओवरलैपिंग संरचनाएं शामिल थीं, जैसे कि गांठ बांधने के कार्य के दौरान धागे का अपने ऊपर मुड़ना, तो सिस्टम ने कभी-कभी गलतियाँ कीं, धागे के आकार को इस तरह से 'हैलुसिनेट' (hallucination) किया जो वास्तविकता से मेल नहीं खाता था। ये त्रुटियां तेज़, रियल-टाइम संस्करण में अधिक आम थीं, जो धीमे, अधिक सटीक टीचर मॉडल की तुलना में, यह सुझाव देती हैं कि हालांकि यह प्रणाली प्रशिक्षण और मूल्यांकन के लिए एक शक्तिशाली उपकरण है, यह अभी भी हर प्रकार के नाजुक हेरफेर के लिए पूर्ण नहीं है।

इन सीमाओं के बावजूद, इस कार्य के निहितार्थ महत्वपूर्ण हैं। एक सुरक्षित, स्केलेबल और फोटो-रियलिस्टिक वातावरण प्रदान करके, Cosmos-H-Dreams सर्जिकल शिक्षा के लिए एक नया आधार प्रदान करता है। सर्जन अब बिना कैडेवर या जानवरों की आवश्यकता के जटिल प्रक्रियाओं का बार-बार अभ्यास कर सकते हैं, और रोबोटिक पॉलिसियों को अस्पताल में तैनात करने से पहले एक डिजिटल सैंडबॉक्स में प्रशिक्षित और परिष्कृत किया जा सकता है। शोधकर्ताओं ने कोड और मॉडल को सार्वजनिक रूप से उपलब्ध कराया है, इस उम्मीद में कि इससे सुरक्षित सर्जिकल रोबोट और बेहतर प्रशिक्षण उपकरणों के विकास में तेजी आएगी। जबकि वर्तमान में यह सिस्टम टेबलटॉप स्यूटिंग कार्यों पर केंद्रित है, टीम इसे जटिल एनाटॉमी वाले पूर्ण नैदानिक (clinical) प्रक्रियाओं को कवर करने के लिए विस्तारित करने की कल्पना करती है। फिलहाल, यह एक प्रमाण (proof of concept) के रूप में खड़ा है कि सर्जिकल प्रशिक्षण का भविष्य एक भौतिक लैब में नहीं, बल्कि एक रियल-टाइम, जनरेटिव दुनिया में है, जहाँ गलतियाँ सुरक्षित हैं और सीखना अनंत है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →