← नवीनतम पेपर
💻 computer science

Hybrid Offline-Online Reinforcement Learning for Sensorless, High-Precision Force Regulation in Surgical Robotic Grasping

यह शोध पत्र सर्जिकल रोबोटिक ग्रैस्पिंग के लिए एक सेंसरलेस कंट्रोल फ्रेमवर्क प्रस्तुत करता है जो केवल प्रॉक्सिमल मापों का उपयोग करके उच्च-परिशुद्धता वाले डिस्टल फोर्स रेगुलेशन को प्राप्त करने के लिए एक फर्स्ट-प्रिंसिपल डिजिटल ट्विन को हाइब्रिड ऑफलाइन-ऑनलाइन रिइन्फोर्समेंट लर्निंग पाइपलाइन के साथ जोड़ता है, और सिमुलेशन एवं हार्डवेयर प्रयोगों दोनों में अपने प्रदर्शन को सफलतापूर्वक प्रमाणित करता है।

मूल लेखक: Edoardo Fazzari, Omar Mohamed, Khalfan Hableel, Hamdan Alhadhrami, Cesare Stefanini

प्रकाशित 2026-03-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Edoardo Fazzari, Omar Mohamed, Khalfan Hableel, Hamdan Alhadhrami, Cesare Stefanini

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप रोबोटिक चिमटों (tongs) के साथ एक नाजुक अंगूर को उठाने की कोशिश कर रहे हैं, लेकिन एक पेच है: आप अंगूर को देख नहीं सकते, और न ही उसे महसूस कर सकते हैं।

चिमटों को दूर स्थित मोटरों द्वारा नियंत्रित किया जाता है (जैसे एक लंबी छड़ी के हैंडल की तरह), जो पतले, खिंचाव वाले तारों (tendons) के माध्यम से सिरों से जुड़े होते हैं। जैसे ही आप हैंडल हिलाते हैं, तार खिंचते हैं, ट्यूब के अंदर रगड़ खाते हैं और मुड़ जाते हैं। जब तक गति सिरों तक पहुँचती है, वह अव्यवस्थित और अप्रत्याशित हो जाती है। यदि आप बहुत ज़ोर से दबाते हैं, तो आप अंगूर को कुचल देंगे। यदि आप बहुत हल्के से दबाते हैं, तो यह फिसल जाएगा।

यह बिल्कुल वही समस्या है जिसका सामना सर्जिकल रोबोटिक उपकरणों के साथ सर्जन करते हैं। यह शोध पत्र एक शानदार समाधान प्रस्तुत करता है: रोबोट को बिना किसी सेंसर के "महसूस" करना सिखाना।

इसे सरल चरणों में इस प्रकार समझा जा सकता है:

1. "डिजिटल ट्विन" बनाना (एक आभासी सिम्युलेटर)

सबसे पहले, शोधकर्ताओं ने केवल अनुमान नहीं लगाया कि रोबोट कैसे काम करता है। उन्होंने कंप्यूटर के भीतर सर्जिकल टूल का एक अत्यंत सटीक आभासी क्लोन (एक "डिजिटल ट्विन") बनाया।

  • उपमा: इसे एक पायलट के लिए फ्लाइट सिम्युलेटर की तरह समझें। उन्होंने कंप्यूटर को यह जानने के लिए प्रोग्राम किया कि तार कैसे खिंचते हैं, घर्षण (friction) कैसा महसूस होता है, और मोटर कैसे घूमती है। यह इतना यथार्थवादी है कि यदि आप आभासी रोबोट को दबाने के लिए कहते हैं, तो कंप्यूटर जानता है कि टिप कितना बल लगाएगी, भले ही वहां कोई सेंसर न हो।

2. "ओरेकल" (एक आदर्श शिक्षक)

रोबोट को सिखाने के लिए, उन्हें एक आदर्श उदाहरण की आवश्यकता थी जिसे वह अनुसरण कर सके। लेकिन रोबोट इतना जटिल है कि यदि आप इसे केवल परीक्षण और त्रुटि (trial and error) से सीखने देंगे, तो यह चीजों को तोड़ देगा या बार-बार विफल होगा।

  • उपमा: कल्पना कीजिए कि आप एक बच्चे को साइकिल चलाना सिखा रहे हैं। आप उन्हें एक हज़ार बार गिरने के लिए नहीं छोड़ देंगे। इसके बजाय, आपके पास एक पेशेवर साइकिल चालक (ओरेकल) होगा जो पहले उनके साथ चलते हुए बिल्कुल सही तरीके से साइकिल चलाएगा।
  • कंप्यूटर में, उन्होंने एक बहुत ही स्मार्ट गणितीय एल्गोरिदम (जिसे CMA-ES कहा जाता है) का उपयोग इस "ओरेकल" के रूप में किया। इसने गणना की कि मोटरों को भेजने के लिए बिजली के संकेतों का परफेक्ट क्रम क्या होना चाहिए ताकि वह हर बार अंगूर को बिल्कुल सही तरीके से दबा सके। इसने हजारों घंटों के "परफेक्ट प्रैक्टिस" डेटा को तैयार किया।

3. "स्टूडेंट" (एक AI शिक्षार्थी)

अब, उन्हें एक ऐसे छात्र की आवश्यकता थी जो बिना वास्तविक रोबोट को दोबारा छुए, ओरेकल के डेटा से सीख सके।

  • उपमा: यह एक ऐसे छात्र की तरह है जो एक मास्टर शेफ को वीडियो पर लाखों बार खाना बनाते हुए देखता है, हर हरकत को याद करता है, लेकिन वास्तव में कभी रसोई में कदम नहीं रखता।
  • उन्होंने ऑफलाइन रीइन्फोर्समेंट लर्निंग नामक तकनीक का उपयोग किया। AI ने ओरेकल के परफेक्ट डेटा का अध्ययन किया और एक "पॉलिसी" (नियमों का एक सेट) सीखी। उसने सीखा: "जब मैं देखता हूँ कि मोटर इस गति से चल रही है और तार इतना टाइट महसूस हो रहा है, तो मुझे सटीक दबाव पाने के लिए इस विशिष्ट वोल्टेज को भेजना चाहिए।"

4. "फाइन-ट्यूनिंग" (वास्तविक दुनिया का अभ्यास)

छात्र वीडियो गेम में तो बहुत अच्छा था, लेकिन वास्तविक दुनिया अव्यवस्थित है। तार थोड़े अलग हो सकते हैं, या घर्षण बदल सकता है।

  • उपमा: यह उस छात्र की तरह है जो अंततः व्यंजन बनाने के लिए रसोई में कदम रखता है। वह वीडियो से प्राप्त ज्ञान के साथ शुरू करता है, लेकिन वह वास्तविक पैन कैसा महसूस होता है, इसके आधार पर सूक्ष्म समायोजन करता है।
  • उन्होंने AI को वास्तविक रोबोट के साथ थोड़ा सा इंटरैक्ट करने दिया ताकि वह अपने कौशल को "फाइन-ट्यून" कर सके। इसने आभासी दुनिया और वास्तविक दुनिया के बीच के सूक्ष्म अंतरों के अनुकूल होना सीखा।

परिणाम: अलौकिक सटीकता (Superhuman Precision)

अंतिम परिणाम एक छोटा, स्मार्ट कंप्यूटर प्रोग्राम (रोबोट का "मस्तिष्क") है जो केवल एक छोटे ऐप के आकार का है।

  • सेंसर की आवश्यकता नहीं: इसे टिप पर प्रेशर सेंसर की आवश्यकता नहीं है। यह बस मोटरों और तारों को देखता है और जानता है कि यह कितनी ज़ोर से दबा रहा है।
  • अविश्वसनीय सटीकता: परीक्षणों में, रोबोट ने दबाने वाले बल को लक्ष्य के 1% के भीतर रखा। यह एक अंगूर को इतनी कोमलता से पकड़ने जैसा है कि वह दब न जाए, लेकिन इतनी मजबूती से भी कि वह लुढ़क न जाए, भले ही रोबोट तेज़ी से इधर-उधर घूम रहा हो।
  • तेज़: यह एक सेकंड में 26,000 बार सोचता है, जो वास्तविक समय की सर्जरी के लिए पर्याप्त तेज़ है।

यह क्यों महत्वपूर्ण है

पहले, इस तरह के नियंत्रण को प्राप्त करने के लिए, इंजीनियरों को उपकरणों के बहुत छोटे सिरों पर महंगे, नाजुक सेंसर जोड़ने पड़ते थे, जिससे उन्हें स्टरलाइज़ करना कठिन हो जाता था और उनके टूटने की संभावना अधिक होती थी।

यह शोध पत्र दिखाता है कि यदि आप भौतिकी (physics) को अच्छी तरह से समझते हैं और स्मार्ट AI का उपयोग करते हैं, तो आपको अतिरिक्त हार्डवेयर की आवश्यकता नहीं है। आप रोबोट को एक आदर्श आभासी मॉडल देकर और उसे सर्वश्रेष्ठ से सीखने देकर उसे एक "गोल्डन टच" दे सकते हैं। यह मानव शरीर के सबसे नाजुक ऊतकों को संभालने के लिए पर्याप्त कोमल सर्जिकल रोबोट बनाने का एक सस्ता, सरल और सुरक्षित तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →