← नवीनतम पेपर
💻 computer science

Minute-Scale Training for Microrobot Navigation

यह शोध पत्र एक ऐसे लर्निंग फ्रेमवर्क को प्रस्तुत करता है जो एक हाई-थ्रूपुट वेक्टराइज्ड सिम्युलेटर के साथ टास्क-शेपिंग-रेगुलराइजेशन रिवॉर्ड सिस्टम को जोड़कर मिनटों के भीतर प्रभावी माइक्रोरोबोट नेविगेशन प्राप्त करता है, जिससे तीव्र प्रशिक्षण और विविध परिदृश्यों में ज़ीरो-शॉट परिनियोजन सक्षम होता है।

मूल लेखक: Yinghan Sun, Aoji Zhu, Xiang Ji, Yamei Li, Jiachi Zhao, Yun Wang, Li Zhang, Huijun Gao, Lidong Yang

प्रकाशित 2026-08-04
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yinghan Sun, Aoji Zhu, Xiang Ji, Yamei Li, Jiachi Zhao, Yun Wang, Li Zhang, Huijun Gao, Lidong Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ सूक्ष्म, अदृश्य रोबोट आपके रक्तप्रवाह में सूक्ष्म पनडुब्बियों की तरह तैर रहे हैं, जो सीधे ट्यूमर तक दवा पहुँचाते हैं या बंद धमनी को साफ करते हैं। यह विज्ञान कथा नहीं है; यह माइक्रोरोबोटिक्स का अत्याधुनिक क्षेत्र है। लेकिन यहाँ एक पेंच है: ये रोबोट इतने छोटे हैं कि इनमें जीपीएस (GPS) या कंप्यूटर मस्तिष्क नहीं हो सकता। इसके बजाय, वे दूर स्थित एक कंप्यूटर में रहने वाले "मस्तिष्क" द्वारा निर्देशित होकर, चलने के लिए चुंबकीय क्षेत्रों पर निर्भर करते हैं। मानव रक्त वाहिकाओं के घुमावदार, मुड़ने वाले और शाखाओं वाले भूलभुलैया में इस मस्तिष्क को नेविगेट करना सिखाने के लिए, वैज्ञानिक 'डीप रीइन्फोर्समेंट लर्निंग' (DRL) नामक विधि का उपयोग करते हैं। DRL को एक कुत्ते को चीज़ें लाना सिखाने जैसा समझें: कंप्यूटर लाखों चालें आज़माता है, जब वह कुछ सही करता है तो उसे एक "इनाम" (पुरस्कार) मिलता है, और जब वह टकरा जाता है तो उसे "डाँट" मिलती है। समस्या यह है कि लंबे समय तक, इन डिजिटल मस्तिष्कों को सिखाने में बहुत समय लगता था—लगातार प्रशिक्षण के कई दिन या हफ्तों—जिससे नए विचारों का तेज़ी से परीक्षण करना या अलग-अलग रोबोट आकृतियों के अनुकूल होना असंभव हो जाता था।

अब, शोधकर्ताओं की एक टीम ने इस प्रक्रिया को नाटकीय रूप से तेज़ करने का कोड क्रैक कर लिया है। उन्होंने एक सुपर-चार्ज्ड प्रशिक्षण प्रणाली बनाई है जो एक माइक्रोरोबोट को दस मिनट से भी कम समय में जटिल संवहनी वातावरण (vascular environments) में नेविगेट करना सिखा सकती है। एक बार में एक नकली रक्त वाहिका में एक रोबलेट को प्रशिक्षित करने के बजाय, उन्होंने एक साथ चल रहे 10,000 से अधिक विभिन्न संवहनी मानचित्रों के साथ एक विशाल डिजिटल खेल का मैदान बनाया। उन्होंने एक नया तरीका भी आविष्कार किया जिससे "इनाम" और "डाँट" दी जाती है, जो रोबोट को न केवल लक्ष्य तक कैसे पहुँचना है, बल्कि इसे सुचारू रूप से और सुरक्षित रूप से कैसे करना है, यह सीखने में मदद करता है। परिणाम? एक ऐसा रोबोट जो मिनटों में बाधाओं से बचना और तंग कोनों में तैरना सीख सकता है, और फिर तुरंत वास्तविक दुनिया में कूदकर विभिन्न प्रकार के सूक्ष्म रोबोटों को निर्देशित कर सकता है—यहाँ तक कि उन्हें भी जिन्हें उसने पहले कभी नहीं देखा है—बिना किसी अतिरिक्त अभ्यास के।

नन्हे रोबोटों के लिए "स्पीड रन"

शोधकर्ताओं ने, यिंगहान सन और सहयोगियों के नेतृत्व में, माइक्रोरोबोटिक्स की दुनिया की दो बड़ी समस्याओं को हल किया: गति और समझ।

गति की समस्या: एक लेन से सुपरहाइवे तक
पारंपरिक रूप से, इन रोबोटों को प्रशिक्षित करना एक-एक करके छात्रों को कक्षा में बुलाकर उन्हें पढ़ाने जैसा था। पुराने तरीके एक समय में केवल एक ही वातावरण का अनुकरण (simulate) करते थे, जो लगभग 110 स्टेप्स प्रति सेकंड की धीमी गति से डेटा उत्पन्न करते थे। इसका मतलब था कि एक एकल पॉलिसी (नियमों का समूह जिसका रोबोट पालन करता है) को प्रशिक्षित करने में 10 घंटे या कई दिन लग सकते थे।

टीम ने एक "फुली वेक्टराइज्ड" सिम्युलेटर बनाकर इस समस्या को हल किया। कल्पना कीजिए कि छात्रों को एक-एक करके बुलाने के बजाय, आप एक स्टेडियम खोल देते हैं जहाँ 10,000 कक्षाएं एक साथ चल रही हैं। उनके नए सिस्टम में, वे एक ही समय में 13,000 से अधिक कृत्रिम रक्त वाहिका वातावरणों का अनुकरण करते हैं। शक्तिशाली कंप्यूटर चिप्स (GPUs) का उपयोग करके इन सभी सिमुलेशन को समानांतर (parallel) रूप से प्रोसेस करके, उन्होंने डेटा जनरेशन की गति को लगभग 1,90,000 ट्रांज़िशन प्रति सेकंड तक बढ़ा दिया। यह एक विशाल छलांग है, जिसने प्रशिक्षण के समय को दिनों से घटाकर 10 मिनट से भी कम कर दिया है।

समझ की समस्या: "TSR" रिवॉर्ड सिस्टम
तेज़ कंप्यूटरों के बावजूद, यदि "इनाम" और "डाँट" अच्छी तरह से डिज़ाइन नहीं की गई हैं, तो रोबोट गलत चीजें सीख सकता है। शोधकर्ताओं ने पाया कि केवल रोबोट को यह कहना कि "यदि आप लक्ष्य तक पहुँचते हैं तो आप जीतते हैं" या "यदि आप टकराते हैं तो आप हारते हैं" (स्पार्स रिवॉर्ड) पर्याप्त नहीं था। रोबोट भ्रमित हो जाता, और अक्सर कुछ भी उपयोगी सीखने में विफल रहता।

इसे ठीक करने के लिए, उन्होंने टास्क-शेपिंग-रेगुलराइजेशन (TSR) नामक एक नया रिवॉर्ड फ्रेमवर्क पेश किया। इसे तीन-भागों वाली कोचिंग रणनीति के रूप में समझें:

  1. टास्क-ओरिएंटेड रिवॉर्ड: यह अंतिम लक्ष्य है। यदि आप लक्ष्य तक पहुँचते हैं तो आपको बड़ा "+1" मिलता है और यदि आप टकराते हैं तो "-1" मिलता है।
  2. शेपिंग रिवॉर्ड: यह "प्रोग्रेस बार" है। अंत तक प्रतीक्षा करने के बजाय कि "अच्छा काम किया", सिस्टम लक्ष्य के करीब हर कदम के लिए छोटे इनाम देता है। टीम ने इसे करने के दो तरीकों का परीक्षण किया और पाया कि पोटेंशियल-बेस्ड रिवॉर्ड शेपिंग (PBRS) नामक एक विधि बहुत अधिक मजबूत थी। यह एक दिशा-सूचक यंत्र (compass) की तरह कार्य करता है, जो नक्शा कितना भी बड़ा क्यों न हो, रोबोट को लगातार लक्ष्य की ओर धकेलता रहता है।
  3. रेगुलराइजेशन रिवॉर्ड: यह "स्टाइल पॉइंट्स" है। यह रोबोट को सुचारू रूप से चलने और दीवारों से दूर रहने के लिए प्रोत्साहित करता है। इसके बिना, रोबोट लक्ष्य तक तो पहुँच सकता है लेकिन वह झटकेदार तरीके से हिलते हुए या दीवारों से रगड़ते हुए पहुँच सकता है। इस प्रशिक्षण भाग ने रोबोट की झटकेदार गतिविधियों को कम से कम 33.7% कम कर दिया और बाधाओं से सुरक्षा दूरी को कम से कम 2.1% बढ़ा दिया।

परिणाम: मिनटों में सीखना, सेकंडों में तैनात करना

जब उन्होंने इन सभी हिस्सों को एक साथ जोड़ा, तो परिणाम आश्चर्यजनक थे। अपने सिमुलेशन में, रोबोट ने केवल 194 सेकंड (लगभग 3 मिनट) में जटिल, शाखाओं वाली रक्त वाहिकाओं में नेविगेट करना सीख लिया। प्रशिक्षण के अंत तक, रोबोट उच्च सफलता दर के साथ सबसे कठिन नेविगेशन पहेलियों को भी हल कर सकता था।

लेकिन असली जादू तब हुआ जब वे कंप्यूटर में प्रशिक्षित किए गए "मस्तिष्क" को वास्तविक दुनिया में ले गए। इसे जीरो-शॉट ट्रांसफर कहा जाता है। आमतौर पर, यदि आप सिमुलेशन में एक रोबोट को प्रशिक्षित करते हैं, तो वास्तविक लैब में जाने पर वह विफल हो जाता है क्योंकि वास्तविक जीवन अव्यवस्थित होता है। हालाँकि, यह नया सिस्टम नेविगेशन के सिद्धांतों को सीखने में इतना अच्छा था कि इसने दो पूरी तरह से अलग प्रकार के रोबों पर तुरंत काम किया:

  • एक पॉलेन-आधारित माइक्रोपार्टिकल (एक छोटा पराग कण जिसे चुंबकीय सामग्री से ढका गया है और जो हवा में घूमता है)।
  • एक हेलिकल माइक्रोरोबोट (एक छोटा कॉर्कस्क्रू के आकार का रोबोट जो बैक्टीरिया की तरह तैरता है)।

प्रशिक्षित पॉलिसी ने दोनों रोबोटों को कृत्रिम रक्त वाहिकाओं और यहाँ तक कि गतिशील बाधाओं (चलती हुई बाधाओं) के माध्यम से निर्देशित किया, जिन्हें रोबोट ने प्रशिक्षण के दौरान कभी नहीं देखा था। यह 2D में और यहाँ तक कि मानव मस्तिष्क धमनी के 3D-प्रिंटेड मॉडल में भी काम कर गया। रोबोट को फिर से प्रशिक्षित या बदलने की आवश्यकता नहीं थी; यह बस काम कर गया।

यह क्यों महत्वपूर्ण है

यह शोध पत्र केवल रोबोट को प्रशिक्षित करने का तेज़ तरीका नहीं दिखाता है; यह पूरे क्षेत्र के डिज़ाइन लूप को बदल देता है। पहले, यदि कोई वैज्ञानिक एक नए रोबोट आकार या एक नए प्रकार की रक्त वाहिका का परीक्षण करना चाहता था, तो उसे प्रशिक्षण समाप्त होने के लिए दिनों तक प्रतीक्षा करनी पड़ सकती थी। अब, वे मिनटों में एक पॉलिसी को प्रशिक्षित कर सकते हैं, उसका परीक्षण कर सकते हैं, और तुरंत उसमें सुधार कर सकते हैं।

शोधकर्ता स्वीकार करते हैं कि उनका प्रशिक्षण डेटा अभी भी रक्त वाहिकाओं के कृत्रिम मॉडलों पर आधारित है, वास्तविक मानव शरीर रचना पर नहीं, और वास्तविक जीवन का रक्त प्रवाह उनके सिमुलेशन की तुलना में और भी अधिक अराजक है। हालाँकि, यह सिद्ध करके कि एक मिनट-स्केल प्रशिक्षण ढांचा ऐसी नीतियां बना सकता है जो विभिन्न रोबोटों और अनदेखे वातावरणों के अनुकूल हो सकती हैं, उन्होंने एक मजबूत नींव रखी है। उन्होंने दिखाया है कि सही "कोचिंग" (TSR फ्रेमवर्क) और एक विशाल डिजिटल खेल के मैदान (वेक्टराइज्ड सिम्युलेटर) के साथ, हम बुद्धिमान, स्वायत्त माइक्रोरोबॉट्स की यात्रा को तेज कर सकते हैं जो एक दिन मानव शरीर के भीतर जीवन बचा सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →