← नवीनतम पेपर
🤖 AI

ASTRIL-MPC: Autonomous Traversal Framework of Articulated Tracked Robots with Language-Guided Neural-Kinematic MPC

यह शोध पत्र ASTRIL-MPC प्रस्तुत करता है, जो एक भाषा-निर्देशित न्यूरल काइनेमैटिक मॉडल प्रेडिक्टिव कंट्रोल फ्रेमवर्क है जो जटिल, संपर्क-समृद्ध वातावरण में आर्टिकुलेटेड ट्रैक्ड रोबोट्स के स्वायत्त पारगमन प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है, जो मजबूत, टकराव-मुक्त नेविगेशन प्राप्त करने के लिए सीखे गए काइनेमैटिक्स, अनुकूलन-आधारित योजना और लार्ज लैंग्वेज मॉडल-संचालित पैरामीटर ट्यूनिंग को एकीकृत करता है।

मूल लेखक: Zhenfeng Gan, Yanbo Chen, Lirong Che, Junbo Tan, Xueqian Wang

प्रकाशित 2026-09-14
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhenfeng Gan, Yanbo Chen, Lirong Che, Junbo Tan, Xueqian Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

शहरी खोज और बचाव के अराजक, खंडहर हो चुके परिदृश्यों में, जहाँ इमारतें ढह गई हैं और सीढ़ियाँ मलबे के ढेर में बदल गई हैं, रोबोटों को केवल आगे बढ़ने का रास्ता देखने से कहीं अधिक कुछ करना होता है; उन्हें महसूस करते हुए आगे बढ़ना होता है। यह आर्टिकुलेटेड ट्रैक्ड रोबोटों (articulated tracked robots) का क्षेत्र है, जो ऐसी मशीनें हैं जो टैंकों की तरह निरंतर ट्रैक्स से लैस होती हैं लेकिन अतिरिक्त, चलने योग्य फ्लिपर्स (flippers) से युक्त होती हैं जो सीढ़ियों या मलबे को पकड़ने के लिए बाहर निकल सकते हैं। ये मशीनें उन वातावरणों में नेविगेट करने के लिए डिज़ाइन की गई हैं जो मनुष्यों के लिए बहुत खतरनाक हैं और मानक पहिए वाले वाहनों के लिए बहुत जटिल हैं। हालाँकि, इन रोबोटों को विश्वसनीय रूप से चलाना एक गहन चुनौती है। ज़मीन जिस पर वे चलते हैं वह कोई चिकनी सड़क नहीं बल्कि एक अस्थिर, असमान सतह है जहाँ रोबोट के धातु के ट्रैक और फ्लिपर्स लगातार पृथ्वी के संपर्क में आते और टूटते रहते हैं। हर बार जब एक फ्लिपर किसी सीढ़ी को छूता है या ट्रैक किसी ढीले पत्थर पर फिसलता है, तो रोबोट की गति का भौतिक विज्ञान तुरंत बदल जाता है। पारंपरिक कंप्यूटर प्रोग्राम इसके साथ संघर्ष करते हैं क्योंकि वे पूर्व-लिखित नियमों पर निर्भर करते हैं जो हर संभावित उभार या कोण का हिसाब नहीं रख सकते, जबकि नए लर्निंग-आधारित सिस्टम अक्सर ऐसे तरीकों से चलना सीखते हैं जो सिद्धांत में तो सुचारू होते हैं लेकिन वास्तविकता में खतरनाक रूप से झटकेदार या अस्थिर होते हैं।

इसे हल करने के लिए, शोधकर्ताओं ने ASTRIL-MPC नामक एक नया ढांचा विकसित किया है, जो इन बचाव रोबोटों को बाधाओं पर चढ़ते समय वास्तविक समय में सोचने और तालमेल बिठाने की अनुमति देता है। इस प्रणाली का मूल एक हाइब्रिड दृष्टिकोण है जो तीन विशिष्ट क्षमताओं को जोड़ता है। पहला, यह एक सीखे हुए मॉडल (learned model) का उपयोग करता है, जो अनिवार्य रूप से हजारों सिम्युलेटेड चढ़ाइयों पर प्रशिक्षित एक डिजिटल मस्तिष्क है, जो यह भविष्यवाणी करता है कि सामने की जमीन के आकार के आधार पर अगला कुछ सेकंड रोबोट कैसे आगे बढ़ेगा। दूसरा, यह एक गणितीय योजनाकार (mathematical planner) का उपयोग करता है जो इन भविष्यवाणियों की सख्त सुरक्षा नियमों के साथ निरंतर जांच करता है, यह सुनिश्चित करता है कि रोबोट कभी पलटे नहीं या दीवार से न टकराए। तीसरा, और शायद सबसे अभिनव, यह प्रणाली एक उच्च-स्तरीय पर्यवेक्षक के रूप में एक लार्ज लैंग्वेज मॉडल (LLM) का उपयोग करती है। रोबोट को यह बताने के बजाय कि कौन सा मोटर घुमाना है, यह पर्यवेक्षक सरल मानवीय निर्देशों को सुनता है, जैसे कि "सावधानी से चलें" या "तेज़ चलें", और उन्हें रोबोट के आंतरिक सेटिंग्स के सटीक समायोजन में अनुवादित करता है। यह रोबोट को बिना किसी पुन: प्रोग्रामिंग या पुन: प्रशिक्षण के विभिन्न भूभागों और ऑपरेटर की प्राथमिकताओं के अनुकूल व्यवहार करने की अनुमति देता है।

शोधकर्ताओं ने इस ढांचे का परीक्षण एक सिम्युलेटेड वातावरण में किया जो आपदा क्षेत्र की कठिन स्थितियों की नकल करता है, जिसमें खड़ी सीढ़ियाँ और बिखरे हुए आंतरिक भाग शामिल हैं। उन्होंने अपने नए सिस्टम की तुलना दो अन्य सामान्य दृष्टिकोणों के विरुद्ध की: एक मानक योजना प्रणाली जो नई स्थितियों के अनुकूल नहीं होती है, और एक लर्निंग-आधारित प्रणाली जिसे प्रयास और त्रुटि (trial and error) के माध्यम से प्रशिक्षित किया गया है। परिणामों ने दिखाया कि नया भाषा-निर्देशित सिस्टम अन्य सभी से काफी बेहतर प्रदर्शन करता है। सीढ़ियों पर चढ़ने और उतरने के परीक्षणों में, एडेप्टिव सिस्टम ने गैर-अनुकूलन योग्य प्लानर की तुलना में 71 प्रतिशत तक और लर्निंग-आधारित बेसलाइन की तुलना में 67 प्रतिशत तक समग्र पारगमन (traversal) की गुणवत्ता में सुधार किया। महत्वपूर्ण रूप से, नए सिस्टम ने सीढ़ियों से उतरते समय मापने योग्य टकराव प्रभावों (collision impacts) को समाप्त कर दिया, जो एक सामान्य विफलता बिंदु है जहाँ रोबोट अक्सर सीढ़ियों से टकराते हैं या अपना संतुलन खो देते हैं। इस प्रणाली ने गति और स्थिरता के बीच अपने आंतरिक संतुलन को निरंतर परिष्कृत करके यह उपलब्धि हासिल की, जिससे यह सुनिश्चित हुआ कि रोबोट का शरीर स्तर पर रहे और उसकी गतिविधियाँ सुचारू रहें, भले ही उसके नीचे का भूभाग बदल रहा हो।

यह उपलब्धि विशेष रूप से उल्लेखनीय है कि यह प्रणाली रोबोट की गति की जटिलता को कैसे संभालती है। शोधकर्ताओं ने पाया कि रोबोट के ट्रैक्स और ज़मीन के बीच प्रत्येक संभावित भौतिक संपर्क को लिखना वास्तविक समय में बहुत कठिन था। इसके बजाय, उन्होंने एक न्यूरल नेटवर्क को इन अंतःक्रियाओं को डेटा से सीखने के लिए प्रशिक्षित किया, जिससे यह एक-दशांश सेकंड से भी कम समय में रोबोट की भविष्य की स्थिति की उच्च सटीकता के साथ भविष्यवाणी कर सका। यह गति आवश्यक है क्योंकि रोबोट को सीधा रहने के लिए प्रति सेकंड सैकड़ों बार निर्णय लेने होते हैं। सिस्टम फिर इस भविष्यवाणी को एक प्लानिंग लूप में समाहित करता है जो कठोर सीमाओं का सम्मान करते हुए आगे के सर्वोत्तम पथ के लिए समाधान निकालता है, जैसे कि ट्रैक के घूमने की अधिकतम गति या वह कोण जिस पर रोबोट पलट सकता है। इन सुरक्षा बाधाओं को सख्त रखकर, सिस्टम यह सुनिश्चित करता है कि भले ही रोबोट नए निर्देश के अनुकूल हो रहा हो, वह उन भौतिक नियमों का उल्लंघन कभी न करे जो उसे गिरने से बचाते हैं।

इस प्रक्रिया में भाषा मॉडल की भूमिका मानवीय इरादे और मशीन के निष्पादन के बीच एक सेतु के रूप में कार्य करना है। जब एक ऑपरेटर नया निर्देश प्रदान करता है, तो सिस्टम केवल रोबोट के गंतव्य को नहीं बदलता है; यह सूक्ष्म रूप से उन भारों (weights) और सीमाओं को ट्यून करता है जो रोबोट के व्यवहार को नियंत्रित करते हैं। उदाहरण के लिए, यदि ऑपरेटर अधिक सतर्क दृष्टिकोण के लिए कहता है, तो सिस्टम स्वचालित रूप से रोबोट की गति सीमाओं को कम कर सकता है और किसी भी अचानक हलचल के लिए दंड (penalty) को बढ़ा सकता है, जिससे रोबोट अधिक धीरे और विचारपूर्वक चलता है। इसके विपरीत, यदि निर्देश तेज़ी से चलने का है, तो सिस्टम स्थिरता बनाए रखते हुए तेज़ गति की अनुमति देने के लिए मापदंडों को समायोजित करता है। यह समायोजन एक सुरक्षा गेट (safety gate) के भीतर होता है जो भाषा मॉडल को बहुत अधिक चरम या विरोधाभासी परिवर्तन करने से रोकता है, यह सुनिश्चित करता है कि रोबोट को प्राप्त निर्देश के बावजूद सुरक्षित रहे। शोधकर्ताओं ने प्रदर्शित किया कि यह तरीका रोबोट को बिना किसी नए प्रशिक्षण डेटा के, अलग ऊंचाई वाली सीढ़ियों जैसे अनदेखे अवरोधों के लिए अपने कौशल को सामान्य बनाने की अनुमति देता है।

अपने प्रयोगों में, शोधकर्ताओं ने देखा कि सिस्टम ने विभिन्न चुनौतीपूर्ण परिदृश्यों में एक सुसंगत और स्थिर मुद्रा बनाए रखी। एक बड़े ब्लॉक को पार करने या सीढ़ियों की एक श्रृंखला के माध्यम से नेविगेट करने के दौरान, रोबलेट स्वायत्त रूप से अपने फ्लिपर्स के लिए सही कॉन्फ़िगरेशन का चयन करता है, सीढ़ियों को पकड़ने के लिए उन्हें फैलाता है या बाधाओं से बचने के लिए उन्हें सिकोड़ता है। समन्वय का यह स्तर, जिसके लिए पहले प्रत्येक विशिष्ट वातावरण के लिए विशेषज्ञ ट्यूनिंग की आवश्यकता होती थी, इस प्रणाली द्वारा गतिशील रूप से प्राप्त किया गया। डेटा ने दिखाया कि एडेप्टिव कंट्रोलर ने रोबोट के शरीर के हिलने-डुलने और झटकों को कम कर दिया, जिससे सुचारू गति और मशीन के घटकों पर कम तनाव हुआ। उतरते समय टकराव प्रभावों को समाप्त करने की क्षमता विशेष रूप से महत्वपूर्ण थी, क्योंकि यह सुझाव देती है कि रोबोट खुद को या आसपास के मलबे को नुकसान पहुँचाए बिना खड़ी, अस्थिर ढलानों से सुरक्षित रूप से नीचे उतर सकता है।

इस ढांचे की सफलता जटिल, असंरचित वातावरण में स्वायत्त रोबोटों के लिए एक नया मार्ग सुझाती है। सीखे हुए मॉडलों की भविष्य कहने वाली शक्ति, गणितीय नियोजन की कठोर सुरक्षा और भाषा-निर्देशित अनुकूलन के लचीलेपन को जोड़कर, शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जो मजबूत और उत्तरदायी दोनों है। निष्कर्ष बताते हैं कि यह दृष्टिकोण रोबोट-भूभाग अंतःक्रियाओं की हाइब्रिड और विच्छिन्न (discontinuous) प्रकृति को संभाल सकता है, जहाँ ज़मीन एक क्षण में ठोस से फिसलन भरी या समतल से खड़ी हो जाती है। जबकि वर्तमान कार्य सिमुलेशन में किया गया था, कंट्रोल लूप की गति और परिणामों की स्पष्टता बताती है कि यह सिस्टम भविष्य में तैनाती के लिए आशाजनक है। शोधकर्ता इस कार्य को विकृत वस्तुओं (deformable objects) को संभालने के लिए विस्तारित करने, रोबोट के निर्णय लेने में ऊर्जा दक्षता को शामिल करने और लंबी अवधि के बचाव मिशनों में दक्षता को और बढ़ाने के लिए अतिरिक्त वास्तविक दुनिया के प्लेटफार्मों पर इस ढांचे को मान्य करने की योजना बना रहे हैं। अंततः, यह कार्य प्रदर्शित करता है कि सही संयोजन के साथ सीखने और सुरक्षा के, रोबोटों पर पृथ्वी के सबसे कठिन और खतरनाक स्थानों में नेविगेट करने के लिए भरोसा किया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →