← नवीनतम पेपर
💻 computer science

Learning the Right Abstraction: Neural Reduced Dynamics for Complex Robot Control

यह शोध पत्र एक न्यूरल रिड्यूस्ड डायनेमिक्स (NRD) फ्रेमवर्क पेश करता है जो सरल मॉडलों में तीव्र, उच्च-थ्रूपुट पॉलिसी प्रशिक्षण को सक्षम करने के लिए इष्टतम अवस्था अमूर्तता (state abstractions) सीखता है, जिससे जटिल, उच्च-सटीकता वाले रोबोटिक सिमुलेशन में सफल ज़ीरो-शॉट ट्रांसफर और श्रेष्ठ नियंत्रण प्रदर्शन प्राप्त होता है।

मूल लेखक: Harry Zhang, Dan Negrut

प्रकाशित 2026-08-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Harry Zhang, Dan Negrut

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

वास्तविक दुनिया में चलने वाले रोबोटों के सामने एक मौलिक समस्या आती है: उनकी गति का भौतिक विज्ञान (फिजिक्स) अविश्वसनीय रूप से जटिल है। जब एक पहियों वाला वाहन नरम मिट्टी पर चलता है, या एक ट्रैक वाला प्लेटफॉर्म पथरीली पहाड़ी पर चढ़ता है, तो जमीन जिस तरह से प्रतिक्रिया करती है उसे समझना कठिन होता है। इन स्थितियों को संभालने के लिए एक रोबोट बनाने हेतु, इंजीनियर अक्सर उन कंप्यूटर सिमुलेशन पर भरोसा करते हैं जो वास्तविक दुनिया की अत्यधिक सटीकता के साथ नकल करते हैं। ये सिमुलेशन इस बात की गणना करते हैं कि प्रत्येक पहिया, प्रत्येक ट्रैक लिंक और रेत का प्रत्येक कण कैसे परस्पर क्रिया करता है। हालांकि, इस सटीकता की एक भारी कीमत चुकानी पड़ती है। इन विस्तृत सिमुलेशन को चलाना इतना धीमा है कि कंप्यूटर को एक सरल कार्य सीखने में, जैसे कि एक खेत में कार चलाना, वर्षों लग जाएंगे, क्योंकि कंप्यूटर लाखों अलग-अलग प्रयासों को करने के लिए पर्याप्त तेज़ नहीं चल सकता है।

इसे हल करने के लिए, शोधकर्ताओं ने एक अलग दृष्टिकोण अपनाया है: रोबोट को दुनिया के एक सरलीकृत संस्करण का उपयोग करके सिखाना। यह इस तरह है जैसे एक पायलट एक ऐसे फ्लाइट सिम्युलेटर में प्रशिक्षण ले सकता है जो हवा के हर एक अणु की आवश्यकता के बिना उड़ने के अहसास को पकड़ लेता है। चुनौती यह जानने में निहित है कि क्या रखना है और क्या हटा देना है। यदि सिमुलेशन बहुत सरल है, तो रोबोट बुरी आदतें सीख लेगा जो वास्तविकता में विफल हो जाती हैं। यदि यह बहुत जटिल है, तो सीखना बहुत धीमा हो जाएगा। प्रश्न यह बन जाता है: रोबोट को स्मार्ट और तेज़ बनाए रखने के लिए विवरण का सही स्तर क्या है?

विस्कॉन्सिन-मैडिसन विश्वविद्यालय के शोधकर्ताओं की एक टीम ने इस प्रश्न का उत्तर देने के लिए एक नया तरीका विकसित किया है। उन्होंने एक प्रणाली बनाई है जो रोबोट के भौतिक विज्ञान के एक "न्यूनीकरण" (रिड्यूस्ड) संस्करण को सीखती है। एक जटिल मशीन के हर एक विवरण की भविष्यवाणी करने के बजाय, उनकी प्रणाली केवल उन विशिष्ट चरों (वेरिएबल्स) को ट्रैक करना सीखती है जो उस कार्य के लिए महत्वपूर्ण हैं। एक वाहन के लिए, इसका अर्थ यह हो सकता है कि पहिये कितनी तेज़ी से घूम रहे हैं और उन पर कितना भार पड़ रहा है, जबकि इंजन के हर पेंच की सटीक स्थिति को अनदेखा किया जाए। एक हाथ (आर्म) के लिए, इसका अर्थ जोड़ों के कोण को ट्रैक करना हो सकता है, जबकि सरल गणित का उपयोग करके हाथ की स्थिति की गणना की जाए। यह कंप्यूटर को पहले की तुलना में हजारों गुना तेज़ी से सिमुलेशन चलाने की अनुमति देता है, जिससे वर्षों के बजाय कुछ ही मिनटों में ट्रायल और एरर के माध्यम से रोबोट को प्रशिक्षित करना संभव हो जाता है।

शोधकर्ताओं ने इस विचार का परीक्षण दो बहुत अलग रोबोटों पर किया। पहला एक सैन्य-शैली का वाहन था जिसे ऊबड़-खाबड़, असमान जमीन पर चलने के लिए डिज़ाइन किया गया था। उन्होंने तीन प्रकार के भूभागों पर: समतल कठोर जमीन, नरम मिट्टी जिसमें पहिये धंस जाते हैं, और ऊबड़-खाबड़ कठोर जमीन (जिसे रोबोट ने पहले कभी नहीं देखा था) पर एक विशिष्ट पथ का अनुसरण करने के लिए एक नियंत्रण प्रणाली को उनके तेज़, सरलीकृत मॉडल के भीतर प्रशिक्षित किया। जब उन्होंने प्रशिक्षित रोबोट को वापस धीमे, उच्च-सटीकता वाले सिम्युलेटर में डाला ताकि देख सकें कि क्या वह वास्तव में काम कर सकता है, तो वह सफल रहा। रोबोट ने सभी सतहों पर उच्च सटीकता के साथ पथ का अनुसरण किया। उल्लेखनीय रूप से, सरलीकृत मॉडल पर प्रशिक्षित एकल रोबोट ने उन रोबोटों से बेहतर प्रदर्शन किया जिन्हें प्रत्येक विशिष्ट प्रकार की जमीन के लिए अलग-अलग प्रशिक्षित किया गया था। इसने ऊबड़-खाबड़ इलाके को भी पूरी तरह से संभाला, जबकि उसे उस पर कभी प्रशिक्षित नहीं किया गया था, जिससे यह सिद्ध हुआ कि सरलीकृत मॉडल ने केवल प्रशिक्षण डेटा को याद करने के बजाय ड्राइविंग के वास्तविक नियमों को सीखा था।

दूसरे परीक्षण में एक ट्रैक्ड वाहन शामिल था जो एक रोबिक आर्म (रोबोटिक हाथ) से लैस था। यहाँ, शोधकर्ताओं ने समस्या को दो अलग-अलग कार्यों में विभाजित किया। पहले, उन्होंने वाहन को जमीन पर एक विशिष्ट स्थान तक जाने के लिए सिखाया। दूसरे, उन्होंने हाथ को अंतरिक्ष में एक विशिष्ट बिंदु तक ले जाने के लिए सिखाया। दोनों मामलों में, उन्होंने अपने तेज़, सरलीकृत मॉडलों का उपयोग करके नियंत्रण प्रणालियों को प्रशिक्षित किया। परिणाम आश्चर्यजनक थे। वाहन एक सौ अलग-अलग लक्ष्यों तक गया और हर बार लक्ष्य से एक चौथाई मीटर के भीतर रुक गया। रोबोटिक आर्म ने एक सौ में से सत्तानवे लक्ष्यों तक केवल पांच सेंटीमीटर की सटीकता के साथ पहुँच बनाया, और इस दौरान उसने न तो जमीन से और न ही वाहन से टक्कर मारी। सरलीकृत मॉडल विस्तृत सिम्युलेटर की तुलना में लगभग चार ऑर्डर ऑफ मैग्नीट्यूड (दस हजार गुना) तेज़ चले, जिसका अर्थ है कि जिस प्रशिक्षण प्रक्रिया में धीमे सिस्टम में महीनों लग जाते, वह एक घंटे से भी कम समय में पूरी हो गई।

इस कार्य का मुख्य निष्कर्ष यह है कि रोबोट की दुनिया को सरल बनाने का सबसे अच्छा तरीका इसे छोटा बनाना नहीं है, बल्कि यह बनाना है कि वह क्या रखता है उसके बारे में अधिक स्मार्ट हो। शोधकर्ताओं ने पाया कि सही सरलीकरण पूरी तरह से इस बात पर निर्भर करता है कि रोबोट क्या करने की कोशिश कर रहा है। वाहन के लिए, सबसे महत्वपूर्ण चीजें टायरों पर लगने वाले बल और पहियों की गति थीं, क्योंकि यही तय करते हैं कि वाहन फिसलेगा या धंसेगा। हाथ के लिए, सबसे महत्वपूर्ण जोड़ों के कोण थे, क्योंकि हाथ की स्थिति उन कोणों का एक गणितीय परिणाम है। आवश्यक भौतिकी को बनाए रखकर और बाकी को सरल सूत्रों के साथ गणना करके, सिस्टम ने वास्तविक दुनिया में काम करने के लिए पर्याप्त सटीकता बनाए रखी और सीखने के लिए आवश्यक गति भी प्राप्त की।

यह दृष्टिकोण अभी यह साबित नहीं करता है कि ये रोबोट वास्तविक दुनिया में भौतिक हार्डवेयर पर काम कर सकते हैं, क्योंकि परीक्षण पूरी तरह से कंप्यूटर के भीतर किए गए थे। हालाँकि, परिणाम दर्शाते हैं कि एक सावधानीपूर्वक डिज़ाइन किया गया, सरलीकृत मॉडल, वास्तविक दुनिया के धीमे, सटीक भौतिक विज्ञान और रोबोट को सिखाने के लिए आवश्यक तेज़, व्यापक लर्निंग के बीच एक शक्तिशाली सेतु के रूप में कार्य कर सकता है। यह सुझाव देता है कि रोबोट को सिखाने के लिए हमें सब कुछ सिम्युलेट करने की आवश्यकता नहीं है; हमें केवल सही चीजों को सिम्युलेट करने की आवश्यकता है। किसी विशिष्ट कार्य को नियंत्रित करने वाले विशेष भौतिक विज्ञान पर ध्यान केंद्रित करके, इंजीनियर अब जटिल मशीनों को कठिन वातावरण को संभालने के लिए प्रशिक्षित कर सकते हैं, जो ऐसी गति और लचीलापन प्रदान करता है जो पहले पहुंच से बाहर था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →