← नवीनतम पेपर
🤖 machine learning

Accelerating Visual Policy Learning with Sampling-Based Model Predictive Control

यह शोध पत्र सैंपलिंग-गाइडेड पॉलिसी सर्च (SGPS) का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो जटिल रोबोटिक लोकोमोशन और मैनिपुलेशन कार्यों के लिए विजुअल पॉलिसियों को कुशलतापूर्वक प्रशिक्षित करने हेतु सैंपलिंग-आधारित मॉडल प्रेडिक्टिव कंट्रोल को फर्स्ट-ऑर्डर पॉलिसी ऑप्टिमाइज़ेशन के साथ जोड़ता है, जिससे वास्तविक दुनिया के हार्डवेयर पर ज़ीरो-शॉट ट्रांसफर प्राप्त होता है।

मूल लेखक: Yilang Liu, Haoxiang You, Qian Wang, Daniel Rakita, Ian Abraham

प्रकाशित 2026-09-18
📖 10 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yilang Liu, Haoxiang You, Qian Wang, Daniel Rakita, Ian Abraham

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट जो ऊबड़-खाबड़ जमीन पर चल सकते हैं, भारी वस्तुओं को धकेल सकते हैं, या बिखरे हुए कमरों में नेविगेट कर सकते हैं, वे अब विज्ञान कथा (साइंस फिक्शन) नहीं रह गए हैं, लेकिन उन्हें ऐसा करना सिखाना एक कठिन चुनौती है। एक मशीन के प्रभावी ढंग से चलने के लिए, उसे अपने अंगों का भौतिक दुनिया के साथ निरंतर समन्वय करना चाहिए, और यह तय करना चाहिए कि पैर या हाथ को ठीक कब और कहाँ रखना है। पारंपरिक रूप से, इंजीनियरों ने हर संभव गति को हाथ से प्रोग्राम करके इसे हल करने की कोशिश की है, जो एक उबाऊ प्रक्रिया है और अक्सर तब विफल हो जाती है जब रोबोट किसी अप्रत्याशित चीज़ का सामना करता है। हाल ही में, वैज्ञानिकों ने 'रीइन्फोर्समेंट लर्निंग' (reinforcement learning) नामक एक पद्धति की ओर रुख किया है, जहाँ एक रोबोट प्रयास और त्रुटि (trial and error) के माध्यम से सीखता है, बिल्कुल वैसे ही जैसे एक बच्चा चलना सीखता है। रोबोट एक गति का प्रयास करता है, देखता है कि वह गिर जाता है या सफल होता है, और अगली बार बेहतर करने के लिए अपने आंतरिक नियमों को समायोजित करता है। हालाँकि, यह सीखने की प्रक्रिया अविश्वसनीय रूप से महंगी है। इसके लिए कंप्यूटर की विशाल शक्ति और समय की आवश्यकता होती है, विशेष रूप से जब रोबोट को केवल आंतरिक सेंसरों पर निर्भर रहने के बजाय कैमरों के माध्यम से अपनी दुनिया को देखना सीखना होता है। रोबोट को यह सीखना होगा कि जो वह देखता है उसे भौतिक क्रियाओं में कैसे बदला जाए, एक ऐसा कार्य जो अक्सर सावधानीपूर्वक मार्गदर्शन न होने पर अनाड़ी और अनपेक्षित गतिविधियों की ओर ले जाता है।

येल यूनिवर्सिटी और सिडनी विश्वविद्यालय के शोधकर्ताओं की एक टीम ने इस समस्या को हल करने के लिए एक नया दृष्टिकोण विकसित किया है, जिससे रोबोट पहले की तुलना में बहुत तेज़ी से और अधिक विश्वसनीय रूप से जटिल दृश्य व्यवहार सीख सकते हैं। उन्होंने एक प्रणाली बनाई जिसे वे 'सैंपलिंग-गाइडेड पॉलिसी सर्च' (Sampling-Guided Policy Search) कहते हैं। लाखों यादृच्छिक प्रयासों के माध्यम से रोबोट को अंधाधुंध भटकने देने के बजाय, यह प्रणाली एक स्मार्ट प्लानिंग टूल का उपयोग करती है जो पहले सही गति का एक मोटा खाका तैयार करती है। इस प्लानिंग टूल को एक ऐसे कोच के रूप में सोचें जो किसी विशिष्ट कार्य, जैसे बाधा के ऊपर से कदम रखना या क्रेट को धकेलना, के लिए कदमों के सर्वोत्तम क्रम का पता लगाने के लिए अपने दिमाग में एक त्वरित सिमुलेशन चलाता है। रोबोट फिर इस खाके को एक शुरुआती बिंदु के रूप में उपयोग करता है। शोधकर्ताओं ने पाया कि इस प्रारंभिक मार्गदर्शन को उस विधि के साथ जोड़ने से, जो रोबोट को सीधे कैमरा छवियों से सीखने की अनुमति देती है, वे सामान्यतः आवश्यक समय के एक अंश में अत्यधिक सक्षम रोबोटों को प्रशिक्षित कर सके।

उनकी खोज का मूल आधार यह है कि वे सीखने की प्रक्रिया को कैसे संभालते हैं। कई पिछले प्रयासों में, शोधकर्ताओं ने एक रोबोट को उसके अपने शरीर और वातावरण के बारे में सटीक आंतरिक डेटा का उपयोग करके प्रशिक्षित किया, और फिर एक दूसरे संस्करण के रोबोट को केवल वही सीखने के लिए सिखाने की कोशिश की जो एक कैमरा देखता है। यह दो-चरणीय प्रक्रिया धीमी थी और अक्सर एक ऐसा रोबोट परिणाम देती थी जो वास्तविक दुनिया की खामियों को नहीं संभाल पाता था। नई विधि इस बिचौलिए को हटा देती है। यह रोबोट को सीधे डेप्थ इमेज (depth images)—वह विजुअल डेटा जो दिखाता है कि वस्तुएं कितनी दूर हैं—से सीखने के लिए प्रशिक्षित करती है, और साथ ही साथ रोबोट के लक्ष्यों को परिष्कृत करने के लिए प्लानिंग टूल का उपयोग करती है। यह प्रणाली एक चक्र के रूप में कार्य करती है: यह एक लक्षित गति उत्पन्न करती है, रोबोट को उसका अनुसरण करने देती है, और फिर रोबोट यदि थोड़ा भी मार्ग से भटक जाता है तो लक्ष्य को सुधारने के लिए प्लानिंग टूल का उपयोग करती है। यह निरंतर आदान-प्रदान यह सुनिश्चित करता है कि रोबोट न केवल एक आदर्श पथ की नकल करना सीखता है, बल्कि गलतियों से उबरना और इलाके या रोबोट द्वारा ले जा रही वस्तुओं के वजन के अनुसार खुद को ढालना भी सीखता है।

शोधकर्ताओं ने इस प्रणाली का परीक्षण दो अलग-अलग प्रकार के रोबोटों पर किया: एक चार पैरों वाला कुत्ता जैसा रोबोट और एक दो पैरों वाला ह्यूमनाइड (मानव जैसा) रोबोट। सिमुलेशन में, चार पैरों वाले रोबोट ने समतल जमीन पर दौड़ना, एक कम बीम के नीचे रेंगना और एक बाधा के ऊपर से कूदना सीखा। ह्यूमनाइड रोबट ने फर्श पर एक भारी क्रेट को धकेलना और जॉगिंग करते समय एक बॉक्स ले जाना सीखा। इन परिणामों को जो बात विशेष रूप से प्रभावशाली बनाती थी, वह यह थी कि रोबोटों ने इन कौशलों को केवल एक ग्राफिक्स कार्ड का उपयोग करके सीखा, जो कई गेमिंग कंप्यूटरों में पाया जाने वाला एक मानक कंप्यूटर हार्डवेयर है। अतीत में, ऐसे जटिल व्यवहारों को प्रशिक्षित करने के लिए विशाल सुपरकंप्यूटरों या हफ्तों के निरंतर सिमुलेशन की आवश्यकता होती थी। यहाँ, सिस्टम ने इन कार्यों को कुछ ही घंटों में सीखना शुरू कर दिया। शोधकर्ताओं ने यह भी दिखाया कि प्लानिंग टल ने केवल एक शुरुआती बिंदु प्रदान करने से कहीं अधिक किया; इसने प्रशिक्षण के दौरान सक्रिय रूप से सीखने की प्रक्रिया में सुधार किया, जिससे रोबोट को चलने के अधिक कुशल तरीके खोजने और बुरी आदतों में फंसने से बचने में मदद मिली।

यह सिद्ध करने के लिए कि यह विधि वास्तविक दुनिया में काम करती है, शोधकर्ताओं ने प्रशिक्षित सॉफ्टवेयर को लिया और इसे बिना किसी अतिरिक्त समायोजन के एक भौतिक चार पैरों वाले रोबलेट पर स्थापित किया। इसे 'जीरो-शॉट ट्रांसफर' (zero-shot transfer) कहा जाता है, जिसका अर्थ है कि रोबोट ने वास्तविक दुनिया को पहले कभी नहीं देखा था, फिर भी वह तुरंत उन कार्यों को करने में सक्षम था जो उसने सिमुलेशन में सीखे थे। रोबोट ने सफलतापूर्वक एक कमरे में दौड़ लगाई, एक अवरोध के नीचे रेंगकर गया और एक बॉक्स के ऊपर से कूदा, और यह सब करते समय केवल अपने ऑनबोर्ड कैमरे का उपयोग किया कि वह कहाँ जा रहा है। उसे नेविगेट करने के लिए किसी बाहरी सेंसर, मोशन कैप्चर कैमरों या मानवीय मार्गदर्शन की आवश्यकता नहीं थी। रोबोट ने खुद निर्णय लिया कि उसे कब अपना शरीर नीचे करना है या कब अपने पैर उठाने हैं, और उसके सामने आने वाली बाधाओं के प्रति तुरंत प्रतिक्रिया दी। इसने प्रदर्शित किया कि सीखने की प्रक्रिया ने गति की एक मजबूत समझ विकसित की है जो वास्तविक दुनिया की अव्यवस्थित और अप्रत्याशित प्रकृति में भी जीवित रह सकती है।

अध्ययन ने यह भी रेखांकित किया कि पिछली विधियाँ अक्सर क्यों विफल रहीं। जब शोधकर्ताओं ने प्लानिंग टूल के मार्गदर्शन के बिना रोबोट को प्रशिक्षित करने की कोशिश की, तो रोबोट अक्सर अजीब और असंबद्ध हरकतें करने लगा। उदाहरण के लिए, जब दौड़ने के लिए कहा गया, तो बिना इस मार्गदर्शन के प्रशिक्षित रोबोट के पैर इस तरह से खिसक सकते थे जो एक उचित चाल (gait) से बिल्कुल अलग दिखता था। प्लानिंग टूल ने एक स्टेबलाइज़र के रूप में कार्य किया, यह सुनिश्चित करते हुए कि रोबोट शुरुआत से ही सही लय और समन्वय सीखे। यह विशेष रूप से वातावरण के संपर्क वाले कार्यों के लिए महत्वपूर्ण था, जैसे कि किसी भारी वस्तु को धकेलना। बिना मार्गदर्शन के, रोबोट गलत दिशा में धकेल सकता था या अपना संतुलन खो सकता था। मार्गदर्शन के साथ, उसने वस्तु को सुचारू रूप से और कुशलता से चलाने के लिए अपने शरीर और हाथों का समन्वय करना सीखा।

इस कार्य का एक सबसे महत्वपूर्ण पहलू यह है कि यह विजुअल जानकारी को कैसे संभालता है। रोबोट अक्सर कैमरा छवियों से सीखने में संघर्ष करते हैं क्योंकि एक तस्वीर को भौतिक कमांड में बदलने की प्रक्रिया गणितीय रूप से कठिन होती है। शोधकर्ताओं ने विजुअल प्रोसेसिंग को भौतिक गणनाओं से अलग करके इस समस्या को हल किया। इसने रोबोट को कैमरा कैसे काम करता है इसकी जटिल गणित से उलझे बिना छवियों से सीखने की अनुमति दी। इसके बजाय, इसने यह सीखने पर ध्यान केंद्रित किया कि जो वह देख रहा है और उसे कैसे हिलना चाहिए, उनके बीच क्या संबंध है। इस अलगाव ने प्रशिक्षण प्रक्रिया को बहुत तेज़ और अधिक स्थिर बना दिया, जिससे रोबोट बिना गिरे जॉगिंग करते समय बॉक्स ले जाने जैसे जटिल कौशल सीख सका।

शोधकर्ताओं ने यह भी पता लगाया कि विभिन्न कौशलों को एक ही रोबोट में कैसे जोड़ा जाए। उन्होंने दौड़ने, रेंगने और कूदने के लिए अलग-अलग विशेषज्ञ (experts) प्रशिक्षित किए, और फिर एक ही रोबोट को अपने आप इन व्यवहारों के बीच स्विच करना सिखाया। जब रोबोट ने एक कम बीम देखी, तो वह रेंगना जानता था। जब उसने एक बाधा देखी, तो वह कूदना जानता था। उसे यह बताने के लिए किसी इंसान की ज़रूरत नहीं थी कि उसे कौन सा मोड उपयोग करना है; वह बस दुनिया को देखता और सही क्रिया चुन लेता। विभिन्न व्यवहारों को एक एकल, लचीली प्रणाली में संयोजित करने की यह क्षमता रोबोटिक्स में एक बड़ा कदम है। इसका अर्थ है कि रोबोट संभावित रूप से जटिल वातावरण में नेविगेट कर सकते हैं, बिना हर नई स्थिति के लिए एक नए प्रोग्राम के, समतल जमीन से बाधाओं तक और वापस आ सकते हैं।

इस पद्धति की सफलता रोबोटिक्स के भविष्य के लिए एक नया मार्ग सुझाती है। सीखने की प्रक्रिया को निर्देशित करने के लिए एक प्लानिंग टूल का उपयोग करके, शोधकर्ता रोबोट को पहले की तुलना में बहुत तेज़ी से जटिल भौतिक कार्य करने के लिए सिखा सकते हैं। यह दृष्टिकोण भारी मात्रा में कंप्यूटिंग शक्ति की आवश्यकता को कम करता है और रोबोट को सीधे देखने से सीखने की अनुमति देता है। जबकि वर्तमान प्रयोग सिमुलेशन और एक एकल भौतिक रोबोट पर किए गए थे, परिणाम संकेत देते हैं कि इस पद्धति को रोबोट को और भी कठिन कार्य सिखाने के लिए बढ़ाया जा सकता है, जैसे कि उपकरणों का उपयोग करना या भीड़भाड़ वाली जगहों में नेविगेट करना। मुख्य अंतर्दृष्टि यह है कि सीखना केवल सही उत्तर के लिए एक अंधाधुंध खोज नहीं होना चाहिए; यह एक निर्देशित यात्रा हो सकती है जहाँ एक स्मार्ट प्लानर रोबोट को रास्ता खोजने में मदद करता है।

अंत में, यह कार्य प्रदर्शित करता है कि सिमुलेशन और वास्तविकता के बीच के अंतर को पहले की तुलना में अधिक प्रभावी ढंग से पाटा जा सकता है। रोबोटों ने केवल एक आदर्श पथ की नकल करना नहीं सीखा; उन्होंने अनुकूलन करना, उबरना और जो वे देखते हैं उसके आधार पर निर्णय लेना सीखा। चार पैरों वाला रोबोट, जो कभी एक सिमुलेशन था, एक वास्तविक मशीन बन गया जो भौतिक स्थान में स्वायत्त गति करने में सक्षम है। वह रेंग सका, दौड़ सका और कूद सका, जिसमें एक ऐसी तरलता थी जो उसके अपने शरीर और दुनिया की गहरी समझ का सुझाव देती है। यह केवल एक तकनीकी उपलब्धि नहीं है; यह एक ऐसे भविष्य की ओर एक कदम है जहाँ रोबोट मनुष्यों के साथ स्वतंत्र रूप से और सुरक्षित रूप से चल सकते हैं, और उन कार्यों को संभाल सकते हैं जिनमें शक्ति और दक्षता दोनों की आवश्यकता होती है। शोधकर्ताओं ने दिखाया है कि सही मार्गदर्शन के साथ, मशीनें उसी सहजता और अनुकूलन क्षमता के साथ चल सकती हैं जिसे हम प्राकृतिक दुनिया में सहज रूप से लेते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →