← नवीनतम पेपर
💻 computer science

Closing the Loop on the Poppy Humanoid: Bipedal Locomotion with Linear-Quadratic Control and Learned Cost Functions

यह शोध पत्र पॉपी ह्यूमनॉइड रोबोट के लिए एक क्लोज्ड-लूप वॉकिंग कंट्रोलर प्रस्तुत करता है जो विश्वसनीय, बिना सहायता के द्विपद लोकोमोशन (bipedal locomotion) प्राप्त करने के लिए एक सीखे हुए कॉस्ट फंक्शन के साथ लीनियर-क्वाड्रेटिक रेगुलेटर (LQR) फ्रेमवर्क का उपयोग करता है, जो ओपन-लूप ट्रजेक्टरी प्लेबैक की तुलना में सांख्यिकीय रूप से महत्वपूर्ण प्रदर्शन सुधार प्रदर्शित करता है।

मूल लेखक: Xulin Chen, Borui He, Ruipeng Liu, Naveed Tahir, Zhenyu Gan, Garrett E. Katz

प्रकाशित 2026-08-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xulin Chen, Borui He, Ruipeng Liu, Naveed Tahir, Zhenyu Gan, Garrett E. Katz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

चलना निरंतर, अदृश्य गणना की एक उपलब्धि है। एक मनुष्य के लिए, यह संतुलन का एक सहज प्रवाह है, जहाँ मस्तिष्क और शरीर हमें सीधा रखने के लिए हर सेकंड हजारों सूक्ष्म समायोजन करते हैं। एक रोबोट के लिए, यही कार्य एक अनिश्चितता से भरा जोखिम भरा काम है। चुनौती केवल पैरों को हिलाने की नहीं है, बल्कि ऐसा करने की है कि वह गिर न जाए, विशेष रूप से तब जब मशीन हल्के, सस्ते पुर्जों से बनी हो जिनमें उच्च श्रेणी के औद्योगिक रोबोटों जैसे सटीक सेंसर या शक्तिशाली मोटर नहीं होते। यह वह विशिष्ट पहेली है जिसका सामना 'पॉपी ह्यूमनॉइड' (Poppy Humanoid) के साथ काम करने वाले शोधकर्ताओं को करना पड़ रहा है, जो शिक्षा और अध्ययन के लिए डिज़ाइन किया गया एक छोटा, ओपन-सोर्स रोबोट है। हालांकि पॉपी आर्टिफिशियल इंटेलिजेंस के बारे में सीखने के लिए एक सुलभ मंच है, लेकिन ऐतिहासिक रूप से इसे अपने आप चलने में संघर्ष करना पड़ा है। बिना किसी मानवीय सहायता के इसे स्थिर रखने के लिए, रोबोट जल्दी ही अपना संतुलन खो देता और गिर जाता, जिससे इसकी उपयोगिता एक वास्तविक स्वायत्त मशीन के बजाय केवल एक कक्षा प्रदर्शन तक सीमित रह जाती।

मुख्य कठिनाई रोबोट के हार्डवेयर में निहित है। यह 3D-प्रिंटेड प्लास्टिक अंगों से बना है और उन मोटरों पर निर्भर करता है जिन्हें केवल यह बताया जा सकता है कि उन्हें कहाँ मुड़ना है, न कि यह कि कितना बल लगाना है। इसके अलावा, रोबोट में महंगे मशीनों में पाए जाने वाले उच्च-गति वाले सेंसरों का अभाव है, जिसका अर्थ है कि वह वास्तविक समय में कदम के माध्यम से रास्ता "महसूस" नहीं कर सकता। पिछले प्रयासों में पॉपी को चलाने के लिए गतिविधियों के एक पूर्व-रिकॉर्ड किए गए अनुक्रम को चलाने (प्लेबैक) का उपयोग किया गया था, जैसे कि एक टेप रिकॉर्डिंग। यह 'ओपन-लूप' दृष्टिकोण तभी काम करता था जब फर्श एकदम सही हो और रोबोट एक आदर्श स्थिति में शुरू हुआ हो। क्षण भर में ही यदि कोई छोटी सी त्रुटि हुई—जैसे थोड़ा सा डगमगाना या फिसलना—तो रोबोट के पास खुद को सुधारने का कोई तरीका नहीं था, और वह त्रुटि बढ़ती जाती जब तक कि रोबोट गिर न जाए। शोधकर्ताओं के सामने प्रश्न यह था कि क्या इस नाजुक, कम लागत वाली मशीन को अपनी गलतियों से उबरने और बिना मानवीय हस्तक्षेप के विश्वसनीय रूप से चलने के लिए सिखाना संभव है।

सिरैक्यूज़ यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने पॉपी को आत्म-सुधार का एक सरल रूप देकर इसे हल करने का प्रयास किया। केवल एक निश्चित स्क्रिप्ट चलाने के बजाय, उन्होंने एक ऐसी प्रणाली बनाई जो वास्तविक समय में रोबोट के जोड़ों पर नज़र रखती है और उसे ट्रैक पर रखने के लिए तुरंत छोटे समायोजन करती है। उन्होंने सैकड़ों चलने के प्रयासों को रिकॉर्ड करके शुरुआत की, जिनमें से कुछ सफल थे और कई जिनका अंत गिरने के साथ हुआ। सफल और असफल गतिविधियों के बीच के अंतर का विश्लेषण करके, उन्होंने एक कंप्यूटर प्रोग्राम को गिरने के शुरुआती संकेतों को पहचानना सिखाया। प्रोग्राम ने नियमों का एक सेट सीखा जिसने हर संभावित गतिविधि को एक "लागत" (cost) सौंपी, जहाँ उच्च लागत का अर्थ गिरने का उच्च जोखिम था। फिर इसने इन नियमों का उपयोग करके हर क्षण सबसे अच्छा संभव छोटा सुधार गणना करने के लिए किया, जिससे प्रभावी रूप से एक सुरक्षा जाल बन गया जिसे रोबोट सीधा रहने के लिए उपयोग कर सकता था।

इसके परिणाम आश्चर्यजनक थे। जब शोधकर्ताओं ने एक मानक कार्यालय वातावरण में रोबोट का परीक्षण किया, तो पुरानी विधि (एक निश्चित स्क्रिप्ट चलाना) ने रोबोट को गिरने से पहले औसतन केवल चार से अधिक कदम पूरे करने दिया। नई, आत्म-सुधार प्रणाली के साथ, रोबोट ने काफी अधिक दूरी तय की, गिरने से पहले औसतन पांच से अधिक कदम चले, और लगभग 80 प्रतिशत परीक्षणों में छह-कदमों के पूर्ण अनुक्रम को पूरा करने में सफल रहा। यह सुधार तब और भी उल्लेखनीय हो गया जब शोधकर्ताओं ने रोबोट का परीक्षण एक अलग कमरे में एक चिकने फर्श पर किया, जो एक ऐसा सतह थी जिसे उसने पहले कभी नहीं देखा था। इस नए वातावरण में, पुरानी विधि की सफलता दर गिरकर 30 प्रतिशत रह गई, लेकिन नई प्रणाली अभी भी 42.5 प्रतिशत बार सफल रही। इससे यह सिद्ध हुआ कि रोबोट केवल एक विशिष्ट पथ को याद नहीं कर रहा था, बल्कि उसने विभिन्न स्थितियों के विरुद्ध खुद को संतुलित करने की एक सामान्य क्षमता सीख ली थी।

इस सफलता की कुंजी कोई जटिल नया मस्तिष्क नहीं, बल्कि रोबोट द्वारा पहले से उत्पन्न डेटा का उपयोग करने का एक परिष्कृत तरीका था। शोधकर्ताओं को नए सेंसर बनाने या रोबोट के भौतिक डिज़ाइन को बदलने की आवश्यकता नहीं थी। इसके बजाय, उन्होंने एक गणितीय ढांचे का उपयोग किया जिसे 'लीनियर-क्वाड्रेटिक रेगुलेटर' (linear-quadratic regulator) कहा जाता है, जो त्रुटियों को न्यूनतम करते हुए लक्ष्य तक सबसे कुशल पथ खोजने की एक विधि है। सिस्टम में रोबोट के अपने विफल प्रयासों से प्राप्त डेटा फीड करके, वे इसे सिखाने में सक्षम हुए कि योजनाबद्ध पथ से कौन से विचलन खतरनाक थे। सिस्टम ने उन गतिविधियों को दंडित करना सीखा जो गिरने जैसी लग सकती थीं, जिससे रोबोट को एक स्थिर केंद्र की ओर वापस लाया जा सके। इसने रोबोट को उन छोटे झटकों और डगमगाहटों को सहने की अनुमति दी जो पहले पतन का कारण बनते थे, जिससे एक कठोर, भंगुर मशीन को एक ऐसी मशीन में बदल दिया जो वास्तविक दुनिया के अनुकूल हो सके।

यह कार्य किफायती रोबकीिक्स की दिशा में एक महत्वपूर्ण कदम है। यह सिद्ध करता है कि भले ही एक रोबोट सस्ते, बाजार में उपलब्ध पुर्जों और सीमित सेंसरों से बना हो, यदि उसे सही प्रकार की लर्निंग (सीखने की क्षमता) से लैस किया जाए, तो वह विश्वसनीय, स्वायत्त गति प्राप्त कर सकता है। शोधकर्ताओं ने दिखाया कि एक सरल नियंत्रण रणनीति को डेटा-संचालित लर्निंग के साथ जोड़कर, वे उस अंतर को पाट सकते हैं जो एक ऐसे रोबोट के बीच है जिसे हाथ पकड़ने के लिए इंसान की जरूरत होती है और एक ऐसे रोबोट के बीच जो अपने आप चल सकता है। हालाँकि यह रोबोट अभी भी धीरे चलता है और इसने मुड़ने या तेज चलने जैसे जटिल कार्यों में महारत हासिल नहीं की है, लेकिन गिरने के बिना चलने की क्षमता किसी भी भविष्य के अनुप्रयोग के लिए एक मौलिक आवश्यकता है। यह अध्ययन पुष्टि करता है कि सही सॉफ्टवेयर के साथ, कम लागत वाले हार्डवेयर की सीमाओं को पार किया जा सकता है, जिससे अनुसंधान और शिक्षा के लिए अधिक सुलभ और सक्षम रोबोटों के द्वार खुलते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →