← नवीनतम पेपर
💻 computer science

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

यह शोध पत्र ड्रिफ्ट-बेस्ड पॉलिसी ऑप्टिमाइज़ेशन (DBPO) को प्रस्तुत करता है, जो एक दो-चरणीय ढांचा है जो पुनरावृत्ति परिशोधन (iterative refinement) को प्रशिक्षण में आंतरिक रूप से समाहित करके और ऑनलाइन सुदृढीकरण शिक्षण (reinforcement learning) का समर्थन करके रोबोटिक नियंत्रण के लिए नेटिव वन-स्टेप जनरेटिव पॉलिसियों को सक्षम बनाता है, जिससे उच्च-आवृत्ति, कम-विलंबता प्रदर्शन प्राप्त होता है जो मौजूदा मल्टी-स्टेप डिफ्यूजन और सिंगल-स्टेप बेसलाइन्स से बेहतर है।

मूल लेखक: Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

प्रकाशित 2026-09-01
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोटिक भुजाएं कारखानों और प्रयोगशालाओं में तेजी से आम होती जा रही हैं, जिन्हें इलेक्ट्रॉनिक्स को जोड़ने या वस्तुओं को छांटने जैसे नाजुक कार्यों के लिए तैनात किया जाता है। इन मशीनों के बेहतर ढंग से काम करने के लिए, उन्हें एक "मस्तिष्क" की आवश्यकता होती है जो यह तय कर सके कि उसके कैमरों द्वारा देखे गए दृश्यों के आधार पर उसके जोड़ों को बिल्कुल कैसे हिलाना है। यह निर्णय लेने की प्रक्रिया एक सेकंड के बहुत छोटे हिस्से में होती है, और यह बार-बार होती रहती है, क्योंकि रोबोट बदलती दुनिया के प्रति प्रतिक्रिया देता है। चुनौती यह है कि वास्तविक दुनिया अव्यवस्थित और अप्रत्याशित है। मेज पर रखे एक ब्लॉक का एक एकल दृश्य, रोबोट की पिछली गतिविधियों या प्रकाश में मामूली बदलाव के आधार पर, उसे पकड़ने के कई अलग-अलग वैध तरीकों की अनुमति दे सकता है। इस अनिश्चितता को संभालने के लिए, शोधकर्ताओं ने ऐसी प्रणालियाँ विकसित की हैं जो केवल एक एकल उत्तर नहीं चुनतीं, बल्कि संभावित अच्छे कार्यों की एक श्रृंखला को भी सीखती हैं। अब तक की सबसे सफल प्रणालियाँ एक ऐसी विधि का उपयोग करती हैं जो एक धीमे, सावधानीपूर्वक मूर्तिकार की तरह काम करती है: वे एक यादृच्छिक अनुमान (random guess) से शुरू होती हैं और धीरे-धीरे इसे तब तक परिष्कृत करती हैं, चरण दर चरण, जब तक कि क्रिया एकदम सटीक न हो जाए। हालांकि यह दृष्टिकोण उच्च गुणवत्ता वाली गतिविधियाँ प्रदान करता है, लेकिन यह धीमा है। रोबोट को अपने प्रत्येक कदम के लिए अपने कंप्यूटर मस्तिष्क को कई बार चलाना पड़ता है, जिससे एक देरी पैदा होती है जो इसे तेज़, वास्तविक समय के कार्यों या परीक्षण और त्रुटि के माध्यम से नए कौशल सीखने के लिए बहुत सुस्त बना देती है।

शोधकर्ताओं की एक टीम ने अब एक तरीका खोज लिया है जिससे इन स्मार्ट रोबोटिक मस्तिष्कों को उतना ही सक्षम लेकिन बहुत अधिक तेज़ बनाया जा सकता है। उन्होंने एक नई प्रणाली विकसित की है जो दर्जनों चरणों में उन्हें परिष्कृत करने के बजाय, एक ही क्षण में उच्च-गुणवत्ता वाली, बहु-विकल्प कार्य योजनाओं को तैयार करती है। अपने कार्य में, उन्होंने दिखाया कि प्रशिक्षण के दौरान रोबोट को कैसे सिखाया जाए, यह बदलकर, वे इसे पूरे धीमे परिष्करण (refinement) की प्रक्रिया को पूरी तरह से छोड़ने के लिए सिखा सकते हैं। अपनी गलतियों को करने के बाद उन्हें सुधारने के बजाय, रोबोट पहली बार में ही सही उत्तर देना सीख जाता है। बारह विभिन्न रोबोटिक कार्यों के एक समूह पर परीक्षण किए जाने पर, इस नई विधि ने पुराने, धीमे सिस्टम की तुलना में उच्च औसत सफलता दर हासिल की, जबकि निर्णय लेने में लगने वाले समय को सौ कंप्यूटर गणनाओं से घटाकर केवल एक कर दिया। यह गति वृद्धि केवल एक सैद्धांतिक सुधार नहीं है; एक वास्तविक लैब में एक भौतिक ड्यूल-आर्म रोबोट पर, नए सिस्टम ने अपने 82 प्रतिशत कार्यों को पूरा किया, जबकि पिछले सर्वश्रेष्ठ एक-चरण वाले सिस्टम ने 59 प्रतिशत कार्य पूरे किए, और यह सब इतना तेज़ था कि यह वास्तविक समय में रोबोट को नियंत्रित करने के लिए पर्याप्त था।

इस सफलता का मूल आधार यह है कि रोबोट उदाहरणों से कैसे सीखता है। पारंपरिक विधियाँ जो उच्च-गुणवत्ता वाले कार्य उत्पन्न करती हैं, अक्सर 'इटरेटिव डिनोइजिंग' (iterative denoising) नामक प्रक्रिया पर निर्भर करती हैं। कल्पना कीजिए कि एक रोबोट एक कप उठाने का सबसे अच्छा तरीका खोजने की कोशिश कर रहा है। पुराने सिस्टम शायद एक पूरी तरह से यादृच्छिक हाथ की स्थिति से शुरू होंगे और फिर धीरे-धीरे उसे कप के करीब धकेलेंगे, अपने काम की जांच करेंगे, फिर से धकेलेंगे, और इस चक्र को कई बार दोहराएंगे जब तक कि हाथ एकदम सही स्थान पर न पहुँच जाए। यह सुनिश्चित करता है कि रोबोट एक अच्छा समाधान खोज ले, लेकिन इसमें समय लगता है। नया दृष्टिकोण, जिसे शोधकर्ता 'ड्रिफ्ट-बेस्ड पॉलिसी' (drift-based policy) कहते हैं, इस तर्क को उलट देता है। वास्तविक क्रिया के क्षण के दौरान उत्तर को परिष्कृत करने के बजाय, रोबोट प्रशिक्षण के दौरान ही संपूर्ण सुधार प्रक्रिया को आत्मसात करना सीख जाता है। प्रशिक्षण के दौरान, सिस्टम को सफल गतिविधियों के कई उदाहरण दिखाए जाते हैं और इसे सिखाया जाता है कि एक यादृच्छिक अनुमान एक सही अनुमान की ओर कैसे बढ़ेगा। यह इन सुधारों को अपनी आंतरिक सेटिंग्स में समाहित करना सीख जाता है ताकि जब इसे अंततः तैनात किया जाए, तो इसे उन धीमे, क्रमिक चरणों की आवश्यकता न पड़े। यह तुरंत अंतिम, सुधारा गया कार्य आउटपुट के रूप में दे देता है।

यह विचार काम करता है, यह सिद्ध करने के लिए शोधकर्ताओं ने विविध चुनौतियों पर अपने सिस्टम का परीक्षण किया। उन्होंने ब्लॉक को धकेलने, वस्तुओं को उठाने और उपकरणों को संचालित करने वाले बारह मानक सिमुलेशन कार्यों के साथ शुरुआत की। पुराने, बहु-चरणीय सिस्टम को एक एकल चाल तय करने के लिए कंप्यूटर को सौ बार अपना नेटवर्क चलाना पड़ता था। नया सिस्टम उसी काम को केवल एक रन के साथ कर देता है। परिणाम एक ऐसा सिस्टम था जो न केवल सौ गुना तेज़ था, बल्कि समग्र रूप में थोड़ा अधिक सफल भी था, जिसने 79 प्रतिशत की तुलना में 83 प्रतिशत की औसत सफलता दर हासिल की। इसने प्रदर्शित किया कि गति गुणवत्ता की कीमत पर नहीं आई थी; रोबोट कार्य में उतना ही अच्छा था, लेकिन वह बहुत अधिक कुशल था।

शोधकर्ताओं ने सिस्टम को और आगे बढ़ाया यह देखने के लिए कि क्या यह अधिक जटिल, त्रि-आयामी (3D) वातावरण को संभाल सकता है जहाँ रोबमा को एक सपाट छवि के बजाय बिंदुओं के बादल (cloud of points) के रूप में दिखाई देता है। उन्होंने हथौड़ा चलाने या दरवाजे का हैंडल घुमाने जैसे सरल वस्तु हेरफेर से लेकर कठिन कौशल वाले कार्यों तक, सैंतीस अलग-अलग कार्यों का परीक्षण किया। इन परीक्षणों में, नया सिस्टम मौजूदा अग्रणी एक-चरण गति प्रणालियों से भी बेहतर प्रदर्शन करता रहा। इसने 88.4 प्रतिशत की औसत सफलता दर हासिल की, जो अगले सर्वश्रेष्ठ एक-चरण वाले सिस्टम से काफी अधिक थी। इसने दिखाया कि यह विधि वास्तविक दुनिया के 3D विजन की जटिलता को संभालने के लिए पर्याप्त मजबूत थी, जिसमें पहले ऐसे कठिन कार्यों के लिए धीमे, बहु-चरणीय परिष्करण की आवश्यकता मानी जाती थी।

हालाँकि, एक रोबोट जो मानवीय प्रदर्शनों की नकल करने में अच्छा है, वह हमेशा नई समस्याओं को हल करने या गलतियों से उबरने में अच्छा नहीं होता है। इसे संबोधित करने के लिए, शोधकर्ताओं ने अपने ढांचे में दूसरा चरण जोड़ा, जिससे रोबोट को 'ऑनलाइन रीइन्फोर्समेंट लर्निंग' (online reinforcement learning) के माध्यम से सीखने की अनुमति मिली। यह एक ऐसी प्रक्रिया है जहाँ रोबोट केवल पुराने वीडियो की नकल करने के बजाय, पर्यावरण के साथ बातचीत करके और अपनी सफलता पर फीडबैक प्राप्त करके अपने प्रदर्शन में सुधार करने का प्रयास करता है। यहाँ चुनौती यह थी कि मानक लर्निंग एल्गोरिदम आमतौर पर प्रत्येक संभावित क्रिया की संभावना की गणना करने की आवश्यकता रखते हैं, जो इन तेज़, एक-चरण जनरेटरों के लिए कठिन है। टीम ने इस समस्या को एक विशेष इंटरफ़ेस बनाकर हल किया जिसने रोबोट को अपने अनुभवों से सीखने की अनुमति दी और साथ ही इसकी तेज़, एक-चरण प्रकृति को भी बरकरार रखा। उन्होंने पाया कि इस दृष्टिकोण ने रोबोट को अपने कौशल को प्रभावी ढंग से निखारने में मदद की, जिससे उन कार्यों पर इसके प्रदर्शन में सुधार हुआ जहाँ इसे शुरू में केवल मानवीय प्रदर्शनों पर प्रशिक्षित किया गया था।

अंतिम परीक्षण ने सिस्टम को कंप्यूटर सिमुलेशन से बाहर निकालकर एक वास्तविक प्रयोगशाला में एक भौतिक रोबोट पर उतारा। उन्होंने इसे एक मानव के समान दो भुजाओं वाले ड्यूल-आर्म रोबोट पर लगाया और इसे एक ब्लॉक उठाने, कैन ले जाने और दो भुजाओं के बीच वस्तुओं को स्थानांतरित करने जैसे कार्य करने के लिए कहा। रोबोट को कैमरों से प्राप्त दृश्य जानकारी पर वास्तविक समय में प्रतिक्रिया देनी थी, जिसमें किसी मानवीय हस्तक्षेप की आवश्यकता नहीं थी। सिस्टम ने दुनिया को देखने और हाथ हिलाने के बीच औसतन केवल 9.5 मिलीसेकंड का विलंब (delay) दिखाया, जो उच्च-आवृत्ति नियंत्रण के लिए पर्याप्त तेज़ गति है। परीक्षणों की एक श्रृंखला में, रोबोट ने 150 प्रयासों में से 123 को सफलतापूर्वक पूरा किया, जो 82 प्रतिशत की सफलता दर थी। इसकी तुलना में, पिछला सर्वश्रेष्ठ एक-चरण वाला सिस्टम 150 में से केवल 89 प्रयासों, यानी 59 प्रतिशत में सफल हो सका। जो विफलताएं हुईं, वे मुख्य रूप से भौतिक समस्याओं जैसे कि वस्तु का फिसलना या दोनों भुजाओं का आपस में टकराना था, न कि निर्णय लेने वाली प्रणाली की विफलता।

यह कार्य यह सुझाव देता है कि रोबोटिक नियंत्रण में गति और बुद्धिमत्ता के बीच का ट्रेड-ऑफ उतना निश्चित नहीं है जितना कि पहले माना जाता था। परिष्करण के बोझ को क्रिया के क्षण से हटाकर सीखने के समय पर स्थानांतरित करके, ऐसे रोबोटिक नियंत्रक बनाए जा सकते हैं जो अत्यधिक सक्षम और अविश्वसनीय रूप से तेज़ हों। शोधकर्ताओं ने दिखाया है कि रोबोट को एक अच्छा निर्णय लेने के लिए अपने विकल्पों पर चरण-दर-चरण विचार करने के लिए समय बिताने की आवश्यकता नहीं है; यह तुरंत सही निर्णय लेना सीख सकता है। यह उन रोबोटों के लिए द्वार खोलता है जो मानवीय प्रतिक्रियाओं की गति से काम कर सकते हैं, और हमारी दुनिया के जटिल, अप्रत्याशित वातावरण में वास्तविक समय में सीख और अनुकूलित हो सकते हैं। इस नए सिस्टम का कोड अन्य शोधकर्ताओं के लिए उपलब्ध कराया गया है, जिससे समुदाय को इस तेज़, जेनेरेटिव कंट्रोल के आधार पर आगे बढ़ने की अनुमति मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →