← नवीनतम पेपर
💻 computer science

StructRL: Structured Action-Space Exploration for Flow-Based VLAs

यह शोधपत्र StructRL प्रस्तुत करता है, जो फ्लो-आधारित विजन-लैंग्वेज-एक्शन मॉडल्स के लिए एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है, जो एक नियतात्मक ODE डिकोडर और लास्ट-स्टेप रिप्ले के माध्यम से संरचित स्टोकास्टिसिटी (structured stochasticity) को सीधे एक्शन स्पेस में स्थानांतरित करके मौजूदा विधियों की "स्ट्रक्चर्ड नॉइज़ डाइल्यूशन" समस्या को दूर करता है, जिससे रोबोटिक हेरफेर कार्यों में अन्वेषण दक्षता (exploration efficiency) और आउट-ऑफ-डिस्ट्रीब्यूशन प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Jiarui Yang, Bin Zhu, Jingjing Chen, Na Zou, Yanwei Fu, Jianggang Zhu, Yu-Gang Jiang

प्रकाशित 2026-08-18
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiarui Yang, Bin Zhu, Jingjing Chen, Na Zou, Yanwei Fu, Jianggang Zhu, Yu-Gang Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट जो मानवीय भाषा को समझ सकते हैं और जटिल निर्देशों का पालन कर सकते हैं, वे अब केवल विज्ञान कथा (साइंस फिक्शन) का सपना नहीं रहे; वे दुनिया भर की प्रयोगशालाओं में एक वास्तविकता बनते जा रहे हैं। ये प्रणालियाँ, जिन्हें विजन-लैंग्वेज-एक्शन मॉडल के रूप में जाना जाता है, रोबोट के मस्तिष्क के रूप में कार्य करती हैं, जो यह लेती हैं कि रोबोट क्या देख रहा है और इंसान क्या कह रहा है, और फिर यह निर्णय लेती हैं कि किसी कार्य को पूरा करने के लिए अपने हाथों और बाहों को ठीक से कैसे हिलाना है। इन गतिविधियों को सुचारू और सटीक बनाने के लिए, शोधकर्ता अक्सर एक ऐसी तकनीक का उपयोग करते हैं जो एक मूर्तिकार द्वारा मिट्टी के एक ब्लॉक को तराशने जैसा काम करती है। कंप्यूटर एक अनुमान के साथ शुरू करता है कि रोबट को क्या करना चाहिए—जो कि एक कच्चा और शोर भरा (नॉइजी) अनुमान होता है—और फिर धीरे-धीरे इसे तब तक साफ करता है, कदम-दर-कदम, जब तक कि एक पूर्ण, तरल गति उभर न आए। यह प्रक्रिया अविश्वसनीय रूप से शक्तिशाली है, लेकिन जब रोबोट अपने आप नए कार्य सीखने की कोशिश करता है, तो यह एक दीवार से टकरा जाती है। सीखने के लिए, एक रोबोट को अन्वेषण (एक्सप्लोर) करना होता है, यानी यह देखने के लिए अलग-अलग क्रियाएं आज़माना कि क्या काम करता है और क्या विफल होता है। हालाँकि, यदि रोबोट इस सफाई प्रक्रिया के दौरान अपनी गतिविधियों में यादृच्छिक झटकों (रैंडम जिटर्स) को जोड़कर सीखने की कोशिश करता है, तो सफाई करने की क्रिया अनजाने में उन झटकों को उस समय ही मिटा सकती है जब रोबोट ने उन्हें वास्तव में आज़माया भी नहीं होता। रोबोट अंततः इस तरह से अन्वेषण करता है जो या तो उपयोगी होने के लिए बहुत अधिक रैंडम होता है या सुरक्षित होने के लिए बहुत अधिक अराजक।

शोधकर्ताओं की एक टीम ने इन रोबोटों को अपनी गलतियों से सीखना सिखाने का एक बेहतर तरीका खोज निकाला है। उन्होंने पाया कि समस्या शोर (नॉइज़) जोड़ने के विचार में नहीं थी, बल्कि इस बात में थी कि वह शोर कहाँ जोड़ा जा रहा था। पिछले तरीकों में, यादृच्छिक भिन्नताओं को सफाई प्रक्रिया के शुरुआती चरणों में डाला जाता था, जो बाद के चरणों द्वारा आंशिक रूप से मिटा दिए जाते थे जो गति को परिष्कृत करते थे। शोधकर्ता इस घटना को "स्ट्रक्चर्ड नॉइज़ डाइल्यूशन" कहते हैं, जहाँ अन्वेषण के विशिष्ट, सहायक पैटर्न वास्तविक व्यवहार को प्रभावित करने से पहले ही धुल जाते हैं। इसे हल करने के लिए, उन्होंने 'स्ट्रक्टआरएल' (StructRL) नामक एक नया दृष्टिकोण विकसित किया। शोर को तब जोड़ने के बजाय जब कंप्यूटर अभी गति को समझने की कोशिश कर रहा होता है, वे कंप्यूटर को अपना काम पहले पूरा करने देते हैं, जिससे एक साफ, पूर्ण गति योजना तैयार होती है। उसके बाद ही वे अंतिम गति में आवश्यक भिन्नताएं सीधे जोड़ते हैं। यह सुनिश्चित करता है कि रोबोट वास्तव में नई, थोड़ी अलग क्रियाओं को आज़माए, न कि कंप्यूटर की आंतरिक गणनाओं द्वारा उन्हें सुचारू बनाया जाए।

इस काम को सफल बनाने की कुंजी यह समझना था कि रोबोट की गतिविधियों की एक विशिष्ट संरचना होती है जिसे रैंडम शोर अक्सर अनदेखा कर देता है। एक रोबोट का हाथ तीन अलग-अलग तरीकों से चलता है: यह अंतरिक्ष में अपनी स्थिति बदलता है, यह अपने ओरिएंटेशन (झुकाव) को घुमाता है, और यह अपने ग्रिपर को खोलता या बंद करता है। ये तीन प्रकार की गतिविधियाँ एक-दूसरे से भिन्न हैं; स्थिति में एक छोटा सा बदलाव सुरक्षित हो सकता है, जबकि समान आकार का रोटेशन खतरनाक हो सकता है, और ग्रिपर को पूरी तरह से अलग तरह के नियंत्रण की आवश्यकता होती है। शोधकर्ताओं ने अपने नए तरीके को इन अंतरों का सम्मान करने के लिए डिज़ाइन किया। उन्होंने ऐसा शोर जोड़ा जो समय के साथ सुचारू (स्मूथ) था, ताकि रोबोट बार-बार झटके न ले, और उन्होंने प्रत्येक गति के लिए शोर को अलग-अलग स्केल किया। इसका मतलब था कि रोबोट गति की एक उदार सीमा के साथ नई स्थितियों का अन्वेषण कर सकता था, जबकि अपने रोटेशन और ग्रिपर की क्रियाओं को बहुत अधिक सावधानीपूर्ण और नियंत्रित रख सकता था। कंप्यूटर की आंतरिक सफाई प्रक्रिया को नियत (डिटरमिनिस्टिक) और अनुमानित रखते हुए, और केवल अंत में आवश्यक रैंडमनेस पेश करके, शोधकर्ताओं ने यह सुनिश्चित किया कि रोबोट का अन्वेषण सुरक्षित और प्रभावी दोनों हो।

टीम ने इन नए तरीकों का परीक्षण विभिन्न सिम्युलेटेड कार्यों और एक वास्तविक प्रयोगशाला में एक वास्तविक रोबोटिक आर्म पर किया। सिमुलेशन में, रोबोटों को जटिल हेरफेर वाले कार्य करने के लिए कहा गया था, जैसे वस्तुओं को उठाना, उन्हें विशिष्ट स्थानों पर ले जाना और पुर्जों को जोड़ना। परिणामों ने इस नए दृष्टिकोण का स्पष्ट लाभ दिखाया। चुनौतीपूर्ण 'लॉन्ग-होराइजन' कार्यों पर, नए तरीके का उपयोग करने वाले रोबोटों ने लगभग 99 प्रतिशत की सफलता दर हासिल की, जो सफाई प्रक्रिया के दौरान शोर जोड़ने वाले पुराने तरीकों से काफी बेहतर थी। सुधार और भी अधिक स्पष्ट था जब रोबोटों को ऐसी स्थितियों का सामना करना पड़ा जो उन्होंने पहले कभी नहीं देखी थीं, जैसे कि नई जगहों पर रखी गई वस्तुएं या अलग प्रकाश व्यवस्था। नए तरीके से प्रशिक्षित रोबोट बहुत तेज़ी से अनुकूलन करने में सक्षम थे, और उन्होंने unexpected बदलावों को संभालने के लिए कम प्रयासों के साथ सीखा। यह सुझाव देता है कि वास्तविक दुनिया की अव्यवस्थित और अप्रत्याशित परिस्थितियों में अपने कौशल को सामान्य बनाने (जनरलाइज करने) के लिए अन्वेषण की संरचना को बनाए रखना महत्वपूर्ण है।

यह साबित करने के लिए कि यह काम कंप्यूटर के बाहर भी काम करता है, शोधकर्ताओं ने अपने सबसे बेहतर प्रदर्शन करने वाले मॉडल को एक भौतिक रोबोटिक आर्म पर स्थापित किया। उन्होंने रोबोट को दो विशिष्ट चुनौतियाँ दीं: एक केला उठाना और दीवार के सॉकेट में चार्जर लगाना। शुरुआत में, रोबोट के पास इन कार्यों के केवल कुछ प्रदर्शन देखे गए थे और स्वतंत्र रूप से करने के लिए कहा जाने पर वह पूरी तरह विफल रहा। शोधकर्ताओं ने फिर रोबोट को ऑनलाइन लर्निंग के माध्यम से, इस नए स्ट्रक्चर्ड एक्सप्लोरेशन मेथड का उपयोग करके, सीखने दिया। केले के कार्य के लिए, रोबोट ने केवल एक घंटे की ऑनलाइन लर्निंग के बाद 84 प्रतिशत बार सफलतापूर्वक केला उठाने में सक्षम हुआ, जबकि पुराने, कम संरचित तरीके का उपयोग करने वाला रोबोट केवल 56 प्रतिशत बार सफल हुआ। चार्जर कार्य के लिए, जिसमें प्लग को सॉकेट के साथ संरेखित करने के लिए सूक्ष्म मोटर कौशल की आवश्यकता थी, नए तरीके ने रोबोट को पुराने तरीके की तुलना में लगभग पांच मिनट पहले एक स्थिर, सफल अवस्था तक पहुँचने में मदद की। इन वास्तविक दुनिया के परिणामों ने पुष्टि की कि सैद्धांतिक सुधार सीधे भौतिक मशीनों के लिए तेज़, अधिक विश्वसनीय शिक्षण में परिवर्तित हुए।

इस कार्य की सफलता रोबोट को सिखाने के तरीके में एक मौलिक बदलाव को रेखांकित करती है। यह दिखाता है कि एक रोबोट अपने वातावरण का अन्वेषण कैसे करता है, यह उसके निर्णय लेने के लिए उपयोग की जाने वाली बुद्धिमत्ता जितना ही महत्वपूर्ण है। यह समझकर कि रोबोट की आंतरिक "सोचने" की प्रक्रिया को स्थिर और अनुमानित रहना चाहिए, जबकि "कार्य करने" की प्रक्रिया वह है जहाँ प्रयोग किए जाते हैं, शोधकर्ता अधिक कुशल और सुरक्षित रूप से सीखने वाली प्रणालियाँ बना सकते हैं। निष्कर्ष बताते हैं कि वास्तविक दुनिया के कार्यों के लिए आवश्यक जटिल, निरंतर गतिविधियों में महारत हासिल करने के लिए, हमें रोबोट की क्रियाओं को रैंडम अनुमानों की एक श्रृंखला के रूप में मानना बंद करना होगा और उन्हें संरचित, उद्देश्यपूर्ण प्रयोगों के रूप में मानना शुरू करना होगा। यह दृष्टिकोण न केवल रोबोटों को निर्देशों का पालन करने में बेहतर बनाता है; यह उन्हें अपने आप नए निर्देश खोजने की क्षमता भी देता है, जो उन मशीनों की दिशा में एक महत्वपूर्ण कदम है जो वास्तव में हमारे दैनिक जीवन में हमारी सहायता कर सकती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →