VGFM: Expressive Robot Policies via Dense Value Guidance in Flow Matching
यह शोध पत्र वैल्यू-गाइडेड फ्लो मैचिंग (VGFM) का प्रस्ताव करता है, जो एक स्केलेबल ऑफलाइन रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो रोबोटिक कंट्रोल के लिए एक्सप्रेसिव फ्लो-मैचिंग पॉलिसीज़ में डेंस वैल्यू-बेस्ड गाइडेंस को एकीकृत करता है, जिसमें बैकप्रोपैगेशन थ्रू टाइम या अतिरिक्त एल्गोरिथमिक ओवरहेड की आवश्यकता नहीं होती है, और विविध लोकोमोशन एवं मैनिपुलेशन कार्यों में उत्कृष्ट प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट लंबे समय से दोहराव वाले, पूर्वानुमेय कार्यों के विशेषज्ञ रहे हैं, लेकिन उन्हें वास्तविक दुनिया की अव्यवस्थित और अप्रत्याशित विविधता को संभालने के लिए सिखाना एक कठिन चुनौती बना हुआ है। वर्षों से, शोधकर्ता रोबोटों को पिछले आंदोलनों के विशाल पुस्तकालय खिलाकर इसे हल करने का प्रयास कर रहे हैं, इस उम्मीद में कि मशीन वास्तविक दुनिया में अभ्यास किए बिना मानवीय कौशल की नकल करना सीख सकेगी। यह दृष्टिकोण, जिसे ऑफलाइन लर्निंग (offline learning) कहा जाता है, प्रशिक्षण के लिए एक सुरक्षित और कुशल मार्ग प्रदान करता है, लेकिन जब रोबोट अपने प्रशिक्षण डेटा से थोड़ी अलग स्थिति का सामना करता है, तो यह विफल हो जाता है। इसके बाद रोबोट को यह निर्णय लेना होता है कि उसे कैसे कार्य करना है, जो अक्सर कई अलग-अलग वैध तरीकों के बीच चयन करने जैसा होता है, ठीक वैसे ही जैसे एक ड्राइवर एक जटिल चौराहे पर होता है जो बाएं मुड़ सकता है, सीधा जा सकता है, या यातायात के बीच से रास्ता बना सकता है। पारंपरिक तरीके इस समृद्ध विविध विकल्पों को पकड़ने में संघर्ष करते हैं, और अक्सर रोबोट को एक एकल, कठोर पथ पर मजबूर कर देते हैं जो स्थितियां बदलने पर विफल हो जाता है। इन सीमाओं से आगे बढ़ने के लिए, वैज्ञानिक जनरेटिव मॉडल्स (generative models) की ओर मुड़ रहे हैं, जो एक प्रकार का आर्टिफिशियल इंटेलिजेंस है जो केवल एक क्रिया के बजाय संभावित क्रियाओं के एक विस्तृत स्पेक्ट्रम की कल्पना करने में सक्षम है।
मुख्य कठिनाई इन काल्पनिक मॉडल्स को न केवल रचनात्मक, बल्कि स्मार्ट बनाने में निहित है। एक रोबोट को यह जानने की आवश्यकता है कि उसकी कई कल्पित क्रियाओं में से कौन सी वास्तव में सफलता की ओर ले जाएगी। अतीत में, रोबोट की कल्पना को एक अच्छे परिणाम की ओर निर्देशित करने के लिए एक गणनात्मक रूप से भारी प्रक्रिया की आवश्यकता होती थी जहाँ कंप्यूटर को रोबोट की विचार प्रक्रिया के हर एक कदम को पीछे की ओर ट्रैक करना पड़ता था ताकि यह देखा जा सके कि वह कहाँ गलत हुआ। यह धीमा, अस्थिर था, और अक्सर प्रशिक्षण प्रक्रिया को स्केल करने के लिए बहुत जटिल बना देता था। कॉर्नेल यूनिवर्सिटी के शोधकर्ताओं ने अब एक नई विधि पेश की है जिसे 'वैल्यू-गाइडेड फ्लो मैचिंग' (Value-Guided Flow Matching) कहा जाता है, जो इस बाधा को पूरी तरह से दूर करती है। कंप्यूटर को समय के माध्यम से अपने कदमों को फिर से ट्रेस करने के लिए मजबूर करने के बजाय, यह नया दृष्टिकोण रोबोट को उसके निर्णय लेने की प्रक्रिया के हर एक क्षण में मार्गदर्शन प्राप्त करने की अनुमति देता है, यह सुनिश्चित करते हुए कि उसके मध्यवर्ती विचार भी उसे एक सफल परिणाम की ओर ले जा रहे हैं।
टीम ने, जिसका नेतृत्व प्रज्वल कोइराला और मार्क कैंपबेल ने किया, एक ऐसी प्रणाली डिजाइन की है जहाँ रोबोट की पॉलिसी, या उसके चलने की रणनीति, असंबद्ध छलांगों की एक श्रृंखला के बजाय एक निरंतर प्रवाह की तरह बनाई गई है। एक स्रोत से गंतव्य तक बहती हुई नदी की कल्पना करें; रोबोट आंदोलन के एक सरल, यादृच्छिक विचार के साथ शुरू होता है और धीरे-धीरे इसे एक विशिष्ट क्रिया में आकार देता है। यहाँ नवाचार यह है कि सिस्टम इस नदी के पथ पर प्रत्येक बिंदु पर क्रिया की गुणवत्ता की जाँच करता है, न कि केवल अंत में। प्रत्येक मध्यवर्ती चरण पर आंदोलन के अंतिम गंतव्य की भविष्यवाणी करके, सिस्टम एक "वैल्यू" सिग्नल (एक माप कि वह क्रिया कितनी अच्छी है) लागू कर सकता है, बिना पूरी जनरेटिव प्रक्रिया को अनलॉ (unravel) किए। इसका अर्थ है कि रोबोट निरंतर अपने आंदोलनों को परिष्कृत करना सीखता है, एक ऐसे आलोचक द्वारा निर्देशित होता है जो वास्तविक समय में क्रिया की गुणवत्ता का मूल्यांकन करता है, और यह सब समय के माध्यम से पीछे जाने की भारी गणनात्मक लागत से बचते हुए किया जाता है।
इस विचार का परीक्षण करने के लिए, शोधकर्ताओं ने OGBench नामक एक मानक बेंचमार्क का उपयोग करके चुनौतियों की एक कठोर श्रृंखला के माध्यम से अपने सिस्टम को परखने के लिए इसे तैयार किया, जिसमें कार्यों की एक विस्तृत श्रृंखला शामिल है। इन कार्यों में चार पैरों वाले और मानव रूपी (humanoid) रोबोटों के साथ जटिल भूलभुलैया से लेकर रोबोटिक भुजाओं के साथ वस्तुओं का हेरफेर करना शामिल था। भूलभुलैया के परिदृश्यों में, रोबोटों को घुमावदार गलियारों के माध्यम से अपना रास्ता खोजना था, जबकि हेरफेर वाले कार्यों के लिए क्यूब्स को स्टैक करने या अव्यवस्थित वातावरण में वस्तुओं के साथ बातचीत करने की आवश्यकता थी। सिस्टम को पिछले आंदोलनों के स्थिर डेटासेट पर प्रशिक्षित किया गया था, जिसका अर्थ है कि इसने सीखने के चरण के दौरान वातावरण को कभी नहीं देखा, केवल रिकॉर्ड किए गए डेटा को देखा। परिणाम आश्चर्यजनक थे: नया तरीका लगभग सभी विविध कार्यों में मौजूदा सर्वोत्तम तकनीकों के साथ लगातार बेहतर प्रदर्शन करता है या उनके बराबर रहता है। इसने AntMaze और HumanoidMaze वातावरणों में नेविगेशन के लिए उच्च सफलता दर हासिल की और Cube और Scene हेरफेर कार्यों के लिए आवश्यक सटीक आंदोलनों में उत्कृष्टता प्राप्त की।
इस दृष्टिकोण की एक प्रमुख विशेषता इसके वास्तविक उपयोग के दौरान इसकी लचीलापन है। एक बार जब सिस्टम प्रशिक्षित हो जाता है, तो इंजीनियर बिना मॉडल को पुन: प्रशिक्षित किए, एक एकल क्रिया उत्पन्न करने के लिए उपयोग की जाने वाली कंप्यूटिंग शक्ति को समायोजित कर सकते हैं। शोधकर्ताओं ने पाया कि केवल कंप्यूटर द्वारा अंतिम आंदोलन की गणना करने के लिए चरणों की संख्या बढ़ाकर, रोबोट अधिक सटीक और जटिल कार्य कर सकता है। गति और सटीकता के बीच यह ट्रेड-ऑफ वास्तविक दुनिया के अनुप्रयोगों के लिए महत्वपूर्ण है, जहाँ एक रोबोट को एक सरल स्थिति में तेजी से चलने की आवश्यकता हो सकती है लेकिन एक नाजुक स्थिति में सटीक होने के लिए धीमा होने की आवश्यकता हो सकती है। अध्ययन ने दिखाया कि यह स्केलेबिलिटी लगभग बिना किसी अतिरिक्त समय लागत के आती है, जिससे रोबोट निर्णय लेने के क्षण में अधिक प्रोसेसिंग पावर का उपयोग करके अधिक अभिव्यंजक और सक्षम बन सकता है।
इस पद्धति की सफलता रोबोटिक नियंत्रण के लिए एक नए पथ का सुझाव देती है, जो सुरक्षा और डेटा दक्षता की आवश्यकता को जटिल, अनुकूल व्यवहार की मांग के साथ संतुलित करती है। हर कदम को पीछे की ओर ट्रेस करने के भारी गणनात्मक बोझ को हटाकर, शोधकर्ताओं ने रोबोट को लंबे, जटिल क्रियाओं के अनुक्रमों को संभालने के लिए प्रशिक्षित करना संभव बना दिया है, जो पहले पहुंच से बाहर की अभिव्यक्ति के स्तर तक पहुँच सकते हैं। यह प्रणाली जादू या शॉर्टकट पर निर्भर नहीं है; यह केवल इस बात पर पुनर्विचार करती है कि मार्गदर्शन कैसे लागू किया जाए, जिससे रोबोट अपनी पूरी निर्णय लेने की यात्रा के दौरान फीडबैक के एक सघन प्रवाह से सीख सके। जैसे-जैसे रोबics का क्षेत्र मशीनों को असंरचित मानव वातावरण में संचालित करने की दिशा में आगे बढ़ रहा है, इस तरह के तरीके उन्हें संभावनाओं की दुनिया से सही क्रिया चुनने की सूक्ष्म कला सिखाने के लिए एक स्केलेबल और प्रभावी तरीका प्रदान करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।