Reinforcement Learning for Real-Time Vision-Language-Action Policies
यह शोध पत्र Real-Time EXPO-FT को प्रस्तुत करता है, जो एक सुदृढीकरण अधिगम (reinforcement learning) ढांचा है जो धीमी, अभिव्यंजक क्रिया पीढ़ी (expressive action generation) को तेज़, प्रतिक्रियाशील क्रिया संपादन (reactive action editing) से अलग करता है ताकि इन्फरेंस विलंबता (inference latency) के बावजूद वास्तविक दुनिया की गतिशीलता के लिए बड़े विज़न-लैंग्वेज-एक्शन मॉडलों का नमूना-कुशल (sample-efficient), उच्च-प्रदर्शन अनुकूलन सक्षम किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट लंबे समय से जीवित चीजों की तरह सहजता से चलने के लिए संघर्ष कर रहे हैं। हालांकि उन्हें कारखाने में निर्देशों के एक कठोर सेट का पालन करने के लिए प्रोग्राम किया जा सकता है, लेकिन वास्तविक दुनिया अव्यवस्थित, अप्रत्याशित और तेज़ होती है। इस स्थिति से निपटने के लिए, शोधकर्ताओं ने 'विज़न-लैंग्वेज-एक्शन मॉडल' नामक एक प्रकार के आर्टिफिशियल इंटेलिजेंस की ओर रुख किया है। ये विशाल कंप्यूटर प्रोग्राम हैं जिन्हें डेटा की भारी मात्रा पर प्रशिक्षित किया जाता है, जिससे वे कैमरे के माध्यम से जो देखते हैं उसे समझने, एक टेक्स्ट निर्देश को पढ़ने और एक रोबोटिक आर्म (यांत्रिक हाथ) को कैसे चलाना है, यह निर्णय लेने में सक्षम होते हैं। वे शक्तिशाली हैं क्योंकि उन्होंने दुनिया कैसे काम करती है, इसके इतने उदाहरण देखे हैं, जो अनुभव के एक विशाल पुस्तकालय की तरह कार्य करते हैं। हालाँकि, इसमें एक बड़ी समस्या है: क्योंकि ये मॉडल इतने बड़े और जटिल होते हैं, उन्हें सोचने में उल्लेखनीय समय लगता है। उस एक सेकंड के छोटे से हिस्से में, जिसमें कंप्यूटर एक छवि को प्रोसेस करता है और गति का निर्णय लेता है, भौतिक दुनिया पहले ही बदल चुकी होती है। यदि कोई रोबोट गेंद को पकड़ने या किसी वस्तु को संतुलित करने की कोशिश कर रहा है, तो जब तक वह वास्तव में हिलता है, उसके निर्णय लेने के लिए उपयोग की गई जानकारी पहले ही पुरानी हो चुकी होती है, जिससे अक्सर क्रिया विफल हो जाती है।
स्टैनफोर्ड यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने इन बड़े मॉडलों को वास्तविक समय में कार्य करने के लिए सिखाने का एक नया तरीका विकसित किया है, भले ही वे सोचने में धीमे हों। उनका दृष्टिकोण, जिसे 'रियल-टाइम EXPO-FT' कहा जाता है, निर्णय लेने की प्रक्रिया को दो अलग-अलग भागों में विभाजित करके देरी की समस्या को हल करता है। विशाल, धीमे मॉडल को हर एक सेकंड के सूक्ष्म समायोजन करने के लिए मजबूर करने के बजाय, वे इसे एक सामान्य पथ की योजना बनाने का भारी काम करने देते हैं, जबकि एक बहुत छोटा, तेज़ कंप्यूटर प्रोग्राम तत्काल सुधारों को संभालता है। एक ऑर्केस्ट्रा का संचालन करने वाले कंडक्टर की कल्पना करें; कंडक्टर समग्र लय और धुन निर्धारित करता है, लेकिन व्यक्तिगत संगीतकारों को ताल बनाए रखने के लिए तुरंत अपने वादन को समायोजित करना होता है। इस प्रणाली में, बड़ा मॉडल एक कंडक्टर की तरह कार्य करता है, जो जो उसने एक क्षण पहले देखा था उसके आधार पर गतिविधियों का एक क्रम प्रस्तावित करता है। फिर, एक हल्का सहायक (लाइटवेट असिस्टेंट) दुनिया की वर्तमान स्थिति को देखता है और उन प्रस्तावित गतिविधियों में सूक्ष्म, तीव्र संपादन करता है ताकि यह सुनिश्चित हो सके कि वे ठीक उसी क्षण के लिए सही हैं जब रोबोट को कार्य करने की आवश्यकता होती है। यह रोबोट को बड़े मॉडल के गहरे ज्ञान का उपयोग करने की अनुमति देता है बिना उसकी धीमी सोचने की गति के कारण बाधित हुए।
शोधकर्ताओं ने इस पद्धति का परीक्षण दो बहुत ही अलग वातावरणों में किया: भौतिकी का एक सिम्युलेटेड (कृत्रिम) संसार और वास्तविक भौतिक दुनिया। सिमुलेशन में, उन्होंने रोबोट को दस अलग-अलग गतिशील कार्यों के साथ चुनौती दी, जैसे कि प्लेट पर गेंद को संतुलित करना, डिफेंडर (रक्षक) से बचते हुए सॉकर बॉल को किक मारना, और चलती हुई वस्तु को पकड़ना। उन्होंने अपनी नई पद्धति की तुलना कई मौजूदा तकनीकों से की जो देरी को संभालने की कोशिश करती थीं। परिणाम स्पष्ट थे: नए दृष्टिकोण ने रोबोट को लगभग हर एक प्रयास में सफल होने की अनुमति दी, जिसने सभी अन्य विधियों को पीछे छोड़ दिया, यहाँ तक कि उन विधियों को भी जो बिना किसी देरी के काम करती थीं। यह एक महत्वपूर्ण खोज थी क्योंकि इसने दिखाया कि सिस्टम को स्पष्ट रूप से अपनी सुस्ती को ध्यान में रखने के लिए सिखाने से, रोबोट उन प्रणालियों की तुलना में अधिक विश्वसनीय हो सकता है जो सैद्धांतिक रूप से तेज़ हैं लेकिन कम अनुकूलनीय हैं।
यह साबित करने के लिए कि यह वास्तविक दुनिया में काम करता है, टीम ने रोबोट को एक प्रयोगशाला सेटिंग में ले जाया और उसे चार चुनौतीपूर्ण कार्य दिए जिनमें निरंतर, तीव्र प्रतिक्रिया की आवश्यकता थी। इनमें घूमती हुई प्लेट पर पिंग-पॉन्ग बॉल को संतुलित रखना, घूमती सतह से एक ब्लॉक उठाना, दूसरे रोबोटिक आर्म द्वारा पास की गई वस्तु को पकड़ना, और डिफेंडर के आसपास घूमने के दौरान गोल में गेंद को किक मारना शामिल था। शोधकर्ताओं ने प्रशिक्षण समय को केवल दस मिनट तक सीमित कर दिया, जिसमें रोबोट पर्यावरण के साथ अंतःक्रिया करता है, यह सुनिश्चित करते हुए कि सिस्टम बिना घंटों के अभ्यास के तेजी से सीख सके। अपनी पद्धति लागू करने से पहले, इन कार्यों पर रोबोट की सफलता दर काफी कम थी, जो औसतन लगभग 42 प्रतिशत थी। इस नई रियल-टाइम ट्रेनिंग फ्रेमवर्क का उपयोग करने के बाद, सफलता दर उछलकर 97 प्रतिशत हो गई। रोबोट ने वस्तुओं की अराजक गतिविधियों और कार्यों की समय सीमाओं के अनुकूल होना सीख लिया, और यह सब प्रशिक्षण के दौरान बिना किसी मानवीय हस्तक्षेप के हुआ।
अध्ययन ने यह भी पता लगाया कि यह प्रणाली विभिन्न स्थितियों के तहत कितनी अच्छी तरह बनी रहती है। जब शोधकर्ताओं ने रोबोट की सोचने की प्रक्रिया में कृत्रिम रूप से देरी बढ़ाई, तो नई पद्धति ने अपने उच्च स्तर के प्रदर्शन को बनाए रखा, जबकि अन्य विधियाँ देरी बढ़ने पर विफल हो गईं। इसी तरह, जब चलती वस्तुओं की गति बढ़ाई गई, तो इस नए फ्रेमवर्क का उपयोग करने वाला रोबोट सफल रहा, जबकि अन्य दृष्टिकोण मुकाबला करने में संघर्ष करते रहे। यह प्रदर्शित करता है कि सिस्टम केवल एक विशिष्ट गति या देरी के लिए नहीं है, बल्कि यह एक गतिशील वातावरण की अप्रत्याशित प्रकृति को संभालने के लिए पर्याप्त मजबूत है। शोधकर्ताओं ने उल्लेख किया कि हालांकि उनका सिस्टम अत्यधिक प्रभावी है, फिर भी यह कार्य समाप्त होने के बाद रोबोट को रीसेट करने के लिए एक मानव पर निर्भर करता है, और इसे प्रत्येक कार्य के लिए सफलता को परिभाषित करने के एक विशिष्ट तरीके की आवश्यकता होती है। हालांकि, मुख्य उपलब्धि यह प्रदर्शन है कि बड़े, शक्तिशाली AI मॉडल को वास्तविक समय में काम करने के लिए बनाया जा सकता है, जो आर्टिफिशियल इंटेलिजेंस की धीमी, विचारशील योजना और भौतिक दुनिया की तेज़, प्रतिक्रियाशील मांगों के बीच के अंतर को पाटता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।