dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models
यह शोध पत्र dVLA-RL को प्रस्तुत करता है, जो डिस्क्रीट डिफ्यूजन विजन-लैंग्वेज-एक्शन मॉडल्स के लिए एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है, जो डिनोइजिंग ट्रेजेक्टरीज की संयुक्त प्रायिकता को अनुकूलित करके मार्जिनल एक्शन प्रोबेबिलिटीज की जटिलता को दूर करता है, जिससे एक एकीकृत, वेरिएबल-स्टेप शेड्यूलिंग दृष्टिकोण के माध्यम से रोबोटिक मैनिपुलेशन बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक जटिल व्यंजन, जैसे कि सूफ़ले (soufflé) बनाना सिखा रहे हैं।
पुराना तरीका (द "कॉपीकैट" समस्या):
पहले, रोबोट इंसानी शेफ को एक बार काम करते हुए देखकर और उसके हर मूवमेंट की हूबहू नकल करने की कोशिश करके सीखते थे। इसे "सुपरवाइज्ड फाइन-ट्यूनिंग" (Supervised Fine-Tuning) कहा जाता है। यह सरल कार्यों के लिए ठीक काम करता है, लेकिन अगर रसोई थोड़ी गंदी हो जाए या सामग्रियां थोड़ी अलग हों, तो रोबोट घबरा जाता है और असफल हो जाता है। यह उस छात्र की तरह है जिसने अभ्यास परीक्षा के उत्तर तो रट लिए, लेकिन नई समस्या हल नहीं कर पा रहा।
नया टूल (द "डिनाइजिंग" रोबोट):
हाल ही में, वैज्ञानिकों ने एक नए प्रकार का रोबोट दिमाग बनाया जिसे dVLA (डिस्क्रीट डिफ्यूजन विज़न-लैंग्वेज-एक्शन मॉडल) कहा जाता है। अगला कदम तुरंत तय करने के बजाय, यह रोबोट "नॉइज़ी" (noisy) तरीके से सोचता है। कल्पना कीजिए कि रोबोट के पास कागज़ का एक खाली टुकड़ा है जो लकीरों और बिखराव (noise) से भरा है। फिर वह धीरे-धीरे उन लकीरों को मिटाता है, और धीरे-धीरे एक सटीक रेसिपी को प्रकट करता है।
- चरण 1: वह कुछ शब्दों का अनुमान लगाता है।
- चरण 2: वह जो देख रहा है, उसके आधार पर उन शब्दों को और बेहतर बनाता है।
- चरण 3: वह रेसिपी को अंतिम रूप देता है।
यह "धीमी अभिव्यक्ति" (slow reveal) की प्रक्रिया रोबोट को अपने प्लान को बार-बार सुधारने की अनुमति देती है, ठीक वैसे ही जैसे एक कलाकार स्याही भरने से पहले एक स्केच बनाता है।
खोई हुई कड़ी (द "रीइन्फोर्समेंट लर्निंग" गैप):
हालांकि यह "धीमी अभिव्यक्ति" वाला रोबोट स्मार्ट था, लेकिन वह अभी भी केवल एक नकलची (copycat) ही था। उसने अपनी गलतियों से नहीं सीखा था। वैज्ञानिक रीइन्फोर्समेंट लर्निंग (RL) का उपयोग करना चाहते थे—एक ऐसी विधि जहाँ रोबोट चीज़ों को आज़माता है, सफलता के लिए उसे "थम्स अप" (इनाम) मिलता है और विफलता के लिए "थम्स डाउन" (सजा), जिससे वह समय के साथ बेहतर करना सीखता है।
बड़ी समस्या:
यहाँ एक गणितीय बाधा थी। मानक रोबोट दिमागों में, आप सही उत्तर मिलने की संभावना आसानी से निकाल सकते हैं। लेकिन इस "धीमी अभिव्यक्ति" वाले रोबोट में, अंतिम उत्तर अनुमानों के एक लंबे, घुमावदार रास्ते का परिणाम होता है। उस सटीक संभावना की गणना करना, जो रोबोट के पास जाने वाले हर संभावित रास्ते को देखकर की जा सकती है, समुद्र तट पर रेत के हर एक कण को गिनने की कोशिश करने जैसा है ताकि ज्वार का अनुमान लगाया जा सके। यह गणितीय रूप से असंभव (intractable) है।
समाधान: dVLA-RL (द "जर्नी" अप्रोच)
इस पेपर के लेखकों ने इसे बदलकर हल किया। उन्होंने यह नहीं पूछा कि, "एक आदर्श अंतिम उत्तर पाने की संभावना क्या है?" बल्कि उन्होंने पूछा, "अभी हमने जो विशिष्ट रास्ता तय किया है, उसकी संभावना क्या है?"
इसे एक वीडियो गेम की तरह समझें:
- पुराना गणित: पूरा टूर्नामेंट शुरू होने से पहले ही जीतने की संभावनाओं की गणना करना।
- नया गणित (dVLA-RL): अगले स्तर तक पहुँचने के लिए आपने जो विशिष्ट कदम उठाए हैं, उनकी संभावना की गणना करना।
इस प्रक्रिया को एक चरण-दर-चरण यात्रा (ट्रैजेक्टरी) के रूप में मानकर, वे रोबोट को मानक रीइन्फोर्समेंट लर्निंग का उपयोग करके सिखा सकते हैं। वे रोबोट को उस पूरे रास्ते के लिए पुरस्कृत करते हैं जो उसने समस्या को हल करने के लिए लिया, न कि केवल अंतिम परिणाम के लिए।
"हाइब्रिड" रणनीति (द "स्मार्ट शेड्यूलर")
लेखकों ने एक चतुर तकनीक भी पेश की जिसे Hybrid dVLA-RL कहा जाता है।
- आसान कार्य: यदि रोबोट किसी सरल कार्य में अच्छा है (जैसे कप उठाना), तो उसे सोचने के लिए 10 चरणों की आवश्यकता नहीं है। वह केवल 1 या 2 चरणों में काम कर सकता है। इससे समय और ऊर्जा बचती है।
- कठिन कार्य: यदि कार्य जटिल है (जैसे ब्लॉक्स का टावर बनाना), तो रोबोट को अपने प्लान को सोचने और सुधारने के लिए अधिक चरणों की अनुमति दी जाती है।
यह एक शिक्षक की तरह है जो आसान सवालों के लिए छात्र को छोटा क्विज़ देता है, लेकिन एक कठिन रिसर्च पेपर के लिए निबंध लिखने की अनुमति देता है। यह रोबोट को आसान कामों पर तेज़ और कठिन कामों पर स्मार्ट बनाता है।
परिणाम
टीम ने दो प्रमुख रोबोट प्रशिक्षण क्षेत्रों पर इसका परीक्षण किया:
- LIBBRO: सिंगल-आर्म रोबोट्स के लिए एक सिमुलेशन। नए तरीके ने 99.7% सफलता दर हासिल की, जिसका अर्थ है कि इसने कार्यों में महारत हासिल कर ली है।
- RoboTwin 2.0: दो-हाथ वाले रोबोट्स (इंसानों की तरह) के लिए एक कठिन सिमुलेशन। नए तरीके ने पुराने "कॉपीकैट" संस्करण की तुलना में सफलता दर में 30.6% का सुधार किया, जो अन्य शीर्ष-स्तरीय रोबोट दिमागों को भी पीछे छोड़ देता है।
सारांश में
यह पेपर "धीमी सोच" वाले रोबोट्स को उनके अपने अनुभवों से सीखने का एक तरीका प्रस्तुत करता है। अंतिम परिणाम के बारे में असंभव गणित की गणना करने में फंसने के बजाय, वे रोबोट को उस विशिष्ट यात्रा को सिखाते हैं जो उसे वहाँ तक ले गई। यह रोबोटों को निर्देशों का पालन करने और जटिल भौतिक कार्यों को संभालने में काफी बेहतर बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।