← नवीनतम पेपर
💻 computer science

dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models

यह शोध पत्र dVLA-RL को प्रस्तुत करता है, जो डिस्क्रीट डिफ्यूजन विजन-लैंग्वेज-एक्शन मॉडल्स के लिए एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है, जो डिनोइजिंग ट्रेजेक्टरीज की संयुक्त प्रायिकता को अनुकूलित करके मार्जिनल एक्शन प्रोबेबिलिटीज की जटिलता को दूर करता है, जिससे एक एकीकृत, वेरिएबल-स्टेप शेड्यूलिंग दृष्टिकोण के माध्यम से रोबोटिक मैनिपुलेशन बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Yuhao Wu, Yitian Liu, Weijie Shen, Mishuo Han, Wenjie Xu, Haotian Liang, Zhongshan Liu, Yinan Mao, Lei Xu, Xinping Guan, Ru Ying, Ran Zheng, Wei Sui, Xiaokang Yang, Wenbo Ding, Yao Mu

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuhao Wu, Yitian Liu, Weijie Shen, Mishuo Han, Wenjie Xu, Haotian Liang, Zhongshan Liu, Yinan Mao, Lei Xu, Xinping Guan, Ru Ying, Ran Zheng, Wei Sui, Xiaokang Yang, Wenbo Ding, Yao Mu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल व्यंजन, जैसे कि सूफ़ले (soufflé) बनाना सिखा रहे हैं।

पुराना तरीका (द "कॉपीकैट" समस्या):
पहले, रोबोट इंसानी शेफ को एक बार काम करते हुए देखकर और उसके हर मूवमेंट की हूबहू नकल करने की कोशिश करके सीखते थे। इसे "सुपरवाइज्ड फाइन-ट्यूनिंग" (Supervised Fine-Tuning) कहा जाता है। यह सरल कार्यों के लिए ठीक काम करता है, लेकिन अगर रसोई थोड़ी गंदी हो जाए या सामग्रियां थोड़ी अलग हों, तो रोबोट घबरा जाता है और असफल हो जाता है। यह उस छात्र की तरह है जिसने अभ्यास परीक्षा के उत्तर तो रट लिए, लेकिन नई समस्या हल नहीं कर पा रहा।

नया टूल (द "डिनाइजिंग" रोबोट):
हाल ही में, वैज्ञानिकों ने एक नए प्रकार का रोबोट दिमाग बनाया जिसे dVLA (डिस्क्रीट डिफ्यूजन विज़न-लैंग्वेज-एक्शन मॉडल) कहा जाता है। अगला कदम तुरंत तय करने के बजाय, यह रोबोट "नॉइज़ी" (noisy) तरीके से सोचता है। कल्पना कीजिए कि रोबोट के पास कागज़ का एक खाली टुकड़ा है जो लकीरों और बिखराव (noise) से भरा है। फिर वह धीरे-धीरे उन लकीरों को मिटाता है, और धीरे-धीरे एक सटीक रेसिपी को प्रकट करता है।

  • चरण 1: वह कुछ शब्दों का अनुमान लगाता है।
  • चरण 2: वह जो देख रहा है, उसके आधार पर उन शब्दों को और बेहतर बनाता है।
  • चरण 3: वह रेसिपी को अंतिम रूप देता है।

यह "धीमी अभिव्यक्ति" (slow reveal) की प्रक्रिया रोबोट को अपने प्लान को बार-बार सुधारने की अनुमति देती है, ठीक वैसे ही जैसे एक कलाकार स्याही भरने से पहले एक स्केच बनाता है।

खोई हुई कड़ी (द "रीइन्फोर्समेंट लर्निंग" गैप):
हालांकि यह "धीमी अभिव्यक्ति" वाला रोबोट स्मार्ट था, लेकिन वह अभी भी केवल एक नकलची (copycat) ही था। उसने अपनी गलतियों से नहीं सीखा था। वैज्ञानिक रीइन्फोर्समेंट लर्निंग (RL) का उपयोग करना चाहते थे—एक ऐसी विधि जहाँ रोबोट चीज़ों को आज़माता है, सफलता के लिए उसे "थम्स अप" (इनाम) मिलता है और विफलता के लिए "थम्स डाउन" (सजा), जिससे वह समय के साथ बेहतर करना सीखता है।

बड़ी समस्या:
यहाँ एक गणितीय बाधा थी। मानक रोबोट दिमागों में, आप सही उत्तर मिलने की संभावना आसानी से निकाल सकते हैं। लेकिन इस "धीमी अभिव्यक्ति" वाले रोबोट में, अंतिम उत्तर अनुमानों के एक लंबे, घुमावदार रास्ते का परिणाम होता है। उस सटीक संभावना की गणना करना, जो रोबोट के पास जाने वाले हर संभावित रास्ते को देखकर की जा सकती है, समुद्र तट पर रेत के हर एक कण को गिनने की कोशिश करने जैसा है ताकि ज्वार का अनुमान लगाया जा सके। यह गणितीय रूप से असंभव (intractable) है।

समाधान: dVLA-RL (द "जर्नी" अप्रोच)
इस पेपर के लेखकों ने इसे बदलकर हल किया। उन्होंने यह नहीं पूछा कि, "एक आदर्श अंतिम उत्तर पाने की संभावना क्या है?" बल्कि उन्होंने पूछा, "अभी हमने जो विशिष्ट रास्ता तय किया है, उसकी संभावना क्या है?"

इसे एक वीडियो गेम की तरह समझें:

  • पुराना गणित: पूरा टूर्नामेंट शुरू होने से पहले ही जीतने की संभावनाओं की गणना करना।
  • नया गणित (dVLA-RL): अगले स्तर तक पहुँचने के लिए आपने जो विशिष्ट कदम उठाए हैं, उनकी संभावना की गणना करना।

इस प्रक्रिया को एक चरण-दर-चरण यात्रा (ट्रैजेक्टरी) के रूप में मानकर, वे रोबोट को मानक रीइन्फोर्समेंट लर्निंग का उपयोग करके सिखा सकते हैं। वे रोबोट को उस पूरे रास्ते के लिए पुरस्कृत करते हैं जो उसने समस्या को हल करने के लिए लिया, न कि केवल अंतिम परिणाम के लिए।

"हाइब्रिड" रणनीति (द "स्मार्ट शेड्यूलर")
लेखकों ने एक चतुर तकनीक भी पेश की जिसे Hybrid dVLA-RL कहा जाता है।

  • आसान कार्य: यदि रोबोट किसी सरल कार्य में अच्छा है (जैसे कप उठाना), तो उसे सोचने के लिए 10 चरणों की आवश्यकता नहीं है। वह केवल 1 या 2 चरणों में काम कर सकता है। इससे समय और ऊर्जा बचती है।
  • कठिन कार्य: यदि कार्य जटिल है (जैसे ब्लॉक्स का टावर बनाना), तो रोबोट को अपने प्लान को सोचने और सुधारने के लिए अधिक चरणों की अनुमति दी जाती है।

यह एक शिक्षक की तरह है जो आसान सवालों के लिए छात्र को छोटा क्विज़ देता है, लेकिन एक कठिन रिसर्च पेपर के लिए निबंध लिखने की अनुमति देता है। यह रोबोट को आसान कामों पर तेज़ और कठिन कामों पर स्मार्ट बनाता है।

परिणाम
टीम ने दो प्रमुख रोबोट प्रशिक्षण क्षेत्रों पर इसका परीक्षण किया:

  1. LIBBRO: सिंगल-आर्म रोबोट्स के लिए एक सिमुलेशन। नए तरीके ने 99.7% सफलता दर हासिल की, जिसका अर्थ है कि इसने कार्यों में महारत हासिल कर ली है।
  2. RoboTwin 2.0: दो-हाथ वाले रोबोट्स (इंसानों की तरह) के लिए एक कठिन सिमुलेशन। नए तरीके ने पुराने "कॉपीकैट" संस्करण की तुलना में सफलता दर में 30.6% का सुधार किया, जो अन्य शीर्ष-स्तरीय रोबोट दिमागों को भी पीछे छोड़ देता है।

सारांश में
यह पेपर "धीमी सोच" वाले रोबोट्स को उनके अपने अनुभवों से सीखने का एक तरीका प्रस्तुत करता है। अंतिम परिणाम के बारे में असंभव गणित की गणना करने में फंसने के बजाय, वे रोबोट को उस विशिष्ट यात्रा को सिखाते हैं जो उसे वहाँ तक ले गई। यह रोबोटों को निर्देशों का पालन करने और जटिल भौतिक कार्यों को संभालने में काफी बेहतर बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →