← नवीनतम पेपर
🤖 machine learning

Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups

प्रिज्म-जीआरपीओ (Prism-GRPO) बाइनरी सफलता पुरस्कारों को निष्पादन-गुणवत्ता स्कोर के साथ बढ़ाकर विजन-लैंग्वेज-एक्शन पॉलिसी अनुकूलन को त्वरित करता है ताकि समान-परिणाम समूहों को विभाजित किया जा सके, जिससे त्याग दिए गए रोलआउट्स से प्रशिक्षण संकेतों को पुनः प्राप्त किया जा सके और लक्षित सफलता दर तक पहुँचने के लिए 56% तक कम रोलआउट्स की आवश्यकता हो।

मूल लेखक: Zeyun Deng, Yuzhe Lu, Yawei Wang, Linbo Liu, Qing Ping, Han Ding, Guande Wu, Panpan Xu, Jun Huan

प्रकाशित 2026-08-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zeyun Deng, Yuzhe Lu, Yawei Wang, Linbo Liu, Qing Ping, Han Ding, Guande Wu, Panpan Xu, Jun Huan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट जो देख सकते हैं, भाषा समझ सकते हैं और उद्देश्यपूर्ण तरीके से चल सकते हैं, वे अब केवल विज्ञान कथा (साइंस फिक्शन) नहीं रह गए हैं। उन्हें विजन-लैंग्वेज-एक्शन मॉडल नामक एक प्रकार के आर्टिफिशियल इंटेलिजेंस का उपयोग करके बनाया जा रहा है। ये सिस्टम एक रोबोट जो देखता है और उसे जो करने के लिए कहा जाता है, उसके बीच एक सेतु का कार्य करते हैं। एक ऐसे रोबोट की कल्पना करें जो सुनता है "लाल कप उठाओ" और एक मेज पर रखे कप को देखता है; उसे फिर कप को पकड़ने के लिए अपने हाथ की सटीक गतिविधियों की गणना करनी होगी। इन रोबोटों को बेहतर बनाने के लिए, शोधकर्ता अक्सर 'रीइन्फोर्समेंट लर्निंग' (reinforcement learning) नामक एक विधि का उपयोग करते हैं। इस प्रक्रिया में, रोबोट एक कार्य करने का प्रयास करता है, और यदि वह सफल होता है, तो उसे एक इनाम मिलता है। यदि वह विफल होता है, तो उसे कुछ नहीं मिलता। हजारों प्रयासों के माध्यम से, रोबोट सीखता है कि कौन से कार्य सफलता की ओर ले जाते हैं। हालाँकि, यह सीखने की प्रक्रिया अविश्वसनीय रूप से महंगी है। हर बार जब रोबोट किसी कार्य को करने का प्रयास करता है, तो वह समय और कंप्यूटिंग शक्ति की खपत करता है। यदि रोबोट बार-बार विफल होता है, या यदि वह अनाड़ी तरीके से सफल होता है, तो कंप्यूटर अक्सर उस प्रयास को बेकार डेटा मानकर फेंक देता है। यह बर्बादी एक बड़ी बाधा है, जो वास्तविक दुनिया में सुरक्षित और कुशलता से काम करने वाले रोबोटों के विकास को धीमा कर देती है।

शोधकर्ताओं की एक टीम ने इस बर्बादी को ठीक करने के लिए एक नया दृष्टिकोण विकसित किया है, जो कभी फेंके जाने वाले डेटा को मूल्यवान सबक में बदल देता है। उनका तरीका, जिसे Prism-GRPO कहा जाता है, इस बात को बदल देता है कि रोबोट अपने स्वयं के प्रयासों का मूल्यांकन कैसे करता है। मानक तरीके में, एक रोबोट को एक साधारण पास-या-फेल (सफल या विफल) स्कोर दिया जाता है। यदि प्रयासों का एक समूह सफल होता है, तो उन सभी को एक ही समान पूर्ण स्कोर मिलता है। यदि वे सभी विफल होते हैं, तो उन सभी को एक ही समान शून्य स्कोर मिलता है। क्योंकि स्कोर समान होते हैं, इसलिए कंप्यूटर यह नहीं बता पाता कि कौन सा प्रयास दूसरों से बेहतर था, इसलिए वह समय बचाने के लिए पूरे समूह को हटा देता है। शोधकर्ताओं ने महसूस किया कि भले ही रोबोट विफल हो जाए, या सफल भी हो जाए, अक्सर उसके प्रदर्शन में सूक्ष्म अंतर होते हैं। एक सफल प्रयास सुचारू और कोमल हो सकता है, जबकि दूसरा झटकेदार हो सकता है और आसपास की वस्तुओं को गिरा सकता है। इन बारीकियों को अनदेखा करके, पुराना तरीका उस जानकारी को फेंक रहा था जिसकी आवश्यकता रोबोट को अधिक सटीक बनाने के लिए होती है।

यह नया तरीका एक दूसरे स्तर का फीडबैक जोड़कर इस समस्या को हल करता है। केवल "क्या यह काम कर गया?" पूछने के बजाय, सिस्टम यह भी पूछता है कि "यह कितनी अच्छी तरह से काम कर गया?" यह कार्य के भौतिक निष्पादन के आधार पर एक गुणवत्ता स्कोर निर्धारित करता है, जैसे कि कितना बल लगाया गया, गतिविधियाँ कितनी सुचारू थीं, या क्या रोबोट ने अनजाने में उन चीजों से टक्कर मारी जिन्हें उसे नहीं छूना चाहिए था। इस स्कोर को पास-या-फेल के परिणाम के साथ जोड़ा जाता है। अब, भले ही प्रयासों का एक समूह सफल हो जाए, सिस्टम देख सकता है कि कौन सा प्रयास दूसरों की तुलना में अधिक साफ-सुथरा था और उसके अनुसार उसे पुरस्कृत कर सकता है। इसी तरह, यदि एक समूह विफल हो जाता है, तो सिस्टम पहचान सकता है कि कौन सा विफल प्रयास सबसे कम नुकसानदेह था और उसे सीखने के संकेत के रूप में उपयोग कर सकता है। इस सरल परिवर्तन का अर्थ है कि लगभग कोई भी डेटा बर्बाद नहीं होता है। रोबोट हर एक प्रयास से सीखता है, न कि केवल उन दुर्लभ मामलों से जहाँ कुछ सफल होते हैं और अन्य विफल।

शोधकर्ताओं ने चार अलग-अलग रोबोटिक कार्यों पर इस विचार का परीक्षण किया, जिसमें दो हाथों से बर्तन उठाना और एक डिब्बे को हिलाकर बर्तन के पास रखना शामिल है। उन्होंने पाया कि उनके नए तरीके ने रोबोट को मानक पद्धति का उपयोग करके सफल होने के लिए 56 प्रतिशत तक कम प्रयासों की आवश्यकता के साथ समान स्तर की सफलता प्राप्त करने में सक्षम बनाया। यह समय और कंप्यूटिंग शक्ति की एक महत्वपूर्ण बचत है। इससे भी महत्वपूर्ण बात यह है कि इस नए तरीके से प्रशिक्षित रोबोट केवल सफल होना ही नहीं सीखे; उन्होंने सफलतापूर्वक और शालीनता से कार्य करना सीखा। वे "शॉर्टकट" या युक्तियों विकसित करने की कम संभावना रखते थे। उदाहरण के लिए, एक कार्य में जहाँ रोबोट को एक डिब्बे को उठाकर बर्तन के पास रखने के लिए कहा गया था, पुराने तरीके ने कभी-कभी रोबोट को डिब्बे को उठाने के बजाय बर्तन को डिब्बे की ओर धकेलना सिखा दिया। इसने कंप्यूटर के सफलता चेक को संतुष्ट किया लेकिन यह वह नहीं था जो मानव ने मांगा था। नया तरीका, धकेलने की उग्र गति को दंडित करके, रोबोट को सही, कोमल उठाने और रखने की क्रिया करने के लिए सिखाता है।

जब शोधकर्ताओं ने सिमुलेशन से सर्वश्रेष्ठ प्रदर्शन करने वाले रोबोटों को एक वास्तविक भौतिक रोबोट पर रखा, तो परिणाम बरकरार रहे। नए तरीके से प्रशिक्षित रोबोट अधिक विश्वसनीय थे और उन अनाड़ी शॉर्टकट को करने की संभावना कम थी जो सिमुलेशन में काम कर गए थे लेकिन वास्तविक दुनिया में विफल हो गए थे। अध्ययन यह दर्शाता है कि केवल कार्य के अंतिम परिणाम पर ध्यान देने के बजाय, एक क्रिया की गुणवत्ता पर ध्यान देकर, हम रोबोट को बहुत तेज़ी से प्रशिक्षित कर सकते हैं और उन्हें अधिक सुरक्षित बना सकते हैं। शोधकर्ताओं ने गणितीय रूप से सिद्ध किया कि यह दृष्टिकोण मुख्य कार्य को सीखने की रोबोट की क्षमता को कभी नुकसान नहीं पहुँचाता है, और उनके प्रयोगों ने पुष्टि की कि यह लगातार गति और व्यवहार दोनों में सुधार करता है। यह कार्य एक स्पष्ट मार्ग सुझाता है कि रोबole न केवल एक काम करने में सक्षम हों, बल्कि वे इसे उस देखभाल और सटीकता के साथ करने में भी सक्षम हों जिसकी मनुष्यों के साथ काम करने के लिए आवश्यकता होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →