← नवीनतम पेपर
💻 computer science

Temporal GRPO: Beyond Trajectory-Level Credit in Vision-Language-Action Reinforcement Learning

टेम्पोरल GRPO, स्टेज-विशिष्ट एडवांटेज अलाइनमेंट के माध्यम से ट्राजेक्टरी-लेवल क्रेडिट एलियासिंग को कम करके विजन-लैंग्वेज-एक्शन सुदृढीकरण शिक्षण (reinforcement learning) को उन्नत करता है, जिससे पारंपरिक रोलआउट-लेवल विधियों की तुलना में कार्य सफलता और सैंपल दक्षता में सुधार होता है।

मूल लेखक: Yao Zhou, Hang Gao, Fengge Wu, Changwen Zheng, Wenwen Qiang

प्रकाशित 2026-08-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yao Zhou, Hang Gao, Fengge Wu, Changwen Zheng, Wenwen Qiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल भोजन बनाना सिखा रहे हैं, जैसे कि तीन-कोर्स वाला रात्रिभोज। रोबोटिक्स और आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे "विज़न-लैंग्वेज-एक्शन" लर्निंग कहा जाता है। रोबोट के पास आँखें (दृष्टि/vision) हैं, निर्देशों को समझने वाला एक मस्तिष्क (भाषा/language) है, और चीजों को हिलाने के लिए हाथ (क्रिया/action) हैं। आमतौर पर, हम इन रोबोट्स को इंसानों द्वारा कार्य करने के वीडियो दिखाकर सिखाते हैं, लेकिन यह धीमा और महंगा होता है। एक नया, अधिक शानदार तरीका "रीइन्फोर्समेंट लर्निंग" (Reinforcement Learning) है, जहाँ रोबोट अपने आप चीज़ों को आज़माता है। यदि वह सफल होता है, तो उसे एक "हाई-फाइव" (पुरस्कार/reward) मिलता है; यदि वह विफल होता है, तो उसे एक कोमल "फिर से प्रयास करें" (दंड/penalty) मिलता है।

समस्या यह है कि वास्तविक जीवन बहुत अव्यवस्थित है। एक रोबोट सब्जियां काटने, प्याज को भूनने और व्यंजन को प्लेट में सजाने का काम पूरी तरह से कर सकता है, लेकिन तभी वह अंतिम सजावट (garnish) को गिरा देता है। रोबोट सिखाने के पुराने तरीके में, कंप्यूटर पूरे भोजन को देखता है और कहेगा, "तुम पूरा भोजन बनाने में विफल रहे!" और वह रोबोट को उन सभी चीज़ों के लिए दंडित करेगा जो उसने सही की थीं, यहाँ तक कि उस सटीक कटाई और भूनने के लिए भी। यह ऐसा है जैसे किसी छात्र को गणित के टेस्ट में केवल इसलिए कम ग्रेड देना क्योंकि उसने आखिरी स्टेप में एक छोटी सी गलती की, जिससे उसके पहले के सभी सही उत्तरों का श्रेय मिट गया। यह रोबोट को भ्रमित करता है और उसे लंबे, जटिल कार्यों को सीखने में कठिन बनाता है। यह पेपर इस अन्याय को संबोधित करता है, एक स्मार्ट तरीका प्रस्तावित करता है जिससे क्रेडिट देने का तरीका बेहतर हो सके ताकि रोबोट यह समझ सके कि वास्तव में क्या गलत हुआ, बिना अपनी सफलताओं को भूले।


"सब-या-कुछ-नहीं" का जाल (The "All-or-Nothing" Trap)

पुराने तरीके से रोबोट को प्रशिक्षित करने से मिलें, जिसे लेखक ट्रैजेक्टरी-लेवल क्रेडिट (Trajectory-Level Credit) कहते हैं। कल्पना कीजिए कि एक रोबलेट ब्लॉक्स को स्टैक करने की कोशिश कर रहा है। वह पहले ब्लॉक को सफलतापूर्वक उठाता है, उसे मेज तक ले जाता है और उसे स्टैक करता है। लेकिन फिर, बिल्कुल आखिरी ब्लॉक पर, वह फिसलता है और पूरा टावर गिरा देता है।

मानक विधि (जिसे GRPO कहा जाता है) में, कंप्यूटर अंतिम परिणाम को देखता है: टावर गिर गया। यह पूरी क्रियाओं के क्रम को एक एकल "विफलता स्कोर" (failure score) प्रदान करता है। इसका अर्थ है कि रोबोट के मस्तिष्क को एक संकेत मिलता है कि, "ब्लॉक मत उठाओ, उन्हें मत ले जाओ, और उन्हें स्टैक भी मत करो।" यह शुरुआती सफल चालों को भी उतनी ही कड़ी सजा देता है जितनी कि विफल अंतिम चाल को। लेखक इसे ट्रैजेक्टरी-लेवल क्रेडिट एलियासिंग (trajectory-level credit aliasing) कहते हैं। यह एक शिक्षक द्वारा छात्र के निबंध का मूल्यांकन केवल अंतिम वाक्य देखकर करने जैसा है; यदि अंत खराब है, तो पूरा निबंध 'F' ग्रेड पाता है, भले ही प्रस्तावना और मुख्य भाग शानदार रहे हों। यह रोबोट को भ्रमित करता है और लंबे, जटिल कार्यों को सीखना कठिन बना देता है।

नया विचार: टेम्पोरल GRPO (The New Idea: Temporal GRPO)

यह पेपर एक नई विधि पेश करता है जिसे टेम्पोरल GRPO (Temporal GRPO) कहा जाता है (जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन है, लेकिन आइए इसे "टाइम-ट्रैवल टीचर" कहें)। पूरी कहानी को एक बड़े ब्लॉक के रूप में देखने के बजाय, यह विधि कार्य को स्पष्ट, पता लगाने योग्य अध्यायों या "चरणों" (stages) में विभाजित करती है।

रोबोट के काम को एक वीडियो गेम के स्तरों (levels) के रूप में सोचें:

  1. स्तर 1: लाल कप उठाएं।
  2. स्तर 2: कप को शेल्फ तक ले जाएं।
  3. स्तर 3: कप को शेल्फ पर रखें।

टेम्पोरल GRPO के साथ, कंप्यूटर केवल अंतिम "गेम ओवर" स्क्रीन को नहीं देखता है। यह देखता है कि रोबोट प्रत्येक स्तर को कैसे खेल रहा है।

  • यदि रोबोट स्तर 3 में विफल होता है (कप गिरा देता है), तो कंप्यूटर कहता है, "स्तर 1 और 2 के लिए बहुत अच्छा! आपने कप को स्थिर रखा और अच्छी तरह से हिलाया। लेकिन आपने अंतिम प्लेसमेंट में गलती की।"
  • इसके बाद, यह विशेष रूप से स्तर 1 और 2 में की गई क्रियाओं को "हाई-फाइव" (सकारात्मक क्रेडिट) देता है, और केवल स्तर 3 में की गई क्रियाओं को ही "फिर से प्रयास करें" (नकारात्मक क्रेडिट) देता है।

पेपर बताता है कि यह निर्देशों के आधार पर "पता लगाने योग्य चरणों" (detectable stages) की एक सूची बनाकर किया जाता है। रोबोट की क्रियाओं को फिर इन चरणों के साथ संरेखित किया जाता है। यदि कोई रोबोट स्तर 2 तक पहुँचने में भी विफल रहता है, तो उसकी तुलना उस रोबोट से नहीं की जाती है जो स्तर 3 तक पहुँच गया था। उन्हें केवल उन्हीं अन्य रोबोटों के साथ तुलना किया जाता है जो उसी चरण पर थे। यह सुनिश्चित करता है कि रोबोट अपनी सफलताओं को अनलर्न (unlearn) किए बिना अपनी गलतियों से सीखे।

प्रयोगों ने क्या दिखाया (What the Experiments Showed)

शोधकर्ताओं ने इस नई विधि का परीक्षण दो अलग-अलग रोबोट प्रशिक्षण मैदानों पर किया: RoboTwin 2.0 और LIBERO-Long।

RoboTwin 2.0 पर, जिसमें विभिन्न लंबाई के कार्य (छोटे, मध्यम और बहुत लंबे) हैं, नई विधि काफी बेहतर काम करती है।

  • पुरानी विधियों (जैसे मानक Trajectory-GRPO) की औसत सफलता दर लगभग 46.4% थी।
  • नया Temporal GRPO तरीका 75.8% की सफलता दर तक पहुँच गया।
  • यह सुधार सभी कार्य लंबाई के बीच सुसंगत था, लेकिन यह उन लंबे, जटिल कार्यों के लिए विशेष रूप से सहायक था जहाँ "सब-या-कुछ-नहीं" वाली गलती आमतौर पर होती है।

शोधकर्ताओं ने यह देखने के लिए LIBERO-Long पर एक विशेष परीक्षण भी चलाया कि रोबोट वास्तव में कहाँ सीख रहा था। उन्होंने पाया कि पुरानी विधि के साथ, रोबोट वास्तव में शुरुआती चरणों (जैसे वस्तु को उठाना) में खराब हो जाता था क्योंकि उसे बाद की विफलता के लिए दंडित किया जा रहा था। Temporal GRPO के साथ, रोबोट अपने शुरुआती कौशल को तेज रखता है और केवल उस विशिष्ट चरण पर ध्यान केंद्रित करता है जहाँ वह विफल हो रहा है।

यह क्यों मायने रखता है (Why This Matters)

यह केवल कप रखने वाले रोबोटों के बारे में नहीं है; यह मशीनों को बिना भ्रमित हुए लंबे, जटिल कार्यों को संभालने के लिए सिखाने के बारे में है। क्रेडिट देने के तरीके को ठीक करके, रोबोट तेजी से और अधिक कुशलता से सीखता है। लेखक सुझाव देते हैं कि यह दृष्टिकोण उन कार्यों में महारत हासिल करने में मदद कर सकता है जिनमें कई चरणों की आवश्यकता होती है, जैसे फर्नीचर असेंबल करना या पूरा भोजन बनाना, यह सुनिश्चित करते हुए कि वे एक छोटी सी चूक के कारण अपने अच्छे काम को बेकार न कर दें।

हालाँकि, पेपर नोट करता है कि यह विधि वर्तमान में इन "चरणों" को स्पष्ट रूप से परिभाषित करने की क्षमता पर निर्भर करती है। यदि कार्य बहुत अधिक अव्यवस्थित है या चरण स्पष्ट नहीं हैं, तो सिस्टम को यह जानने में संघर्ष करना पड़ सकता है कि एक चरण कहाँ समाप्त होता है और दूसरा कहाँ शुरू होता है। लेकिन स्पष्ट शुरुआत, मध्य और अंत वाले कार्यों के लिए, यह "टाइम-ट्रैवल टीचर" रोबोट को स्मार्ट और अधिक विश्वसनीय बनाने के लिए एक गेम-चेंजर प्रतीत होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →