← नवीनतम पेपर
🤖 AI

Z-1: Efficient Reinforcement Learning for Vision-Language-Action Models

Z-1 एक सुदृढीकरण शिक्षण (reinforcement learning) पोस्ट-ट्रेनिंग फ्रेमवर्क है जो सार्वजनिक रूप से उपलब्ध RoboCasa प्रदर्शनों पर ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) का लाभ उठाकर, बिना किसी अतिरिक्त निजी डेटा की आवश्यकता के, फ्लो-आधारित विजन-लैंग्वेज-एक्शन मॉडल्स के प्रदर्शन और सफलता दरों को महत्वपूर्ण रूप से बढ़ाता है।

मूल लेखक: Lang Cao, Renhong Chen, Luyi Li, Peng Wang, Mofan Peng, Yitong Li

प्रकाशित 2026-07-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lang Cao, Renhong Chen, Luyi Li, Peng Wang, Mofan Peng, Yitong Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल भोजन बनाना सिखा रहे हैं, जैसे कॉफी बनाना या किसी कठिन दराज को खोलना।

समस्या: "नकलची" रोबोट (The "Copycat" Robot)
अब तक, अधिकांश रोबोट प्रशिक्षक "बिहेवियर क्लोनिंग" (Behavior Cloning) नामक विधि का उपयोग करते थे। इसे एक ऐसे छात्र की तरह समझें जो केवल अपने शिक्षक के सटीक वीडियो रिकॉर्डिंग देखकर सीखता है। रोबोट शिक्षक को सफल होते हुए देखता है और हर हरकत की हूबहू नकल करने की कोशिश करता है।

  • खामी: यदि छात्र एक छोटी सी गलती करता है (जैसे हैंडल पकड़ने के लिए एक मिलीमीटर भी ज्यादा हाथ आगे बढ़ा देना), तो वीडियो यह नहीं दिखाता कि उसे कैसे सुधारा जाए। रोबोट वहीं फंस जाता है, उसे सुधार करना नहीं आता, और वह असफल हो जाता है। वह अपनी गलतियों से नहीं सीख सकता क्योंकि प्रशिक्षण के दौरान उसे गलतियाँ करने की अनुमति ही नहीं दी गई थी।

समाधान: Z-1 (द "ट्रायल-एंड-एरर" कोच)
यह शोध पत्र Z-1 पेश करता है, जो एक नया प्रशिक्षण सिस्टम है जो रोबोट को करके, असफल होकर और फिर से प्रयास करके सीखने की अनुमति देता है। यह एक ऐसे कोच की तरह है जो छात्र को रसोई में अभ्यास करने देता है, असफल होने देता है, और फिर अगली बार बेहतर करने के लिए विशिष्ट फीडबैक देता है।

Z-1 कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. शुरुआती बिंदु (SFT)

सबसे पहले, रोबोट को सार्वजनिक वीडियो (जैसे दरवाजे खोलना या सिंक का उपयोग करना) देखकर एक "क्रैश कोर्स" मिलता है। यह उसे काम करने का एक बुनियादी विचार देता है, जो खाना पकाने से पहले रेसिपी पढ़ने जैसा है।

2. "ग्रुप प्रैक्टिस" (GRPO)

रोबोट को अकेले अभ्यास करने देने के बजाय, Z-1 ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) का उपयोग करता है।

  • उदाहरण: कल्पना करें कि एक कोच एक ही समय में कॉफी बनाने के लिए 8 छात्रों को रसोई में भेजता है।
  • लक्ष्य: कोच केवल यह नहीं कहता कि "अच्छा काम किया" या "बुरा काम किया।" इसके बजाय, कोच उन 8 छात्रों की एक-दूसरे के विरुद्ध तुलना करता है। यदि 7 छात्र कॉफी गिरा देते हैं लेकिन 1 छात्र सही ढंग से बनाता है, तो कोच सफल छात्र को बताता है, "तुमने इसे अलग तरीके से किया; जो तुम कर रहे थे उसे जारी रखो।" इससे रोबोट को यह समझने में मदद मिलती है कि किस सूक्ष्म हरकत ने अंतर पैदा किया।

3. स्मार्ट ट्रिक्स (नए मॉड्यूल्स)

यह शोध पत्र अभ्यास को कुशल और स्थिर बनाने के लिए चार चतुर ट्रिक्स पेश करता है:

  • शेयर्ड-प्रिफिक्स (The "Same Start" Rule - "एक जैसा आरंभ" नियम):

    • समस्या: यदि छात्र A बाईं ओर चलकर शुरू करता है और छात्र B दाईं ओर चलकर शुरू करता है, तो उनके अंतिम कॉफी बनाने के कौशल की तुलना करना अनुचित है। उनके शुरुआती बिंदु अलग थे।
    • समाधान: Z-1 सभी 8 छात्रों को ठीक उन्हीं पहले कुछ कदमों के साथ शुरू करने के लिए मजबूर करता है (जैसे काउंटर तक चलना)। एक बार जब वे सभी काउंटर पर खड़े हो जाते हैं, तो वे अलग-अलग तरीकों से मग पकड़ने की कोशिश करते हैं। यह सुनिश्चित करता है कि रोबोट कार्य के महत्वपूर्ण हिस्से (पकड़ने वाले भाग) से सीखे, न कि चलने से।
  • ट्री-स्ट्रक्चर्ड ब्रांचिंग (The "Branching Path" Rule - "शाखाओं वाला रास्ता" नियम):

    • समस्या: कभी-कभी, "काउंटर तक चलने" वाले हिस्से का भी अभ्यास करने की आवश्यकता होती है। यदि हम उन्हें बिल्कुल एक जैसा शुरू करने के लिए मजबूर करते हैं, तो वे खराब चाल को ठीक करना कभी नहीं सीख पाएंगे।
    • समाधान: Z-1 एक "ट्री" (पेड़) संरचना का उपयोग करता है। सभी छात्र एक साथ शुरू करते हैं, लेकिन फिर वे अलग-अलग बिंदुओं पर छोटे समूहों में बंट जाते हैं। कुछ जल्दी अलग होते हैं, कुछ देर से। यह रोबट को व्यवस्थित रहते हुए भी छोटी गलतियों को सुधारने का अभ्यास करने देता है।
  • सक्सेस-अवेयर रिवॉर्ड डिके (The "Speed Bonus" - "गति बोनस" नियम):

    • समस्या: यदि एक रोबोट दरवाजा खोलने में 10 मिनट लेता है और दूसरा उसी दरवाजे को 1 मिनट में खोलता है, तो एक मानक सिस्टम दोनों को "अच्छा काम किया" का स्टिकर दे सकता है।
    • समाधान: Z-1 उस रोबोट को बड़ा "अच्छा काम किया" स्टिकर देता है जो तेजी से काम पूरा करता है। यह धीमे वाले को दंडित नहीं करता है, लेकिन सफल होने वाले को अधिक पुरस्कृत करता है। यह रोबोट को बिना डरे कुशल बनने के लिए प्रोत्साहित करता है।
  • सिलेक्टिव जॉइंट ट्रेनिंग (The "Brain vs. Hands" Switch - "दिमाग बनाम हाथ" स्विच):

    • समस्या: कभी-कभी रोबोट इसलिए विफल होता है क्योंकि उसके "हाथ" (एक्शन एक्सपर्ट) अनाड़ी हैं। अन्य समय में, वह इसलिए विफल होता है क्योंकि उसका "दिमाग" (विज़न-लैंग्वेज ब्रेन) नॉब को स्पष्ट रूप से नहीं देख पाता।
    • समाधान: आमतौर पर, स्थिरता बनाए रखने के लिए Z-1 केवल "हाथों" को प्रशिक्षित करता है। लेकिन यदि रोबोट इसलिए विफल हो रहा है क्योंकि वह चीज़ों को देख या समझ नहीं पा रहा है, तो Z-1 एक स्विच बदल देता है और "दिमाग" और "हाथों" को एक साथ प्रशिक्षित करता है। यह वैसा ही है जैसे यह समझना कि, "ओह, छात्र अनाड़ी नहीं है; वह बस हैंडल को देख नहीं पा रहा है!" और उसे बेहतर देखना सिखाना।

परिणाम

टीम ने 24 विभिन्न घरेलू कार्यों (जैसे दराज खोलना, सिंक का उपयोग करना और कॉफी बनाना) पर Z-1 का परीक्षण किया।

  • Z-1 से पहले (केवल वीडियो देखना): रोबोट लगभग 67% बार सफल हुआ।
  • Z-1 के बाद (इन नए ट्रिक्स के साथ अभ्यास करना): रोबोट 80.6% बार सफल हुआ।

यह सुधार इतना महत्वपूर्ण था कि इसने सार्वजनिक डोमेन में मौजूद अन्य शीर्ष-स्तरीय रोबोट मॉडलों को भी पीछे छोड़ दिया, भले ही Z-1 ने किसी गुप्त या निजी डेटा का उपयोग नहीं किया—केवल सार्वजनिक वीडियो और अपने स्वयं के अभ्यास सत्रों का उपयोग किया।

सारांश में:
Z-1 एक ऐसे रोबोट को लेता है जो केवल एक नकलची था और उसे एक समस्या-समाधानकर्ता (problem-solver) में बदल देता है। इसे समूहों में अभ्यास करने देकर, एक ही स्थान से शुरू करके, गति को पुरस्कृत करके, और यह जानकर कि कब आँखों बनाम हाथों को प्रशिक्षित करना है, रोबोट घर की वास्तविक दुनिया की चुनौतियों को पहले की तुलना में बहुत बेहतर तरीके से संभालना सीख जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →