← नवीनतम पेपर
💻 computer science

An Empirical Study on Stage-Information Interfaces for VLA Fine-Tuning

यह अनुभवजन्य अध्ययन इस बात की जांच करता है कि विभिन्न चरण-सूचना इंटरफेस (पूर्ण-कार्य निर्देश, वर्तमान-चरण पाठ, और क्रमिक चरण-अवस्था) लंबी-अवधि के कार्यों पर VLA फाइन-ट्यूनिंग को कैसे प्रभावित करते हैं, जिसमें यह पाया गया है कि जबकि प्रत्यक्ष फाइन-ट्यूनिंग के तहत स्पष्ट चरण सूचना सार्वभौमिक रूप से प्रदर्शन में सुधार नहीं करती है, रोबोट अवस्था में सामान्यीकृत क्रमिक अनुक्रमणिका के रूप में चरणों को प्रस्तुत करना निरंतरता फाइन-ट्यूनिंग के दौरान बेहतर परिणाम देता है।

मूल लेखक: Yingwei Ji

प्रकाशित 2026-07-16
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yingwei Ji

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल भोजन बनाना सिखा रहे हैं, जैसे कि तीन-कोर्स वाला रात्रिभोज। आप बस कह सकते हैं, "रात का खाना बनाओ," और उम्मीद कर सकते हैं कि रोबोट चरणों के क्रम को समझ जाएगा: सब्जियां काटना, पानी उबालना, स्टेक तलना और भोजन परोसना। आज कई आधुनिक रोबोट इसी तरह सीखते हैं; उन्हें विजन-लैंग्वेज-एक्शन (VLA) मॉडल कहा जाता है। वे उन सुपर-स्मार्ट छात्रों की तरह हैं जो कैमरों के माध्यम से दुनिया देख सकते हैं, आपकी बोली गई बातों को समझ सकते हैं और कार्यों को करने के लिए अपने हाथों को हिला सकते हैं। लेकिन पेचीदा हिस्सा यह है: जब कोई कार्य लंबा होता है और उसमें कई चरण होते हैं, तो रोबोट भ्रमित हो सकता है। यह एक पूरी उपन्यास लिखने की कोशिश करने जैसा है; कभी-कभी कहानी को अध्यायों में तोड़ना आसान होता है।

वैज्ञानिकों ने सोचा: क्या होगा यदि हम रोबोट को ठीक से बताएं कि वह कार्य के किस "अध्याय" में है? केवल "रात का खाना बनाओ" कहने के बजाय, हम कह सकते हैं, "आप वर्तमान में सब्जियां काट रहे हैं," या "अब आप पानी उबाल रहे हैं।" विचार यह है कि यदि रोबोट को पता है कि वह किस चरण पर है, तो वह खोएगा नहीं, और वह तेजी से सीखेगा। यह शोध पत्र ठीक इसी प्रश्न की गहराई में जाता है। यह पूछता है: क्या रोबोट को उसके वर्तमान चरण की निरंतर याद दिलाना वास्तव में उसे बेहतर सीखने में मदद करता है, और यदि हां, तो हमें इसे कैसे बताना चाहिए? क्या हमें उसके कान में चरण का नाम फुसफुसाना चाहिए (जैसे एक टेक्स्ट मैसेज), या हमें उसके मस्तिष्क में एक गुप्त संख्या कोड देना चाहिए?


द ग्रेट रोबोट स्टेप-काउंटर एक्सपेरिमेंट (महान रोबोट चरण-गणक प्रयोग)

इस अध्ययन में, शोधकर्ताओं ने यह देखने के लिए एक दौड़ आयोजित की कि "स्टेज इंफॉर्मेशन" (चरण संबंधी जानकारी) देने के विभिन्न तरीके एक रोबोट की सीखने की क्षमता को कैसे प्रभावित करते हैं। उन्होंने एक रोबोट मस्तिष्क GR00T N1.6 और एक टेस्ट किचन LIBERO-10 का उपयोग किया, जिसमें दस अलग-अलग हेरफेर कार्य शामिल हैं, जैसे कि मोका पॉट को स्टोव पर रखना।

सबसे पहले, उन्होंने प्रत्येक लंबे कार्य को छोटे "चरणों" (stages) में विभाजित किया। उदाहरण के लिए, कार्य "पॉट को स्टोव पर रखें" को इस प्रकार विभाजित किया गया: 1) बटन दबाएं, 2) पॉट रखें, और 3) बांहों को वापस खींचें। इसके बाद उन्होंने रोबोट को तीन अलग-अलग तरीकों से प्रशिक्षित किया ताकि यह देखा जा सके कि कौन सा सबसे अच्छा काम करता है:

  1. मूल तरीका (बिना स्टेज इन्फो के): रोबोट ने केवल पूरा निर्देश सुना, "पॉट को स्टोव पर रखें," और बाकी सब खुद समझने की कोशिश की।
  2. टेक्स्ट व्हिस्पर (TASKCTX): रोबोट ने पूरा निर्देश सुना साथ ही एक टेक्स्ट अपडेट भी सुना जो ठीक से बताता था कि वह किस चरण में है, जैसे "आप अब बटन दबा रहे हैं।"
  3. गुप्त संख्या कोड (ORDINAL STAGE-STATE): रोबोट ने पूरा निर्देश सुना लेकिन अपने स्टेट डेटा के अंदर एक छोटा, नॉर्मलाइज्ड नंबर (एक कोड -1 और 1 के बीच) प्राप्त किया जो बिना किसी अतिरिक्त शब्दों के उसे बताता था कि वह किस चरण पर है।

शोधकर्ताओं ने यह देखने के लिए दो अलग-अलग प्रशिक्षण परिदृश्य चलाए कि ये तरीके कैसे काम करते हैं।

परिदृश्य 1: शुरुआत से सीखना

पहले परिदृश्य में, उन्होंने रोबोट को इन नए तरीकों का उपयोग करके बिल्कुल शुरुआत से सिखाया। परिणाम थोड़े आश्चर्यजनक थे। शोधकर्ताओं को उम्मीद थी कि वर्तमान चरण को जानने से सीखना आसान हो जाएगा, जैसे हाइकिंग करते समय हाथ में एक नक्शा होना। हालांकि, डेटा ने दिखाया कि न तो टेक्स्ट व्हिस्पर और न ही गुप्त संख्या कोड ने रोबोट को मूल विधि की तुलना में बेहतर प्रदर्शन करने में मदद की।

वास्तव में, मूल "बिना स्टेज इन्फो" विधि के साथ प्रशिक्षित रोबोट ने इस दौर में जीत हासिल की, जिसने 57.45% की औसत सफलता दर प्राप्त की। टेक्स्ट अपडेट प्राप्त करने वाले रोबोट ने केवल 50.24% तक ही पहुंच प्राप्त की, और गुप्त संख्या कोड वाले रोबोट ने 54.36% प्राप्त किया। यह सुझाव देता है कि केवल चरण की जानकारी जोड़ना स्वचालित रूप से रोबोट को स्मार्ट नहीं बनाता है; कभी-कभी, यह केवल शोर (noise) जोड़ता है जो सीखने की प्रक्रिया को भ्रमित कर देता है।

परिदृश्य 2: "फिनिश लाइन" बूस्ट

दूसरा परिदृश्य अधिक दिलचस्प था। यहाँ, उन्होंने पहले मूल विधि (बेसलाइन) का उपयोग करके रोबोट को पूरा कार्य सिखाया। एक बार जब रोबोट को काम की बुनियादी समझ हो गई, तो उन्होंने यह देखने के लिए चरण की जानकारी पेश की कि क्या यह उसके कौशल को और निखार सकता है।

इस बार, परिणाम बदल गए! गुप्त संख्या कोड (ORDINAL STAGE-STATE) प्राप्त करने वाले रोबोट चैंपियन बन गया। इसने 53.75% की औसत सफलता दर हासिल की, जिसने मूल विधि (49.07%) और टेक्स्ट व्हिस्पर विधि (50.00%) दोनों को पीछे छोड़ दिया। प्रयोग के प्रत्येक युग्मित रन (paired run) में, संख्या कोड वाले संस्करण ने अन्य सभी को पछाड़ दिया।

इसका क्या अर्थ है?

तो, मुख्य निष्कर्ष क्या है? शोध पत्र सुझाव देता है कि आप रोबोट को क्या जानकारी देते हैं, यह उतना ही मायने रखता है जितना कि आप उसे कैसे जानकारी देते हैं।

जब रोबोट नया कार्य शुरू से सीख रहा होता है, तो वर्तमान चरण के बारे में अतिरिक्त टेक्स्ट जोड़ना उसे भ्रमित कर देता है। यह किसी को तब कार चलाना सिखाने जैसा है जब आप उसे हर बार गियर बदलते समय उस गियर का नाम चिल्लाकर बता रहे हों, जबकि वह अभी भी स्टीयरिंग व्हील पकड़ना सीख रहा है। रोब सहित बदलती टेक्स्ट निर्देशों से अभिभूत हो जाता है।

हालांकि, एक बार जब रोबोट पहले से ही कार्य की बुनियादी बातें जानता है (प्रारंभिक प्रशिक्षण के बाद), तो एक सरल, लो-लेवल नंबर कोड जोड़ना चमत्कार कर सकता है। यह एक ऐसे ड्राइवर को देने जैसा है जो पहले से ही रास्ता जानता है, एक छोटा, शांत GPS सिग्नल जो बस कहता है "अब बाएं मुड़ें।" क्योंकि रोबोट का मस्तिष्क (विशेष रूप से भाषा को प्रोसेस करने वाले हिस्से) पहले से ही फ्रीज और मूल निर्देश के लिए सेट था, इसलिए उसके स्टेट डेटा में एक छोटा नंबर जोड़ना एक कोमल, आसान समायोजन था। इसने रोबोट को भाषा समझने के तरीके को फिर से सीखने के लिए मजबूर नहीं किया; इसने उसे बस एक सूक्ष्म, सटीक धक्का दिया।

शोधकर्ताओं ने पाया कि टेक्स्ट-आधारित विधि (TASKCTX) दूसरे परिदृश्य में भी उतनी अच्छी नहीं रही, संभवतः इसलिए क्योंकि इसने रोबोट को भाषा के संदर्भ की लगातार पुनर्व्याख्या करने के लिए मजबूर किया, जो संख्या कोड की तुलना में अनुकूलित करना कठिन था।

निचोड़

यह अध्ययन यह साबित नहीं करता है कि चरण की जानकारी बेकार है। इसके बजाय, यह सुझाव देता है कि स्पष्ट चरण एनोटेशन (explicit stage annotations) स्वचालित रूप से पॉलिसी लर्निंग को सरल नहीं बनाते यदि उन्हें शुरुआत से पेश किया जाता है। हालांकि, यदि आपके पास एक रोबोट है जो पहले से ही काम जानता है, तो उसे एक लो-डायमेंशनल स्टेज-स्टेट इंटरफेस (जैसे एक साधारण संख्या कोड) देना, भाषा बदलने की तुलना में अधिक प्रभावी हो सकता है।

शोधकर्ता सावधानीपूर्वक नोट करते हैं कि ये परिणाम एक विशिष्ट सिमुलेशन, एक विशिष्ट डेटासेट (LIBERO-10) और एक विशिष्ट रोबोट मॉडल से आए हैं। वे सुझाव देते हैं कि यह पैटर्न अन्य सेटअपों में भी सही हो सकता है, लेकिन वे अभी तक दावा नहीं करते कि यह सभी रोबोटों के लिए एक सार्वभौमिक नियम है। यह इंजीनियरों के लिए एक आशाजनक संकेत है: यदि आप चाहते हैं कि एक रोबोट लंबे कार्य में महारत हासिल करे, तो शुरुआत से ही उसे चरणों के बारे में चिल्लाकर न बताएं। पहले उसे पूरा गाना सिखाएं, और फिर उसे लय बनाए रखने के लिए एक सरल, शांत मेट्रोनोम दें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →