तकनीकी सारांश: इन-कॉन्टेक्स्ट VLA (VLA-Talker)
समस्या विवरण
विज़न-लैंग्वेज-एक्शन (VLA) मॉडल सामान्यीकृत रोबोटिक हेरफेर (manipulation) के लिए मानक बन गए हैं, जिन्हें आमतौर पर स्थिर छवियों और निश्चित निर्देशों के आधार पर विशेषज्ञ क्रियाओं (expert action chunks) की नकल करने के लिए बिहेवियर क्लोनिंग (BC) के माध्यम से प्रशिक्षित किया जाता है। हालांकि, ये मॉडल दो प्राथमिक सीमाओं से ग्रस्त हैं:
- अपारदर्शी कंडीशनिंग (Opaque Conditioning): निर्देशों को समझे गए अवधारणाओं के बजाय याद किए गए स्ट्रिंग्स के रूप में माना जाता है; पैराफ्रेसिंग या अनदेखे पर्यायवाची शब्दों का उपयोग प्रदर्शन को कम कर देता है।
- निष्क्रिय धारणा (Passive Perception): नीतियां एक सिंगल फीड-फॉरवर्ड पास में अवलोकनों (observations) का उपभोग करती हैं, जिनमें तब तक सक्रिय रूप से जानकारी खोजने की क्षमता नहीं होती जब तक कि उत्तर तुरंत दिखाई न दे (जैसे कि वस्तुओं के स्थान)।
इस समस्या को हल करने के लिए एक स्वाभाविक परिकल्पना 'चेन-ऑफ-थॉट' (CoT) के माध्यम से स्पष्ट तर्क (explicit reasoning) को इंजेक्ट करना है। हालांकि, लेखक प्रदर्शित करते हैं कि फ्री-फॉर्म जेनेरेटिव CoT लो-लेवल कंट्रोल के लिए हानिकारक है, जिसके तीन कारण हैं:
- ग्राउंडिंग गैप (Grounding Gap): तर्क (rationales) उन्हीं स्टैटिक फीचर्स से उत्पन्न होते हैं जो एक्शन हेड के लिए होते हैं, जिससे कोई नया साक्ष्य नहीं जुड़ता। यदि मॉडल किसी स्थान का भ्रम (hallucination) पैदा करता है, तो यह सक्रिय रूप से एक्शन हेड को गुमराह करता है।
- ऑब्जेक्टिव इंटरफेरेंस (Objective Interference): एक सिंगल ऑटोरेग्रेसिव लॉस में, तर्क (reasoning) के लिए भाषा टोकन की विशाल संख्या एक्शन टोकन के ग्रेडिएंट सिग्नल पर हावी हो जाती है, जिससे नीति एक सटीक अभिनेता बनने के बजाय एक "प्रभावी कथावाचक" (fluent narrator) बन जाती है।
- लेटेंसी और ड्रिफ्ट (Latency and Drift): प्रत्येक निर्णय के लिए सैकड़ों रीजनिंग टोकन जेनरेट करना क्लोज्ड-लूप टाइमिंग को तोड़ देता है, और ऑटोरेग्रेसिव प्रीफिक्स में त्रुटियां एक्शन सफिक्स में प्रसारित हो जाती हैं।
लेखक तर्क देते हैं कि एक VLA को भाषा जेनरेट करने की क्षमता की आवश्यकता नहीं है, बल्कि ग्राउंडेड भाषा का उपभोग (consume) करने की क्षमता की आवश्यकता है।
कार्यप्रणाली: VLA-Talker
यह पेपर VLA-Talker पेश करता है, जो एक फ्रेमवर्क है जो इन-कॉन्टेक्स्ट पोस्ट-ट्रेनिंग और एजेंटिक टूल यूज़ के माध्यम से VLA मॉडल्स को भाषा की सक्षमता प्रदान करता है, जो साक्ष्य प्राप्ति (evidence acquisition) को साक्ष्य उपभोग (evidence consumption) से अलग करता है।
1. ग्राउंडेड साक्ष्य के लिए एजेंटिक टूल-यूज़
तर्क (reasoning) टेक्स्ट जेनरेट करने के बजाय, सिस्टम साक्ष्य प्राप्ति को एक बाहरी एजेंटिक लूप को सौंप देता है जो एक विशिष्ट क्वेरी का उत्तर देने के लिए विशेष टूल्स का उपयोग करता है: ग्रिपर और कार्य-प्रासंगिक वस्तुओं के इमेज-स्पेस लोकेशन और सापेक्ष डेप्थ क्या हैं?
- डेप्थ और ज्योमेट्री: एक मोनोकुलर डेप्थ एस्टिमेटर सापेक्ष डेप्थ ऑर्डरिंग प्रदान करता है।
- ऑब्जेक्ट लोकलाइजेशन: एक ओपन-वोकैबुलरी डिटेक्टर (जैसे GroundingDino) वस्तुओं को स्थानीयकृत करता है। यदि डिटेक्टर अनिश्चित है, तो एक एजेंटिक फॉलबैक गुणात्मक विवरण या अनुमानित निर्देशांकों के लिए विज़न-लैंग्वेज मॉडल (VLM) से क्वेरी करता है।
- ग्रिपर प्रोजेक्शन: ग्रिपर की वर्ल्ड पोजीशन (प्रोपियोसेप्शन से) को कैमरा इंट्रिंसिक्स का उपयोग करके एनालिटिकली इमेज स्पेस में प्रोजेक्ट किया जाता है, जो बिना सीखे सटीक पिक्सेल निर्देशांक प्रदान करता है।
- एविडेंस टुपल (Evidence Tuple): आउटपुट एक स्ट्रक्चर्ड टुपल है जिसमें निर्देशांक, डेप्थ और संबंध शामिल हैं (जैसे, "मग ग्रिपर से 42px दाईं ओर और 0.08m अधिक गहरा है")।
2. विविध कैप्शन रेंडरिंग (Diverse Caption Rendering)
नीति को एक ही टेम्पलेट पर ओवरफिट होने से रोकने के लिए, एक डेटा इंजन रॉ एविडेंस टुपल को विविध, पैराफ्रेज़्ड नेचुरल लैंग्वेज विवरणों में रेंडर करता है। ये विवरण निम्नलिखित में भिन्न होते हैं:
- मोडैलिटी (Modality): एब्सोल्यूट कोऑर्डिनेट्स बनाम रिलेटिव ऑफसेट्स बनाम गुणात्मक विवरण।
- रेफरेंस फ्रेम (Reference Frame): एगोसेंट्रिक (ग्रिपर से) बनाम एलोसेंट्रिक (कैमरा/टेबल से)।
- लेक्सिकल/सिंटैक्टिक फॉर्म: वस्तुओं के लिए पर्यायवाची शब्द और स्थानिक प्रीपोजिशन।
- वर्बोसिटी (Verbosity): छोटे वाक्य बनाम विस्तृत बहु-वाक्य कैप्शन।
महत्वपूर्ण रूप से, ज्यामितीय अर्थ स्थिर रहता है जबकि सतही रूप (surface form) बदल जाता है, जो नीति को पैटर्न याद करने के बजाय विविध भाषा की व्याख्या करने के लिए मजबूर करता है।
3. इन-कॉन्टेक्स्ट पोस्ट-ट्रेनिंग
VLA बैकबोन अपरिवर्तित रहता है। प्रशिक्षण के दौरान, रेंडर किया गया साक्ष्य इमेज और निर्देश के साथ <spatial> टैग में लिपटे हुए, प्रॉम्प्ट में 'रीड-ओनली कॉन्टेक्स्ट' के रूप में इंजेक्ट किया जाता है।
- सुपरविजन: लॉस फंक्शन केवल एक्शन टोकन्स पर लागू होता है। एविडेंस टोकन्स और निर्देश को मास्क कर दिया जाता है।
- प्रभाव: मॉडल इंजेक्ट किए गए साक्ष्य के आधार पर क्रियाओं की भविष्यवाणी करने के लिए कंडीशन होना सीखता है लेकिन स्वयं साक्ष्य जेनरेट करना नहीं सीखता। यह ऑब्जेक्टिव इंटरफेरेंस और ऑटोरेग्रेसिव लेटेंसी को समाप्त करता है।
4. ट्रजेक्टरी-लेवल RL (GRPO)
अंतिम चरण के रूप में, इन-कॉन्टेक्स्ट पॉलिसी को स्पार्स सक्सेस रिवॉर्ड के साथ ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) का उपयोग करके फाइन-ट्यून किया जाता है।
- लक्ष्य: टूल इनवोकेशन (tool invocation) और एक्शन निष्पादन के समय को वास्तविक कार्य सफलता के साथ संरेखित करना।
- तंत्र: नीति यह सीखती है कि कब टूल्स को कॉल करना है (जैसे, केवल तभी जब री-ग्राउंडिंग की आवश्यकता हो) बजाय इसके कि उन्हें अंधाधुंध बुलाया जाए, जिससे साक्ष्य प्राप्ति लागत और कार्य सफलता के बीच के ट्रेड-ऑफ को अनुकूलित किया जा सके।
मुख्य योगदान
- CoT का आलोचनात्मक विश्लेषण: पेपर इस बात का अनुभवजन्य और विश्लेषणात्मक प्रमाण प्रदान करता है कि फ्री-फॉर्म जेनेरेटिव CoT ग्राउंडिंग गैप, ऑब्जेक्टिव इंटरफेरेंस और लेटेंसी के कारण लो-लेवल कंट्रोल को नुकसान पहुँचाता है, जो ग्राउंडेड भाषा के उपभोग के लाभों के विपरीत है।
- VLA-Talker फ्रेमवर्क: एक नया आर्किटेक्चर जो एजेंटिक टूल यूज़ (डिटेक्शन, डेप्थ, VLM फॉलबैक) को इन-कॉन्टेक्स्ट लर्निंग के साथ एकीकृत करता है, जहाँ साक्ष्य को टोकन के रूप में जेनरेट करने के बजाय कॉन्टेक्स्ट के रूप में इंजेक्ट किया जाता है।
- विविध ग्राउंडेड भाषा: एक डेटा इंजन जो विविध पैराफ्रेस में स्ट्रक्चर्ड साक्ष्य को रेंडर करता है, जिससे नीति को भाषाई भिन्नता के प्रति मजबूत बनाया जाता है बिना ग्राउंडिंग से समझौता किए।
- दो-चरणीय प्रशिक्षण: एक रेसिपी जो टास्क आउटकम के साथ टूल यूज़ को संरेखित करने के लिए सुपरवाइज्ड इन-कॉन्टेक्स्ट पोस्ट-ट्रेनिंग को ट्रजेक्टरी-लेवल RL के साथ जोड़ती है।
प्रयोगात्मक परिणाम
विधि का मूल्यांकन तीन सिमुलेशन बेंचमार्क (LIBERO, RoboCasa-GR1, SimplerEnv) और AgiBot G1 ह्यूमनॉइड पर आठ वास्तविक दुनिया के कार्यों पर किया गया।
- प्रदर्शन: VLA-Talker सभी बेंचमार्क पर स्टेट-ऑफ-द-आर्ट (SOTA) परिणाम प्राप्त करता है।
- LIBERO: 97.4% औसत सफलता दर (Gen-CoT के 96.2% और VLA-Thinker के 97.0% के मुकाबले)।
- RoboCasa-GR1: 59.5% औसत सफलता दर (Gen-CoT के 46.5% के मुकाबले)।
- SimplerEnv: 72.4% औसत सफलता दर (Gen-CoT के 54.7% के मुकाबले)।
- दक्षता: ऑटोरेग्रेसिव रीजनिंग टोकन के जेनरेशन से बचकर, VLA-Talker CoT-आधारित दृष्टिकोणों की तुलना में प्रति-निर्णय लेटेंसी को 4.6 गुना कम कर देता है (78ms बनाम 359ms), जो उच्च कंट्रोल फ्रीक्वेंसी (~12.8 Hz बनाम 2.8 Hz) सक्षम करता है।
- डेटा दक्षता: विधि लो-डेटा रिजीम में मानक BC और Gen-CoT की तुलना में काफी बेहतर प्रदर्शन करती है। केवल 25 प्रदर्शनों (demonstrations) के साथ, VLA-Talker 50 प्रदर्शनों पर प्रशिक्षित BC से आगे निकल जाता है।
- सामान्यीकरण (Generalization): दृष्टिकोण अनदेखी वस्तुओं, डिस्ट्रैक्टर्स (distractors) और पैराफ्रेज़्ड निर्देशों के प्रति बेहतर मजबूती दिखाता है। जबकि BC और Gen-CoT डिस्ट्रैक्टर्स के साथ काफी गिर जाते हैं, VLA-Talker उच्च सफलता दर बनाए रखता है क्योंकि पॉलिसी तक पहुँचने से पहले ही टूल लूप द्वारा ऑब्जेक्ट आइडेंटिटी को हल कर लिया जाता है।
- वास्तविक दुनिया में तैनाती: AgiBot G1 पर, VLA-Talker ने सिंगल-टास्क पॉलिसी पर 58.1% और मल्टी-टास्क पॉलिसी पर 45.0% की सफलता दर हासिल की, जो बेसलाइन और CoT वेरिएंट दोनों से बेहतर थी, विशेष रूप से सूक्ष्म इंसर्शन (fine-grained insertion) कार्यों पर।
महत्व और दावे
पेपर का दावा है कि VLA भाषा सक्षमता, रीजनिंग जेनरेशन के बजाय ग्राउंडेड भाषा की समझ से आती है। "सोचने" (टेक्स्ट जेनरेट करना) से "देखने/महसूस करने" (टूल-व्युत्पन्न साक्ष्य का उपभोग करना) की ओर शिफ्ट होकर, VLA-Talker भाषा जेनरेशन और लो-लेवल कंट्रोल के बीच मौलिक संघर्षों को हल करता है।
लेखक जोर देते हैं कि उनका दृष्टिकोण:
- साक्ष्य प्राप्त करने और साक्ष्य का उपयोग करने की भूमिकाओं को अलग (decouple) करता है।
- ऑटोरेग्रेसिव CoT में निहित लेटेंसी और एरर प्रोपेगेशन को समाप्त करता है।
- स्पष्ट रूप से उन ज्यामितीय तथ्यों को प्रदान करके डेटा दक्षता में सुधार करता है जिनकी पॉलिसी को आवश्यकता होती है, जिससे मॉडल पर पिक्सेल से उन्हें अनुमान लगाने का बोझ कम हो जाता है।
- प्रमाणित करता है कि एजेंटिक टूल यूज़, जब जेनेरेटिव CoT के बजाय इन-कॉन्टेक्स्ट लर्निंग के माध्यम से एकीकृत किया जाता है, तो अधिक मजबूत, कुशल और सक्षम रोबोटिक नीतियां बनाता है।
पेपर निष्कर्ष निकालता है कि जबकि VLA-Talker ग्राउंडिंग और धारणा त्रुटियों को काफी कम कर देता है, शेष विफलता मोड मुख्य रूप से कंट्रोल प्रिसिजन एरर (जैसे, टाइट इंसर्शन) हैं, जो यह सुझाव देते हैं कि भविष्य के सुधारों को और अधिक रीजनिंग जेनरेशन के बजाय लो-लेवल एक्शन रिप्रेजेंटेशन पर ध्यान केंद्रित करना चाहिए।