In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use
यह शोध पत्र **In-Context VLA** प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो मुक्त-रूप (free-form) चेन-ऑफ-थॉट जनरेशन को संरचित संवेदी साक्ष्य (structured perceptual evidence) और एजेंटिक टूल उपयोग पर इन-कॉन्टेक्स्ट पोस्ट-ट्रेनिंग से बदलकर विजन-लैंग्वेज-एक्शन मॉडल्स को उन्नत करता है, जिससे सिमुलेशन और वास्तविक दुनिया के हेरफेर कार्यों में बेहतर निम्न-स्तरीय नियंत्रण और अत्याधुनिक प्रदर्शन के लिए ग्राउंडेड लैंग्वेज कंजम्प्शन सक्षम होता है।