← नवीनतम पेपर
💻 computer science

In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use

यह शोध पत्र **In-Context VLA** प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो मुक्त-रूप (free-form) चेन-ऑफ-थॉट जनरेशन को संरचित संवेदी साक्ष्य (structured perceptual evidence) और एजेंटिक टूल उपयोग पर इन-कॉन्टेक्स्ट पोस्ट-ट्रेनिंग से बदलकर विजन-लैंग्वेज-एक्शन मॉडल्स को उन्नत करता है, जिससे सिमुलेशन और वास्तविक दुनिया के हेरफेर कार्यों में बेहतर निम्न-स्तरीय नियंत्रण और अत्याधुनिक प्रदर्शन के लिए ग्राउंडेड लैंग्वेज कंजम्प्शन सक्षम होता है।

मूल लेखक: Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

प्रकाशित 2026-08-07
📖 3 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखा रहे हैं, जैसे सैंडविच बनाना या एक बिखरे हुए कमरे को व्यवस्थित करना। लंबे समय से, वैज्ञानिक इन मशीनों को वीडियो दिखाकर सिखाने की कोशिश कर रहे हैं जिनमें इंसान काम करते हुए दिख रहे हों और रोबोट को कह रहे हों, "जो तुम देख रहे हो उसकी ठीक वैसी ही नकल करो।" यह सरल कार्यों के लिए तो ठीक काम करता है, लेकिन यह एक नई भाषा सीखने के लिए केवल एक ही कठोर वाक्य को रटने जैसा है। यदि आप रोबोट को "लाल मग उठाओ" कहते हैं लेकिन फिर कहते हैं, "उस क्रिमसन कप को पकड़ो," तो रोबोट भ्रमित हो सकता है क्योंकि उसने शब्दों के पीछे के अर्थ को समझना नहीं सीखा, बल्कि केवल उन विशिष्ट ध्वनियों को मिलाना सीखा जो उसने प्रशिक्षण के दौरान सुनी थीं।

इसे ठीक करने के लिए, शोधकर्ताओं ने हाल ही में रोबोट को एक "सोचने" वाला चरण देने का प्रयास किया, जो मनुष्यों के काम करने से पहले खुद से बात करने के समान है। उन्हें उम्मीद थी कि रोबोट पहले एक योजना लिखेगा जैसे, "ठीक है, कप मेज पर है, और मुझे अपना हाथ बाईं ओर ले जाने की आवश्यकता है," और फिर कार्य करेगा। इसे "चेन-ऑफ-थॉट" (Chain-of-Thought) कहा जाता है। लेकिन यहाँ एक मोड़ है: रोबोट के लिए, हिलने-डुलने से पहले बहुत अधिक बातें करना वास्तव में उन्हें उनके काम में और भी खराब बना देता है। यह सड़क के बारे में उपन्यास लिखते हुए कार चलाने की कोशिश करने जैसा है; जब तक आप अपना वाक्य पूरा करते हैं, तब तक आप मोड़ चूक चुके होते हैं। रोबमाट वस्तु को पकड़ने के बजाय अपनी ही सोच का वर्णन करने के लूप में फंस जाता है, और वह अक्सर चीजों के बारे में तथ्य गढ़ लेता है क्योंकि वह देखने के बजाय केवल अनुमान लगा रहा होता है।

यह शोध पत्र रोबोट को सिखाने का एक नया तरीका पेश करता है जिसे VLA-Talker कहा जाता है। रोबोट को अपने स्वयं के विचार लिखने के लिए मजबूर करने के बजाय, शोधकर्ताओं ने रोबोट को एक "स्मार्ट असिस्टेंट" दिया है जो उसके लिए देखने और रिपोर्ट करने का काम करता है। इसे एक ऐसे रोबोट के रूप में सोचें जिसके पास सुपर-पावर्ड चश्मा और एक सहायक सह-पायलट है। जब रोबोट को जानने की आवश्यकता होती है कि चम्मच कहाँ है, तो वह अनुमान नहीं लगाता या पैराग्राफ नहीं लिखता। इसके बजाय, वह तुरंत अपने सह-पायलट (जो विशेष उपकरणों जैसे डेप्थ कैमरा और ऑब्जेक्ट डिटेक्टर का उपयोग करता है) से पूछता है कि "चम्मच आपके हाथ से 42 पिक्सेल दाईं ओर और थोड़ा नीचे है।" रोबोट फिर इस स्पष्ट, तथ्यात्मक रिपोर्ट को पढ़ता है और तुरंत कार्य करता है।

शोधकर्ताओं ने पाया कि यह तरीका गेम-चेंजर है। रोबोट को अपने टूल्स से स्पष्ट, जमीनी भाषा ग्रहण करने देने से, न कि अपनी खुद की भ्रमित करने वाली बातें उत्पन्न करने से, रोबोट बहुत तेज़ और अधिक सटीक हो जाता है। अपने परीक्षणों में, इस दृष्टिकोण ने न केवल बेहतर प्रदर्शन किया; यह पुराने "सोचने" वाले तरीकों की तुलना में लगभग 4.6 गुना तेज़ था क्योंकि रोबोट ने हिलने से पहले निबंध लिखने में समय बर्बाद नहीं किया। उन्होंने इसे जटिल कंप्यूटर सिमुलेशन और यहाँ तक कि एक वास्तविक मानव-आकार के रोबोट पर भी टेस्ट किया, और इसने लगातार उन कार्यों को हल किया जिनमें अन्य रोबोट संघर्ष करते थे, जिससे यह सिद्ध हुआ कि कभी-कभी, सोचने का सबसे अच्छा तरीका किसी ऐसे व्यक्ति को सुनना है जो तथ्यों को जानता हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →