← नवीनतम पेपर
💻 computer science

NS-VLA: Towards Neuro-Symbolic Vision-Language-Action Models

यह शोध पत्र NS-VLA को प्रस्तुत करता है, जो एक नवीन न्यूरो-सिंबोलिक विजन-लैंग्वेज-एक्शन फ्रेमवर्क है जो मौजूदा विधियों की तुलना में बेहतर डेटा दक्षता, ज़ीरो-शॉट सामान्यीकरण (zero-shot generalizability), और रोबोटिक मैनिपुलेशन में विस्तारित अन्वेषण प्राप्त करने के लिए सिंबोलिक एनकोडिंग, सॉल्विंग और ऑनलाइन सुदृढीकरण लर्निंग (reinforcement learning) को एकीकृत करता है।

मूल लेखक: Ziyue Zhu, Shangyang Wu, Shuai Zhao, Zhiqiu Zhao, Shengjie Li, Yi Wang, Fang Li, Haoran Luo

प्रकाशित 2026-03-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ziyue Zhu, Shangyang Wu, Shuai Zhao, Zhiqiu Zhao, Shengjie Li, Yi Wang, Fang Li, Haoran Luo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखा रहे हैं।

पुराना तरीका (वर्तमान VLA मॉडल):
अधिकांश वर्तमान रोबोटिक दिमाग एक ऐसे छात्र की तरह हैं जिसने सैंडविच बनाने वाले लोगों के हजारों वीडियो रट लिए हैं। यदि आप उनसे "सैंडविच बनाओ" कहते हैं, तो वे उन वीडियो की नकल करने की कोशिश करते हैं जो उन्होंने देखे थे।

  • समस्या: यदि रसोई में रोशनी बदल दी जाए, या ब्रेड का रंग अलग हो जाए, तो रोबोट भ्रमित हो जाता है। वह पहले देखे गए सटीक पिक्सेल (pixels) की नकल करने की कोशिश करता है। वह वास्तव में यह नहीं समझता कि वह चाकू क्यों उठा रहा है या "एक स्लाइस" क्या है। यह बिना अर्थ समझे शब्दों को दोहराने वाले एक तोते की तरह है। साथ ही, उन्हें सीखने के लिए लाखों वीडियो देखने पड़ते हैं, जो बहुत धीमा और महंगा है।

नया तरीका (NS-VLA):
यह पेपर NS-VLA (न्यूरो-सिम्बोलिक विजन-लैंग्वेज-एक्शन) पेश करता है। इसे एक वीडियो लाइब्रेरी के बजाय एक शेफ की रेसिपी बुक और एक स्मार्ट असिस्टेंट देने के रूप में सोचें।

यह कैसे काम करता है, इसे तीन सरल भागों में विभाजित किया गया है:

1. "रेसिपी" (सिम्बोलिक एनकोडर)

हर छोटी मांसपेशी की हरकत का अनुमान लगाने के बजाय, रोबोट पहले आपकी आवाज़ के कमांड ("मग को प्लेट पर रखें") को एक सरल, संरचित रेसिपी में बदल देता है।

  • उपमा: कल्पना कीजिए कि रोबोट "एक हाथ से कप हिलते हुए" नहीं देखता। बल्कि वह चरणों की एक सूची देखता है: [मग उठाएं] →\rightarrow [प्लेट की ओर ले जाएं] →\rightarrow [मग रखें]।
  • यह क्यों मदद करता है: यह एक बड़े, डरावने कार्य को छोटे, प्रबंधनीय "प्रिमिटिव्स" (मूल क्रियाओं) में तोड़ देता है। भले ही रोबोट ने पहले कभी वह विशिष्ट मग न देखा हो, लेकिन वह "उठाने" और "रखने" की अवधारणा को समझता है। वह कार्य के चित्र को नहीं, बल्कि उसके तर्क (logic) को समझता है।

2. "स्पॉटलाइट" (सिम्बोलिक सॉल्वर और विजुअल स्पारसिफिकेशन)

रोबोट आमतौर पर बहुत अधिक दृश्य जानकारी (पूरी रसोई, बैकग्राउंड, काउंटर पर जमी धूल) से अभिभूत हो जाते हैं।

  • उपमा: कल्पना कीजिए कि रोबोट एक अंधेरे कमरे में टॉर्च लेकर खड़ा है। जब रेसिपी कहती है "लाल मग उठाएं," तो रोबोट का "स्पॉटलाइट" (सॉल्वर) तुरंत नीली प्लेट, टोस्टर और खिड़की को अनदेखा कर देता है। वह केवल लाल मग पर ध्यान केंद्रित करता है।
  • यह क्यों मदद करता है: यह रोबोट को बहुत तेज़ और कम भ्रमित बनाता है। यह "शोर" को फ़िल्टर करता है और केवल रेसिपी के वर्तमान चरण के लिए प्रासंगिक वस्तु पर ध्यान केंद्रित करता है।

3. "अभ्यास सत्र" (ऑनलाइन रीइन्फोर्समेंट लर्निंग)

अधिकांश रोबोट केवल वीडियो देखकर सीखते हैं (ऑफलाइन)। यदि वे वास्तविक दुनिया में कोई गलती करते हैं, तो वे उसे ठीक नहीं कर सकते। NS-VLA अलग है; यह वास्तविक समय में करके और खुद को सुधारकर सीखता है।

  • उपमा: कल्पना कीजिए कि एक रोबोट साइकिल चलाना सीख रहा है। केवल किसी को साइकिल चलाते हुए देखने के बजाय, वह साइकिल पर चढ़ता है, डगमगाता है, गिरता है, और तुरंत सीखता है, "ठीक है, अगली बार बाईं ओर झुकना है।"
  • जादू: रोबोट एक चाल आज़माता है। यदि वह सफल होता है, तो उसे एक "हाई फाइव" (पुरस्कार) मिलता है। यदि वह विफल होता है, तो वह तुरंत अपनी रणनीति को समायोजित करता है। क्योंकि उसके पास "रेसिपी" (चरण 1) और "स्पॉटलाइट" (चरण 2) है, इसलिए वह अराजकता में खो नहीं जाता; उसे पता होता है कि किस चरण को दोबारा प्रयास करना है।

यह एक बड़ी बात क्यों है?

पेपर दिखाता है कि NS-VLA तीन तरीकों से वर्तमान रोबोटों की तुलना में एक सुपरहीरो है:

  1. डेटा दक्षता (द "वन-शॉट" सुपरपावर):

    • पुराना रोबोट: कप उठाने का तरीका सीखने के लिए उसे 1,000 वीडियो देखने की आवश्यकता होती है।
    • NS-VLA: वह एक वीडियो देख सकता है, "रेसिपी" को समझ सकता है, और फिर एक अलग कप के साथ, एक अलग कमरे में इसे करने का तरीका निकाल सकता है। वह एक इंसान की तरह सीखता है, न कि एक तोते की तरह।
  2. सामान्यीकरण (द "गिरगिट" प्रभाव):

    • पुराना रोबोट: यदि बैकग्राउंड या लाइटिंग बदल दी जाए, तो वह टूट जाता है।
    • NS-VLA: क्योंकि यह तर्क (उठाना →\rightarrow रखना) को समझता है और वस्तु को खोजने के लिए "स्पॉटलाइट" का उपयोग करता है, यह तब भी पूरी तरह से काम करता है जब रसोई बिल्कुल अलग दिखती है। यह शोर से विचलित नहीं होता।
  3. अन्वेषण (द "जिज्ञासु बच्चा"):

    • पुराना रोबोट: यह केवल वही करता है जो उसने वीडियो में देखा था। यदि रास्ता अवरुद्ध है, तो वह रुक जाता है।
    • NS-VLA: क्योंकि यह वास्तविक समय में अभ्यास करता है, यह समस्या को हल करने के विभिन्न तरीके आज़मा सकता है। यदि सीधा रास्ता अवरुद्ध है, तो यह वस्तु तक पहुँचने का एक नया तरीका खोज सकता है, जिससे उसका "एक्सप्लोरेशन स्पेस" बढ़ जाता है।

निष्कर्ष

NS-VLA को एक वीडियो रिकॉर्डर (जो केवल वही कॉपी करता है जो वह देखता है) से एक सोचने वाले शेफ (जो रेसिपी समझता है, सामग्री पर ध्यान केंद्रित करता है, और स्वाद लेकर और सुधार करके सीखता है) में अपग्रेड करने जैसा है। यह रोबोटों को स्मार्ट, तेज़ और वास्तविक, अप्रत्याशित दुनिया में बहुत अधिक विश्वसनीय बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →