← नवीनतम पेपर
💻 computer science

ExpReS-VLA: Specializing Vision-Language-Action Models Through Experience Replay and Retrieval

एक्सपी-आर-ई-एस-वी-एल-ए (ExpReS-VLA) एक विशिष्ट विजन-लैंग्वेज-एक्शन मॉडल है जो संकुचित अनुभव पुनरावृत्ति (compressed experience replay), रिट्रीवल-ऑगमेंटेड जनरेशन और एक नवीन कंट्रास्टिव लॉस को जोड़कर विशिष्ट रोबोटिक कार्यों के लिए तीव्र, मेमोरी-कुशल ऑन-डिवाइस अनुकूलन को सक्षम बनाता है ताकि कैटास्ट्रोफिक फॉरगेटिंग को रोका जा सके और स्थानिक एवं लॉन्ग-होरिजन बेंचमार्क दोनों पर प्रदर्शन में महत्वपूर्ण सुधार किया जा सके।

मूल लेखक: Shahram Najam Syed, Yatharth Ahuja, Arthur Jakobsson, Jeff Ichnowski

प्रकाशित 2026-03-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shahram Najam Syed, Yatharth Ahuja, Arthur Jakobsson, Jeff Ichnowski

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक प्रतिभाशाली, दुनिया भर की यात्रा करने वाले शेफ को काम पर रखा है। इस शेफ ने दुनिया की हर कुकबुक पढ़ रखी है और वह आपके द्वारा पूछी गई लगभग किसी भी डिश का एक अच्छा संस्करण बना सकता है (यह एक विज़न-लैंग्वेज-एक्शन मॉडल या VLA है)। वे "ज़ीरो-शॉट" कुकिंग में माहिर हैं—जिसका अर्थ है कि वे बिना पहले कभी देखी गई रेसिपी को भी आज़मा सकते हैं।

समस्या:
आपने इस शेफ को आपके विशिष्ट किचन में काम करने के लिए रखा है। आपको उन्हें 10,000 अलग-अलग व्यंजन बनाने की ज़रूरत नहीं है। आपको बस ज़रूरत है कि वे आपके परिवार का पसंदीदा लाज़ानिया (lasagna) पूरी तरह से बनाएं, आपके पास्ता के विशेष ब्रांड और आपके विशेष ओवन का उपयोग करके।

समस्या यह है कि दुनिया भर की यात्रा करने वाला यह शेफ बहुत अधिक सामान्य (general) है। वे आपके अजीबोगरीब लाइटिंग, आपके बर्तन के खास हैंडल, या इस तथ्य से भ्रमित हो सकते हैं कि आपका "बेसिल" (तुलसी जैसा पौधा) उनके ट्रेनिंग बुक्स के बेसिल से थोड़ा अलग दिखता है। यदि आप उन्हें केवल कुछ बार अपना किचन दिखाकर आपकी विशिष्ट शैली सिखाने की कोशिश करते हैं, तो वे आपके लाज़ानिया पर इतना ध्यान केंद्रित कर सकते हैं कि वे कुछ और बनाना भूल जाएं (इसे कैटास्ट्रोफिक फॉरगेटिंग या 'विस्मृति' कहा जाता है)। या, वे आपके किचन को पूरी तरह से याद कर सकते हैं लेकिन अगर आपने एक कुर्सी बदल दी या बैकग्राउंड बदल दिया, तो वे विफल हो सकते हैं।

समाधान: ExpReS-VLA
यह पेपर ExpReS-VLA को पेश करता है, जो इस सामान्य विशेषज्ञ को आपके किचन का एक विशिष्ट मास्टर बनाने का तरीका बताता है, बिना बाकी चीज़ों को भूले। यह तीन चतुर तरीकों का उपयोग करता है:

1. "पॉकेट-साइज़्ड" मेमोरी (कंप्रेस्ड एक्सपीरियंस रिप्ले)

आमतौर पर, किसी कुकिंग प्रयास को याद रखने के लिए, आपको पूरे किचन, शेफ के हाथों और सामग्रियों का 4K वीडियो सहेजना होगा। इसमें बहुत अधिक हार्ड ड्राइव स्पेस लगता है।

ExpReS-VLA अधिक स्मार्ट है। वीडियो सहेजने के बजाय, यह एक छोटा, अमूर्त सारांश (एक "एम्बेडिंग") सहेजता है कि शेफ ने क्या देखा था।

  • उपमा: कल्पना करें कि पूरे कुकिंग शो की फिल्म सहेजने के बजाय, आप केवल एक वाक्य सहेजते हैं जो मुख्य दृश्य का वर्णन करता है: "लाल बर्तन, उठती हुई भाप, शेफ घड़ी की दिशा में चला रहा है।"
  • परिणाम: इसने मेमोरी की आवश्यकता को 97% तक कम कर दिया है। रोबोट एक ही स्टैंडर्ड कंप्यूटर चिप (जैसे पेपर में उल्लेखित RTX 5090) पर अपने पिछले हजारों प्रयासों को बिना स्पेस खत्म किए याद रख सकता है।

2. "स्मार्ट लाइब्रेरियन" (रिट्रीवल-ऑगमेंटेड जनरेशन)

जब रोबोट कोई कार्य करने की कोशिश करता है और फंस जाता है, तो वह केवल अनुमान नहीं लगाता। वह एक लाइब्रेरियन की तरह काम करता है।

  • उपमा: आप लाइब्रेरियन से पूछते हैं, "मैं एक मग को कटोरे में रखने की कोशिश कर रहा हूँ, लेकिन वह बार-बार फिसल रहा है।" लाइब्रेरियन तुरंत मेमोरी बैंक से सबसे मिलते-जुलते 5 पिछले किस्से निकाल लेता है: "ओह, देखिए! पिछले हफ्ते तीन बार हमारे साथ ऐसा ही हुआ था। यहाँ बताया गया है कि हमने इसे ठीक कैसे किया।"
  • परिणाम: रोबोट तेज़ी से सीखता है क्योंकि वह शून्य से शुरुआत नहीं करता। यह इन "पिछले किस्सों" को सीधे अपने ट्रेनिंग सेशन में डाल देता है, जिससे इसे केवल 12 उदाहरणों का उपयोग करके 31 सेकंड में अनुकूलित होने में मदद मिलती है।

3. "ऐसा मत करो!" कोच (थ्रेशोल्डेड हाइब्रिड कॉन्ट्रास्टिव लॉस)

अधिकांश रोबोट केवल सफलता से सीखते हैं। यदि वे एक कप गिरा देते हैं, तो वे बस फिर से कोशिश करते हैं और उम्मीद करते हैं। ExpReS-VLA में एक विशेष कोच है जो विफलताओं को देखता है।

  • उपमा: एक ड्राइविंग इंस्ट्रक्टर की कल्पना करें। यदि आप फुटपाथ से टकरा जाते हैं, तो एक सामान्य इंस्ट्रक्टर सिर्फ कहता है, "फिर से कोशिश करो।" यह विशेष कोच कहता है, "रुको! देखो कि तुमने फुटपाथ क्यों छुआ। क्या यह कोण (angle) था? गति थी? चलिए अपनी गलती की तुलना एक परफेक्ट टर्न से करते हैं ताकि आपका दिमाग समझ सके कि क्या नहीं करना है।"
  • परिणाम: रोबोट अपनी गलतियों से सीखता है। यह यह पता लगाने के लिए एक विशेष गणितीय सूत्र (THCL) का उपयोग करता है कि विफलता एक साधारण गलती थी या एक जटिल एक, और तदनुसार अपनी सीखने की रणनीति को समायोजित करता है। यह उसे एक ही गलती दोबारा करने से रोकता है।

वास्तविक दुनिया के परिणाम

शोधकर्ताओं ने इसका परीक्षण एक वास्तविक रोबोटिक आर्म (Franka Panda) और सिमुलेशन में किया।

  • "नेइव" (Naive) दृष्टिकोण: यदि आप केवल एक मानक रोबोट को आपके विशिष्ट कार्यों के लिए फाइन-ट्यून करते हैं, तो वह आपके किचन में तो अच्छा हो जाता है (85% सफलता) लेकिन यदि आप बैकग्राउंड बदलते हैं या कोई अलग वस्तु उपयोग करते हैं, तो वह बुरी तरह विफल हो जाता है (32% सफलता तक गिर जाता है)। यह ओवरफिट हो जाता है।
  • ExpReS-VLA दृष्टिकोण: इसने आपके विशिष्ट कार्यों पर 98% सफलता प्राप्त की और तब भी उच्च प्रदर्शन बनाए रखा जब आपने बैकग्राउंड या ऑब्जेक्ट्स बदल दिए। इसने केवल रटा नहीं; इसने कार्य की अवधारणा (concept) को समझा।

यह क्यों महत्वपूर्ण है

यह एक बड़ी बात है क्योंकि यह "जनरलिस्ट बनाम स्पेशलिस्ट" के विरोधाभास को हल करता है।

  • पहले: रोबोट या तो "सब कुछ थोड़ा-बहुत जानने वाले, लेकिन किसी में भी माहिर नहीं" (कई चीज़ों में अच्छे, लेकिन आपकी विशिष्ट ज़रूरतों के लिए बुरे) थे, या "एक चीज़ के मास्टर, लेकिन सीखने के लिए विशाल सुपरकंप्यूटर और हफ्तों के प्रशिक्षण की आवश्यकता थी।"
  • अब: ExpReS-VLA एक रोबोट को आपके विशिष्ट वातावरण में एक मिनट से भी कम समय में विशेषज्ञ बनने की अनुमति देता है, जबकि एक सिंगल कंज्यूमर-ग्रेड ग्राफिक्स कार्ड का उपयोग करता है, और ज़रूरत पड़ने पर अन्य चीज़ों को करने का तरीका भी याद रखता है।

संक्षेप में: ExpReS-VLA एक रोबोट को एक छोटी, अत्यंत कुशल नोटबुक देने जैसा है जहाँ वह अपने दिन का "सार" लिखता है, सही सलाह तुरंत खोजने के लिए एक जादुई इंडेक्स, और एक कोच जो उसे अपनी गलतियों से सीखना सिखाता है। यह रोबोटों को वास्तविक दुनिया की नौकरियों के लिए बहुत तेज़ी से और अधिक विश्वसनीय रूप से तैयार करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →