← नवीनतम पेपर
💻 computer science

ETA-VLA: Efficient Token Adaptation via Temporal Fusion and Intra-LLM Sparsification for Vision-Language-Action Models

यह शोध पत्र ETA-VLA का प्रस्ताव करता है, जो विजन-लैंग्वेज-एक्शन मॉडल्स के लिए एक कुशल फ्रेमवर्क है जो एक नवीन इंट्रा-एलएलएम स्पार्स एग्रीगेटर (Intra-LLM Sparse Aggregator) का उपयोग करता है ताकि टेक्स्टुअल मार्गदर्शन और टेम्पोरल कंसिस्टेंसी के आधार पर रेडंडेंट विजुअल टोकन्स को डायनामिकली प्रून किया जा सके, जिससे NAVSIM v2 बेंचमार्क पर उच्च ड्राइविंग प्रदर्शन बनाए रखते हुए कंप्यूटेशनल लागत को काफी कम किया जा सके।

मूल लेखक: Yiru Wang, Anqing Jiang, Shuo Wang, Yuwen Heng, Zichong Gu, Hao Sun

प्रकाशित 2026-03-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yiru Wang, Anqing Jiang, Shuo Wang, Yuwen Heng, Zichong Gu, Hao Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखा रहे हैं। आप चाहते हैं कि वह एक इंसान की तरह स्मार्ट हो, जो सड़क को देख सके, ट्रैफिक संकेतों को समझ सके, आपकी आवाज़ के निर्देशों ("अगले लाइट पर बाएं मुड़ें") को सुन सके और वास्तव में कार को स्टीयर कर सके।

यही काम VLA (विज़न-लैंग्वेज-एक्शन) मॉडल्स करते हैं। वे एक 'सुपर-ब्रेन' की तरह हैं जो आँखों (दृष्टि), कानों (भाषा) और हाथों (क्रिया) को एक साथ जोड़ते हैं।

हालाँकि, एक बहुत बड़ी समस्या है: यह सुपर-ब्रेन बहुत भारी है।

समस्या: "सूचना का ओवरलोड" (Information Overload)

सुरक्षित रूप से चलाने के लिए, एक इंसान केवल अभी सड़क पर क्या हो रहा है, यह ही नहीं देखता। वे याद रखते हैं कि एक सेकंड पहले वे कहाँ थे, दो सेकंड पहले एक कार कहाँ थी, और वे एक साथ कई कैमरों (सामने, बगल, पीछे) को देखते हैं।

यदि आप रोबोट को बहुत सारा डेटा (6 कैमरे × 10 सेकंड का इतिहास) खिलाते हैं, तो यह सूचना का एक विशाल पहाड़ बना देता है। रोबोट के दिमाग (एक लार्ज लैंग्वेज मॉडल) को इस डेटा के हर एक हिस्से को प्रोसेस करना पड़ता है।

  • उपमा (Analogy): कल्पना कीजिए कि आप एक साधारण सा सवाल पूछने के लिए एक साथ 1,000 किताबों के पुस्तकालय को पढ़ने की कोशिश कर रहे हैं। यह प्रयास आपके दिमाग को थका देगा। कंप्यूटर की भाषा में, इसे "क्वाड्रेटिक कॉम्प्लेक्सिटी" (Quadratic Complexity) कहा जाता है—आप जितना अधिक डेटा जोड़ते हैं, सोचने की प्रक्रिया उतनी ही तेजी से कठिन होती जाती है। यह एक असली कार के कंप्यूटर पर चलाना असंभव बना देता है।

समाधान: ETA-VLA (एक "स्मार्ट फिल्टर")

इस पेपर के लेखकों ने ETA-VLA बनाया है। इसे एक स्मार्ट, कुशल सहायक के रूप में सोचें जो रोबोट ड्राइवर को केवल उसी चीज़ पर ध्यान केंद्रित करने में मदद करता है जो महत्वपूर्ण है, ठीक वैसे ही जैसे एक इंसान करता है।

उन्होंने इस सहायक को दो मुख्य उपकरणों के साथ बनाया है:

1. "टाइम-ट्रैवल समराइज़र" (टेम्पोरल फ्यूजन मॉड्यूल)

  • यह कैसे काम करता है: सड़क के 10 अलग-अलग वीडियो फ्रेम दिखाने के बजाय, यह मॉड्यूल उन्हें जल्दी से एक "समरी वीडियो" (सारांश वीडियो) में मिला देता है।
  • उपमा: कल्पना कीजिए कि आप एक फिल्म देख रहे हैं। हर एक फ्रेम को रोकने और उसका विश्लेषण करने के बजाय, आप बस पिछले कुछ मिनटों का सार याद रखते हैं। "कार धीमी हो रही थी, फिर लाइट हरी हो गई।"
  • परिणाम: रोबोट को हर एक फ्रेम के हर एक पिक्सेल को प्रोसेस करने की आवश्यकता के बिना, पिछले कुछ सेकंडों की कहानी मिल जाती है। यह समय को संकुचित (compress) कर देता है।

2. "सिलेक्टिव अटेंशन" फिल्टर (इंट्रा-LLM स्पार्स एग्रीगेटर)

यह जादुई हिस्सा है। समय को सारांशित करने के बाद भी, अभी भी बहुत सारा विजुअल डेटा (जैसे पेड़, बादल और खाली आसमान) मौजूद होता है। रोबोट को उबाऊ चीजों को अनदेखा करने और खतरनाक चीजों पर ध्यान केंद्रित करने की आवश्यकता है।

  • कैसे काम करता है: रोबोट खुद से पूछता है, "ड्राइवर मुझसे क्या करने को कह रहा है?" (जैसे, "बाएं मुड़ें")। फिर वह सभी कैमरा व्यूज को देखता है और पूछता, "बाएं मुड़ने के लिए इमेज के कौन से हिस्से महत्वपूर्ण हैं?"
  • उपमा: कल्पना कीजिए कि आप 100 लोगों से भरे एक भीड़भाड़ वाले कमरे में हैं जो बात कर रहे हैं।
    • पुराना तरीका: आप एक साथ सभी को सुनने की कोशिश करते हैं। आपको सिरदर्द होता है और आप महत्वपूर्ण व्यक्ति को मिस कर देते हैं।
    • ETA-VLA तरीका: आप अपने दोस्त को कहते हैं, "उस लाल टोपी वाले आदमी को देखो।" आप तुरंत बाकी 99 लोगों को अनदेखा कर देते हैं और अपना पूरा ध्यान केवल उस लाल टोपी वाले आदमी पर लगा देते हैं।
  • "रीसाइक्लिंग" का तरीका: लेखकों ने महसूस किया कि यदि आप केवल 85% डेटा को फेंक देते हैं, तो आप गलती से कुछ महत्वपूर्ण चीज़ (जैसे ब्लाइंड स्पॉट में कोई पैदल यात्री) डिलीट कर सकते हैं। इसलिए, उन्होंने एक "रीसाइक्लिंग बिन" जोड़ा।
    • वे सबसे महत्वपूर्ण चीज़ों (लाल टोपी वाला आदमी) को रखते हैं।
    • लेकिन वे किसी भी सरप्राइज को मिस न करने के लिए हर कैमरा एंगल से कुछ "रैंडम" टुकड़े भी रखते हैं। यह साइड मिरर पर अपनी अतिरिक्त नज़र रखने जैसा है, भले ही आप सामने की सड़क पर ध्यान केंद्रित कर रहे हों।

यह एक बड़ी बात क्यों है?

लेखकों ने इस सिस्टम का परीक्षण NAVISIM नामक एक प्रसिद्ध ड्राइविंग बेंचमार्क पर किया। यहाँ परिणाम दिए गए हैं, जिन्हें सरल भाषा में अनुवादित किया गया है:

  1. यह स्मार्ट है: रोबोट लगभग एक मानव विशेषज्ञ की तरह चला (90.3 में से 85.0 का स्कोर किया)।
  2. यह तेज़ है: इसने कंप्यूटर के काम (FLOPs) को 32% कम कर दिया।
  3. यह कुशल है: इसने 85% विजुअल डेटा (बेकार के पिक्सल) को हटा दिया, लेकिन फिर भी 94% ड्राइविंग सटीकता बनाए रखी।

निष्कर्ष (The Bottom Line)

ETA-VLA रोबोट को मानवीय ध्यान (human attention) की नकल करके गाड़ी चलाना सिखाता है।

  • इंसान हर पेड़ के हर पत्ते को नहीं घूरते; हम सड़क और कारों पर ध्यान केंद्रित करते हैं।
  • इंसान पिछले एक घंटे के हर एक सेकंड को याद नहीं रखते; हम ट्रैफिक के प्रवाह को याद रखते हैं।

यह नया सिस्टम भी यही करता है। यह शोर को फ़िल्टर करता है, अतीत का सारांश बनाता है, और रोबोट के दिमाग को केवल उन महत्वपूर्ण क्षणों पर केंद्रित करता है जो सुरक्षित रूप से चलाने के लिए आवश्यक हैं। यह इन सुपर-स्मार्ट ड्राइविंग ब्रेन्स को बिना किसी विशाल घर जितने बड़े सुपरकंप्यूटर की आवश्यकता के, असली कारों में डालना संभव बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →