← नवीनतम पेपर
💻 computer science

Efficient Long-Horizon Vision-Language-Action Models via Static-Dynamic Disentanglement

यह शोध पत्र DySta का प्रस्ताव करता है, जो विजन-लैंग्वेज-एक्शन मॉडल्स के लिए एक कुशल फ्रेमवर्क है जो कॉन्टेक्स्ट लेंथ को कम करने और KV कैश पुन: उपयोग को सक्षम करने के लिए स्टैटिक और डायनेमिक विजुअल टोकन को अलग करता है, जिससे सिम्युलेटेड और वास्तविक दुनिया के रोबोटिक कार्यों पर मल्टी-फ्रेम इंटीग्रेशन प्रदर्शन और इन्फरेंस स्पीड में महत्वपूर्ण सुधार होता है।

मूल लेखक: Weikang Qiu, Huashuo Lei, Tinglin Huang, Rex Ying

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weikang Qiu, Huashuo Lei, Tinglin Huang, Rex Ying

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल भोजन बनाना सिखा रहे हैं, जैसे कि टोस्टर के इंतज़ार के दौरान एक सैंडविच बनाना। इसे अच्छी तरह से करने के लिए, रोबोट को रसोई को "देखने", रेसिपी को "पढ़ने" और यह "याद रखने" की आवश्यकता होगी कि उसने अभी क्या किया है।

यह शोध पत्र एक नया तरीका पेश करता है जिसे DySta (डायनामिक-स्टैटिक) कहा जाता है, ताकि रोबोट के दिमाग को अधिक स्मार्ट, तेज़ और चीज़ों को याद रखने में बेहतर बनाया जा सके। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

समस्या: रोबोट का "कम ध्यान देने का समय" (Short Attention Span)

वर्तमान रोबोट के दिमाग (जिन्हें विज़न-लैंग्वेज-एक्शन मॉडल कहा जाता है) उन छात्रों की तरह हैं जो शिक्षक द्वारा व्हाइटबोर्ड मिटाने से पहले केवल एक सेकंड के लिए उसे देख पाते हैं।

  1. याद रखने के लिए बहुत कुछ: यदि रोबोट यह समझने के लिए पिछले 10 सेकंड के वीडियो को देखने की कोशिश करता है कि क्या हो रहा है, तो जानकारी की मात्रा इतनी विशाल होती है कि कंप्यूटर बहुत धीमा हो जाता है। यह एक चम्मच उठाने का निर्णय लेने के लिए पूरी विश्वकोश (encyclopedia) पढ़ने की कोशिश करने जैसा है।
  2. कोई स्मृति नहीं: क्योंकि कंप्यूटर बहुत धीमा है, अधिकांश रोबोट केवल वर्तमान तस्वीर देखते हैं और अनुमान लगाते हैं कि आगे क्या करना है। वे भूल जाते हैं कि उन्होंने पहले बटन दबाया है या प्लेट पर ब्रेड रखी है। वे शायद बटन दबाते ही रह जाएँगे!

समाधान: "स्टैटिक बनाम डायनामिक" का तरीका

लेखकों ने महसूस किया कि अधिकांश कार्यों (जैसे रसोई या गोदाम) में, ज़्यादातर चीज़ें नहीं बदलतीं। दीवारें, मेज़ और चूल्हा बिल्कुल वैसे ही रहते हैं। केवल कुछ ही चीज़ें हिलती हैं, जैसे रोबोट का हाथ या वह कैन जिसे वह पकड़े हुए है।

DySta रोबोट के विज़न को दो बाल्टियों में विभाजित करता है:

  1. "स्टैटिक" बाल्टी (पृष्ठभूमि/Background): यह दृश्य के अपरिवर्तित हिस्सों (दीवारें, मेज़) को रखती है।
  2. "डायनामिक" बाल्टी (क्रिया/Action): यह हिलने वाले हिस्सों (रोबोट का हाथ, पकड़ी जा रही वस्तु) को रखती है।

जादुई उपमा: लाइब्रेरी कार्ड
कल्पना कीजिए कि आप एक लाइब्रेरी में किताब पढ़ रहे हैं।

  • पुराना तरीका: हर बार जब आप पन्ना पलटते हैं, तो आपको पूरी लाइब्रेरी कैटलॉग को फिर से पढ़ना पड़ता है और लाइब्रेरी के पते को फिर से सत्यापित करना पड़ता है, भले ही लाइब्रेरी अपनी जगह से नहीं हिली हो। इसमें बहुत समय लगता है।
  • DySta का तरीका: आप लाइब्रेरी का पता और कैटलॉग एक स्टिकी नोट (स्टैटिक टोकन) पर लिखते हैं और उसे अपनी मेज़ पर चिपका देते हैं। आप केवल नया पन्ना पढ़ते हैं (डायनामिक टोकन)।
    • क्योंकि आपको हर बार पूरा कैटलॉग फिर से नहीं पढ़ना पड़ता, इसलिए आप किताब 2 गुना तेज़ी से पढ़ पाते हैं।
    • क्योंकि आपने स्टिकी नोट को संभाल कर रखा है, इसलिए आप पूरी कहानी के संदर्भ को बिना भटके याद रख सकते हैं।

यह कैसे तय करता है कि कब अपडेट करना है

रोबोट को यह जानने की ज़रूरत है कि "स्टैटिक" बाल्टी वास्तव में कब बदल रही है। शायद रोबोट ने एक फूलदान गिरा दिया हो, या रोशनी बदल गई हो।

  • "रीकैश गेट" (Recache Gate): यह एक छोटा, स्मार्ट स्विच है जिसे रोबट सीखना शुरू करता है। यह वर्तमान दृश्य को देखता है और पूछता है, "क्या बैकग्राउंड अभी भी वही है?"
    • यदि हाँ: तो यह पुराने "स्टिकी नोट" (कैश किए गए डेटा) का पुन: उपयोग करता है।
    • यदि नहीं: तो यह नई जानकारी के साथ नोट को जल्दी से अपडेट करता है।
    • यह निर्णय स्वचालित रूप से होता है और रोबोट द्वारा सीखा जाता है, न कि इंसानों द्वारा प्रोग्राम किया जाता है।

उन्होंने क्या परीक्षण किया

शोधकर्ताओं ने एक नया परीक्षण बनाया जिसे LIBERO-Memory कहा जाता है। इसे रोबोट के लिए मेमोरी गेम की तरह समझें:

  • कार्य: रोबोट को ठीक 1.4 सेकंड के लिए सूप के एक कैन को गर्म करना होगा, उसे हटाना होगा, उसे वापस वहीं रखना होगा जहाँ से शुरू किया था, और फिर दूसरे कैन को गर्म करना होगा।
  • यह कठिन क्यों है: यदि रोबोट भूल जाता है कि पहला कैन तैयार है, तो वह उसे फिर से गर्म करने की कोशिश कर सकता है। यदि वह भूल जाता है कि उसने पहले कैन को कहाँ रखा था, तो वह दूसरे कैन को सही जगह पर नहीं रख पाएगा।
  • परिणाम:
    • स्मार्टर: DySta रोबोट ने इन मेमोरी कार्यों को पिछले रोबोटों की तुलना में 23% बेहतर तरीके से हल किया।
    • तेज़: इसने निर्णय लेने में 2.2 गुना तेज़ी दिखाई क्योंकि इसने स्थिर बैकग्राउंड को फिर से पढ़ने में समय बर्बाद नहीं किया।

सारांश

DySta एक "हाइलाइटर" देने जैसा है जो उन हिस्सों को चिह्नित करता है जो दुनिया में कभी नहीं बदलते। पहली नज़र के बाद अपरिवर्तित हिस्सों को अनदेखा करके, रोबोट बहुत सारा समय और ऊर्जा बचाता है, जिससे वह लंबे कार्यों को याद रख पाता है और भ्रमित या धीमा हुए बिना जटिल कार्य कर पाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →