← नवीनतम पेपर
💻 computer science

UniFS: Unified Fast-to-Slow Hierarchical Architecture for Vision-Language-Action Models

UniFS विजन-लैंग्वेज-एक्शन मॉडल्स के लिए एक एकीकृत फास्ट-टू-स्लो पदानुक्रमित आर्किटेक्चर पेश करता है जो अपडेट फ्रीक्वेंसी के आधार पर VLM परतों को स्तरीकृत करता है और दक्षता-सटीकता के बीच के संतुलन को हल करने के लिए मल्टी-स्केल फीचर इंटरैक्शन को पुनः रूट करता है, जिससे LIBERO बेंचमार्क और रियल-रोबोट प्लेटफॉर्म पर अत्याधुनिक प्रदर्शन और काफी कम विलंबता (लेटेंसी) प्राप्त होती है।

मूल लेखक: Lin Sun, Zhiwei Guan, Conglin Wang, Zihong Chen, Jianhai Yu, Zongsheng Li, Boyong He, Tao Sun, Jiale Cao, Lige Liu

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lin Sun, Zhiwei Guan, Conglin Wang, Zihong Chen, Jianhai Yu, Zongsheng Li, Boyong He, Tao Sun, Jiale Cao, Lige Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक नाजुक कार्य करना सिखाने की कोशिश कर रहे हैं, जैसे ब्लॉक को एक के ऊपर एक रखना या कप उठाना। इसके लिए, रोबोट को दो चीजों की एक साथ आवश्यकता होती है:

  1. दिमाग (विज़न-लैंग्वेज मॉडल): यह हिस्सा दृश्य को देखता है, निर्देशों को पढ़ता है, और "बड़ी तस्वीर" को समझता है (जैसे, "मुझे नीले ब्लॉक पर लाल ब्लॉक रखना है")। यह स्मार्ट है लेकिन सोचने में धीमा है।
  2. हाथ (एक्शन एक्सपर्ट): यह हिस्सा वास्तव में रोबोट के हाथ को चलाता है। इसे चीजों को गिरने से बचाने के लिए तुरंत प्रतिक्रिया देने की आवश्यकता होती है, इसलिए इसे बहुत तेज़ होना चाहिए।

समस्या: "गति बनाम बुद्धिमत्ता" का द्वंद्व (The "Speed vs. Smarts" Dilemma)

वर्तमान रोबोटिक दिमागों के सामने एक निराशाजनक कैच-22 (catch-22) की स्थिति होती है।

  • पुराना तरीका: "दिमाग" और "हाथ" अलग-अलग हैं। दिमाग हाथों को एक धीमा अपडेट भेजता है। यदि दिमाग बहुत बार अपडेट होता है, तो रोबोट धीमा और सुस्त हो जाता है। यदि वह बहुत कम बार अपडेट होता है, तो दिमाग के निर्देश तब तक पुराने हो जाते हैं जब तक कि वे हाथों तक नहीं पहुँच जाते, जिससे रोबोट पुरानी जानकारी पर कार्य करने लगता है (जैसे कि उस गेंद को पकड़ने की कोशिश करना जो पहले ही हिल चुकी है)।
  • सूचना की हानि: इससे भी बुरा यह है कि हाथों को केवल दिमाग का अंतिम विचार मिलता है। वे उन सभी दिलचस्प "सोचने के चरणों" को मिस कर देते हैं जो दिमाग ने रास्ते में लिए थे, जो रोबोट की गति को बहुत सटीक बनाने की क्षमता को सीमित करता है।

समाधान: UniFS (एक "बहु-गति वाला दिमाग")

इस पेपर के लेखकों ने UniFS के माध्यम से देखा कि मानव मस्तिष्क कैसे काम करता है। उन्होंने गौर किया कि हमारे मस्तिष्क में केवल एक गति नहीं होती; हम एक साथ विभिन्न गतियों पर सूचनाओं को प्रोसेस करते हैं। तेज़ लहरें तत्काल संवेदी विवरणों (जैसे अचानक हुई आवाज़) को संभालती हैं, जबकि धीमी लहरें गहरे, स्थिर विचारों (जैसे आपका नाम या दीर्घकालिक योजना) को संभालती हैं।

UniFS इस विचार को रोबोटिक्स पर लागू करता है, एक एकीकृत तेज़-से-धीमी संरचना (Unified Fast-to-Slow Architecture) बनाकर। यह इस प्रकार काम करता है:

1. "स्तरित टीम" (Stratified Layers)

पूरे दिमाग को एक ही गति पर सोचने के बजाय, UniFS दिमाग की परतों को अलग-अलग शिफ्ट शेड्यूल वाली एक टीम में विभाजित करता है:

  • उथली परतें (द स्काउट्स - The Shallow Layers): ये नेटवर्क की बाहरी परतें हैं। ये बहुत तेज़ी से अपडेट होती हैं (हर एक स्टेप पर)। ये स्काउट्स की तरह हैं जो चारों ओर दौड़ रहे हैं, लगातार वातावरण में होने वाले तत्काल परिवर्तनों की रिपोर्ट कर रहे हैं (जैसे, "कप अभी डगमगाया!")।
  • गहरी परतें (द स्ट्रैटेजिस्ट्स - The Deep Layers): ये आंतरिक परतें हैं। ये बहुत धीरे अपडेट होती हैं (हर कुछ स्टेप के बाद)। ये कमांड सेंटर में बैठे जनरलों की तरह हैं, जो स्थिर योजना ("लाल ब्लॉक रखें") को थामे रखते हैं ताकि वे हर छोटी हलचल से विचलित न हों।

परिणाम: रोबोट को दोनों दुनियाओं का सर्वश्रेष्ठ लाभ मिलता है: परिवर्तनों के प्रति तत्काल प्रतिक्रिया और एक स्थिर, दीर्घकालिक योजना, वह भी एक ही दिमाग से।

2. "गुप्त हैंडऑफ" (Latent Vector Inversion)

एक पेचीदा समस्या थी: मानक AI में, गहरी परतें (धीमी रणनीतिकार) वास्तव में बहुत तेज़ी से बदल रही थीं क्योंकि वे एक्शन आउटपुट के बहुत करीब थीं। इसने योजना के "धीमे" हिस्से को बिगाड़ दिया था।

इसे ठीक करने के लिए, UniFS एक चतुर तकनीक का उपयोग करता है जिसे लेटेंट वेक्टर इनवर्जन (Latent Vector Inversion) कहा जाता है।

  • उपमा: कल्पना कीजिए कि एक रिले रेस है जहाँ बैटन (baton) को उल्टे क्रम में पास किया जाता है। आमतौर पर, "तेज़" धावक (उथली परतें) "धीमे" धावकों (गहरी परतों) को पास करते हैं। UniFS इसे उलट देता है: "तेज़" संवेदी विवरणों को उन परतों को भेजा जाता है जो सूक्ष्म मोटर कौशल (fine motor skills) को संभालती हैं, जबकि "धीमे" स्थिर प्लान को उन परतों को भेजा जाता है जो बड़ी तस्वीर को संभालती हैं।
  • यह क्यों मदद करता है: यह सुनिश्चित करता है कि "रणनीतिकार" शांत और स्थिर रहें, जबकि "स्काउट्स" अराजक, तेज़-मूविंग विवरणों को संभालें। यह सही जानकारी को सही काम के साथ संरेखित करता है।

3. "कोच की सीटी" (Multi-Level Supervision)

यह सुनिश्चित करने के लिए कि रोबोट सही ढंग से सीखता है, प्रशिक्षण प्रक्रिया मल्टी-लेवल सुपरविजन का उपयोग करती है।

  • उपमा: केवल छात्र (रोबोट) को अंतिम परीक्षा (अंतिम क्रिया) पर ग्रेड देने के बजाय, शिक्षक (प्रशिक्षण एल्गोरिदम) सीखने की प्रक्रिया के हर चरण में फीडबैक देता है।
  • लक्ष्य: यह "धीमी" परतों को दीर्घकालिक योजनाएं बनाने और "तेज़" परतों को त्वरित सुधार करने के लिए मजबूर करता है, जिससे रोबोट को शॉर्टकट लेने या भ्रमित होने से रोका जा सके।

परिणाम: तेज़ और स्मार्ट

पेपर में इस नए सिस्टम का परीक्षण LIBERO (रोबोट मैनिपुलेशन कार्यों का एक सेट) और एक वास्तविक रोबोटिक आर्म (Franka) पर किया गया।

  • गति: नया सिस्टम पिछले तरीकों की तुलना में 2.1 गुना तेज़ है। इसने निर्णय लेने में लगने वाले समय को 36.5 मिलीसेकंड से घटाकर केवल 17.8 मिलीसेकंड कर दिया। यह एक सुस्त घोंघे से एक तेज़ धावक बनने जैसा है।
  • सफलता दर: इसने 98.3% सफलता दर हासिल की, जो अन्य मॉडलों की तुलना में उच्चतम (स्टेट-ऑफ-द-आर्ट) है।
  • स्मृति: क्योंकि "धीमी" परतें हर स्टेप पर अपडेट नहीं होती हैं, वे स्वाभाविक रूप से अतिरिक्त मेमोरी बैंक की आवश्यकता के बिना पिछले संदर्भ (context) को थामे रखती हैं। यह एक अंतर्निहित शॉर्ट-टर्म मेमोरी की तरह है जो अपने आप याद रखता है कि कुछ सेकंड पहले क्या हुआ था।

सारांश

UniFS एक ऐसे रोबोट को देने जैसा है जिसका दिमाग एक साथ कई गतियों पर सोच सकता है। इसमें तत्काल सुरक्षा के लिए एक तेज़-प्रतिक्रिया देने वाली बाहरी परत और दीर्घकालिक योजना के लिए एक स्थिर आंतरिक परत है। इन परतों के आपस में बात करने के तरीके को बदलकर और हर स्तर पर विशिष्ट फीडबैक के साथ उन्हें प्रशिक्षित करके, रोबोट पहले से कहीं अधिक तेज़ और सटीक बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →