← नवीनतम पेपर
💻 computer science

PVI: Plug-in Visual Injection for Vision-Language-Action Models

यह शोध पत्र प्लग-इन विजुअल इंजेक्शन (PVI) को प्रस्तुत करता है, जो एक हल्का, एनकोडर-अज्ञेय (encoder-agnostic) मॉड्यूल है जो शून्य-आरंभीकृत अवशिष्ट पथों (zero-initialized residual pathways) के माध्यम से टेम्पोरल वीडियो फीचर्स को इंजेक्ट करके विजन-लैंग्वेज-एक्शन मॉडल्स को बेहतर बनाता है, जिससे व्यापक आर्किटेक्चरल परिवर्तनों या बहु-चरणीय प्रशिक्षण की आवश्यकता के बिना जटिल, बहु-चरणीय हेरफेर कार्यों पर प्रदर्शन में सुधार होता है।

मूल लेखक: Zezhou Zhang, Songxin Zhang, Xiao Xiong, Junjie Zhang, Zejian Xie, Jingyi Xi, Zunyao Mao, Zan Mao, Zhixin Mai, Zhuoyang Song, Jiaxing Zhang

प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zezhou Zhang, Songxin Zhang, Xiao Xiong, Junjie Zhang, Zejian Xie, Jingyi Xi, Zunyao Mao, Zan Mao, Zhixin Mai, Zhuoyang Song, Jiaxing Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक अत्यधिक बुद्धिमान रोबोट बटलर को शर्ट मोड़ने या कील ठोकने का काम सिखा रहे हैं। इस काम के लिए आपके पास दो मुख्य उपकरण हैं:

  1. "दिमाग" (VLM): यह एक सुपर-स्मार्ट AI है जो भाषा और सामान्य अवधारणाओं को समझता है। यह जानता है कि "शर्ट" क्या है और "साफ सुथरे तरीके से मोड़ना" का क्या अर्थ है। हालांकि, यह एक ऐसे दार्शनिक की तरह है जिसने पुस्तकालय की हर किताब पढ़ी है लेकिन कभी कपड़े को छुआ तक नहीं है। यह कार्य के विचार को समझता है, लेकिन यह भौतिक विवरणों (जैसे कि कपड़ा ठीक कहाँ से सिकुड़ रहा है या हथौड़ा कैसे चल रहा है) पर थोड़ा धुंधला हो सकता है।
  2. "हाथ" (एक्शन एक्सपर्ट): यह रोबोट का वह हिस्सा है जो वास्तव में हाथों को हिलाता है। यह गणित और टाइमिंग में बहुत अच्छा है, लेकिन यह पूरी तरह से "दिमाग" पर निर्भर करता है कि उसे क्या करना है।

समस्या: "धुंधला" हैंडऑफ (The "Blury" Handoff)

वर्तमान रोबोट डिजाइनों में, "दिमाग" "हाथों" से बात करता है। लेकिन क्योंकि दिमाग बड़े विचारों पर केंद्रित होता है, यह अक्सर सूक्ष्म, महत्वपूर्ण विवरणों को छोड़ देता है।

  • लुप्त ज्यामिति (The Missing Geometry): दिमाग कह सकता है, "शर्ट मोड़ो," लेकिन यह हाथों को यह नहीं बताता कि आस्तीन का किनारा ठीक कहाँ है।
  • लुप्त गति (The Missing Motion): दिमाग आमतौर पर एक एकल स्नैपशॉट (झलक) को देखता है। यह गति को नहीं देख पाता। इसे पता नहीं चलता कि शर्ट फिसल रही है या हथौड़ा टकराने ही वाला है। यह सड़क की एक सिंगल फोटो देखकर कार चलाने की कोशिश करने जैसा है; आप आसपास के चलते हुए ट्रैफिक को मिस कर देते हैं।

इस कारण से, रोबोट के "हाथ" अक्सर लड़खड़ा जाते हैं, लक्ष्य चूक जाते हैं या बहुत अनाड़ी तरीके से चलते हैं।

समाधान: PVI (प्लग-इन विजुअल इंजेक्शन)

इस शोध पत्र के लेखक, Plug-in Visual Injection (PVI), ने एक चतुर समाधान निकाला है। पूरे रोबोट को फिर से प्रशिक्षित करने के बजाय (जो महंगा और जोखिम भरा है), उन्होंने एक विशेष "बायपास केबल" बनाया है।

यह कैसे काम करता है, इसके लिए एक रचनात्मक उपमा देखें:

"बायपास केबल" की उपमा

कल्पना कीजिए कि रोबोट के "हाथ" (एक्शन एक्सपर्ट) एक जटिल व्यंजन पका रहे मास्टर शेफ हैं। "दिमाग" (VLM) एक रेसिपी बुक (नुस्खा पुस्तिका) है।

  • पुराना तरीका: शेफ रेसिपी बुक पढ़ता है। किताब कहती है "नमक डालें," लेकिन यह शेफ को यह नहीं बताती कि खाना अभी कितना छनछना रहा है उसके आधार पर कितना और कब छिड़कना है। शेफ को अनुमान लगाना पड़ता है।
  • PVI तरीका: लेखक शेफ के हाथों के ठीक बगल में एक दूसरा, हाई-टेक कैमरा स्थापित करते हैं। यह कैमरा हाई डेफिनेशन और स्लो मोशन में भोजन को देखता है।
    • यह कैमरा एक छोटे, स्मार्ट सहायक (PVI मॉड्यूल) से जुड़ा है।
    • यह सहायक सीधे शेफ के कान में सूक्ष्म विवरण फुसफुसाता है: "कपड़ा बाईं ओर फिसल रहा है," या "हथौड़ा 2 इंच दूर है।"
    • महत्वपूर्ण बात यह है कि शेफ को अपनी खाना पकाने की शैली बदलने या चाकू पकड़ने का तरीका फिर से सीखने की आवश्यकता नहीं है। सहायक बस शेफ के मौजूदा विचारों में ये अतिरिक्त फुसफुसाहटें जोड़ देता है।

यह क्यों एक बड़ी बात है

यह पेपर इस सिस्टम को तीन मुख्य "सुपरपावर्स" प्रदान करता है:

  1. यह एक "प्लग-एंड-प्ले" अपग्रेड है: आपको रोबोट के दिमाग या हाथों को फिर से बनाने की आवश्यकता नहीं है। आप बस इस नए विजुअल मॉड्यूल को "प्लग इन" करते हैं। यह कैमरा बॉडी बदले बिना कैमरे में नया लेंस जोड़ने जैसा है।
  2. इसे फोटो से ज्यादा "वीडियो" पसंद है: शोधकर्ताओं ने सहायक के लिए दो प्रकार की जानकारी का परीक्षण किया:
    • स्थिर फोटो (DINOv2): एक उच्च-गुणवत्ता वाली एकल तस्वीर।
    • वीडियो क्लिप्स (V-JEPA2): गति दिखाने वाला एक छोटा वीडियो।
    • परिणाम: वीडियो हर बार जीत गया। ठीक वैसे ही जैसे एक इंसान को गेंद को पकड़ने के लिए उसे चलते हुए देखने की आवश्यकता होती है, रोबमा को शर्ट मोड़ने या कील ठोकने के लिए गति देखने की आवश्यकता होती है। वीडियो डेटा ने रोबोट की सफलता दर में भारी उछाल दिया (परीक्षणों में ~36% सफलता से ~60% तक)।
  3. यह वास्तविक दुनिया में काम करता है: उन्होंने इसे केवल कंप्यूटर सिमुलेशन में टेस्ट नहीं किया। उन्होंने इसे एक वास्तविक, दो-हाथों वाले रोबोट पर लगाया और सफलतापूर्वक कपड़े को मोड़ने का काम किया। यह एक कठिन कार्य है क्योंकि कपड़ा लचीला और अप्रत्याशित होता है, जिसके लिए दोनों हाथों के बीच सटीक समन्वय की आवश्यकता होती है। रोबोट ने इसे सुचारू रूप से किया।

निचोड़ (The Bottom Line)

PVI एक सरल, हल्का तरीका है जो रोबोट लर्निंग में एक बड़ी कमी को ठीक करता है। यह समझता है कि जबकि रोबोट का "दिमाग" शब्दों को समझने में महान है, रोबोट के "हाथों" को भौतिक कार्य करने के लिए गति और सूक्ष्म विवरणों को देखने की आवश्यकता होती है।

एक "बायपास केबल" जोड़कर जो वीडियो-आधारित मोशन डेटा को सीधे हाथों तक पहुँचाता है, रोबोट बहुत अधिक कुशल, सटीक और जटिल, वास्तविक दुनिया के कार्यों जैसे कपड़े तह करने या ब्लॉक्स के साथ निर्माण करने में सक्षम हो जाता है, और वह भी बिना पूरी तरह से पुन: प्रशिक्षित हुए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →