← नवीनतम पेपर
💻 computer science

VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models

यह शोध पत्र VP-VLA का प्रस्ताव करता है, जो एक दोहरा-प्रणाली ढांचा (dual-system framework) है जो एक संरचित विजुअल प्रॉम्प्टिंग इंटरफेस के माध्यम से उच्च-स्तरीय तर्क (high-level reasoning) को निम्न-स्तरीय निष्पादन (low-level execution) से अलग करके विजन-लैंग्वेज-एक्शन मॉडल्स को उन्नत करता है, जिससे रोबोटिक कार्यों में स्थानिक सटीकता और मजबूती में महत्वपूर्ण सुधार होता है।

मूल लेखक: Zixuan Wang, Yuxin Chen, Yuqi Liu, Jinhui Ye, Pengguang Chen, Changsheng Lu, Shu Liu, Jiaya Jia

प्रकाशित 2026-04-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zixuan Wang, Yuxin Chen, Yuqi Liu, Jinhui Ye, Pengguang Chen, Changsheng Lu, Shu Liu, Jiaya Jia

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को रसोई साफ करना सिखाने की कोशिश कर रहे हैं। आप उसे एक सरल निर्देश देते हैं: "उस बोतल को उठाओ और उसे रीसाइक्लिंग बिन में डाल दो।"

अतीत में, रोबोट को इस तरह से सिखाना एक घबराए हुए छात्र को एक साथ तीन कठिन काम करने के लिए कहने जैसा था:

  1. निर्देश को पढ़ना।
  2. बिखरी हुई चीज़ों के बीच बोतल को ढूँढना।
  3. किसी चीज़ को गिराए बिना बोतल को पकड़ने के लिए अपने हाथ को पूरी तरह से हिलाना।

अधिकांश रोबोट (और उनके पीछे के AI मॉडल) घबरा जाते थे। वे शब्दों को समझ तो लेते थे लेकिन बोतल ढूँढने में विफल हो जाते थे, या वे बोतल ढूँढ तो लेते थे लेकिन उसे गलत जगह से पकड़ लेते थे, जिससे वह गिर जाती थी। वे "सोचने" और "करने" को एक ही विशाल, उलझे हुए दिमाग में मिलाने की कोशिश कर रहे थे।

VP-VLA रोबोट को सिखाने का एक नया तरीका है जो इस काम को दो अलग-अलग भूमिकाओं में विभाजित करता है, जैसे कि एक मैनेजर (प्रबंधक) और एक वर्कर (श्रमिक)।

दो-प्रणाली वाली टीम (The Two-System Team)

यह शोध पत्र एक "दो-प्रणाली" (Dual-System) आर्किटेक्चर का प्रस्ताव देता है। इसे एक निर्माण स्थल (construction site) की तरह समझें:

1. मैनेजर (सिस्टम 2 प्लानर)

  • वे कौन हैं: एक स्मार्ट, धीरे सोचने वाला AI (एक इंसान प्रोजेक्ट मैनेजर की तरह)।
  • वे क्या करते हैं: वे औजारों को नहीं छूते। इसके बजाय, वे बिखरे हुए कमरे और उपयोगकर्ता के निर्देश को देखते हैं। वे बड़े कार्य को छोटे चरणों में तोड़ देते हैं: "पहले, बोतल ढूँढो। दूसरा, उसे पकड़ो। तीसरा, हरा बिन ढूँढो। चौथा, उसे डाल दो।"
  • उनका जादू: केवल वर्कर को "जाओ बोतल लाओ" कहने के बजाय, मैनेजर कैमरा व्यू पर सीधे एक डिजिटल हाईलाइट बनाता है। वे बोतल पर एक छोटा सा "X" (क्रॉसहेयर) रखते हैं और रीसाइक्लिंग बिन के चारों ओर एक बॉक्स बनाते हैं।
  • यह कैसे मदद करता है: यह एक भ्रमित करने वाले मौखिक निर्देश ("बोतल लाओ") को एक स्पष्ट दृश्य लक्ष्य ("X की ओर जाओ") में बदल देता है।

2. वर्कर (सिस्टम 1 कंट्रोलर)

  • वे कौन हैं: एक तेज़, प्रतिक्रियाशील AI (एक कुशल निर्माण श्रमिक की तरह)।
  • वे क्या करते हैं: वे बड़ी तस्वीर या शब्दों के अर्थ की चिंता नहीं करते। वे बस कैमरा फीड को देखते हैं। जब वे बोतल पर "X" देखते हैं, तो उनका एकमात्र काम रोबोट के हाथ को ठीक उसी स्थान पर ले जाना होता है। जब वे बिन के चारों ओर बॉक्स देखते हैं, तो वे हाथ को वहां ले जाते हैं।
  • उनका जादू: क्योंकि मैनेजर ने पहले ही कठिन सोच का काम पूरा कर लिया है और मानचित्र बना दिया है, इसलिए वर्कर पूरी तरह से सटीक होने पर ध्यान केंद्रित कर सकता है। उन्हें यह अनुमान लगाने की ज़रूरत नहीं है कि कहाँ जाना है; वे बस दृश्य संकेतों (visual clues) का पालन करते हैं।

यह एक बड़ी बात क्यों है

शोध पत्र दिखाता है कि यह "मैनेजर + वर्कर" दृष्टिकोण तीन प्रमुख समस्याओं को हल करता है:

  • "अनुवाद में खो जाने" की समस्या (The "Lost in Translation" Problem): पुराने रोबोट अक्सर इसलिए विफल होते थे क्योंकि वे नई स्थितियों में "बोतल" का क्या मतलब है, इसका अनुमान लगाने की कोशिश करते थे। VP-VLA के साथ, मैनेजर सीधे वस्तु की ओर इशारा करता है। भले ही रोबोट ने उस विशिष्ट बोतल को पहले कभी न देखा हो, मैनेजर उसे हाईलाइट करता है, और वर्कर उसे पकड़ लेता है।
  • "बिखराव" की समस्या (The "Clutter" Problem): बहुत सारी वस्तुओं वाले बिखरे हुए कमरे में, यह जानना मुश्किल होता है कि किसे उठाना है। मैनेजर शोर को हटा देता है और केवल सही वस्तु के चारों ओर एक बॉक्स बनाता है।
  • "सटीकता" की समस्या (The "Precision" Problem): यदि आप रोबोट को कहें कि "अंडे को कार्टन में रखें," तो वह उसे कहीं भी गिरा सकता है। लेकिन यदि मैनेजर कार्टन के विशिष्ट खाली स्लॉट के चारों ओर एक बॉक्स बनाता है, तो रोबमा को पता चल जाता है कि अंडे को कहाँ रखना है।

एक वास्तविक दुनिया का उदाहरण: GPS बनाम ड्राइवर

पुराने रोबोट मॉडल को एक ऐसे ड्राइवर के रूप में सोचें जो एक ही समय में नक्शा पढ़ने, रेडियो सुनने और कार चलाने की कोशिश कर रहा है। वे विचलित हो जाते हैं और मोड़ चूक जाते हैं।

VP-VLA एक GPS (मैनेजर) और एक ड्राइवर (वर्कर) होने जैसा है।

  • GPS कार नहीं चलाता। यह बस कहता है, "500 फीट में बाएं मुड़ें," और स्क्रीन पर एक चमकीली नीली रेखा बनाता है जो बिल्कुल दिखाती है कि कहाँ जाना है।
  • ड्राइवर बस नीली रेखा को देखता है और कार चलाता है। उन्हें मंजिल या ट्रैफिक नियमों की चिंता करने की ज़रूरत नहीं है; वे बस रेखा का अनुसरण करते हैं।

परिणाम

शोधकर्ताओं ने सिमुलेशन और वास्तविक जीवन में रोबोट पर इनका परीक्षण किया।

  • रसोई में: रोबोट ने सफलतापूर्वक कचरा छाँटा, विशिष्ट रंग के अंडे उठाए और ग्रिड पर सटीक स्थानों पर वस्तुएं रखीं।
  • सुधार: रोबोट बहुत अधिक सटीक (पिछले सर्वश्रेष्ठ मॉडलों से लगभग 5% से 8% बेहतर) हो गया। इससे भी महत्वपूर्ण बात यह है कि जब उसने कोई नई वस्तु या फर्नीचर की नई व्यवस्था देखी, तो वह घबराया नहीं। वह बस मैनेजर द्वारा लक्ष्य को हाईलाइट करने का इंतज़ार करता, और फिर अपना काम करता।

संक्षेप में: VP-VLA रोबोट को उनके दिमाग को बड़ा बनाकर नहीं, बल्कि उन्हें एक-दूसरे से बात करने का एक बेहतर तरीका देकर स्मार्ट बनाता है। यह "सोचने" को "करने" से अलग करता है, और मानव भाषा और रोबोट की गति के बीच के अंतर को पाटने के लिए विजुअल हाइलाइट्स का उपयोग करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →