← नवीनतम पेपर
💻 computer science

GeoAware-VLA: Implicit Geometry Aware Vision-Language-Action Model

GeoAware-VLA एक हल्के प्रोजेक्शन लेयर के माध्यम से एक फ्रोजन, प्रीट्रेंड ज्योमेट्रिक विजन मॉडल से फीचर्स को एकीकृत करके विजन-लैंग्वेज-एक्शन मॉडल्स के व्यूपॉइंट जनरलाइजेशन को बढ़ाता है, जिससे बिना किसी स्पष्ट 3D ट्रेनिंग डेटा की आवश्यकता के, सिमुलेशन बेंचमार्क और रियल-वर्ल्ड रोबोटिक प्लेटफॉर्म्स दोनों पर अनदेखे कैमरा पोजीशंस पर ज़ीरो-शॉट प्रदर्शन में महत्वपूर्ण सुधार प्राप्त होता है।

मूल लेखक: Ali Abouzeid, Malak Mansour, Qinbo Sun, Zezhou Sun, Dezhen Song

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ali Abouzeid, Malak Mansour, Qinbo Sun, Zezhou Sun, Dezhen Song

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को मेज सजाना सिखा रहे हैं। आप उसे अपने किचन कैमरे से एक वीडियो दिखाते हैं: "कप को प्लेट पर रखें।" रोबोट इसे पूरी तरह सीख जाता है। लेकिन अगले दिन, आप कैमरे को कमरे के दूसरी ओर रख देते हैं। अचानक, रोबोट भ्रमित हो जाता है। वह गलत कोण से कप को पकड़ने की कोशिश कर सकता है या प्लेट को पूरी तरह से मिस कर सकता है।

यह वह समस्या है जिसे GeoAware-VLA पेपर हल करने की कोशिश करता है।

समस्या: रोबोट "2D-अंधा" है

अधिकांश आधुनिक रोबोट 2D तस्वीरों (जैसे आपके फोन पर फोटो) को देखकर सीखते हैं। वे यह पहचानने में बहुत अच्छे हैं कि चीजें क्या हैं (एक कप, एक प्लेट, एक अनानास), लेकिन जब कैमरा हिलता है, तो वे यह समझने में बहुत खराब होते हैं कि चीजें 3D स्पेस में कहाँ हैं।

इसे इस तरह सोचें: यदि आपने केवल कार का सामने का चित्र देखा है, और फिर किसी ने आपको बगल का चित्र दिखाया, तो शायद आप तुरंत यह नहीं समझ पाएंगे कि यह वही कार है। आपको इसे मानसिक रूप से घुमाना (rotate करना) पड़ेगा। रोबोट इस मानसिक रोटेशन के साथ संघर्ष करते हैं। वे केवल 2D फोटो देखकर शून्य से 3D ज्योमेट्री सीखने की कोशिश करते हैं, जो बिल्कुल वैसा ही है जैसे पक्षियों के बारे में किताब पढ़कर उड़ना सीखने की कोशिश करना।

समाधान: रोबोट को "3D दिमाग" देना

लेखकों, अली अबौज़िद और उनकी टीम ने एक चतुर तरकीब निकाली है। रोबोट को शून्य से 3D ज्योमेट्री सीखने के लिए मजबूर करने के बजाय, उन्होंने उसे भारी काम करने के लिए एक प्री-ट्रेन्ड "3D दिमाग" दिया।

यहाँ इसका सादृश्य (analogy) है:

  • पुराना तरीका: आप एक नए इंटर्न (रोबोट) को काम पर रखते हैं और उन्हें कहते हैं, "इन कपों को स्टैक करने की कोशिश करते समय यह पता लगाओ कि 3D स्पेस कैसे काम करता है।" वे गलतियाँ करेंगे, खासकर यदि आप कैमरा हिलाते हैं।
  • GeoAware का तरीका: आप एक नए इंटर्न को काम पर रखते हैं, लेकिन आप उन्हें एक अनुभवी आर्किटेक्ट (VGGT मॉडल) भी देते हैं जिसने पहले ही लाखों 3D इमारतों का अध्ययन किया है और जानता है कि गहराई (depth) और परिप्रेक्ष्य (perspective) कैसे काम करते हैं। इंटर्न को बस आर्किटेक्ट की सलाह सुनने और फिर निर्णय लेने की आवश्यकता है।

यह कैसे काम करता है (वह "फ्रोजन" रहस्य)

यह पेपर GeoAware-VLA नामक एक मॉडल पेश करता है। यहाँ इसका सरल विवरण है:

  1. द फ्रोजन आर्किटेक्ट (VGGT): वे VGGT नामक एक शक्तिशाली AI मॉडल का उपयोग करते हैं जिसे 3D ज्योमेट्री को समझने के लिए विशाल डेटासेट पर प्रशिक्षित किया गया था। वे इस मॉडल को "फ्रीज" (freeze) कर देते हैं, जिसका अर्थ है कि वे इसके दिमाग को नहीं बदलते। यह केवल एक अत्यंत सटीक फीचर एक्सट्रैक्टर के रूप में कार्य करता है। यह इमेज को देखता है और कहता है, "हे, वह कप 30 सेमी दूर है और 15 डिग्री झुका हुआ है," चाहे कैमरा का कोण कुछ भी हो।
  2. द लाइट ट्रांसलेटर: चूंकि रोबोट का दिमाग (पॉलिसी) एक अलग भाषा बोलता है जिसे आर्किटेक्ट बोलता है, इसलिए वे एक छोटा, सरल "ट्रांसलेटर" लेयर जोड़ते हैं। यह लेयर आर्किटेक्ट के 3D नोट्स को लेती है और उन्हें ऐसे प्रारूप में बदल देती है जिसे रोबोट समझ सके।
  3. रोबोट का निर्णय: रोबोट इन 3D-जागरूक नोट्स को लेता है और निर्णय लेता है, "ठीक है, मुझे कप पकड़ने के लिए अपना हाथ यहाँ ले जाने की आवश्यकता है।"

क्योंकि रोबोट अपनी दिमागी शक्ति यह समझने में बर्बाद नहीं कर रहा है कि "क्या यह एक सपाट तस्वीर है या एक 3D वस्तु?", वह पूरी तरह से कार्य पर ध्यान केंद्रित कर सकता है।

परिणाम: लैब और वास्तविक जीवन में जादू

टीम ने इसे दो प्रसिद्ध रोबोट बेंचमार्क (LIBERO और CALVIN) और उनके लैब में एक वास्तविक रोबोटिक आर्म पर भी टेस्ट किया।

  • "अनसीन व्यू" टेस्ट: उन्होंने रोबोट्स को एक कैमरा एंगल पर प्रशिक्षित किया और फिर उन्हें पूरी तरह से नए एंगल्स पर टेस्ट किया जिन्हें उन्होंने पहले कभी नहीं देखा था।
    • पुराने रोबोट: उनकी सफलता दर गिर गई। वे लगभग 60-80% बार विफल हुए क्योंकि वे रास्ता भटक गए थे।
    • GeoAware रोबोट: उन्होंने अपना धैर्य बनाए रखा। उनकी सफलता दर ऊँची रही, और पुराने रोबोट्स की तुलना में कुछ परीक्षणों में 35% तक सुधार हुआ।
  • वास्तविक दुनिया: जब उन्होंने GeoAware रोबोट को असली टेबल पर असली कप और अनानास के साथ रखा, तो इसने उतना ही अच्छा काम किया। यह कपों को स्टैक कर सका और वस्तुओं को स्थानांतरित कर सका, भले ही कैमरा किसी अजीब जगह पर हो।

यह क्यों महत्वपूर्ण है

यह पेपर साबित करता है कि ज्योमेट्री (Geometry) वह लापता कड़ी है जो रोबोट्स को वास्तव में स्मार्ट बनाने के लिए आवश्यक है।

इसे ड्राइविंग सीखने की तरह समझें। यदि आप केवल एक सिम्युलेटर में ड्राइविंग सीखते हैं जहाँ लाइटिंग एकदम सही है और कैमरा स्थिर है, तो हो सकता है कि जब आप वास्तविक कार में हों और विंडशील्ड का दृश्य अलग हो, तो आप घबरा जाएं। लेकिन यदि आपके पास एक को-पायलट है जिसने हर मौसम में गाड़ी चलाई है और जानता है कि सड़क 3D में कैसे मुड़ती है, तो आप कार में कहीं भी बैठे हों, सुरक्षित रूप से गाड़ी चला सकते हैं।

GeoAware-VLA रोबोट्स को वह को-पायलट देता है। यह एक सरल, प्रभावी अपग्रेड है जो रोबोट्स को बहुत अधिक विश्वसनीय, लचीला और वास्तविक दुनिया के लिए तैयार बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →