← नवीनतम पेपर
💻 computer science

UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling

UniviewVLA एक एकीकृत मल्टीव्यू विजन-लैंग्वेज-एक्शन मॉडल है जो मानक दो-कैमरा अवलोकनों से छिपे हुए संकेतों और भविष्य के दृश्य विकास का अनुमान लगाने के लिए एक वर्ल्ड मॉडल का लाभ उठाता है, जिससे बिना किसी अतिरिक्त हार्डवेयर या स्पष्ट 3D पुनर्निर्माण की आवश्यकता के, अवरोध-केंद्रित कार्यों पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

मूल लेखक: Tao Xu, Runhao Zhang, Zhijian Huang, Jiayi Guan, Jiaxin Wang, Yifan Ding, Yong-Lu Li, Long Chen, Guang Chen, Jinghui Lu

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tao Xu, Runhao Zhang, Zhijian Huang, Jiayi Guan, Jiaxin Wang, Yifan Ding, Yong-Lu Li, Long Chen, Guang Chen, Jinghui Lu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक पहेली सुलझाने की कोशिश कर रहे हैं, लेकिन आपकी आँखों पर आधे चित्र का पर्दा पड़ा है। आप ऊपरी आधा हिस्सा देख सकते हैं, लेकिन निचला आधा हिस्सा एक बॉक्स के पीछे छिपा हुआ है। एक मानक रोबोट मस्तिष्क (एक विजन-लैंग्वेज-एक्शन मॉडल) उस व्यक्ति की तरह है जिसकी आँखें ढकी हुई हैं; वह केवल उसी के आधार पर जो वह देख सकता है, गायब हिस्सों का अनुमान लगाने की कोशिश करता है। अक्सर, उसका अनुमान गलत होता है क्योंकि सबसे महत्वपूर्ण सुराग छिपे हुए होते हैं।

यह पेपर UniviewVLA को पेश करता है, जो एक नए प्रकार का रोबोट मस्तिष्क है जो बिना अधिक कैमरे खरीदे या जटिल 3D मानचित्र बनाए इस समस्या को हल करता है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: "ब्लाइंड स्पॉट" (अंध बिंदु)

रोबोट्स में आमतौर पर दो कैमरे होते हैं: एक उनके "सिर" पर (एजेंट-व्यू) और एक उनकी "कलाई" पर (रिस्ट-व्यू)।

  • समस्या: यदि रोबमाट को एक कप के पीछे छिपे स्विच को पकड़ना है, या एक गुड़िया को हिलाना है जो एक बॉक्स द्वारा आंशिक रूप से बाधित है, तो मानक कैमरे उसे नहीं देख पाते।
  • पुराने समाधान:
    • अधिक कैमरे जोड़ना: यह रोबोट को अतिरिक्त आँखें देने जैसा है। लेकिन यह अव्यवस्थित है। आपको रोबोट को ठीक उन्हीं कैमरों के साथ प्रशिक्षित करना होगा, और यदि आप रोबोट को किसी नए कमरे में ले जाते हैं, तो प्रशिक्षण टूट जाता है क्योंकि कैमरा एंगल बदल जाते हैं।
    • 3D मैप बनाना: यह आपके दिमाग में एक सटीक 3D ब्लूप्रिंट बनाने की कोशिश करने जैसा है जबकि आप हिल रहे हों। इसमें बहुत अधिक दिमागी शक्ति (कंप्यूटिंग पावर) लगती है और यह धीमा है।

2. समाधान: "इमेजिनेशन इंजन" (कल्पना इंजन)

UniviewVLA एक वर्ल्ड मॉडल (World Model) का उपयोग करता है। इसे रोबोट की उन कोणों से कमरे को कल्पना करने की क्षमता के रूप में समझें जहाँ उसके पास कैमरे नहीं हैं, और यह अनुमान लगाने की क्षमता के रूप में कि अगले कुछ सेकंड में दृश्य कैसे बदलेगा।

  • यह कैसे काम करता है: रोबोट अपने दो मानक कैमरों को देखता है। फिर, वह अपने "इमेजिनेशन इंजन" से पूछता है: "यदि मैं बगल से देख रहा होता, या ऊपर से देख रहा होता, तो मुझे अभी क्या दिखाई देता? और अगले एक सेकंड में मुझे क्या दिखाई देगा?"
  • परिणाम: यह इन "काल्पनिक" दृश्यों को तुरंत उत्पन्न करता है। इसे अतिरिक्त हार्डवेयर की आवश्यकता नहीं है; यह केवल अपने मस्तिष्क का उपयोग करके खाली जगहों (ब्लाइंड स्पॉट्स) को भर देता है।

3. स्पीड हैक: "हाइलाइट रील"

एक समस्या थी: इन काल्पनिक दृश्यों को उत्पन्न करना भारी मात्रा में डेटा पैदा करता है (जैसे हर सेकंड के लिए एक पूर्ण हाई-डेफिनिशन मूवी बनाना)। यह रोबोट को धीमा बना देता है, जैसे कोई कंप्यूटर एक साधारण चाल चलने से पहले 4K वीडियो लोड करने की कोशिश कर रहा हो।

  • समाधान (मोशन-इंफॉर्मेटिव टोकन कम्प्रेशन): शोधकर्ताओं ने महसूस किया कि रोबोट को पूरे काल्पनिक मूवी की आवश्यकता नहीं है। उसे केवल यह जानने की आवश्यकता है कि क्या हिल रहा है।
  • उपमा: पूरी 60 मिनट की फिल्म देखने के बजाय, रोबोट एक 16-सेकंड की हाइलाइट रील बनाता है जो केवल हिलते हुए हिस्सों (जैसे कप की ओर बढ़ता हुआ हाथ) को दिखाती है।
  • प्रभाव: यह डेटा को 625 सूचना के टुकड़ों से घटाकर केवल 16 कर देता है। यह रोबोट के सोचने के समय को प्रति दृश्य 6-7 सेकंड से घटाकर केवल 0.2-0.3 सेकंड कर देता है।

4. स्मार्ट स्विचर: "सबसे अच्छा कोण चुनना"

कभी-कभी, कार्य की शुरुआत में "साइड व्यू" सबसे अच्छा होता है, लेकिन बाद में, जैसे-जैसे वस्तुएं हिलती हैं, "टॉप व्यू" अधिक महत्वपूर्ण हो जाता है। एक निश्चित कैमरा अपना विचार नहीं बदल सकता।

  • समाधान (एक्शन-एन्ट्रॉपी व्यू सिलेक्शन): रोबोट लगातार खुद से पूछता है, "कौन सा काल्पनिक कोण मुझे अपनी अगली चाल लेने के लिए सबसे अधिक आत्मविश्वास देता है?"
  • उपमा: कल्पना कीजिए कि आप वीडियो गेम खेल रहे हैं। कभी-कभी आपको मिनीमैप देखने की आवश्यकता होती है; अन्य समय में आपको सीधे सामने देखने की आवश्यकता होती है। UniviewVLA हर चरण पर सबसे सहायक काल्पनिक कोण की ओर अपना "फोकस" गतिशील रूप से बदलता है, बिना पुन: प्रशिक्षित हुए।

5. परिणाम: अदृश्य को देखना

टीम ने दो तरीकों से परीक्षण किया:

  1. मानक परीक्षण: सामान्य कार्यों पर जहाँ कुछ भी छिपा हुआ नहीं है, रोबोट मौजूदा सर्वश्रेष्ठ रोबोट्स के समान प्रदर्शन करता है (95.8% सफलता दर)।
  2. "हिडन" (छिपे हुए) परीक्षण: उन्होंने ऐसे कार्य बनाए जहाँ रोबोट को कोनों के चारों ओर या वस्तुओं के पीछे देखना ही था।
    • मानक रोबोट: केवल 40% बार सफल हुआ।
    • अतिरिक्त कैमरों वाला रोबोट: 66% बार सफल हुआ।
    • UniviewVLA (केवल 2 कैमरों के साथ): 73% बार सफल हुआ।

वास्तविक जीवन में: उन्होंने इसे एक वास्तविक रोबोटिक आर्म पर भी परखा। जब रोबोट को राइस कुकर के पीछे छिपे ओरियो को पकड़ना था या बॉक्स द्वारा बाधित गुड़िया को हिलाना था, तो मानक रोबोट ज्यादातर समय विफल रहा। UniviewVLA, केवल अपने दो मानक कैमरों का उपयोग करके, काफी अधिक बार सफल हुआ, जिससे यह साबित हुआ कि दृश्य को "कल्पना" करना केवल एक भौतिक कैमरा जोड़ने से बेहतर है।

सारांश

UniviewVLA को रोबोट को सुपर-विज़न देने जैसा समझिए। अपने पास मौजूद भौतिक कैमरों तक सीमित होने के बजाय, यह कमरे के बाकी हिस्से की कल्पना करने और भविष्य की भविष्यवाणी करने के लिए एक "वर्ल्ड मॉडल" का उपयोग करता है। यह इतना कुशलता से काम करता है कि इसे अतिरिक्त हार्डवेयर की आवश्यकता नहीं होती, यह अतिरिक्त डेटा से धीमा नहीं होता, और यह उन कठिन कार्यों को हल कर सकता है जहाँ वस्तुएं दृष्टि से छिपी होती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →