← नवीनतम पेपर
💻 computer science

Spatial Memory for Out-of-Vision Manipulation in Vision-Language-Action

यह शोध पत्र SOMA को प्रस्तुत करता है, जो एक स्थानिक स्मृति ढांचा (spatial memory framework) है जो मल्टी-व्यू अवलोकनों से निरंतर 3D स्थानिक निरूपणों का निर्माण, परिशोधन और पुनर्प्राप्ति करके विजन-लैंग्वेज-एक्शन मॉडलों की आउट-ऑफ-विज़न हेरफेर करने की क्षमता को बढ़ाता है, जिससे लक्ष्य वस्तुएं प्रारंभ में अदृश्य होने पर भी मजबूत तर्क और तेज़ कार्य निष्पादन सक्षम होता है।

मूल लेखक: Pengteng Li, Weiyu Guo, He Zhang, Tiefu Cai, Xiao He, Yandong Guo, Hui Xiong

प्रकाशित 2026-05-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pengteng Li, Weiyu Guo, He Zhang, Tiefu Cai, Xiao He, Yandong Guo, Hui Xiong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप मेज पर रखे एक विशिष्ट लाल कप को उठाने की कोशिश कर रहे हैं, लेकिन हर बार जब आप उसकी ओर हाथ बढ़ाते हैं, तो आप गलती से उसे नजरों से ओझल कर देते हैं। एक मानक रोबोट कैमरा एक ऐसे इंसान की तरह काम करता है जो केवल उसी पर भरोसा करता है जो वह अभी देख पा रहा है। यदि कप एक कटोरे के पीछे छिप जाता है, तो रोबोट घबरा जाता है, रुक जाता है और कहता है, "मुझे यह नहीं मिल रहा है!" इसके पास कोई याददाश्त नहीं है कि एक सेकंड पहले कप कहाँ था।

यह पेपर SOMA (Spatial Memory for Out-of-Vision Manipulation) पेश करता है, जो रोबोट के लिए एक नया "दिमाग" है जो इस समस्या को हल करता है। यह उन्हें कमरे का एक स्थायी मानसिक मानचित्र (persistent mental map) देकर यह काम करता है।

SOMA कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. समस्या: "गोल्डफिश मेमोरी" वाला रोबोट

अधिकांश वर्तमान रोबोट गोल्डफिश की तरह हैं जिनकी केवल 7 सेकंड की याददाश्त होती है। वे केवल उन्हीं वस्तुओं के बारे में जानते हैं जो वर्तमान में उनके कैमरे के दृश्य में हैं।

  • परिदृश्य: एक इंसान रोबोट से कहता है, "गुलाबी कप उठाओ और उसे टोकरी में रख दो।"
  • विफलता: यदि कप एक बॉक्स के पीछे छिपा है, या यदि रोबट अपना सिर घुमाता है और कप फ्रेम से बाहर चला जाता है, तो रोबोट थम जाता है। उसे नहीं पता कि कप अभी भी मौजूद है; उसे बस खाली जगह दिखाई देती है। वह इसलिए "अटक" जाता है क्योंकि उसमें कमरे की वैश्विक समझ (global understanding) की कमी है।

2. समाधान: रोबोट का "मानसिक मानचित्र"

SOMA रोबोट को एक स्थानिक स्मृति (spatial memory) देता है, ठीक वैसे ही जैसे आप याद रखते हैं कि आपने अपनी चाबियाँ कहाँ छोड़ी थीं, भले ही आप अभी उन्हें देख न पा रहे हों। यह तीन चरणों में किया जाता है:

चरण A: "स्वीप" (मानचित्र बनाना)

किसी भी चीज़ को उठाने की कोशिश करने से पहले, यदि रोबोट लक्ष्य को देख नहीं पाता है, तो वह एक सुरक्षा गार्ड की तरह 360-डिग्री घुमाव के साथ कमरे का स्कैन (scan) करने के लिए अपने हेड-माउंटेड कैमरे का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि आप एक अंधेरे कमरे में खोए हुए सिक्के को ढूंढ रहे हैं। आप केवल एक जगह पर नहीं देखते; आप पूरी चीज़ों को देखने के लिए अपनी टॉर्च को पूरे कमरे में घुमाते हैं।
  • क्या होता है: रोबोट इन अलग-अलग कोणों को लेता है और उन्हें एक एकल, एकीकृत "मानसिक मानचित्र" में जोड़ देता है जिसमें यह शामिल होता है कि वस्तुएं क्या हैं (एक गुलाबी कप) और वे कहाँ हैं (3D निर्देशांक/coordinates)।

चरण B: "अपडेट" (मानचित्र को ताज़ा रखना)

जैसे-जैसे रोबोट चलता है और दृश्य बदलता है (वस्तुएं हिलती हैं, ढक जाती हैं, या प्रकट होती हैं), SOMA पुराने मानचित्र को केवल फेंक नहीं देता है। यह इसे अपडेट (update) करता है।

  • उपमा: मौसम के मानचित्र के बारे में सोचें। यदि कोई तूफान उत्तर से दक्षिण की ओर बढ़ता है, तो आप मानचित्र को फेंकते नहीं हैं; आप बस तूफान के स्थान को अपडेट करते हैं।
  • क्या होता है: यदि रोबोट देखता है कि कप हिल गया है, तो वह मानसिक मानचित्र पर कप के स्थान को समायोजित करता है। यदि कप एक बॉक्स के पीछे छिप जाता है, तो मानचित्र याद रखता है, "कप बॉक्स के पीछे है," ताकि रोबोट यह न भूल जाए कि वह मौजूद है।

चरण C: "खोज" (मानचित्र का उपयोग करना)

जब रोबोट को कप उठाने की आवश्यकता होती है, तो वह बिना सोचे-समझे इधर-उधर नहीं भटकता। वह अपनी स्मृति से जानकारी प्राप्त (query) करता है।

  • उपमा: अपने फोन को ढूंढने के लिए पूरे घर में भटकने के बजाय, आपको याद आता है, "मैंने आखिरी बार इसे किचन काउंटर पर देखा था," और आप सीधे वहीं जाते हैं।
  • क्या होता है: रोबोट अपनी स्मृति से पूछता है, "गुलाबी कप कहाँ है?" स्मृति कहती है, "यह बाईं ओर, टोकरी के पीछे है।" रोबोट फिर अपना सिर सीधे उस स्थान पर घुमाता है, कप को उठाता है, और उसे टोकरी में रख देता है—अक्सर केवल एक प्रयास में।

3. परिणाम: "अटकने" से "सुचारू रूप से कार्य करने" तक

शोधकर्ताओं ने वास्तविक रोबोटों पर वास्तविक कार्यों (जैसे कप उठाना और उन्हें टोकरियों में ले जाना) के साथ इसका परीक्षण किया।

  • SOMA के बिना: रोबोट अक्सर अटक जाता था, वस्तु को खोजने के लिए अपना सिर बेतरतीब ढंग से घुमाता था, और उसे पकड़ने में विफल रहता था।
  • SOMA के साथ: रोबोट बहुत तेज़ था। उसे पता था कि कहाँ देखना है, उसने अपना सिर कम घुमाया, और उसने लगभग तुरंत (एक "वन-शॉट" ग्रैब की तरह) वस्तु को पकड़ लिया। वह तब भी सफल रहा जब वस्तु शुरुआत में पूरी तरह से अदृश्य थी।

सारांश

SOMA को एक GPS और एक डायरी के संयोजन के रूप में समझें।

  • मानक रोबोट के पास केवल आँखें होती हैं; यदि वे उसे देख नहीं सकते, तो उसका अस्तित्व नहीं है।
  • SOMA रोबोट के पास आँखें और याददाश्त दोनों होती हैं। वे उन वस्तुओं को "देख" सकते हैं जो वर्तमान में छिपी हुई हैं क्योंकि उन्हें कमरे के 3D स्थान में उनकी स्थिति याद रहती है।

यह रोबोटों को जटिल, वास्तविक दुनिया के वातावरण में कार्य करने की अनुमति देता है जहाँ वस्तुएं लगातार दृष्टि से बाहर और अंदर होती रहती हैं, जिससे वे बहुत अधिक विश्वसनीय सहायक बन जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →