← नवीनतम पेपर
💻 computer science

Towards Fine-Grained Object Manipulation: SAM3-Guided Visuomotor Policy with Persistent Memory Learning and Focused Visual Conditioning

यह शोध पत्र एक SAM3-निर्देशित विज़ुओमोटर फ्रेमवर्क प्रस्तुत करता है जिसमें निरंतर वस्तु स्मृति के लिए FOM-SAM3 और केंद्रित दृश्य अनुकूलन के लिए FSAE शामिल है, जो रोबोटों को विचलित करने वाले तत्वों और दृश्य समानताओं के बीच सूक्ष्म वस्तुओं को मजबूती से पहचानने और हेरफेर करने में सक्षम बनाता है।

मूल लेखक: Haolong Meng, Fangbo Qin, Mengchen Bai, Houwu Wang, Cirong Liu, Shan Yu

प्रकाशित 2026-09-21
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haolong Meng, Fangbo Qin, Mengchen Bai, Houwu Wang, Cirong Liu, Shan Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट लंबे समय से व्यापक, व्यापक कार्यों के विशेषज्ञ रहे हैं: एक कप उठाना, एक डिब्बा हिलाना, या ब्लॉक्स को एक के ऊपर एक रखना। इन कामों के लिए, एक रोबोट की "आंखें" आमतौर पर पूरे कमरे को स्कैन करती हैं, और किसी भी ऐसी वस्तु को ढूंढती हैं जो "कप" या "डिब्बा" जैसे सामान्य विवरण में फिट बैठती हो। यह दृष्टिकोण तब अच्छा काम करता है जब लक्ष्य केवल एक कप उठाना हो। लेकिन वास्तविक दुनिया कहीं अधिक विशिष्ट है। कल्पना कीजिए कि एक इंसान ने आपसे शेल्फ पर रखी स्ट्रॉबेरी जूस के एक विशिष्ट लाल कैन को उठाने के लिए कहा, जहाँ सोडा के लाल कैन, पानी के नीले कैन और चाय के हरे कैन भरे पड़े हों। एक इंसान तुरंत ब्रांड, स्वाद और लेबल के सूक्ष्म अंतरों को पहचान लेता है। हालांकि, एक मानक रोबोट अक्सर केवल "लाल कैन" देखता है और गलत वाला उठा लेता है, या अव्यवस्था से भ्रमित हो जाता है। सामान्य वस्तु पहचान और सूक्ष्म विवरणों (जैसे एक विशिष्ट मॉडल, रंग पैटर्न, या ब्रांड) को पहचानने की क्षमता के बीच का यह अंतर ही 'फाइन-ग्रेन्ड मैनिपुलेशन' (सूक्ष्म हेरफेर) की सीमा है। चुनौती केवल वस्तु को देखने की नहीं है, बल्कि कई लगभग समान दिखने वाली वस्तुओं के बीच से सही वस्तु को पहचानने और फिर सटीकता के साथ उस पर कार्य करने की है।

शोधकर्ताओं की एक टीम ने एक नया सिस्टम विकसित किया है जो रोबोट को यह अंतर करना सिखाता है, जिससे वे विजुअली समान "जुड़वा" वस्तुओं के बीच भी विशिष्ट वस्तुओं को संभाल सकते हैं। उनका दृष्टिकोण, जो हाल ही के एक अध्ययन में विस्तृत है, इस विचार से आगे बढ़ता है कि हर बार किसी नई वस्तु के मिलने पर रोबोट को शून्य से नया कौशल सिखाया जाए। इसके बजाय, उन्होंने एक तरीका बनाया जिससे रोबोट उन विशिष्ट वस्तुओं की एक स्थायी स्मृति (मेमोरी) बना सके जिन्हें उसने पहचानना सीखा है। यह सिस्टम एक शक्तिशाली विजुअल फाउंडेशन मॉडल पर आधारित है जिसे SAM3 के रूप में जाना जाता है, जो छवियों में वस्तुओं को खोजने और उनकी रूपरेखा बनाने में उत्कृष्ट है। हालांकि, इस मॉडल का मानक संस्करण सीमित है; इसे "एक कप" खोजने के लिए कहा जा सकता है, लेकिन यह "किनारे पर चिप वाला वह विशिष्ट नीला कप" खोजने में संघर्ष करता है जब उसके ठीक बगल में एक लगभग समान नीला कप रखा हो। शोधकर्ताओं ने एक "मेमोरी बैंक" बनाकर इस समस्या को हल किया, जहाँ रोबroट उन विशिष्ट वस्तुओं के लिए अद्वितीय डिजिटल फिंगरप्रिंट स्टोर करता है जिन्हें उसे सीखना है।

इस मेमोरी को बनाने के लिए, शोधकर्ताओं ने पूरे विशाल विजुअल सिस्टम को फिर से प्रशिक्षित (रिट्रेन) नहीं किया, जो धीमा और गणनात्मक रूप से महंगा होता। इसके बजाय, उन्होंने मुख्य विजुअल इंजन को स्थिर रखा और उसे एक नया तरीका सिखाया: कैसे विशिष्ट 'टोकन' के एक सेट को एक विशिष्ट वस्तु के साथ जोड़ा जाए। उन्होंने रोबोट को एक सादे बैकग्राउंड के सामने लक्षित वस्तु, जैसे कि एक लाल वोंटे स्ट्रॉबेरी जूस कैन, की कुछ दर्जन तस्वीरें दिखाईं। उस विशिष्ट कैन को अन्य लाल कैनों से अलग बनाने वाली चीजों को सीखने की प्रक्रिया के माध्यम से, सिस्टम ने मेमोरी टोकन का एक संक्षिप्त सेट तैयार किया। ये टोकन उस विशिष्ट वस्तु के लिए एक स्थायी आईडी कार्ड की तरह कार्य करते हैं। एक बार स्टोर होने के बाद, रोबोट इस आईडी कार्ड को तब भी प्राप्त कर सकता है जब उसे उस विशिष्ट कैन को फिर से ढूंढना हो, भले ही वह कैन किसी दूसरे कमरे में हो, अलग रोशनी में हो, या भ्रमित करने वाले समान दिखने वाले साथियों से घिरा हो। यह रोबोट को केवल मेमोरी टोकन को बदलकर कार्यों के बीच स्विच करने की अनुमति देता है, न कि पूरे कार्य को फिर से सीखने की आवश्यकता होती है।

दूसरा प्रमुख नवाचार यह है कि रोबोट इस मेमोरी का उपयोग निर्णय लेने के लिए कैसे करता है। कई रोबोटिक सिस्टम में, विजुअल जानकारी पूरे दृश्य का एक धुंधला मिश्रण होती है, जो रोबोट के निर्णय लेने की प्रक्रिया को विचलित कर सकती है। शोधकर्ताओं ने 'फोकस्ड स्पेशियल-अपीयरेंस एनकोडिंग' नामक एक विधि पेश की। यह तकनीक रोबोट को लक्ष्य वस्तु के बाहर की हर चीज़ को अनदेखा करने के लिए मजबूर करती है। यह मेमोरी टोकन द्वारा पहचाने गए लक्ष्य के सटीक आकार और स्थान को लेती है, और केवल उस आकार के भीतर के विजुअल विवरणों को निकालती है। यह इसे उस स्थान के सटीक निर्देशांकों (कोऑर्डिनेट्स) के साथ जोड़ती है जहाँ वस्तु रखी है। रोबोट के एक्शन प्लानर को केवल यह केंद्रित, उच्च-गुणवत्ता वाला डेटा फीड करके, सिस्टम यह सुनिश्चित करता है कि रोबोट उस विशिष्ट वस्तु पर प्रतिक्रिया दे रहा है जिसे उसे ढूंढने के लिए कहा गया था, न कि बैकग्राउंड की अव्यवस्था या समान दिखने वाले पड़ोसियों पर। इस केंद्रित दृश्य को फिर रोबोट के कंट्रोल सॉफ्टवेयर को पास किया जाता है, जो वस्तु को पकड़ने या धकेलने के लिए आवश्यक सुचारू गतिविधियों की गणना करता है।

शोधकर्ताओं ने इस सिस्टम का परीक्षण एक वास्तविक रोबोटिक आर्म पर किया जो दो कैमरों से लैस था, जिसमें से एक टेबल का थर्ड-पर्सन व्यू प्रदान करता था और दूसरा आर्म पर लगा हुआ था जो फर्स्ट-पर्सन पर्सपेक्टिव प्रदान करता था। उन्होंने तीस विभिन्न भौतिक वस्तुओं का एक डेटासेट बनाया, जिनमें कैन और कप से लेकर ढक्कन और बॉक्स तक शामिल थे, जिनमें से कई के विजुअली समान समकक्ष भी थे। परीक्षणों के एक सेट में, रोबोट को एक विशिष्ट कैन उठाने के लिए कहा गया जबकि उसी रंग के अन्य कैन (जो अलग ब्रांड के थे) पास में रखे गए थे। मानक रोबोटिक नीतियां, जो सामान्य दृश्य विवरणों पर निर्भर करती हैं, इन परिदृश्यों में अक्सर विफल रहीं, या तो गलत कैन उठा लेती थीं या विचलित करने वाली वस्तुओं से भ्रमित हो जाती थीं। हालांकि, नए सिस्टम ने लगभग सभी परीक्षणों में सही लक्ष्य की सफलतापूर्वक पहचान की और उसे संचालित किया। जब शोधकर्ताओं ने लक्ष्य को उसी प्रकार की लेकिन अलग ब्रांड की वस्तु से बदल दिया, तो रोबोट ने बिना किसी नए प्रशिक्षण या प्रदर्शन के, बस नया मेमोरी टोकन प्राप्त किया और कार्य को सही ढंग से पूरा किया।

परिणामों ने दिखाया कि सिस्टम उन वस्तुओं के बीच अंतर कर सकता है जो विजुअली लगभग एक जैसी हैं, एक ऐसा कार्य जिसने अन्य विधियों को उलझा दिया था। उन परीक्षणों में जहाँ रोबोट को समान वस्तुओं के समूह में से एक विशिष्ट वस्तु को चुनना था, नए दृष्टिकोण ने उच्च सफलता दर बनाए रखी, जबकि अन्य विधियों के प्रदर्शन में काफी गिरावट आई। सिस्टम ने यह भी सिद्ध किया कि जब रोबोट को वस्तु को एक नई जगह पर ले जाना था, तो वह कितना मजबूत था, क्योंकि फोकस्ड विजुअल एनकोडिंग ने वस्तु की बदलती स्थिति और दिशा को ट्रैक करने में मदद की। शोधकर्ताओं ने नोट किया कि सिस्टम पूर्ण नहीं है; यदि किसी वस्तु की अनूठी विशेषताएं छिपी हुई हैं, जैसे कि कैन का लेबल कैमरे से दूसरी ओर मुड़ा हुआ है, तो रोबोट उसे पहचान नहीं सकता है। इसके अतिरिक्त, लक्ष्य पर बहुत सख्ती से ध्यान केंद्रित करके, रोबोट दृश्य में अन्य बाधाओं को मिस कर सकता है, जो जटिल वातावरण में नेविगेट करने के लिए एक सीमा हो सकती है। फिर भी, यह कार्य रोबोट को वास्तविक दुनिया के सूक्ष्म, विशिष्ट मांगों को संभालने की क्षमता देने की दिशा में एक महत्वपूर्ण कदम प्रदर्शित करता है, जिससे वे सामान्य 'ग्रैबर' से सटीक ऑपरेटर बन जाते हैं जो परिचित को भ्रमित करने वाली चीजों से अलग पहचान सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →