← नवीनतम पेपर
💻 computer science

SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments

SeededGrasp एक डेटा-कुशल फ्रेमवर्क है जो एक विजन-लैंग्वेज मॉडल का उपयोग करके एक लाइटवेट ग्रैस्प जनरेटर के लिए सीड पॉइंट (seed point) की भविष्यवाणी करता है, जिससे उच्च-स्तरीय सिमेंटिक रीजनिंग को निम्न-स्तरीय ज्यामितीय निष्पादन से अलग किया जाता है, जो बिना महंगे एंड-टू-एंड प्रशिक्षण के जटिल दृश्यों में मजबूत, मल्टी-एम्बॉडिमेंट ग्रैस्पिंग को सक्षम बनाता है।

मूल लेखक: Yang Xu, Gurpreet Singh Mukker, Raymond Wang, Jasper Gerigk, Maria Attarian, Igor Gilitschenski

प्रकाशित 2026-07-23
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yang Xu, Gurpreet Singh Mukker, Raymond Wang, Jasper Gerigk, Maria Attarian, Igor Gilitschenski

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक रोबोट एक बिखरे हुए बेडरूम के फर्श से एक खिलौना उठाने की कोशिश कर रहा है। एक इंसान के लिए, यह आसान है: आप खिलौने को देखते हैं, आप जानते हैं कि उसका हैंडल कहाँ है, और आप उसे पकड़ लेते हैं। लेकिन एक रोबोट के लिए, दुनिया आकारों और परछाइयों का एक भ्रमित करने वाला जंजाल है। उसे एक साथ दो बहुत अलग चीजों को समझने की जरूरत है: "बड़ी तस्वीर" (मेरा लक्ष्य क्या है? "लाल कप को उसके हैंडल से उठाओ") और "बारीक विवरण" (मुझे अपनी उंगलियां ठीक कहाँ रखनी चाहिए ताकि मैं लैंप को न गिरा दूँ?)। यह रोबोटिक ग्रैस्पिंग (robotic grasping) की चुनौती है। लंबे समय तक, रोबोट या तो बहुत समझदार लेकिन अनाड़ी थे (वे जानते थे कि क्या करना है लेकिन वे चीजों को छूने के भौतिक विज्ञान को नहीं समझ पाते थे) या भौतिक विज्ञान में बहुत अच्छे लेकिन बुद्धिहीन थे (वे कुछ भी पकड़ सकते थे, लेकिन केवल तभी जब आप उन्हें ठीक से बताएं कि कहाँ पकड़ना है, बिना भाषा को समझे)। वैज्ञानिक एक ऐसा रोबोट बनाने की कोशिश कर रहे हैं जो एक साधारण वाक्य जैसे "टोकरी को उसके हैंडल से पकड़ो" को सुन सके और फिर यह पता लगा सके कि उसे पकड़ने का सही तरीका क्या है, यहाँ तक कि एक बिखरे हुए कमरे में भी, विभिन्न प्रकार के रोबोटिक हाथों का उपयोग करके।

यहाँ सीडेडग्रैस्प (SeededGrasp) आता है, जो एक चतुर टीम की तरह काम करता है: एक "मस्तिष्क" और एक "हाथ"। एक विशाल, सुपर-कॉम्प्लेक्स रोबोट मस्तिष्क को एक साथ सब कुछ सिखाने की कोशिश करने के बजाय (जो कि एक कुत्ते को फेच (fetch) खेलना सीखने के साथ-साथ कैलकुलस सिखाने जैसा है), शोधकर्ताओं ने इस काम को विभाजित कर दिया। सबसे पहले, वे एक शक्तिशाली विज़न-लैंग्वेज मॉडल (VLM) का उपयोग करते हैं—इसे एक सुपर-स्मार्ट AI के रूप में सोचें जो पढ़ और देख सकता है—जो बिखरे हुए दृश्य और निर्देश को देखता है। यह AI सटीक उंगली की स्थिति की गणना करने की कोशिश नहीं करता है; इसके बजाय, यह केवल वस्तु पर एक एकल "सीड पॉइंट" (seed point) की ओर इशारा करता है, जैसे कि एक डिजिटल थंबटैक, जहाँ से पकड़ शुरू होनी चाहिए। यह एक इंसान के "इसे ठीक वहीं से पकड़ो" कहने और उंगली दिखाने जैसा है।

एक बार जब यह "सीड पॉइंट" लगा दिया जाता है, तो एक दूसरा, हल्का मॉडल कार्यभार संभाल लेता है। यह मॉडल एक अत्यधिक कुशल मैकेनिक की तरह है जो जानता है कि उस एक बिंदु के आधार पर रोब투 के हाथों को ठीक से कैसे हिलाना है। चूंकि भाषा को समझने का भारी काम पहले AI द्वारा किया गया है, और ज्यामिति (geometry) का भारी काम दूसरे द्वारा किया गया है, इसलिए वे बहुत कुशलता से एक साथ काम कर सकते हैं। शोधकर्ताओं ने इसका परीक्षण तीन अलग-अलग प्रकार के रोबोटिक हाथों (एक मानक दो-उंगली वाला ग्रिपर, एक तीन-उंगली वाला ग्रिपर, और कई जोड़ों वाला एक बहुत ही कुशल हाथ) पर एक सिम्युलेटेड बिखरे हुए कमरे में किया। उन्होंने पाया कि यह "सीड पॉइंट" दृष्टिकोण अविश्वसनीय रूप से अच्छा काम करता है, जिससे सिमुलेशन में 72% सफलता दर प्राप्त हुई। और भी अधिक प्रभावशाली बात यह है कि जब उन्होंने एक वास्तविक रोबोट पर वास्तविक दुनिया में इसे आजमाया, तो यह 78% बार सफल रहा।

यह पेपर कुछ सामान्य विचारों का खंडन भी करता है। यह सुझाव देता है कि एक विशाल मॉडल को शुरुआत से ही सब कुछ करने के लिए प्रशिक्षित करना बहुत महंगा और डेटा-भूखा है। यह यह भी दिखाता है कि केवल एक VLM का उपयोग करके पूरे ग्रैस्प पोज का अनुमान लगाना अक्सर गलतियों की ओर ले जाता है क्योंकि AI 3D ज्यामिति से भ्रमित हो जाता है। इसके बजाय, "सीड पॉइंट" एक आदर्श सेतु के रूप में कार्य करता है, जिससे स्मार्ट AI भाषा को संभालता है और विशेष मॉडल भौतिकी को संभालता है। यह साबित करने के लिए कि यह काम करता है, टीम ने केवल मौजूदा डेटा पर भरोसा नहीं किया; उन्होंने अपने सिस्टम को प्रशिक्षित करने के लिए 2.56 मिलियन ग्रैस्प्स का एक बिल्कुल नया, विशाल डेटासेट बनाया जो 610 बिखरे हुए दृश्यों में फैला हुआ था। हालांकि परिणाम बहुत आशाजनक हैं, लेखक नोट करते हैं कि इसका परीक्षण सिमुलेशन और विशिष्ट सेटअप के साथ वास्तविक दुनिया के परीक्षणों में किया गया था, और यह सुनिश्चित करने के लिए अभी भी काम किया जाना बाकी है कि रोबोट का हाथ हर उस जगह तक पहुँच सके जहाँ "सीड" इशारा करता है बिना बाधाओं से टकराए। लेकिन फिलहाल, SeededGasp रोबोट को सुनने, देखने और एक उंगली के इशारे की मदद से पकड़ने के लिए सिखाने का एक मजेदार और प्रभावी तरीका दिखाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →