← नवीनतम पेपर
💻 computer science

Utilizing Inpainting for Keypoint Detection for Vision-Based Control of Robotic Manipulators

यह शोध पत्र रोबोटिक मैनिपुलेटर्स के लिए एक नवीन विजुअल सर्वोइंग फ्रेमवर्क प्रस्तुत करता है जो स्वचालित रूप से लेबल की गई, मार्कर रहित प्रशिक्षण छवियों को उत्पन्न करने के लिए इनपेंटिंग-आधारित डेटा संग्रह पाइपलाइन का उपयोग करता है और पूर्ण दृश्यता एवं आंशिक अवरोध (occlusion) दोनों स्थितियों में मजबूत, मॉडल-मुक्त कीपॉइंट डिटेक्शन और नियंत्रण प्राप्त करने के लिए एक रनटाइम इनपेंटिंग मॉडल को अनसेंटेड कलमन फिल्टर के साथ संयोजित करता है।

मूल लेखक: Sreejani Chatterjee, Venkatesh Mullur, Abhinav Gandhi, Berk Calli

प्रकाशित 2026-04-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sreejani Chatterjee, Venkatesh Mullur, Abhinav Gandhi, Berk Calli

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोटिक हाथ को कप उठाने और उसे एक के ऊपर एक रखने (stacking) के लिए सिखाने की कोशिश कर रहे हैं। आमतौर पर, इसके लिए इंजीनियरों को रोबोट के जोड़ों (joints) पर चमकीले, हाई-कंट्रास्ट स्टिकर (जैसे QR कोड या ArUco मार्कर) लगाने पड़ते हैं ताकि कैमरा ठीक से देख सके कि "कोहनी" (elbow) और "कंधे" (shoulder) कहाँ हैं। यह बिल्कुल वैसा ही है जैसे किसी डांसर को ट्रैक करने के लिए डायरेक्टर द्वारा उसके शरीर पर नियॉन टेप लगा देना।

लेकिन क्या होगा अगर आप रोबोट पर स्टिकर नहीं लगा सकते? शायद रोबोट नरम, लचीले पदार्थ से बना है, या स्टिकर काम में बाधा डाल सकते हैं। या शायद रोबोट इतनी तेज़ी से चल रहा है कि स्टिकर धुंधले (blur) हो रहे हैं।

यह पेपर एक चतुर समाधान पेश करता है: रोबोट को बिना किसी स्टिकर के खुद को देखना सिखाएं, यहाँ तक कि तब भी जब चीज़ें उसके दृश्य को बाधित कर रही हों।

इसे कैसे किया गया, इसका विवरण सरल चरणों और उपमाओं (analogies) के साथ यहाँ दिया गया है:

1. "मैजिक इरेज़र" ट्रेनिंग (डेटा संग्रह)

बिना स्टिकर के रोबोट को अपना शरीर कैसा दिखता है, यह सिखाने के लिए शोधकर्ताओं ने दो-चरणीय तकनीक का उपयोग किया:

  • चरण A: उन्होंने अस्थायी रूप से रोबोट पर चमकीले मार्कर चिपकाए और रोबोट के हिलने-डुलने के दौरान हज़ारों तस्वीरें लीं।
  • चरण B: उन्होंने Inpainting (जिसे "मैजिक इरेज़र" या फोटोशॉप के "कंटेंट-अवेयर फिल" की तरह समझें) नामक एक विशेष AI टूल का उपयोग किया, जो डिजिटल रूप से मार्करों को मिटा देता है और खाली जगहों को रोबोट की वास्तविक त्वचा और जोड़ों से भर देता है।

परिणाम: अब उनके पास तस्वीरों का एक विशाल संग्रह है जहाँ रोबोट प्राकृतिक दिखता है (कोई स्टिकर नहीं), लेकिन कंप्यूटर जानता है कि जोड़ कहाँ थे क्योंकि उसे याद है कि स्टिकर पहले कहाँ थे। उन्होंने इस लाइब्रेरी का उपयोग एक "कीपॉइंट डिटेक्टिव" (Keypoint Detective) AI को प्रशिक्षित करने के लिए किया।

2. "कीपॉइंट डिटेक्टिव" (Keypoint Detection)

एक बार प्रशिक्षित होने के बाद, यह AI एक फोटो को देख सकता है और तुरंत धातु के हाथ के प्राकृतिक घुमावों और छाया को देखकर उसके "जोड़ों" (जैसे कंधे, कोहनी और कलाई) की पहचान कर सकता है। यह बिल्कुल वैसा ही है जैसे कोई इंसान एक आकृति (silhouette) को देखकर यह जान जाता है कि व्यक्ति की कोहनियाँ कहाँ हैं, भले ही उसे त्वचा दिखाई न दे रही हो।

3. "इमेजिनेशन इंजन" (Occlusion को संभालना)

यहाँ सबसे पेचीदा हिस्सा आता है: क्या होगा अगर कोई डिब्बा, कोई व्यक्ति, या रोबोट का कोई दूसरा हिस्सा कैमरे के दृश्य को रोक दे? "कीपॉइंट डिटेक्टिव" भ्रमित हो सकता है और कह सकता है, "मैं कोहनी नहीं देख पा रहा हूँ!"

इसे ठीक करने के लिए, शोधकर्ताओं ने एक दूसरा AI जोड़ा, एक इमेजिनेशन इंजन (Imagination Engine)।

  • समस्या: यदि हाथ एक कप के पीछे छिपा हुआ है, तो सामान्य कैमरा केवल एक कप देखता है।
  • समाधान: यह AI रोबोट के दृश्यमान हिस्सों और आसपास के दृश्य को देखता है, और फिर कल्पना (hallucinate/reconstruct) करता है कि छिपे हुए हिस्से को कैसा दिखना चाहिए। यह गायब रोबोटिक शरीर को फिर से बना देता है ताकि "कीपॉइंट डिटेक्टिव" अभी भी जोड़ों को देख सके।
  • उपमा: कल्पना कीजिए कि आप एक बाड़ (fence) के पीछे खड़े अपने दोस्त को देख रहे हैं। आप केवल उनका सिर और पैर देख सकते हैं। आपका मस्तिष्क स्वचालित रूप से उनके बाकी शरीर को "भर" देता है ताकि आप जान सकें कि वे वहाँ खड़े हैं। यह AI गणितीय रूप से और तुरंत यही काम करता है।

4. "स्मूथ ऑपरेटर" (Kalman Filter)

कभी-कभी, "इमेजिनेशन इंजन" गलत अनुमान लगा सकता है, या "कीपॉइंट डिटेक्टिव" थोड़ा अस्थिर (jittery) हो सकता है। रोबोट को झटके देने या हिलने से रोकने के लिए, उन्होंने एक कलमन फ़िल्टर (Kalman Filter) जोड़ा।

  • उपमा: इसे एक भविष्य बताने वाले GPS (predictive GPS) के रूप में सोचें। यदि रोबोट का हाथ सुचारू रूप से दाईं ओर बढ़ रहा है, और एक सेकंड के लिए कैमरा ग्लिच होता है और कहता है कि हाथ अचानक बाईं ओर है, तो GPS जानता है, "यह असंभव है! हाथ दाईं ओर जा रहा था, इसलिए यह अभी भी दाईं ओर ही होना चाहिए।" यह त्रुटियों को सुधारता है और गति को सहज बनाए रखता है।

5. "ब्लाइंड पायलट" (Control)

अंत में, रोबोट इस पूरी जानकारी का उपयोग खुद को चलाने के लिए करता है। उसे किसी 3D मैप की ज़रूरत नहीं है, उसे अपने जोड़ों के सटीक भौतिक विज्ञान (physics) को जानने की ज़रूरत नहीं है, और न ही उसे किसी पैमाने (ruler) की आवश्यकता है। वह बस कैमरे को देखता है, देखता है कि उसके "प्राकृतिक जोड़" (या वे कहाँ होने चाहिए) कहाँ हैं, और लक्ष्य तक पहुँचने के लिए अपने मोटर्स को एडजस्ट करता है।

यह एक बड़ी उपलब्धि क्यों है?

  • स्टिकर की ज़रूरत नहीं: आप इसका उपयोग सॉफ्ट रोबोट्स, सस्ते रोबोट्स, या अव्यवस्थित वातावरण वाले रोबोट्स पर कर सकते हैं जहाँ स्टिकर गिर सकते हैं।
  • 3D कैमरों की ज़रूरत नहीं: यह एक साधारण 2D कैमरे (जैसे वेबकैम) के साथ भी काम करता है।
  • मजबूत (Robust): यह तब भी काम करता रहता है जब चीज़ें दृश्य को बाधित करती हैं, जो कप रखने या कारखाने में पुर्जों को जोड़ने जैसे वास्तविक कार्यों के लिए महत्वपूर्ण है।

संक्षेप में: शोधकर्ताओं ने एक रोबोट को "मैजिक इरेज़र" का उपयोग करके प्रशिक्षण डेटा बनाने, बाधाओं के पार देखने के लिए "इमेजिनेशन इंजन" का उपयोग करने, और गति को स्थिर रखने के लिए "स्मूथ ऑपरेटर" का उपयोग करके अपने शरीर के अंगों को पहचानने के लिए सिखाया। यह रोबोट को केवल एक साधारण कैमरे का उपयोग करके, बिना किसी महंगे सेंसर या भौतिक मार्कर के, खुद को नियंत्रित करने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →