← नवीनतम पेपर
💻 computer science

Hydra: Marker-Free RGB-D Hand-Eye Calibration

यह शोध पत्र हाइड्रा (Hydra) को प्रस्तुत करता है, जो एक मार्कर-मुक्त RGB-D हैंड-आई कैलिब्रेशन विधि है जो ली बीजगणित (Lie algebra) आधारित इटरेटिव क्लोजेस्ट पॉइंट एल्गोरिदम का उपयोग करती है जो मौजूदा बेसलाइन की तुलना में काफी उच्च अभिसरण दर, तेज़ प्रसंस्करण समय और बेहतर टास्क-स्पेस सटीकता प्राप्त करती है, साथ ही ओपन-सोर्स कोड और ROS 2 एकीकरण भी प्रदान करती है।

मूल लेखक: Martin Huber, Huanyu Tian, Christopher E. Mower, Lucas-Raphael Müller, Sébastien Ourselin, Christos Bergeles, Tom Vercauteren

प्रकाशित 2026-09-02
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Martin Huber, Huanyu Tian, Christopher E. Mower, Lucas-Raphael Müller, Sébastien Ourselin, Christos Bergeles, Tom Vercauteren

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट जो अपने हाथों और आँखों से चलते हैं, विज्ञान कथाओं (साइंस फिक्शन) का एक मुख्य हिस्सा हैं, लेकिन वास्तविक दुनिया में, किसी मशीन को यह सिखाना कि उसका हाथ अंतरिक्ष में कहाँ है, एक आश्चर्यजनक रूप से कठिन इंजीनियरिंग पहेली है। यह चुनौती, जिसे हैंड-आई कैलिब्रेशन (hand-eye calibration) कहा जाता है, रोबोट को यह सिखाने की प्रक्रिया है कि वह अपने कैमरे से प्राप्त डेटा को अपने स्वयं के जोड़ों (joints) की भाषा में कैसे अनुवादित करे। इस अनुवाद के बिना, एक रोबोट किसी वस्तु को स्पष्ट रूप से देख तो सकता है, लेकिन गलत स्थान पर पहुँच सकता है, या यह समझने में विफल हो सकता है कि उसकी अपनी गतिविधियों से उसके देखने के नजरिए में क्या बदलाव आता है। दशकों तक, इस समस्या का मानक समाधान भौतिक निशानों (physical markers) पर निर्भर रहा है—रोबोट या वातावरण पर रखे गए विशेष पैटर्न या स्टिकर जिन्हें कैमरा आसानी से पहचान सके। प्रभावी होने के बावजूद, ये निशान नाजुक होते हैं; यदि वे छिप जाते हैं, क्षतिग्रस्त हो जाते हैं, या बस कैमरे के दृश्य में नहीं होते हैं, तो कैलिब्रेशन विफल हो जाता है। यह सीमा रोबोट को उन अव्यवस्थित, अप्रत्याशित वातावरणों में तैनात करना कठिन बनाती है जहाँ ऐसे निशानों की गारंटी नहीं दी जा सकती।

शोधकर्ताओं की एक टीम ने अब बिना किसी निशान के इस समस्या को हल करने का एक नया तरीका विकसित किया है। उनकी विधि, जिसे वे हाइड्रा (Hydra) कहते हैं, रोबोट को केवल अपने हाथ को देखकर खुद को कैलिब्रेट करने की अनुमति देती है। विशेष स्टिकर पर निर्भर रहने के बजाय, यह प्रणाली रोबोट के धातु के लिंक्स और जोड़ों के आकार को कैप्चर करने के लिए एक कैमरे का उपयोग करती है, और फिर उस दृश्य आकार को रोबोट के डिजिटल मॉडल के साथ मिलाती है। शोधकर्ताओं ने इस दृष्टिकोण का परीक्षण तीन अलग-अलग प्रकार के रोबोटिक आर्म्स और दो अलग-अलग कैमरों पर किया, जिससे पता चला कि सिस्टम लगभग सभी मामलों में रोबोट के विजन को उसकी गति के साथ सफलतापूर्वक संरेखित (align) कर सकता है। उल्लेखनीय रूप से, नई विधि रोबोटिक आर्म की केवल तीन यादृच्छिक (random) स्थितियों के साथ काम करती है, और ऐसी सटीकता प्राप्त करती है जो निशानों का उपयोग करने वाली विधियों की बराबरी करती है, लेकिन एक ऐसी गति के साथ जो मार्कर-मुक्त प्रयासों की तुलना में दो क्रम (two orders of magnitude) अधिक तेज़ है।

हाइड्रा के पीछे का मूल विचार रोबोट के हाथ को केवल चलते हुए हिस्सों के संग्रह के रूप में नहीं, बल्कि एक एकल, ठोस 3D वस्तु के रूप में मानना है जिसे कैमरे द्वारा कैप्चर किए गए बिंदुओं के क्लाउड (cloud of points) के साथ मिलाया जा सके। अतीत में, शोधकर्ताओं ने विशिष्ट बिंदुओं को पहचानने के लिए जटिल कंप्यूटर प्रोग्रामों को प्रशिक्षित करने का प्रयास किया था, या भारी कम्प्यूटेशनल तकनीकों का उपयोग किया था जो यह सिम्युलेट करती थीं कि प्रकाश रोबोट की सतह से कैसे टकराता है। ये पुरानी विधियाँ अक्सर धीमी थीं और स्थानीय त्रुटियों (local errors) में फंस जाती थीं, जिसका अर्थ था कि रोबोट को लगता था कि वह कैलिब्रेटेड है जबकि वास्तव में वह थोड़ा गलत था। हाइड्रा टीम ने एक अलग रास्ता अपनाया। उन्होंने वीडियो फीड से रोबोट को बैकग्राउंड से अलग करने के लिए एक आधुनिक इमेज-एनालिसिस टूल का उपयोग किया, जिससे केवल हाथ का एक साफ 3D मैप तैयार हुआ। इसके बाद उन्होंने इस मैप की तुलना रोबोट के ज्ञात डिजिटल ब्लूप्रिंट से की, और दोनों आकृतियों को एक-दूसरे के विरुद्ध तब तक स्लाइड किया जब तक कि वे पूरी तरह से फिट न हो गईं।

इस फिटिंग प्रक्रिया को मजबूत बनाने के लिए, शोधकर्ताओं ने एक गणितीय दृष्टिकोण तैयार किया जो केवल व्यक्तिगत बिंदुओं के बजाय रोबोट की सतहों पर ध्यान केंद्रित करता है। कल्पना कीजिए कि आप पहेली के दो टुकड़ों को एक साथ फिट करने की कोशिश कर रहे हैं; यदि टुकड़े थोड़े घिसे हुए हैं तो केवल कोनों को देखना भ्रामक हो सकता है, लेकिन यह देखना कि सपाट किनारे एक-दूसरे के विरुद्ध कैसे फिसलते हैं, बहुत अधिक स्थिर संबंध प्रदान करता है। टीम की विधि इस सतह संरेखण (surface alignment) के सिद्धांत का उपयोग करती है ताकि सही स्थिति पाई जा सके। उन्होंने एक सुरक्षा तंत्र भी बनाया जो छाया या प्रतिबिंब जैसे भ्रामक डेटा बिंदुओं को अनदेखा करता है, जो अक्सर अन्य प्रणालियों को भ्रमित करते हैं। यह रोबोट को सही संरेखण खोजने की अनुमति देता है, भले ही कैमरा दृश्य दोषपूर्ण हो या रोबोट एक अव्यवस्थित स्थान में हो।

उनके प्रयोगों के परिणाम प्रभावशाली थे। जब तीन अलग-अलग रोबोटिक आर्म्स—एक बड़ा मेडिकल रोबोट, एक कॉम्पैक्ट डेस्कटॉप आर्म, और एक हल्का औद्योगिक मॉडल—पर परीक्षण किया गया, तो सिस्टम केवल तीन यादृच्छिक स्थितियों का उपयोग करके लगभग 90% प्रयासों में सफलतापूर्वक कैलिब्रेट करने में सफल रहा। गति के मामले में, प्रक्रिया को पूरा करने में एक सेकंड से भी कम समय लगा, जो कि अन्य मार्कर-मुक्त विधियों की तुलना में काफी तेज़ है जो दो मिनट से अधिक का समय ले सकती हैं। कैलिब्रेशन की सटीकता भी प्रभावशाली थी, जिसमें रोबोट का हाथ वास्तविक दुनिया में इच्छित लक्ष्य के 5 मिलीमीटर के भीतर पहुँच गया। यह पुराने मार्कर-मुक्त तकनीकों की तुलना में एक महत्वपूर्ण सुधार है, जिनके परिणामस्वरूप अक्सर 7 मिलीमीटर या उससे अधिक की त्रुटियां होती थीं। हालांकि निशानों का उपयोग करने वाली विधियां कभी-कभी थोड़ी अधिक सटीक हो सकती हैं, लेकिन नया दृष्टिकोण उन निशानों की आवश्यकता को पूरी तरह से समाप्त कर देता है, जिससे यह प्रक्रिया उन उपयोगकर्ताओं के लिए बहुत सरल हो जाती है जो अपने उपकरणों पर स्टिकर नहीं लगाना चाहते।

इस कार्य का सबसे व्यावहारिक पहलू यह है कि इसके लिए रोबोट का कोई विशिष्ट ब्रांड या मॉडल होना आवश्यक नहीं है। क्योंकि यह प्रणाली जोड़ों के पूर्व-प्रोग्राम किए गए ज्ञान के बजाय रोबोट के सामान्य आकार पर निर्भर करती है, इसे लगभग किसी भी 'सीरियल मैनिपुलेटर' (serial manipulator) पर लागू किया जा सकता है, जो कि जुड़े हुए खंडों वाले सामान्य प्रकार के रोबोटिक आर्म का तकनीकी शब्द है। शोधकर्ताओं ने अपने सॉफ्टवेयर और अपने प्रयोगों के डेटा को जनता के लिए उपलब्ध कराया है, जिससे अन्य इंजीनियर इस विधि का परीक्षण और सुधार कर सकें। उन्होंने इस प्रणाली को एक मानक रोबोलॉजी सॉफ्टवेयर प्लेटफॉर्म में भी एकीकृत किया है, जिसका अर्थ है कि डेवलपर्स अब न्यूनतम प्रयास के साथ इस क्षमता को अपने स्वयं के रोबोट में जोड़ सकते हैं।

इस अध्ययन की कुछ सीमाएँ भी हैं। वर्तमान में सिस्टम को एक ऐसे कैमरे की आवश्यकता होती है जो गहराई (depth) को माप सके, जिसका अर्थ है कि यह केवल एक मानक 2D कैमरे के साथ काम नहीं कर सकता। यह प्रारंभिक वीडियो फ्रेम में रोबोट को संक्षिप्त रूप से इंगित करने के लिए एक मानव पर भी निर्भर करता है, हालांकि यह इंटरैक्शन न्यूनतम है। इसके अलावा, इस विधि का परीक्षण स्थिर वातावरण में किया गया था जहाँ कैमरा और रोबोट कैलिब्रेशन के दौरान नहीं हिलते हैं, इसलिए यह अभी उन रोबोटों के लिए तैयार नहीं है जो लगातार गति में रहते हैं। इन बाधाओं के बावजूद, यह कार्य रोबोटों को अधिक स्वायत्त और तैनात करने में आसान बनाने की दिशा में एक महत्वपूर्ण कदम है। मार्कर-आधारित प्रणालियों की सटीकता से मेल खाने के लिए भविष्य के काम में गतिशील सेटअप (moving setups) के लिए विधि को अनुकूलित करने और सटीकता को और अधिक परिष्कृत करने पर ध्यान केंद्रित करने का सुझाव दिया गया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →