← नवीनतम पेपर
💻 computer science

Deep Learning Aided Vision System for Planetary Rovers

यह शोध पत्र चंद्रयान 3 के नेविकैम (NavCam) डेटा पर 2.26 सेमी की मध्यस्थ गहराई त्रुटि (median depth error) प्राप्त करते हुए, एक वास्तविक समय मॉड्यूल जो CLAHE-उन्नत स्टीरियो इमेजरी और ऑब्जेक्ट डिटेक्शन के लिए YOLOv11n का उपयोग करता है, को सघन 3D पुनर्निर्माण (dense 3D reconstruction) के लिए डेप्थ एनीथिंग V2 (Depth Anything V2) का लाभ उठाने वाले एक ऑफलाइन मॉड्यूल के साथ संयोजित करता है, जो ग्रहों के रोवर्स के लिए एक स्केलेबल और कंप्यूट-कुशल विजन सिस्टम प्रस्तुत करता है।

मूल लेखक: Lomash Relia, Jai G Singla, Amitabh, Nitant Dube

प्रकाशित 2026-03-31
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lomash Relia, Jai G Singla, Amitabh, Nitant Dube

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप चंद्रमा पर एक कार चला रहे हैं। आप दिशा-निर्देशों के लिए अपनी माँ को कॉल नहीं कर सकते क्योंकि सिग्नल को पृथ्वी तक वापस पहुँचने में बहुत समय लगता है। आप ठीक से देख भी नहीं सकते क्योंकि ज़मीन धूसर धूल से ढकी है, छाया एकदम काली है, और कोई सड़क के संकेत (road signs) भी नहीं हैं।

यह पेपर एक नए "स्मार्ट आइज़" (smart eyes) सिस्टम का वर्णन करता है जिसे इस पेचीदा वातावरण में एक रोबोटिक रोवर को सुरक्षित रूप से चलाने में मदद करने के लिए डिज़ाइन किया गया है। यह ऐसा है जैसे रोबोट को एक ऐसा दिमाग देना जो चलते समय बाधाओं को तुरंत देख सके, और फिर बाद में इलाके का नक्शा बनाने के लिए एक सुपर-पावर्ड मेमोरी।

यह सिस्टम कैसे काम करता है, यहाँ इसके सरल भागों में विवरण दिया गया है:

1. दो-भाग वाला दिमाग: "अभी चलाें" बनाम "बाद में मैप करें"

सिस्टम को दो मोड में विभाजित किया गया है, जैसे एक मानव चालक जिसे सड़क पार करते हुए गिलहरी को देखकर तुरंत प्रतिक्रिया देनी होती है, लेकिन बाद में पूरे पड़ोस का नक्शा बनाने के लिए उसके पास एक जीपीएस ऐप भी होता है।

  • "अभी चलाें" मोड (रियल-टाइम): यह भाग रोवर के कंप्यूटर पर चलता है जबकि वह चल रहा होता है। इसे तेज़ और हल्का होना चाहिए, जैसे कि एक स्पोर्ट्स कार, क्योंकि रोवर के पास बोर्ड पर कोई सुपर-कंप्यूटर नहीं होता।
  • "बाद में मैप करें" मोड (ऑफलाइन): यह भाग पृथ्वी पर वापस चलता है जब रोवर तस्वीरें घर भेज देता है। यह लैंडस्केप का एक विस्तृत 3D मॉडल बनाने के लिए भारी कंप्यूटिंग शक्ति का उपयोग करता है, जैसे कि एक वीडियो गेम डिज़ाइनर एक हाई-डेफिनिशन दुनिया बनाता है।

2. "धूसर कोहरे" को ठीक करना (CLAHE)

चंद्रमा की सतह ज्यादातर धूसर धूल (रेगोलिथ) से बनी है जिसमें कंट्रास्ट बहुत कम है। यह एक मंद कमरे में धूसर कालीन पर धूसर बिल्ली को देखने जैसा है।

  • समाधान: रोबोट कुछ भी देखने की कोशिश करने से पहले, सिस्टम CLAHE नामक एक फ़िल्टर लागू करता है। इसे "नाइट विजन" चश्मे पहनने जैसा समझें जो छाया को चमका देता है और चट्टानों के किनारों को उभार देता है, जिससे एक धुंधली धूसर छवि एक स्पष्ट छवि में बदल जाती है जिसे पढ़ा जा सके।

3. चट्टानों को पहचानना (YOLO)

एक बार जब छवि स्पष्ट हो जाती है, तो रोबोट को यह जानने की ज़रूरत है कि वह क्या देख रहा है। क्या वह एक बड़ी चट्टान है? एक गड्ढा है? या सिर्फ एक छाया है?

  • टूल: वे YOLOv11n नामक एक मॉडल का उपयोग करते हैं। एक बहुत ही तेज़, छोटे सुरक्षा गार्ड की कल्पना करें जो भीड़ को स्कैन कर सकता है और बिना थके तुरंत चिल्ला सकता है, "चट्टान! चट्टान! अवशेष!"
  • ट्रिक: पूरी छवि को स्कैन करने के बजाय (जो धीमा है), रोबोट केवल उन विशिष्ट बॉक्सों पर करीब से देखता है जहाँ उसे लगता है कि कोई वस्तु है। यह पूरी दीवार को घूरने के बजाय केवल संदिग्ध स्थानों पर आवर्धक लेंस (magnifying glass) का उपयोग करने जैसा है।

4. दूरी का अनुमान लगाना (न्यूरल नेटवर्क)

यह जानना कि वस्तु क्या है काफी नहीं है; रोवर को टकराने से बचने के लिए यह जानने की ज़रूरत है कि वह कितनी दूर है।

  • पुराना तरीका: पारंपरिक रूप से, रोबोट दूरी मापने के लिए दो कैमरा एंगल्स की तुलना करके जटिल गणित (त्रिकोणमिति/triangulation) का उपयोग करते हैं। यह अपने अंगूठे को ऊपर रखने और फिर एक आँख बंद करके, फिर दूसरी आँख बंद करके, यह अनुमान लगाने जैसा है कि आपका अंगूठा कितनी दूर है। यह गणित भारी और धीमा है।
  • नया तरीका: लेखकों ने एक न्यूरल नेटवर्क (एक प्रकार का AI) को पैटर्न सीखने के लिए प्रशिक्षित किया है। उन्होंने इसे हजारों उदाहरण दिखाए जहाँ गणित पहले से ही किया जा चुका था। अब, AI एक अनुभवी विशेषज्ञ की तरह काम करता है जो एक चट्टान को देखते ही तुरंत कह सकता है, "यह 3 मीटर दूर है," बिना उस भारी गणित को किए। यह दिमाग में टिप (tip) की गणना करने बनाम बस नियम को जानने के बीच का अंतर है।

5. 3D दुनिया बनाना (Depth Anything V2)

जब रोबोट चल रहा होता है, तो वह तस्वीरें भी लेता है। बाद में, पृथ्वी पर, वैज्ञानिक Depth Anything V2 नामक एक शक्तिशाली AI का उपयोग करते हैं।

  • जादू: यह AI एक एकल सपाट फोटो को देख सकता है और अनुमान लगा सकता है कि हर चीज़ कितनी गहरी है, जिससे एक 2D तस्वीर एक 3D मूर्ति में बदल जाती है।
  • परिणाम: वे रोबोट के त्वरित दूरी के अनुमानों को इस विस्तृत 3D मानचित्र के साथ जोड़ते हैं ताकि एक "पॉइंट क्लाउड" (point cloud) बनाया जा सके—बिंदुओं का एक डिजिटल बादल जो चंद्रमा की सतह का प्रतिनिधित्व करता है। यह एक पहाड़ की फोटो लेने और फिर उसे 3D में प्रिंट करने जैसा है ताकि आप उसकी चोटियों और घाटियों को महसूस कर सकें।

यह एक बड़ी बात क्यों है?

  • गति: रोबोट पृथ्वी का इंतज़ार किए बिना रियल-टाइम में निर्णय ले सकता है।
  • सटीकता: परीक्षणों में, AI ने 1 और 10 मीटर के बीच की वस्तुओं के लिए केवल लगभग 2.26 सेंटीमीटर (एक इंच से भी कम) की त्रुटि के साथ दूरी का अनुमान लगाया। यह कमरे के दूसरी ओर से लक्ष्य के केंद्र (bullseye) को हिट करने जैसा है।
  • दक्षता: यह कम कंप्यूटर शक्ति का उपयोग करता है, जो बहुत महत्वपूर्ण है क्योंकि रोवर बैटरी और सौर पैनलों पर चलते हैं।

संक्षेप में: यह पेपर एक स्मार्ट, दो-चरणीय विज़न सिस्टम प्रस्तुत करता है। यह रोवर को हल्के वजन वाले AI का उपयोग करके चट्टानों से बचने के लिए "स्ट्रीट स्मार्ट्स" देता है, और वैज्ञानिकों के अध्ययन के लिए बाद में चंद्रमा का एक सटीक 3D मानचित्र बनाने के लिए "बुक स्मार्ट्स" प्रदान करता है। यह चंद्रमा और मंगल की स्वतंत्र रूप से खोज करने वाले रोबोट भेजने की दिशा में एक बड़ा कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →