← नवीनतम पेपर
🤖 AI

Adaptive Cost-Sensitive Machine Learning for Autonomous Robot Navigation Failure Prediction: When Not All Errors Are Equal

यह शोध पत्र एक अनुकूली लागत-संवेदनशील मशीन लर्निंग फ्रेमवर्क प्रस्तावित करता है जो श्रेणीगत गंभीरता और वास्तविक समय के भौतिक संदर्भ (जैसे वेग, निकटता और संवेदन अनिश्चितता) दोनों के आधार पर नेविगेशन विफलता भविष्यवाणियों को गतिशील रूप से भारित करता है, जो सिम्युलेटेड और वास्तविक दुनिया के रोबोट नेविगेशन परिदृश्यों में फिक्स्ड-वेटिंग बेसलाइनों की तुलना में छूटे हुए उच्च-जोखिम वाले आयोजनों और टकराव लागतों में महत्वपूर्ण कमी प्रदर्शित करता है।

मूल लेखक: Rifa Ferzana

प्रकाशित 2026-09-09
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rifa Ferzana

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

स्वायत्त रोबोट गोदामों, अस्पतालों और यहाँ तक कि शहर की सड़कों पर भी आम होते जा रहे हैं, जिन्हें बिना मानवीय सहायता के एक बिंदु से दूसरे बिंदु तक जाने का कार्य सौंपा गया है। ऐसा करने के लिए, वे सेंसर और सॉफ्टवेयर के एक जटिल मिश्रण पर निर्भर करते हैं जो दुनिया का एक नक्शा बनाता है और उसके माध्यम से एक मार्ग निर्धारित करता है। वर्षों से, शोधकर्ताओं का प्राथमिक लक्ष्य इन मशीनों को तेज़ और अधिक सटीक बनाना रहा है। हालाँकि, एक अलग प्रकार की समस्या उभर कर आई है: हम यह कैसे जानें कि कोई रोबोट होने वाली घटना से पहले ही कोई खतरनाक गलती करने वाला है? सुरक्षा की दुनिया में, सभी गलतियाँ एक समान नहीं होती हैं। एक रोबोट जो अपने इच्छित पथ से थोड़ा भटक जाता है, वह केवल एक झुंझलाहट है, लेकिन एक रोबोट जो किसी व्यक्ति या दीवार से टकरा जाता है, वह एक आपदा है। पारंपरिक कंप्यूटर प्रोग्राम अक्सर इन दोनों परिणामों को केवल "त्रुटियों" के रूप में देखते हैं, और एक मामूली असुविधा तथा एक जीवन के लिए खतरा पैदा करने वाली घटना के बीच अंतर करने में विफल रहते हैं। समझ में इस कमी ने शोधकर्ताओं को एक अधिक गंभीर प्रश्न पूछने के लिए प्रेरित किया है: क्या हम रोबोट को अपनी विफलताओं की भविष्यवाणी करना सिखा सकते हैं, और इससे भी महत्वपूर्ण बात यह है कि, क्या हम उन्हें उन विफलताओं के प्रति अधिक संवेदनशील बनाना सिखा सकते हैं जो सबसे अधिक मायने रखती हैं?

एडिनबर्ग विश्वविद्यालय की एक शोधकर्ता, रिफा फरज़ाना ने रोबोट को खतरे का पूर्वानुमान लगाना सिखाने के तरीके पर पुनर्विचार करके इस चुनौती का सामना किया है। केवल यह अनुमान लगाने के बजाय कि क्या रोबोट विफल होगा, नया दृष्टिकोण रोबोट से उस विफलता की गंभीरता की भविष्यवाणी करने के लिए कहता है। कल्पना कीजिए कि एक रोबोट बाधाओं से भरे कमरे में नेविगेट कर रहा है। यदि वह अपने पथ से थोड़ा भटक जाता है, तो वह थोड़ा समय बर्बाद करता है। यदि वह दीवार के बहुत करीब आ जाता है, तो उसे टकराने का जोखिम होता है। यदि वह गति से दीवार से टकराता है, तो वह नुकसान पहुँचाता है। फरज़ाना का कार्य एक ऐसा सिस्टम बनाता है जहाँ रोबोट को यह पहचानने के लिए प्रशिक्षित किया जाता है कि इन तीन परिदृश्यों का भार (वेट) बहुत अलग है। यह शोध एक साधारण "पास या फेल" परीक्षण से हटकर एक ऐसा प्रशिक्षण वातावरण बनाता है जहाँ रोबोट सीखता है कि एक मामूली पथ विचलन की तुलना में एक 'नियर-मिस' (बाल-बाल बचना) को अनदेखा करना कहीं अधिक महंगा है।

इस विचार का परीक्षण करने के लिए, शोधकर्ता ने एक आभासी दुनिया बनाई जहाँ एक छोटे, पहिए वाले रोबोट को आठ बेतरतीब ढंग से रखे गए गोलाकार अवरोधों से भरे बीस-दर-बीस मीटर के अरीना में नेविगेट करना था। रोबोट को एक लक्ष्य और अपने परिवेश को देखने के लिए सेंसर दिए गए थे, ठीक वैसे ही जैसे ड्राइवर के साथ एक कार। टीम ने रोबोट द्वारा पूरा किए जाने वाले दो हजार अलग-अलग यात्राओं, या एपिसोड्स को उत्पन्न किया, जो कुल मिलाकर लगभग दस लाख क्षणों की गति का योग था। इस सिम्युलेटेड दुनिया में, रोबोट को विभिन्न स्थितियों के संपर्क में लाया गया, जैसे कि शोर वाले सेंसर जो धुंधली रीडिंग देते थे या उसके अपने मूवमेंट कमांड में अचानक बदलाव। लक्ष्य केवल यह देखना नहीं था कि क्या रोबोट यात्रा पूरी कर सकता है, बल्कि यह देखना था कि क्या एक कंप्यूटर प्रोग्राम रोबोट की वर्तमान स्थिति को देखकर यह अनुमान लगा सकता है कि क्या वह एक गंभीर गलती करने वाला है।

इस खोज का मूल आधार यह है कि कंप्यूटर प्रोग्राम कैसे सीखता है। मानक प्रशिक्षण में, एक कंप्यूटर हजारों उदाहरण देखता है और यथासंभव सही उत्तर प्राप्त करने का प्रयास करता है। यदि वह गलती करता है, तो उसे दंड (पेनल्टी) मिलता है। इस नए सिस्टम में, दंड हर गलती के लिए एक समान नहीं है। जब रोबट ने एक मामूली त्रुटि की, तो दंड छोटा था। जब उसने एक 'नियर-मिस' की, तो दंड पाँच गुना बड़ा था। जब वह टक्कर के कगार पर था, तो दंड पच्चीस गुना बड़ा था। कंप्यूटर को सिखाने के इस सरल परिवर्तन ने इसे खतरनाक स्थितियों पर बहुत अधिक ध्यान देने के लिए मजबूर किया। परिणाम चौंकाने वाले थे। जब शोधकर्ताओं ने इस "कॉस्ट-सेंसिटिव" (लागत-संवेदनशील) प्रशिक्षण का उपयोग किया, तो उच्च-गंभीरता वाली विफलताओं को पकड़ने की सिस्टम की क्षमता लगभग पचासी प्रतिशत से बढ़कर लगभग निन्यानवे प्रतिशत हो गई।

अध्ययन ने एक संदर्भ की परत जोड़कर एक कदम आगे बढ़ाया। शोधकर्ताओं ने महसूस किया कि एक 'नियर-मिस' हमेशा समान रूप से खतरनाक नहीं होता है। स्पष्ट सेंसरों के साथ दीवार के पास धीमी गति से पहुंचना, धुंधले सेंसरों के साथ तेज़ गति से पहुंचना की तुलना में कम जोखिम भरा है। इसे ध्यान में रखते हुए, सिस्टम को रोबोट की गति, बाधाओं से निकटता और सेंसरों की अनिश्चितता के आधार पर अपनी सतर्कता को समायोजित करने के लिए अपडेट किया गया। यदि रोबोट तेज़ गति से चल रहा था या सेंसर संघर्ष कर रहे थे, तो सिस्टम स्वचालित रूप से अधिक रूढ़िवादी (कंजर्वेटिव) हो जाता था, और अधिक आसानी से अलार्म बजा देता था। इस अनुकूलन योग्य दृष्टिकोण ने पता लगाने की दर को और भी ऊपर धकेल दिया, जिससे सिमुलेशन में लगभग हर एक उच्च-गंभीरता वाली घटना पकड़ी जा गई।

हालाँकि, शोधकर्ता व्यापार-बंद (ट्रेड-ऑफ) के बारे में ईमानदार रहने में भी सावधान थे। सिस्टम को खतरे के प्रति इतना संवेदनशील बनाकर, इसने वास्तविक खतरे के बिना भी बार-बार अलार्म बजाना शुरू कर दिया। इसे 'फॉल्स अलार्म' (गलत चेतावनी) कहा जाता है। अध्ययन में पाया गया कि जबकि अनुकूलन योग्य प्रणाली लगभग हर क्रैश को पकड़ने में उत्कृष्ट थी, इसने ऐसा कई सुरक्षित क्षणों को जोखिम भरा बताकर किया। जब शोधकर्ताओं ने समान परिस्थितियों में प्रणालियों की तुलना की, तो अनुकूलित विधि वास्तविक खतरे और सुरक्षा के बीच अंतर करने में सरल विधि की तुलना में केवल थोड़ी ही बेहतर थी। मुख्य लाभ यह नहीं था कि सिस्टम जोखिमों को रैंक करने में अधिक स्मार्ट हो गया था, बल्कि यह था कि वह अधिक सतर्क होने के लिए तैयार था। इसने यह सुनिश्चित करने के लिए अधिक बार अलार्म बजाने का विकल्प चुना कि कोई भी खतरनाक घटना छूट न जाए।

यह सुनिश्चित करने के लिए कि ये निष्कर्ष केवल कंप्यूटर सिमुलेशन का परिणाम नहीं हैं, टीम ने अपने तरीके का परीक्षण एक वास्तविक रोबोट के डेटा पर किया जिसका उपयोग पिछले अध्ययनों में किया गया था। यह रोबोट, जो चौबीस अल्ट्रासाउंड सेंसर से लैस था, को एक दीवार का पीछा करने का कार्य दिया गया था। भले ही इस रोबोट को टकराने के लिए नहीं बनाया गया था, शोधकर्ताओं ने इसकी गतिविधियों को अपने गंभीरता पैमाने (सेवेरिटी स्केल) पर मैप किया। परिणाम बरकरार रहे: लागत-संवेदनशील प्रशिक्षण ने सिस्टम को आपातकालीन युद्धाभ्यास को पूर्ण सटीकता के साथ पहचानने की अनुमति दी, जो मानक तरीकों की तुलना में एक महत्वपूर्ण सुधार है। इसने पुष्टि की कि यह दृष्टिकोण न केवल एक आभासी दुनिया में, बल्कि वास्तविक मशीनों के डेटा के साथ भी काम करता है।

अध्ययन ने यह भी पता लगाया कि क्या होता है जब वास्तव में एक रोबोट दुर्घटनाग्रस्त होता है। मुख्य सिमुलेशन में, रोबोट के सुरक्षा नियंत्रण इतने अच्छे थे कि उसने कभी किसी चीज़ से टक्कर नहीं मारी। वास्तविक टकरावों की भविष्यवाणी करने की प्रणाली की क्षमता का परीक्षण करने के लिए, शोधकर्ताओं ने एक दूसरा, अधिक कठिन सिमुलेशन बनाया जहाँ रोबोट के बाधाओं से टकराने की संभावना अधिक थी। इस कठोर वातावरण में, टकराव की भविष्यवाणी करने की प्रणाली की क्षमता पचासी प्रतिशत से बढ़कर लगभग निन्यानवे प्रतिशत हो गई। टकराव को मिस करने की लागत एक हज़ार इकाइयों के संभावित नुकसान से घटकर केवल एक सौ रह गई। इसने साबित किया कि यह विधि सबसे गंभीर प्रकार की विफलता के लिए भी प्रभावी है, हालांकि इसके साथ फॉल्स अलार्म की उच्च दर भी आई, जिसने लगभग अस्सी प्रतिशत सुरक्षित क्षणों को जोखिम भरा बताया।

शोधकर्ताओं ने निष्कर्ष निकाला कि इस कार्य का सबसे मूल्यवान पहलू केवल संख्याएँ नहीं, बल्कि दृष्टिकोण में बदलाव है। उन्होंने तर्क दिया कि रोबोटिक्स समुदाय को सभी त्रुटियों को समान मानना बंद करने की आवश्यकता है। एक ऐसा सिस्टम जो निन्यानवे प्रतिशत सटीक है लेकिन उस एक क्रैश को मिस कर देता है जो एक रोबोट को नष्ट कर देता है, वह सुरक्षा-महत्वपूर्ण दुनिया में एक विफलता है। मशीनों को उनकी गलतियों को उनके परिणामों के अनुसार तौलना सिखाकर, हम ऐसे सिस्टम बना सकते हैं जो साधारण दक्षता के बजाय मानव सुरक्षा और उपकरण संरक्षण को प्राथमिकता देते हैं। अध्ययन बताता है कि यह दृष्टिकोण यह तय करने का एक सिद्धांत आधारित तरीका प्रदान करता है कि रोबोट को कितना सतर्क होना चाहिए, जिससे इंजीनियरों को वातावरण के आधार पर सुरक्षा स्तर को बढ़ाने की अनुमति मिलती है। जबकि इस सिस्टम के लिए अधिक बार फॉल्स अलार्म का ट्रेड-ऑफ आवश्यक है, शोधकर्ता तर्क देते हैं कि ऐसी स्थितियों में जहाँ क्रैश विनाशकारी हो सकता है, यह एक ऐसा मूल्य है जिसे चुकाना सार्थक है। यह कार्य इस बात का प्रदर्शन है कि सही प्रशिक्षण के साथ, मशीनें यह समझने में सक्षम हो सकती हैं कि सभी गलतियाँ एक समान नहीं होती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →