Character Recognition of Nepali Number Plate
यह शोध पत्र नेपाली लाइसेंस प्लेटों के लिए एक सुदृढ़ पाइपलाइन्ड ऑटोमैटिक नंबर प्लेट रिकग्निशन (ANPR) प्रणाली प्रस्तुत करता है जो 34 देवनागरी अक्षरों पर प्रशिक्षित YOLO-आधारित डिटेक्शन को एक CNN क्लासिफायर के साथ जोड़ता है, जो विविध वास्तविक दुनिया की स्थितियों में 93% तक सटीकता प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप नेपाल की व्यस्त सड़कों से गुजरती हुई एक कार की लाइसेंस प्लेट पढ़ने की कोशिश कर रहे हैं। कई देशों में यह आसान होता है क्योंकि प्लेटों में मानक अंग्रेजी अक्षरों और नंबरों का उपयोग किया जाता है। लेकिन नेपाल में, प्लेटों में देवनागरी लिपि (वही लिपि जिसका उपयोग नेपाली और हिंदी लिखने के लिए किया जाता है) का उपयोग किया जाता है, और वे थोड़ी अव्यवस्थित होती हैं। कुछ प्लेटों में एक पंक्ति होती है, कुछ में दो या तीन, अक्षर हाथ से पेंट किए जा सकते हैं जिससे उनके बीच की दूरी असमान हो सकती है, और कभी-कभी अक्षर उभरे हुए (एम्बॉस्ड) होते हैं जैसे कि कोई स्टैम्प हो।
यह शोध पत्र एक ऐसे समूह का वर्णन करता है जिसने इस "नेपाली अराजकता" को संभालने के लिए विशेष रूप से डिज़ाइन किया गया एक डिजिटल "सुपर-रीडर" बनाया है। उन्होंने इसे सरल चरणों में इस प्रकार किया है:
1. समस्या: एक अव्यवस्थित पुस्तकालय
नेपाली लाइसेंस प्लेट प्रणाली को एक ऐसे पुस्तकालय की तरह समझें जहाँ किताबें बेतरतीब ढंग से फर्श पर फेंकी गई हैं, और वे ऐसी भाषा में लिखी गई हैं जिसे लाइब्रेरियन अच्छी तरह नहीं जानता।
- चुनौती: मानक कंप्यूटर सिस्टम उन लाइब्रेरियन की तरह हैं जिन्हें केवल साफ-सुथरी अंग्रेजी किताबों के लिए प्रशिक्षित किया गया है। जब वे असमान अंतराल या उभरे हुए अक्षरों वाली नेपाली प्लेट देखते हैं, तो वे भ्रमित हो जाते हैं और विफल हो जाते हैं।
- लक्ष्य: एक नया लाइब्रेरियन बनाना जो नेपाली प्लेटों की भाषा बोलता हो और जिसे गंदगी या अव्यवस्था से कोई फर्क न पड़े।
2. समाधान: एक तीन-चरणीय असेंबली लाइन
शोधकर्ताओं ने एक पाइपलाइन (एक असेंबली लाइन) बनाई जिसमें तीन मुख्य कार्यकर्ता हैं, जिनमें से प्रत्येक एक विशिष्ट कार्य करता है:
कार्यकर्ता 1: द स्पॉटर (YOLO)
सबसे पहले, सिस्टम को कार की फोटो में प्लेट को ढूंढना होता है। इसके लिए उन्होंने YOLO (जिसका अर्थ है "You Only Look Once") नामक एक टूल का उपयोग किया। इसे एक ऐसे सुरक्षा गार्ड के रूप में समझें जिसकी नज़र बाज जैसी तेज़ है, जो कारों की भीड़ में तुरंत लाइसेंस प्लेट को पहचान लेता है और उसके चारों ओर एक बॉक्स बना देता है, बाकी सब कुछ अनदेखा कर देता है।कार्यकर्ता 2: द कटर (YOLOv8)
एक बार प्लेट मिल जाने के बाद, सिस्टम को व्यक्तिगत अक्षरों को अलग करने की आवश्यकता होती है। यह पेचीदा है क्योंकि अक्षर आपस में जुड़े हुए या दूर-दूर हो सकते हैं। उन्होंने स्पॉटर के एक दूसरे, अधिक विशिष्ट संस्करण (YOLOv8) को प्रशिक्षित किया ताकि वह एक सटीक पेपर कटर की तरह काम कर सके। यह प्लेट की छवि को छोटे-छोटे टुकड़ों में काट देता है, जिससे प्रत्येक व्यक्तिगत देवनागरी वर्ण अलग हो जाता है।कार्यकर्ता 3: द रीडर (CNN)
अब जब अक्षर अलग हो गए हैं, तो सिस्टम को उन्हें पहचानना होगा। उन्होंने एक कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) बनाया, जो एक ऐसे छात्र की तरह है जिसने सभी 34 अद्वितीय देवनागरी वर्णों के फ्लैशकार्ड डेक को रट लिया है जिनका उपयोग नेपाली प्लेटों पर किया जाता है। यह "छात्र" प्रत्येक कटे हुए अक्षर को देखता है और कहता है, "यह 'क' अक्षर है!" या "यह संख्या '5' है!"
3. प्रशिक्षण: एक बड़ी किताब से सीखना
इन कार्यकर्ताओं को सिखाने के लिए, शोधकर्ताओं ने केवल एक छोटी नोटबुक का उपयोग नहीं किया। उन्होंने दो विशाल, सार्वजनिक रूप से उपलब्ध "पाठ्यपुस्तकों" (डेटासेट) का उपयोग किया जिनमें हजारों चित्र शामिल थे:
- किताब 1: पूरी कारों की तस्वीरें जिनमें प्लेट्स लगी हैं, ताकि स्पॉटर उन्हें ढूंढना सीख सके।
- किताब 2: व्यक्तिगत अक्षरों के 26,000 से अधिक चित्र, ताकि रीडर हर एक प्रकार के 34 वर्णों को पहचानना सीख सके।
"एम्बॉस्ड" (उभरे हुए अक्षर) की बाधा:
एक विशिष्ट समस्या एम्बॉस्ड प्लेटों (जहाँ अक्षर उभरे हुए होते हैं) के साथ आई। नेपाल में इन्हें प्रशिक्षित करने के लिए पर्याप्त तस्वीरें नहीं थीं। इस समस्या को हल करने के लिए, शोधकर्ताओं ने एक चतुर छात्र की तरह व्यवहार किया जो पड़ोसी से किताबें उधार लेता है। उन्होंने अपने सिस्टम को यह सिखाने के लिए भारत और अमेरिका की उभरी हुई प्लेटों की तस्वीरों का उपयोग किया, भले ही उनकी लिपि अलग थी। इससे सिस्टम को यह समझने में मदद मिली कि उभरे हुए अक्षर कैसे दिखते हैं, जिससे वह अक्षरों की 3D बनावट से भ्रमित नहीं हुआ।
4. परिणाम: एक उच्च स्कोर करने वाला छात्र
इस पूरे प्रशिक्षण और "डेटा ऑग्मेंटेशन" (जो कि छात्र को एक ही अक्षर को विभिन्न फोंट, आकार और रोशनी की स्थितियों में दिखाने जैसा है ताकि वह अधिक स्मार्ट बन सके) के बाद, सिस्टम का परीक्षण किया गया।
- स्कोर: सिस्टम ने 93% सटीकता दर प्राप्त की। इसका मतलब है कि 100 लाइसेंस प्लेटों में से, इसने 93 को सही पढ़ा, यहाँ तक कि खराब रोशनी या अव्यवस्थित प्लेटों जैसी वास्तविक स्थितियों में भी।
- डेमो: उन्होंने एक साधारण वेबसाइट भी बनाई जहाँ आप कार की फोटो अपलोड कर सकते हैं, और सिस्टम आपको बताएगा कि प्लेट क्या कहती है, जो यह साबित करता है कि यह वास्तविक दुनिया में काम करता है।
सारांश
संक्षेप में, यह शोध पत्र नेपाल के लिए एक कस्टम-निर्मित "रोबोट लाइब्रेरियन" प्रस्तुत करता है। नेपाली प्लेटों को मानक अंग्रेजी सांचे में ढालने के बजाय, उन्होंने एक विशेष टीम (स्पॉटर, कटर, रीडर) बनाई जिसे विशेष रूप से देवनागरी लिपि और हाथ से पेंट की गई अव्यवस्थित प्लेटों की बारीकियों के लिए प्रशिक्षित किया गया है। उभरे हुए अक्षरों को संभालने के लिए अन्य देशों के प्रशिक्षण डेटा का उपयोग करके, उन्होंने एक ऐसा सिस्टम बनाया जो 93% सटीक है और नेपाल में यातायात प्रबंधन में मदद करने के लिए तैयार है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।