← नवीनतम पेपर
🤖 AI

Real-Time Automatic License Plate Recognition Using YOLOv8, SORT Tracking, and Temporal Data Interpolation

यह शोध पत्र एक पांच-चरणीय, एंड-टू-एंड ALPR पाइपलाइन का प्रस्ताव करता है जो वाहन और लाइसेंस प्लेट डिटेक्शन के लिए YOLOv8, मल्टी-ऑब्जेक्ट ट्रैकिंग के लिए SORT, और टेम्पोरल बाउंडिंग बॉक्स इंटरपोलेशन को एकीकृत करता है ताकि प्रकाश परिवर्तन और उच्च गति जैसी वास्तविक समय की चुनौतियों से पार पाया जा सके, जिससे गतिशील यातायात परिवेशों में पहचान सटीकता और ट्रैकिंग निरंतरता में सुधार किया जा सके।

मूल लेखक: Mirza Muhammad Mobeen

प्रकाशित 2026-06-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mirza Muhammad Mobeen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त राजमार्ग पर तेजी से गुजरने वाली कारों की नंबर प्लेट पढ़ने की कोशिश कर रहे हैं। यह एक बहुत ही चुनौतीपूर्ण काम है: सूरज की चकाचौंध है, परछाइयां नाच रही हैं, कारें तेजी से चल रही हैं, और कभी-कभी एक कार दूसरी कार के दृश्य को रोक देती है। यदि आप केवल एक सिंगल स्नैपशॉट देखते हैं, तो आप शायद पूरी प्लेट को मिस कर देंगे या धुंधली छवि के कारण किसी अक्षर को गलत पढ़ लेंगे।

यह शोध पत्र एक "स्मार्ट कैमरा सिस्टम" का वर्णन करता है जिसे ठीक इसी समस्या को हल करने के लिए बनाया गया है। लेखकों ने एक पांच-चरणीय असेंबली लाइन बनाई है जो केवल एक फोटो नहीं देखती; बल्कि यह पूरी फिल्म को देखती है, जो उसने देखा उसे याद रखती है, और जब वह कार को देख नहीं पाती, तो खाली जगहों को भी भर देती है।

यहाँ बताया गया है कि उनका सिस्टम कैसे काम करता है, जिसे सरल चरणों में विभाजित किया गया है:

पांच-चरणीय असेंबली लाइन

1. द "स्पॉटर" (YOLOv8)
सबसे पहले, सिस्टम एक बहुत ही तेज़, हल्के वजन वाले AI का उपयोग करता है जिसे YOLOv8 कहा जाता है (इसे एक सुपर-क्विक स्पॉटर की तरह समझें)। इसका एकमात्र काम वीडियो को स्कैन करना और चिल्लाना है, "वहाँ एक कार है!" यह हर वाहन के चारों ओर एक बॉक्स बनाता है। यह इतना कुशल है कि यह बड़े सुपरकंप्यूटरों के बजाय छोटे, सस्ते कंप्यूटरों पर भी चल सकता है।

2. द "चैपरोन" (SORT ट्रैकिंग)
एक बार जब स्पॉटर को कार मिल जाती है, तो सिस्टम को यह जानने की आवश्यकता होती है कि फ्रेम 10 में दिखने वाली कार ही फ्रेम 11 में दिखने वाली कार है। यहाँ आता है SORT, एक ट्रैकिंग एल्गोरिदम। इसे एक डांस में मौजूद ऐसे 'चैपरोन' (देखभाल करने वाले) की तरह समझें जो हर किसी पर नज़र रखता है। भले ही कार एक सेकंड के लिए पेड़ के पीछे चली जाए, चैपरोन उसकी गति और दिशा के आधार पर भविष्यवाणी करता है कि उसे कहाँ होना चाहिए। यह कार की "पहचान" को बरकरार रखता है ताकि सिस्टम हर बार इसे एक नई कार न समझ ले।

3. द "ज़ूम लेंस" (लाइसेंस प्लेट फाइंडर)
अब जब सिस्टम को पता है कि कार कहाँ है, तो उसे विशेष रूप से लाइसेंस प्लेट को खोजने की आवश्यकता है। यह कार पर ज़ूम करने और केवल लाइसेंस प्लेट के चारोंට एक छोटा बॉक्स बनाने के लिए दूसरे, विशेष AI का उपयोग करता है। यह एक सुरक्षा गार्ड की तरह है जो किसी व्यक्ति को देखने के बाद, तुरंत उसके आईडी कार्ड पर ध्यान केंद्रित करता है।

4. द "रीडर" (EasyOCR)
सिस्टम प्लेट की उस ज़ूम की गई छवि को लेता है और अक्षरों और नंबरों को पढ़ने की कोशिश करने के लिए EasyOCR का उपयोग करता है। हालाँकि, चलती हुई, धुंधली कार से टेक्स्ट पढ़ना कठिन है। कभी-कभी कैमरा "O" देखता है लेकिन वह वास्तव में "0" (जीरो) होता है, या "I" जो "1" जैसा दिखता है।
इसे ठीक करने के लिए, सिस्टम में एक अंतर्निहित "ग्रामर पुलिस" नियम पुस्तिका है। यह जानता है कि यूके (UK) की लाइसेंस प्लेट एक विशिष्ट पैटर्न का पालन करती है (जैसे दो अक्षर, दो नंबर, तीन अक्षर)। यदि रीडर भ्रमित हो जाता है, तो ग्रामर पुलिस हस्तक्षेप करती है और संभावित गलतियों को बदल देती है (उदाहरण के लिए, यदि स्थिति के लिए अक्षर की आवश्यकता है, तो "0" को "O" में बदलना)।

5. द "टाइम ट्रैवलर" (टेम्पोरल इंटरपोलेशन)
यही इस पेपर का सबसे बड़ा नवाचार है। कभी-कभी, एक ट्रक या पैदल यात्री द्वारा कार को ब्लॉक कर दिया जाता है। सिस्टम कार के स्थान का डेटा खो देता है, जिससे टाइमलाइन में एक "गैप" (अंतराल) बन जाता है।
हार मानने के बजाय, सिस्टम लिनियर इंटरपोलेशन (Linear Interpolation) का उपयोग करता है। कल्पना कीजिए कि आप एक फिल्म देख रहे हैं और प्रोजेक्टर 10 फ्रेम छोड़ देता है। आप उन छूटे हुए फ्रेमों में क्या हुआ होगा, इसका अनुमान लगा सकते हैं—उस स्थान को खींचकर जहाँ कार स्किप होने से पहले थी और जहाँ वह स्किप होने के बाद थी। सिस्टम इसे गणितीय रूप से करता है ताकि कार के पथ को "भरने" (fill in) के लिए, जिससे ट्रैकिंग लाइन सुचारू और निरंतर बनी रहे।

उन्हें क्या मिला?

शोधकर्ताओं ने इस सिस्टम का परीक्षण 3,599 फ्रेम (लगभग एक मिनट का फुटेज) वाले वीडियो पर किया, जिसमें 45 अलग-अलग कारें दिखाई गई थीं।

  • "गैप फिलिंग" का जादू: "टाइम ट्रैवलर" चरण के बिना, सिस्टम ने कारों की केवल 2,247 सफल दृश्य दर्ज किए। इंटरपोलेशन का उपयोग करके अंतराल को भरने के बाद, वे 4,536 डेटा पॉइंट्स तक पहुँच गए। यह डेटा में 101.9% की वृद्धि है! उन्होंने कार के पथ का गणितीय अनुमान लगाकर 2,000 से अधिक गायब क्षणों को सफलतापूर्वक वापस प्राप्त किया।
  • पढ़ने का संघर्ष: जबकि सिस्टम कारों को ढूंढने और ट्रैक करने में बहुत अच्छा था, वास्तविक टेक्स्ट को पढ़ना मुश्किल था। अक्षरों को सही ढंग से पढ़ने में औसत आत्मविश्वास (confidence) केवल 41.4% था। ऐसा इसलिए क्योंकि कारें तेजी से चल रही थीं, जिससे मोशन ब्लर (गति के कारण धुंधलापन) हो रहा था। हालाँकि, जब सिस्टम को कोई अच्छी रीडिंग मिली, तो वह बहुत आश्वस्त था (98.2% तक)।
  • सबक: सिस्टम ने साबित किया कि भले ही आप हर फ्रेम में टेक्स्ट को पूरी तरह से न पढ़ सकें, कार के स्थान का एक निरंतर, सुचारू ट्रैक बनाए रखना अविश्वसनीय रूप से मूल्यवान है।

निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि यह सिस्टम ट्रैफिक मॉनिटरिंग के लिए एक शक्तिशाली उपकरण है। यह एक तेज़ डिटेक्टर, एक स्मार्ट ट्रैकर, एक ग्रामर चेक वाला टेक्स्ट रीडर और एक गणित-आधारित "गैप फिलर" को जोड़ता है।

चुनौती: लेखक स्वीकार करते हैं कि सिस्टम अभी भी पूर्ण नहीं है। यह भारी मोशन ब्लर के साथ संघर्ष करता है, यह केवल यूके लाइसेंस प्लेट को समझने के लिए हार्डकोडेड है, और यह मानक कंप्यूटरों पर थोड़ा धीमा चलता है (इसे सीपीयू की आवश्यकता है, सुपर-फास्ट जीपीयू की नहीं)। लेकिन, इसने सफलतापूर्वक प्रदर्शित किया कि डेटा के गायब हिस्सों को "भरकर", आप ट्रैफिक के खंडित, टूटे हुए रिकॉर्ड को एक सुचारू, निरंतर कहानी में बदल सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →