← नवीनतम पेपर
💻 computer science

Driver Activity Detection and Classification Using Deep Learning- Based YOLO Models for Intelligent Transportation Systems

यह अध्ययन आठ चालक गतिविधियों का पता लगाने और उन्हें वर्गीकृत करने के लिए YOLO आर्किटेक्चर का उपयोग करते हुए एक डीप लर्निंग फ्रेमवर्क प्रस्तावित करता है, जो यह प्रदर्शित करता है कि YOLOv8n मॉडल 5,422 छवियों के डेटासेट पर 96.3% mAP के साथ उत्कृष्ट वास्तविक समय प्रदर्शन प्राप्त करता है, जिससे इंटेलिजेंट ट्रांसपोर्टेशन सिस्टम में सड़क सुरक्षा बढ़ाने के लिए एक प्रभावी समाधान मिलता है।

मूल लेखक: Getaneh Awoke, Eshete Derb, Metages Molla, Baye Atnafu, Daneil Addis, Abebu Sintayehu

प्रकाशित 2026-07-01✓ Author reviewed
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Getaneh Awoke, Eshete Derb, Metages Molla, Baye Atnafu, Daneil Addis, Abebu Sintayehu

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक कार के डैशबोर्ड कैमरा एक बहुत ही पैनी नज़र वाले और अथक सह-चालक (co-pilot) की तरह काम कर रहा है। उसका एकमात्र काम ड्राइवर को देखना है और तुरंत यह पता लगाना है कि क्या वह कुछ खतरनाक कर रहा है, जैसे गाड़ी चलाते समय टेक्स्ट मैसेज करना या स्टीयरिंग के पीछे सैंडविच खाना। यह शोध पत्र बताता है कि कैसे शोधकर्ताओं ने उस सह-चालक के लिए एक "मस्तिष्क" बनाया, जो डीप लर्निंग (Deep Learning) नामक आर्टिफिशियल इंटेलिजेंस के एक प्रकार का उपयोग करता है, विशेष रूप से YOLO (जिसका अर्थ है "You Only Look Once") के रूप में जाने जाने वाले मॉडलों के एक परिवार का उपयोग करके।

यहाँ इस कहानी का सरल विवरण दिया गया है कि उन्होंने इसे कैसे बनाया:

समस्या: विचलित ड्राइवर (The Distracted Driver)

सड़क दुर्घटनाएं अक्सर इसलिए होती हैं क्योंकि ड्राइवर विचलित हो जाते हैं। वे फोन पर हो सकते हैं, अपने बाल ठीक कर रहे हो सकते हैं, या सड़क पर ध्यान देने के बजाय यात्रियों से बात कर रहे हो सकते हैं। शोधकर्ता एक ऐसा सिस्टम बनाना चाहते थे जो इन "असुरक्षित गतिविधियों" को वास्तविक समय (real-time) में पहचान सके, जिससे दुर्घटनाओं को रोकने के लिए एक सुरक्षा जाल के रूप में काम किया जा सके।

प्रशिक्षण: AI को देखना सिखाना (The Training: Teaching the AI to See)

इस AI को सिखाने के लिए, आप इसे केवल एक पाठ्यपुस्तक नहीं दे सकते; आपको इसे हजारों तस्वीरें दिखानी होंगी।

  • कक्षा (The Classroom): शोधकर्ताओं ने इथियोपिया के डेब्रे मारकोस और मोट्टा शहरों में वास्तविक ड्राइवरों की शूटिंग की। उन्होंने स्टूडियो में नकली अभिनेताओं का उपयोग नहीं किया; उन्होंने प्राकृतिक ड्राइविंग स्थितियों का उपयोग किया।
  • होमवर्क (The Homework): उन्होंने 10 वीडियो लिए और उन्हें 5,422 व्यक्तिगत स्नैपशॉट (फ्रेम्स) में विभाजित किया।
  • लेबलिंग (The Labeling): यह कठिन हिस्सा था। इंसानों को हर एक फोटो को देखना था और ड्राइवर के हाथों या चेहरे के चारों ओर एक बॉक्स बनाना था, और सटीक रूप से लेबल करना था कि वह क्या कर रहा है। उन्होंने AI को 8 विशिष्ट व्यवहारों को पहचानना सिखाया:
    1. सुरक्षित ड्राइविंग (अच्छा व्यवहार)
    2. पीना
    3. खाना
    4. फोन का उपयोग करना
    5. कार के हिस्सों के साथ छेड़छाड़ करना (जैसे रेडियो)
    6. मेकअप या बाल ठीक करना
    7. वस्तुओं को संभालना (जैसे बैग के लिए हाथ बढ़ाना)
    8. यात्री से बात करना

इसे एक बच्चे को अलग-अलग फलों को पहचानना सिखाने जैसा समझें। आप उन्हें एक सेब दिखाते हैं और कहते हैं "सेब", फिर एक केला दिखाते हैं और कहते हैं "केला"। अंततः, बच्चा (या इस मामले में AI) बिना बताए तुरंत उन्हें पहचानने में सक्षम हो जाता है।

प्रतियोगी: "YOLO" की दौड़ (The Contenders: The "YOLO" Race)

शोधकर्ताओं ने केवल एक AI मस्तिष्क नहीं चुना; उन्होंने यह देखने के लिए चार अलग-अलग YOLO मॉडल के बीच एक दौड़ आयोजित की कि कौन सा सबसे अच्छा ड्राइवर-मॉनिटर है।

  • धावक (The Racers): उन्होंने YOLOv5s (छोटा और तेज़), YOLOv5m (मध्यम), YOLOv5l (बड़ा), और नवीनतम YOLOv8 का परीक्षण किया।
  • ट्रैक (The Track): उन्होंने इन सभी को एक शक्तिशाली क्लाउड कंप्यूटर (Google Colab) का उपयोग करके एक ही 5,422 फोटो पर प्रशिक्षित किया, जिसमें चीज़ों को तेज़ करने के लिए एक सुपर-फास्ट ग्राफिक्स कार्ड है।

परिणाम: दौड़ में कौन जीता? (The Results: Who Won the Race?)

प्रशिक्षण पूरा होने के बाद, उन्होंने स्कोर की जाँच की। कल्पना कीजिए कि एक परीक्षण है जहाँ आपको भीड़ में सही चीज़ों को पहचानना है।

  • विजेता (The Winner): YOLOv8 ने स्वर्ण पदक जीता। इसने 96.3% सटीकता का स्कोर प्राप्त किया। यह ड्राइवर के सटीक कार्यों को पहचानने में सबसे सटीक था।
  • उपविजेता (The Runners-up): पुराने मॉडल (YOLOv5) भी अच्छा प्रदर्शन करते थे, लेकिन वे थोड़े कम सटीक थे (90% से 95% के बीच)।
  • समझौता (The Trade-off): विजेता (YOLOv8) थोड़ा भारी था और इसे प्रशिक्षित करने में अधिक समय लगा (लगभग 3 घंटे), लेकिन यह अतिरिक्त सटीकता के लिए सार्थक था।

मुख्य निष्कर्ष (The Bottom Line)

शोध पत्र यह निष्कर्ष निकालता है कि इस उन्नत AI (विशेष रूप से YOLOv8 मॉडल) का उपयोग करके, हम एक ऐसा सिस्टम बना सकते हैं जो ड्राइवरों पर नज़र रखता है और तुरंत जान जाता है कि वे विचलित हैं या नहीं। यह एक ऐसे सुपर-विज़न सह-चालक की तरह है जो कभी पलक नहीं झपकाता, यह सुनिश्चित करता है कि यदि कोई ड्राइवर खाना शुरू करता है या टेक्स्टिंग करता है, तो सिस्टम को पता चल जाए कि वास्तव में क्या हो रहा है।

जो शोध पत्र ने नहीं कहा:
शोधकर्ताओं ने प्रयोगशाला सेटिंग में अपने विशिष्ट डेटासेट का उपयोग करके केवल इस डिटेक्शन सिस्टम को बनाने और परीक्षण करने पर ध्यान केंद्रित किया। उन्होंने इस सिस्टम का परीक्षण किसी व्यस्त हाईवे पर चलती कार के अंदर नहीं किया, और न ही यह दावा किया कि यह वर्तमान में व्यावसायिक कारों या अस्पतालों में उपयोग किया जा रहा है। उन्होंने केवल यह सिद्ध किया कि उनका "मस्तिष्क" तस्वीरों और वीडियो में इन 8 विशिष्ट क्रियाओं को पहचानने में बहुत अच्छी तरह से काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →