← नवीनतम पेपर
💻 computer science

Student Classroom Behavior Recognition Based on Improved YOLOv8s

यह शोध पत्र ALC-YOLOv8s का प्रस्ताव करता है, जो एक उन्नत YOLOv8s मॉडल है जिसमें कक्षा के दृश्यों में घने लक्ष्यों और अवरोधों जैसी चुनौतियों को संबोधित करने के लिए SPPF-LSKA, CFC-CRB, SFC-G2 और ATFLoss को शामिल किया गया है, जिससे छात्र व्यवहार पहचान में महत्वपूर्ण प्रदर्शन लाभ प्राप्त हुआ है।

मूल लेखक: Xiang Gao, Shuai Hang

प्रकाशित 2026-05-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiang Gao, Shuai Hang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक व्यस्त कक्षा की कल्पना करें जो छात्रों से भरी एक भीड़भाड़ वाली, शोर-शराबे वाली जगह है। एक शिक्षक जानना चाहता है कि हर कोई वास्तव में क्या कर रहा है: क्या वे सुन रहे हैं? क्या वे लिख रहे हैं? क्या वे हाथ उठा रहे हैं? या क्या वे ख्यालों में खोए हुए हैं?

यह शोध पत्र एक कंप्यूटर को वह "निरीक्षक शिक्षक" बनने के लिए सिखाने के बारे में है। लेखकों ने एक विशेष "डिजिटल आँख" (एक AI मॉडल) बनाई है जो कक्षा के वीडियो को देख सकती है और स्वचालित रूप से पहचान सकती है कि प्रत्येक छात्र क्या कर रहा है। वे अपने नए मॉडल को ALC-YOLOv8s कहते हैं।

उन्होंने इस मॉडल को कैसे बेहतर बनाया, इसे सरल उपमाओं (analogies) का उपयोग करके समझाया गया है:

समस्या: यह कठिन क्यों है?

लेखक कहते हैं कि कंप्यूटर के लिए कक्षा को देखना तीन मुख्य कारणों से कठिन है:

  1. भीड़: बहुत सारे छात्र एक साथ पैक हैं, और वे अक्सर एक-दूसरे को ढक लेते हैं (occlusion)। यह एक भरे हुए कॉन्सर्ट में किसी विशिष्ट व्यक्ति को खोजने की कोशिश करने जैसा है जहाँ हर कोई कंधे से कंधा मिलाकर खड़ा है।
  2. सूक्ष्म विवरण: छात्र अक्सर कैमरे से दूर होते हैं, जिससे वे छोटे बिंदुओं की तरह दिखाई देते हैं। जब वे केवल छोटे आकार के रूप हों, तो "पढ़ने" और "लिखने" के बीच अंतर करना बहुत कठिन होता है।
  3. असंतुलन: कुछ व्यवहार हमेशा होते रहते हैं (जैसे "बैठना और सुनना"), जबकि कुछ बहुत कम होते हैं (जैसे "खड़े होना" या "हाथ उठाना")। यह एक ऐसे शिक्षक की तरह है जो केवल सप्ताह में एक बार छात्रों को हाथ उठाते देखता है; कंप्यूटर भूल सकता है कि वह कैसा दिखता है क्योंकि वह "बैठने" को बहुत अधिक बार देखता है।

समाधान: "सुपर-आई" अपग्रेड

लेखकों ने एक मानक, शक्तिशाली AI मॉडल जिसे YOLOv8s कहा जाता है (जो पहले से ही चीजों को खोजने में अच्छा है) लिया और कक्षा की अराजकता को संभालने के लिए इसे तीन विशिष्ट अपग्रेड दिए।

1. "वाइड-एंगल लेंस" (SPPF-LSKA)

  • अपग्रेड: उन्होंने उस हिस्से को बदल दिया जो बड़े परिदृश्य (big picture) को देखता है।
  • उपमा: कल्पना करें कि आप एक धुंधले पार्क में अपने दोस्त को खोजने की कोशिश कर रहे हैं। यदि आप केवल उनके चेहरे को देखते हैं, तो हो सकता है कि आप उन्हें मिस कर दें यदि वे किसी पेड़ के पीछे हैं। लेकिन यदि आप पूरे पार्क, पेड़ों और उस रास्ते को देखते हैं जिस पर वे चल रहे हैं, तो आप अनुमान लगा सकते हैं कि वे कहाँ हैं, भले ही आप उन्हें स्पष्ट रूप से न देख पा रहे हों।
  • यह क्या करता है: यह अपग्रेड मॉडल को छात्र के "आस-पास के परिवेश" को देखने में मदद करता है। भले ही छात्र डेस्क या किसी अन्य व्यक्ति द्वारा आंशिक रूप से छिपा हुआ हो, मॉडल संदर्भ (डेस्क, अन्य छात्र) का उपयोग करके यह समझने में सक्षम होता है कि, "आह, यह एक छात्र है जो हाथ उठा रहा है," बजाय इसके कि वह भ्रमित हो जाए।

2. "डिटेल मिक्सर" (CFC-CRB और SFC-G2)

  • अपग्रेड: उन्होंने इस बात में सुधार किया कि मॉडल "बड़े परिदृश्य" के विचारों को "सूक्ष्म विवरणों" के साथ कैसे जोड़ता है।
  • उपमा: एक चित्रकार के बारे में सोचें। एक ब्रश पूरे आकाश को पेंट करने के लिए बेहतरीन है (बड़ा परिदृश्य), लेकिन यह पत्ते की सूक्ष्म शिराओं को पेंट करने के लिए बहुत मोटा है। दूसरा ब्रश पत्ते की शिराओं के लिए बेहतरीन है लेकिन आकाश नहीं पेंट कर सकता। लेखकों ने एक विशेष "मिक्सर" बनाया है जो बड़े ब्रश से व्यापक स्ट्रोक और छोटे ब्रश से बारीक विवरण लेता है और उन्हें पूरी तरह से मिला देता है।
  • यह क्या करता है: यह सुनिश्चित करता है कि मॉडल समग्र दृश्य को समझते हुए भी सूक्ष्म विवरणों (जैसे हाथ का कोण) को न खो दे। यह कंप्यूटर को समान क्रियाओं के बीच अंतर करने में मदद करता है, जैसे "नीचे देखना" (बोर होना) बनाम "नीचे देखना" (किताब पढ़ना)।

3. "निष्पक्ष शिक्षक" (ATFLoss)

  • अपग्रेड: उन्होंने उस "ग्रेडिंग सिस्टम" को बदल दिया जिसका उपयोग मॉडल सीखने के दौरान करता है।
  • उपमा: एक छात्र की कल्पना करें जो परीक्षा के लिए पढ़ाई कर रहा है। यदि वे लगातार आसान सवालों को सही करते रहते हैं, तो वे कठिन वाले सीखने की कोशिश करना बंद कर सकते हैं। लेखकों ने नियमों को इस तरह बदला है कि कंप्यूटर को दुर्लभ या कठिन व्यवहारों (जैसे "खड़े होना" या "हाथ उठाना") को सही ढंग से पहचानने के लिए "एक्स्ट्रा क्रेडिट" मिलता है। यह मॉडल को उन चीजों पर अतिरिक्त ध्यान देने के लिए मजबूर करता है जिन्हें वह आमतौर पर गलत समझता है।
  • यह क्या करता है: यह मॉडल को दुर्लभ व्यवहारों को अनदेखा करने से रोकता है क्योंकि वे कम बार होते हैं। यह AI को अधिक संतुलित और निष्पक्ष बनाता है।

परिणाम: क्या यह काम आया?

लेखकों ने अपने नए "सुपर-आई" का परीक्षण मूल मॉडल और अन्य प्रसिद्ध AI मॉडलों के विरुद्ध किया।

  • स्कोर: उनके नए मॉडल ने हर टेस्ट में उच्च स्कोर किया। यह छात्रों को खोजने (Precision) और वे क्या कर रहे हैं इसे याद रखने (Recall) में बेहतर था।
  • तुलना: इसने YOLOv5, YOLOv11 और यहाँ तक कि कुछ पुराने, अधिक जटिल सिस्टमों को भी पछाड़ दिया।
  • निष्कर्ष: शोध पत्र का दावा है कि यह नया मॉडल अब कक्षा की निगरानी करने और आपको बिल्कुल सटीक रूप से बताने में बहुत सक्षम है कि छात्र क्या कर रहे हैं, भले ही कमरा भीड़भाड़ वाला, अस्त-व्यस्त, या कठिन और दुर्लभ व्यवहारों से भरा हो।

संक्षेप में, उन्होंने एक स्मार्ट कैमरा लिया, उसे एक व्यापक दृश्य दिया, उसे बड़े और छोटे विवरणों को बेहतर ढंग से मिलाना सिखाया, और यह सुनिश्चित किया कि वह आसान पाठों के साथ उतनी ही कड़ी मेहनत से कठिन पाठों का भी अध्ययन करे। परिणाम एक ऐसी प्रणाली है जो वास्तविक, अव्यवस्थित कक्षा में छात्र के व्यवहार को सटीक रूप से ट्रैक कर सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →