← नवीनतम पेपर
💻 computer science

A Method for Assessing Preschoolers’ Attention in the Classroom Based on a Multimodal Transformer

यह शोधपत्र एक मल्टीमॉडल ट्रांसफॉर्मर-आधारित पद्धति प्रस्तावित करता है जो कक्षाओं में प्रीस्कुलरों के ध्यान के स्तर का मजबूती से आकलन करने के लिए वीडियो, ऑडियो और एटीट्यूड (व्यवहार) डेटा को एकीकृत करता है, जो बेसलाइन मॉडलों की तुलना में विभिन्न फोकस अवस्थाओं में बेहतर प्रदर्शन और स्थिरता प्रदर्शित करता है।

मूल लेखक: Miao Tian

प्रकाशित 2026-06-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Miao Tian

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: एक कैमरा पर्याप्त क्यों नहीं है

कल्पना कीजिए कि आप एक प्रीस्कूलर (नन्हे बच्चे) को केवल एक मूक फिल्म (silent movie) देखकर यह समझने की कोशिश कर रहे हैं कि वह क्या सोच रहा है। आप देख सकते हैं कि वह शिक्षक की ओर देख रहा है, लेकिन आप यह नहीं सुन सकते कि वह कोई गाना गुनगुना रहा है या नहीं, और आप यह भी नहीं बता सकते कि उसका शरीर घबराहट में छटपटा रहा है या नहीं। यदि वह अपना सिर थोड़ा घुमाता है, तो कैमरा उसे खो सकता है, या कोई छाया उसके चेहरे को छिपा सकती है।

यह शोध पत्र तर्क देता है कि देखने का एक तरीका पर्याप्त नहीं है। यह वास्तव में जानने के लिए कि क्या एक बच्चा ध्यान दे रहा है, आपको एक साथ कमरे की आवाज़ सुननी होगी, उनके चेहरे को देखना होगा और उनके शरीर की गतिविधियों को ट्रैक करना होगा। लेखकों ने एक "सुपर-स्पाय" सिस्टम बनाया है जो यह पता लगाने के लिए कि बच्चा कितना केंद्रित है, इन तीन इंद्रियों को जोड़ता है।

सिस्टम की तीन "इंद्रियां"

शोधकर्ताओं ने एक क्लासरूम में विशेष उपकरणों के साथ तीन प्रकार का डेटा एकत्र करने के लिए सेटअप किया, जैसे कि एक जासूस सुराग इकट्ठा करता है:

  1. आंखें (वीडियो): हाई-डेफिनिशन कैमरे बच्चों के चेहरों और सिरों पर नज़र रखते हैं। यह ट्रैक करता है कि वे कहाँ देख रहे हैं और क्या उनकी आँखें इधर-उधर भटक रही हैं।
  2. कान (ऑडियो): माइक्रोफोन कमरे की आवाज़ सुनते हैं। वे केवल शोर रिकॉर्ड नहीं करते; वे शिक्षक की आवाज़ के ताल (rhythm) और बच्चों की प्रतिक्रियाओं का विश्लेषण करते हैं। क्या वे एक प्रश्न का उत्तर दे रहे हैं? क्या पृष्ठभूमि में बहुत अधिक बातचीत हो रही है?
  3. शरीर (मुद्रा/पोस्चर): सिस्टम बच्चे के "कंकाल" (जैसे कि एक स्टिक फिगर ड्राइंग) को ट्रैक करता है। यह देखता है कि क्या वे आगे की ओर झुक रहे हैं, हाथों से छटपटा रहे हैं, या अपना पूरा शरीर शिक्षक से दूर मोड़ रहे हैं।

ऑपरेशन का "मस्तिष्क": मल्टीमॉडल ट्रांसफॉर्मर

एक बार जब सिस्टम के पास इन तीनों डेटा स्ट्रीम्स का डेटा आ जाता है, तो इसे जोड़ने के लिए इसे एक मस्तिष्क की आवश्यकता होती है। लेखकों ने मल्टीमॉडल ट्रांसफॉर्मर नामक एक प्रकार के AI का उपयोग किया।

इस AI को एक ऑर्केस्ट्रा के कंडक्टर की तरह समझें:

  • वीडियो वायलिन सेक्शन है (तेज़, दृश्य विवरण)।
  • ऑडियो पर्कशन (ताल वाद्य) है (लय और समय)।
  • पोस्चर ब्रास सेक्शन है (बड़े, व्यापक आंदोलन)।

यदि कंडक्टर (AI) केवल वायलिन को सुनता है, तो वह एक बीट मिस कर सकता है। लेकिन तीनों सेक्शन को एक साथ सुनकर, कंडक्टर पूरे गाने को समझ सकता है। यह AI विशेष है क्योंकि यह केवल वीडियो के एक सेकंड को नहीं देखता; यह याद रखता है कि कुछ सेकंड पहले क्या हुआ था और भविष्यवाणी करता है कि आगे क्या हो सकता है। यह समझता है कि एक सेकंड के लिए नज़र हटाना और एक पूरे मिनट तक नज़र हटाकर रखना, एक ही बात नहीं है।

ध्यान की चार अवस्थाएं (Four States of Attention)

सिस्टम हर बच्चे को चार "मूड" या अवस्थाओं में वर्गीकृत करने की कोशिश करता है:

  1. उच्च एकाग्रता (High Focus): बच्चा पूरी तरह से लगा हुआ है, आँखें शिक्षक पर हैं, शरीर स्थिर है। (जैसे एक लेज़र बीम)।
  2. मध्यम एकाग्रता (Medium Focus): बच्चा ध्यान दे रहा है लेकिन शायद थोड़ा दिवास्वप्न (daydreaming) देख रहा है या थोड़ा हिल-डुल रहा है। (जैसे एक मंद हवा)।
  3. अस्थिर ध्यान (Fluctuating Attention): बच्चा ध्यान देने और विचलित होने के बीच झूल रहा है। (जैसे एक यो-यो)।
  4. स्पष्ट व्याकुलता (Obvious Distraction): बच्चे ने पूरी तरह से ध्यान हटा लिया है, खिलौनों से खेल रहा है या दोस्तों से बात कर रहा है। (जैसे किसी दूसरे स्टेशन पर ट्यून किया गया रेडियो)।

उन्होंने इसका परीक्षण कैसे किया

शोधकर्ताओं ने वास्तविक प्रीस्कूल क्लासरूम के वीडियो फिल्माए:

  • शिक्षक-नेतृत्व वाले पाठ: जहाँ शिक्षक बोलता है और बच्चे सुनते हैं।
  • प्रश्न-उत्तर सत्र: जहाँ बच्चे हाथ उठाते हैं और उत्तर देते हैं।
  • प्रायोगिक गतिविधियाँ (Hands-on activities): जहाँ बच्चे घूम रहे होते हैं और चीज़ें बना रहे होते हैं।
  • गेम ट्रांज़िशन (खेल के दौरान बदलाव): वह अराजक समय जब बच्चे एक गतिविधि से दूसरी गतिविधि में जा रहे होते हैं।

उन्होंने इन हजारों वीडियो क्लिप्स को अपने AI में डाला और AI के अनुमानों की तुलना विशेषज्ञों द्वारा बताई गई बच्चों की गतिविधियों से की।

परिणाम: "ऑल-राउंडर" की जीत

पेपर का दावा है कि उनका नया सिस्टम इस काम में सबसे अच्छा है। यहाँ इसका विवरण दिया गया है:

  • सिंगल कैमरों से बेहतर: एक सिस्टम जो केवल वीडियो का उपयोग करता था, उसकी सटीकता लगभग 81% थी। साउंड और बॉडी ट्रैकिंग जोड़ने से सटीकता बढ़कर लगभग 90% हो गई।
  • "ट्रांसफॉर्मर" का लाभ: उनका विशिष्ट AI मॉडल (ट्रांसफॉर्मर) पुराने मॉडलों की तुलना में "अस्थिर" (Fluctuating) अवस्था को पहचानने में बेहतर था। यह वैसा ही है जैसे कि एक व्यक्ति जो पूरी फिल्म की कहानी याद रखता है, वह केवल एक दृश्य देखने वाले व्यक्ति की तुलना में चरित्र को बेहतर समझता है।
  • अराजकता को संभालना: सिस्टम शोर वाले क्लासरूम में भी अच्छा काम करता है, भले ही वहां काफी हलचल हो (जैसे खेलों के दौरान), हालांकि शांत पाठों की तुलना में इन अराजक समयों के दौरान इसकी सटीकता थोड़ी कम थी।

यह पेपर क्या नहीं कहता है

यह महत्वपूर्ण है कि हम केवल वही कहें जो लेखकों ने दावा किया है:

  • उन्होंने यह नहीं कहा कि यह सिस्टम बता सकता है कि कोई बच्चा "सीख रहा है" या "बुद्धिमान" है। यह केवल ध्यान (attention) को मापता है, बुद्धिमत्ता को नहीं।
  • उन्होंने यह नहीं कहा कि यह शिक्षकों की जगह लेगा। यह एक उपकरण है जो कक्षा में क्या हो रहा है, इसे देखने में मदद करता है।
  • उन्होंने यह भी दावा नहीं किया कि यह दुनिया के हर एक किंडरगार्टन में पूरी तरह से काम करता है। उन्होंने उल्लेख किया कि इसका परीक्षण विशिष्ट कैमरों के साथ विशिष्ट क्लासरूम में किया गया था, और इसके लिए अलग-अलग कमरों के अनुसार समायोजन की आवश्यकता हो सकती है।

निष्कर्ष (The Bottom Line)

यह पेपर एक नए तरीके को प्रस्तुत करता है जिससे एक क्लासरूम को एक के बजाय तीन इंद्रियों का उपयोग करके "सुना" जा सकता है। वीडियो, ऑडियो और बॉडी ट्रैकिंग को एक स्मार्ट AI के साथ जोड़कर, जो समय और संदर्भ (context) को समझता है, शोधकर्ताओं ने एक ऐसा टूल बनाया है जो सटीक रूप से बता सकता है कि एक प्रीस्कूलर केंद्रित है, विचलित है, या इन दोनों के बीच कहीं है। यह प्रारंभिक बाल शिक्षा की जटिल, शोर-शराबे वाली और तेज़ गति वाली दुनिया को पहले से कहीं अधिक सटीकता के साथ समझने की दिशा में एक कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →