AI-Assisted Grading in Biochemistry: Automated Long Answer Question Scoring with Expert-Level Accuracy
यह अध्ययन प्रदर्शित करता है कि GPT-4 का उपयोग करने वाला एक AI-संचालित टूल स्नातक जैव रसायन (बायोकेमिस्ट्री) के दीर्घ-उत्तर वाले प्रश्नों के स्कोरिंग के लिए विशेषज्ञ-स्तरीय सटीकता प्राप्त कर सकता है और सुसंगत, रूब्रिक-आधारित फीडबैक प्रदान कर सकता है, जो बड़ी कक्षा के आकार और संकाय की कमी से उत्पन्न चुनौतियों को प्रभावी ढंग से संबोधित करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
चिकित्सा शिक्षा की दुनिया में, जैव रसायन (बायोकेमिस्ट्री) पढ़ाने के लिए केवल इस बारे में तथ्य रटना पर्याप्त नहीं है कि शरीर ऊर्जा को कैसे संसाधित करता है। इसके लिए छात्रों को गहराई से सोचने और जटिल प्रक्रियाओं को अपने शब्दों में समझाने की आवश्यकता होती है। इस समझ को मापने के लिए, प्रशिक्षक अक्सर दीर्घ-उत्तर वाले प्रश्नों का उपयोग करते हैं, जहाँ एक छात्र को एक विस्तृत जैविक तंत्र (मैकेनिज्म) लिखकर समझाना होता है। ये प्रश्न सीखने के शक्तिशाली उपकरण हैं क्योंकि ये छात्रों को अपने विचारों को व्यवस्थित करने और वास्तविक महारत प्रदर्शित करने के लिए मजबूर करते हैं। हालाँकि, इनका मूल्यांकन करना एक भारी बोझ है। जब कक्षा बड़ी हो जाती है, तो एक अकेला शिक्षक प्रत्येक निबंध को ध्यान से पढ़ने, व्यक्तिगत प्रतिक्रिया देने और यह सुनिश्चित करने के लिए आवश्यक समय नहीं दे पाता कि प्रत्येक छात्र का समान मानकों के विरुद्ध निष्पक्ष रूप से मूल्यांकन किया गया है। चुनौती केवल काम की मात्रा नहीं है, बल्कि निरंतरता की आवश्यकता भी है; एक शिक्षक किसी विशिष्ट विवरण को महत्व दे सकता है जिसे दूसरा अनदेखा कर देता है, जिससे असमान परिणाम सामने आते हैं।
भारत के मेडिकल कॉलेजों के शोधकर्ताओं की एक टीम ने यह देखने के लिए प्रयास किया कि क्या एक नए प्रकार का कंप्यूटर प्रोग्राम इस समस्या को हल कर सकता है। वे जानना चाहते थे कि क्या एक कृत्रिम बुद्धिमत्ता (एआई) प्रणाली इन लंबे निबंधों को पढ़ सकती है, एक अनुभवी मानव प्रोफेसर के समान कौशल के साथ ग्रेड दे सकती है, और सटीक रूप से समझा सकती है कि किसी छात्र को एक निश्चित स्कोर क्यों दिया गया। शोधकर्ताओं ने एक ऐसा उपकरण बनाया जो एक डिजिटल परीक्षक की तरह कार्य करता है। केवल शब्दों को गिनने या कीवर्ड्स की जाँच करने के बजाय, इस प्रणाली को नियमों का एक विशिष्ट सेट दिया गया, जिसे 'रुब्रिक' (rubric) कहा जाता है, जो एक आदर्श उत्तर को छोटे हिस्सों में विभाजित करता है। कंप्यूटर को छात्र के लेखन में उन विशिष्ट हिस्सों को खोजने, जो पाए गए उनके लिए अंक देने और फिर यह सुझाव देने का निर्देश दिया गया कि उत्तर में सुधार कैसे किया जा सकता है। इस कार्य को करने के लिए प्रणाली ने एक परिष्कृत भाषा मॉडल (लैंग्वेज मॉडल) का उपयोग किया, जो मानव भाषा को समझने के लिए विशाल मात्रा में टेक्स्ट पर प्रशिक्षित एक प्रकार का कंप्यूटर प्रोग्राम है।
इस अध्ययन में तीन सौ छात्र शामिल थे जिन्होंने जैव रसायन के दो अलग-अलग प्रश्नों के उत्तर लिखे थे। शोधकर्ताओं ने इन छह सौ प्रतिक्रियाओं को एकत्र किया और उन्हें दो बार ग्रेड किया गया: एक बार कंप्यूटर द्वारा और एक बार दो मानव विशेषज्ञों द्वारा जिन्हें विषय पढ़ाने का वर्षों का अनुभव था। मानव शिक्षकों ने कागजों को अंक देने के लिए उन्हीं नियमों के सेट का उपयोग किया। यह सुनिश्चित करने के लिए कि कंप्यूटर केवल अनुमान नहीं लगा रहा है, शोधकर्ताओं ने इसे प्रत्येक पेपर को मामूली बदलावों के साथ पांच बार ग्रेड करने के लिए कहा और फिर मध्य स्कोर को अंतिम परिणाम के रूप में लिया। इस पद्धति ने किसी भी यादृच्छिक त्रुटि (रैंडम एरर) को कम करने में मदद की जो कंप्यूटर द्वारा की जा सकती थी। टीम ने मशीन द्वारा दिए गए स्कोर की तुलना दो मानव शिक्षकों द्वारा दिए गए स्कोर से की ताकि यह देखा जा सके कि वे एक-दूसरे से कितने मेल खाते हैं।
परिणामों ने मशीन और मनुष्यों के बीच सहमति का एक आश्चर्यजनक स्तर दिखाया। कृत्रिम बुद्धिमत्ता द्वारा दिए गए स्कोर मानव विशेषज्ञों द्वारा दिए गए स्कोर के लगभग समान थे। जब शोधकर्ताओं ने यह मापा कि कंप्यूटर के ग्रेड शिक्षकों के ग्रेड का कितनी बारीकी से पालन करते हैं, तो आंकड़ों ने एक उत्कृष्ट मिलान दिखाया, जो कि आमतौर पर दो अलग-अलग मनुष्यों द्वारा एक ही पेपर को ग्रेड करने के मामले में देखे जाने वाले स्तर से कहीं बेहतर है। कंप्यूटर ने लगातार शिक्षकों से अधिक या कम अंक नहीं दिए; इसका औसत स्कोर मानव औसत के लगभग समान था। वास्तव में, कंप्यूटर की ग्रेडिंग विशेषज्ञों के साथ इतनी सुसंगत थी कि इसे कक्षा में एक विश्वसनीय साथी माना जा सकता है। प्रणाली ने विशिष्ट टिप्पणियाँ भी प्रदान कीं कि छात्र का उत्तर कहाँ कमजोर था, जिससे विवरण का एक ऐसा स्तर प्राप्त हुआ जो छात्रों को अपनी गलतियों से सीखने में मदद करता है।
यह कार्य बताता है कि कृत्रिम बुद्धिमत्ता उस सूक्ष्मता (न्यूआंस) को खोए बिना, जो मानव शिक्षक प्रदान करते हैं, विज्ञान में जटिल लिखित उत्तरों को ग्रेड करने के कठिन कार्य को संभाल सकती है। शोधकर्ताओं ने पाया कि कंप्यूटर को यह देखने के लिए स्पष्ट निर्देश देकर कि क्या खोजना है, वह विशेषज्ञ-स्तर की सटीकता के साथ छात्र के कार्य का मूल्यांकन कर सकता है। इसका मतलब यह नहीं है कि कंप्यूटर शिक्षक की जगह ले लेता है, बल्कि यह है कि यह ग्रेडिंग के भारी काम को संभाल सकता है, जिससे मानव शिक्षक शिक्षण और मार्गदर्शन पर ध्यान केंद्रित करने के लिए स्वतंत्र हो सकते हैं। अध्ययन इंगित करता है कि यह दृष्टिकोण कक्षाओं में मूल्यांकन को निष्पक्ष और अधिक कुशल बनाने के लिए उपयोग किए जाने के लिए तैयार है, यह सुनिश्चित करते हुए कि प्रत्येक छात्र को वास्तव में उसकी समझ को दर्शाने वाला ग्रेड प्राप्त हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।