Evaluating Austrian A-Level German Essays with Large Language Models for Automated Essay Scoring
यह शोध पत्र रूब्रिक-आधारित प्रॉम्प्ट्स का उपयोग करके ऑस्ट्रियाई ए-लेवल जर्मन निबंध ग्रेडिंग पर चार अत्याधुनिक ओपन-वेट लार्ज लैंग्वेज मॉडल्स के प्रदर्शन का मूल्यांकन करता है, जिसमें यह पाया गया कि हालांकि वे मानकीकृत मानदंडों को लागू कर सकते हैं, लेकिन मानव विशेषज्ञों के साथ उनकी कम सहमति दर (उप-आयामों पर अधिकतम 40.6% और अंतिम ग्रेड पर 32.8%) उन्हें वर्तमान में वास्तविक दुनिया के स्वचालित स्कोरिंग के लिए अनुपयुक्त बनाती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक शिक्षक हैं जिसे हर हफ्ते सैकड़ों निबंधों को ग्रेड करना पड़ता है। यह थका देने वाला, समय लेने वाला है, और कभी-कभी, आप मंगलवार की सुबह थोड़े सख्त हो सकते हैं या शुक्रवार की दोपहर में बहुत उदार। यह वह समस्या है जिसे ऑटोमेटेड एसे स्कोरिंग (AES) हल करने की कोशिश करता है: कंप्यूटर का उपयोग करके ग्रेडिंग करना ताकि शिक्षक पढ़ाने पर ध्यान केंद्रित कर सकें।
लंबे समय तक, कंप्यूटर कठोर रोबोटों की तरह थे जो केवल यह गिन सकते थे कि निबंध में कितने शब्द हैं या वर्तनी की गलतियों की जांच कर सकते थे। वे वास्तव में लेखन को "समझ" नहीं सकते थे। लेकिन हाल ही में, हमारे पास ये सुपर-स्मार्ट AI दिमाग आए हैं जिन्हें लार्ज लैंग्वेज मॉडल्स (LLMs) कहा जाता है जो लगभग मनुष्यों की तरह पढ़, लिख और तर्क कर सकते हैं।
यह पेपर एक विशिष्ट प्रयोग के रिपोर्ट कार्ड की तरह है: क्या ये नए AI दिमाग ऑस्ट्रियाई हाई स्कूल जर्मन निबंधों को एक मानव शिक्षक की तरह ग्रेड कर सकते हैं?
यहाँ इसका विवरण दिया गया है, कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए:
1. सेटअप: "परीक्षा हॉल"
शोधकर्ताओं ने ऑस्ट्रियाई हाई स्कूल परीक्षाओं से 101 वास्तविक छात्र निबंध एकत्र किए। ये केवल यादृच्छिक पैराग्राफ नहीं थे; ये लेखन के विशिष्ट प्रकार थे जैसे विचार व्यक्त करना (opinion pieces), संपादकों को पत्र लिखना, और साहित्यिक विश्लेषण।
ग्रेडिंग सिस्टम को एक रेसिपी (विधि) की तरह समझें। ऑस्ट्रिया में, एक सख्त "रेसिपी" (जिसे रूब्रिक कहा जाता है) है जिसका शिक्षकों को पालन करना होता है। यह निबंध को चार सामग्रियों में तोड़ देता है:
- सामग्री (Content) (क्या उन्होंने सही बातें कहीं?)
- संरचना (Structure) (क्या यह व्यवस्थित है?)
- शैली (Style) (क्या यह सुनने में अच्छा लगता है?)
- भाषा (Language) (क्या व्याकरण सही है?)
लक्ष्य यह देखना था कि क्या एक AI इस रेसिपी का पूरी तरह से पालन कर सकता है।
2. प्रतियोगी: AI मॉडल
उन्होंने चार अलग-अलग AI मॉडल (DeepSeek, Qwen, Mixtral, और Llama) का परीक्षण किया। कल्पना कीजिए कि ये ग्रेड करने में मदद करने के लिए काम पर रखे गए चार अलग-अलग छात्र इंटर्न हैं।
- Mixtral एक ऐसे इंटर्न की तरह था जो ऊब गया और बिना पढ़े ही सबको "C" (ग्रेड 3) दे रहा था।
- DeepSeek एक ऐसा इंटर्न था जो बहुत सख्त था, अजीब फीडबैक देता था, और कभी-कभी जर्मन के बजाय चीनी भाषा भी बोल देता था!
- Qwen ठीक-ठाक था लेकिन अभी भी थोड़ा कठोर था।
- Llama3.3 स्पष्ट विजेता था। यह सबसे विश्वसनीय था, इसने निर्देशों को सबसे अच्छी तरह समझा और सबसे अधिक मानव जैसा फीडबैक दिया।
3. प्रशिक्षण: उन्होंने AI को कैसे सिखाया?
शोधकर्ताओं ने AI को यह समझने में मदद करने के लिए तीन अलग-अलग तरीके आजमाए कि एक "अच्छा" ग्रेड कैसा दिखता है:
- "ज़ीरो-शॉट" दृष्टिकोण (अंधा अनुमान): उन्होंने बस AI को निबंध और नियम सौंप दिए।
- परिणाम: AI भ्रमित हो गया। उसे यह नहीं पता था कि एक "ग्रेड 1" (परफेक्ट) वास्तव में एक "ग्रेड 5" (फेल) की तुलना में वास्तव में कैसा दिखता है।
- "RAG" दृष्टिकोण (लाइब्रेरी): उन्होंने AI को ग्रेडिंग करते समय देखने के लिए अन्य निबंधों (कुछ अच्छे, कुछ बुरे) का एक "चीट शीट" दिया।
- परिणाम: बेहतर था, लेकिन AI अभी भी सबसे अच्छे और सबसे खराब निबंधों के बीच अंतर करने में संघर्ष कर रहा था। यह एक छात्र को पाठ्यपुस्तक देने जैसा था लेकिन यह नहीं बताया कि कौन सा पेज पढ़ना है।
- "फ्यू-शॉट" दृष्टिकोण (मेंटरशिप): यह सबसे अच्छा तरीका था। उन्होंने AI को कुछ उदाहरण दिखाए: "यह एक परफेक्ट निबंध है (ग्रेड 1), यह एक अस्त-व्यस्त निबंध है (ग्रेड 5), और यह बीच का एक निबंध है (ग्रेड 3)।" फिर उन्होंने AI से उन उदाहरणों के आधार पर एक नया निबंध ग्रेड करने के लिए कहा।
- परिणाम: यह सबसे अच्छा काम कर गया। यह इंटर्न को पिछले काम का पोर्टफोलियो दिखाने जैसा था ताकि वे मानकों को समझ सकें।
4. परिणाम: क्या वे टेस्ट में पास हुए?
यहाँ बुरी खबर है: AI अभी मानव शिक्षकों को बदलने के लिए तैयार नहीं है।
- सहमति दर (Agreement Rate): जब AI और मानव शिक्षक ने एक ही निबंध को ग्रेड किया, तो वे अंतिम ग्रेड पर केवल 33% समय सहमत हुए।
- सब-स्कोर (Sub-scores): यहाँ तक कि केवल "सामग्री" या "व्याकरण" को देखते हुए भी, AI मानव के साथ केवल 40% समय सहमत हुआ।
इसे ऐसे समझें: यदि एक मानव शिक्षक किसी निबंध को "A" देता है, तो AI उसे "C" या "B" दे सकता है। यह पूरी तरह से रैंडम नहीं है, लेकिन यह इतना सटीक नहीं है कि इसे किसी छात्र के भविष्य के साथ भरोसेमंद बनाया जा सके।
5. यह क्यों विफल हुआ?
पेपर कुछ कारणों की ओर इशारा करता है कि AI संघर्ष क्यों कर रहा था:
- "ब्लैक बॉक्स" की समस्या: AI कभी-कभी बहुत चरम होने से डरकर बीच का रास्ता (ग्रेड 3) चुन लेता था।
- "लिखावट" की बाधा: कई छात्र निबंध हस्तलिखित थे। कंप्यूटर को उन्हें स्कैन करना था और टेक्स्ट में बदलना था (OCR)। इस प्रक्रिया ने त्रुटियां पैदा कीं, जैसे कि एक टेढ़े-मेढ़े "s" को "f" में बदल देना, जिससे AI भ्रमित हो गया।
- "एक शिक्षक" का पूर्वाग्रह: डेटासेट में केवल एक मानव शिक्षक के ग्रेड थे। यदि वह शिक्षक थोड़ा विचित्र या सख्त था, तो AI ने उसी विशिष्ट शैली को सीखा, न कि "सार्वभौमिक" सत्य को।
निचोड़ (The Bottom Line)
यह पेपर एक वास्तविकता की जाँच है। हालांकि AI ने बड़ी छलांग लगाई है, लेकिन वर्तमान में यह एक हेल्पफुल टीचिंग असिस्टेंट की तरह है न कि एक हेड टीचर की तरह।
यह एक निबंध पढ़ सकता है, व्याकरण की जांच कर सकता है और गुणवत्ता का एक मोटा अंदाजा दे सकता है। लेकिन यह अभी भी एक छात्र की अनूठी आवाज़ की बारीकियों या एक "अच्छे" और एक "महान" तर्क के बीच के सूक्ष्म अंतर को उस तरह से नहीं समझ सकता जैसे एक मानव कर सकता है।
भविष्य: लेखक सुझाव देते हैं कि भविष्य में, AI शिक्षकों को प्रतिस्थापित नहीं करेगा। इसके बजाय, यह एक ऐसा उपकरण होगा जो उबाऊ काम (वर्तनी की जांच करना, शब्दों को गिनना, संरचना का सुझाव देना) करेगा ताकि शिक्षक अपना समय उस वास्तविक मानवीय फीडबैक देने में बिता सकें जिसकी छात्रों को आवश्यकता होती है। लेकिन अभी के लिए, यह सुनिश्चित करने के लिए कि ग्रेड निष्पक्ष हों, हमें "ह्यूमन इन द लूप" (मानव की निगरानी) की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।