Beyond Holistic Scores: Automatic Trait-Based Quality Scoring of Argumentative Essays
यह शोध पत्र तर्कपूर्ण निबंधों के स्वचालित लक्षण-आधारित स्कोरिंग के लिए दो पूरक दृष्टिकोणों का प्रस्ताव और मूल्यांकन करता है, जो यह प्रदर्शित करता है कि एक सुपरवाइज्ड बिगबर्ड (BigBird) मॉडल ऑर्डिनल रिग्रेशन के साथ मानव रेटर्स के अनुरूप होने में बेसलाइन से काफी बेहतर प्रदर्शन करता है, जबकि छोटे ओपन-सोर्स एलएलएम (LLMs) बिना किसी कार्य-विशिष्ट फाइन-ट्यूनिंग के व्याख्या योग्य, रूब्रिक-संरेखित फीडबैक उत्पन्न करने के लिए एक प्रतिस्पर्धी, गोपनीयता-संरक्षण विकल्प प्रदान करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप ढेर सारे छात्रों के निबंधों को ग्रेड दे रहे एक शिक्षक हैं। पुराने दिनों में, स्वचालित ग्रेडिंग सिस्टम एक गुस्सैल प्रिंसिपल की तरह थे जो बस पूरे ढेर को देखते थे और एक ही नंबर दे देते थे, जैसे कि "10 में से 7"। इसे होलिस्टिक स्कोर (holistic score) कहा जाता है। समस्या क्या है? यह छात्र को यह नहीं बताता कि उन्हें वह स्कोर क्यों मिला। क्या उनके विचार शानदार थे लेकिन लिखावट खराब थी? या क्या उनकी व्याकरण एकदम सही थी लेकिन उनके तर्क कमजोर थे?
यह शोध पत्र एक स्मार्ट ग्रेडिंग सहायक बनाने के बारे में है जो केवल एक संख्या नहीं देता, बल्कि निबंध को विशिष्ट "विशेषताओं" (जैसे विचार (Ideas), संगठन (Organization), शब्द चयन (Word Choice), प्रवाह (Flow), और व्याकरण (Grammar)) में तोड़ता है और प्रत्येक को अलग से ग्रेड देता है। लेखक यह देखना चाहते थे कि क्या वे दो अलग-अलग प्रकार के AI टूल्स का उपयोग करके इसे सटीक रूप से कर सकते हैं।
यहाँ बताया गया है कि उन्होंने इसे कैसे किया, रोजमर्रा के उपमाओं (analogies) के साथ समझाया गया है:
वे दो टूल्स जिनका उन्होंने परीक्षण किया
शोधकर्ताओं ने इन निबंधों को ग्रेड देने के लिए दो बहुत अलग दृष्टिकोणों की तुलना की:
1. "स्मार्ट इंटर्न" (छोटे ओपन-सोर्स LLMs)
इसे एक बहुत ही बुद्धिमान, अच्छी तरह से पढ़ी-लिखी इंटर्न के रूप में सोचें जिसे अभी तक विशेष रूप से निबंध ग्रेड करने के लिए प्रशिक्षित नहीं किया गया है।
- वे कैसे काम करते थे: शोधकर्ताओं ने इंटर्न को एक "चीट शीट" (प्रॉम्ट) दी जिसने स्पष्ट किया कि क्या देखना है, अच्छे और बुरे निबंधों के उदाहरण दिखाए, और उनसे स्कोर देने से पहले अपने तर्क समझाने के लिए कहा।
- ट्विस्ट: उन्होंने छोटे, मुफ्त, ओपन-सोर्स मॉडल (जैसे Ministral-3) का उपयोग किया जो एक सामान्य कंप्यूटर पर चल सकते हैं, न कि बड़ी टेक कंपनियों के स्वामित्व वाले विशाल, महंगे, प्रोप्रायटरी मॉडल्स का।
- लक्ष्य: यह देखना कि क्या एक स्मार्ट, व्याख्या योग्य "इंटर्न" एक सुपर-कंप्यूटर जितना अच्छा ग्रेड दे सकता है, जबकि छात्र डेटा को निजी और स्थानीय रखा जा सके।
2. "विशेषज्ञ सांख्यिकीविद्" (BigBird-CORAL)
इसे एक अत्यधिक प्रशिक्षित सांख्यिकीविद् के रूप में सोचें जो केवल संख्याओं और पैटर्न को देखता है।
- वे कैसे काम करते थे: इस मॉडल को विशेष रूप से हजारों निबंधों पर प्रशिक्षित (fine-tuned) किया गया था।
- सीक्रेट सॉस: लेखकों ने CORAL नामक एक विशेष गणितीय ट्रिक का उपयोग किया। कल्पना कीजिए कि आप एक दौड़ को ग्रेड दे रहे हैं। यदि आप स्थानों (प्रथम, द्वितीय, तृतीय) को केवल यादृच्छिक नामों के रूप में देखते हैं, तो आपको लग सकता है कि प्रथम और तृतीय एक दूसरे से समान दूरी पर हैं। लेकिन वास्तव में, प्रथम स्थान द्वितीय के करीब है जितना कि वह तृतीय से है। CORAL विधि AI को सिखाती है कि ग्रेड क्रमबद्ध (ordered) होते हैं (कम < मध्यम < उच्च)। यह समझता है कि एक "मध्यम" निबंध को "उच्च" स्कोर देना एक बड़ी गलती है, बजाय इसके कि उसे "मध्यम" स्कोर दिया जाए।
- लक्ष्य: यह देखना कि क्या AI को यह सिखाने से कि ग्रेडों का एक विशिष्ट क्रम होता है, वह मानव शिक्षकों के साथ अधिक सहमति बनाता है।
प्रयोग
उन्होंने 8वीं कक्षा के छात्रों द्वारा लिखे गए 1,783 तर्कपूर्ण निबंधों का परीक्षण किया। निबंधों को मनुष्यों द्वारा 1 से 6 के पैमाने पर ग्रेड दिया गया था, जिसे शोधकर्ताओं ने तीन स्तरों में सरल बनाया: कमजोर (Weak), औसत (Fair), और मजबूत (Strong)।
उन्होंने पांच विशिष्ट विशेषताओं को देखा:
- सामग्री (Content): क्या विचार अच्छे हैं?
- संगठन (Organization): क्या निबंध अच्छी तरह से संरचित है?
- शब्द चयन (Word Choice): क्या शब्दावली अच्छी है?
- वाक्य प्रवाह (Sentence Fluency): क्या यह सुचारू रूप से पढ़ा जाता है?
- नियम (Conventions): क्या वर्तनी या व्याकरण की त्रुटियां हैं?
उन्हें क्या मिला
1. "विशेषज्ञ सांख्यिकीविद्" सटीकता में जीत गया।
BigBird-CORAL मॉडल मानव शिक्षकों के स्कोर से मेल खाने में सबसे अच्छा था। शोध ने पाया कि AI को स्पष्ट रूप से यह सिखाने कि ग्रेड क्रमबद्ध होते हैं (CORAL पद्धति का उपयोग करके), इससे बड़ा अंतर आया। यह मनुष्यों के साथ बहुत अधिक बार सहमत हुआ। यह एक ऐसे सांख्यिकीविद् की तरह था जो समझता था कि "B+" एक "A" के करीब है बजाय इसके कि "C" एक "A" के करीब हो, और उसी के अनुसार ग्रेड देता है।
2. "स्मार्ट इंटर्न" आश्चर्यजनक रूप से अच्छा था।
छोटे, ओपन-सोर्स Ministral-3 मॉडल ने बहुत अच्छा काम किया, विशेष रूप से निबंध के "सोचने वाले" हिस्सों (सामग्री और संगठन) पर।
- यह कई क्षेत्रों में सबसे महंगे, विशाल प्रोप्रायटरी मॉडल्स (जैसे GPT-5.1) के लगभग बराबर था।
- यह व्याकरण या वाक्य प्रवाह जैसे "छोटे चित्र" के विवरणों की तुलना में "बड़े चित्र" के तर्कों को ग्रेड देने में बहुत बेहतर था।
- यह क्यों मायने रखता है: क्योंकि यह छोटा और ओपन-सोर्स है, स्कूल छात्र डेटा को क्लाउड में भेजे बिना अपने स्वयं के कंप्यूटर पर इसे चला सकते हैं। यह अपने कक्षा में रखने योग्य एक ग्रेडिंग सहायक की तरह है, न कि किसी विशाल निगम से किराए पर लेने जैसा।
3. "चीट्स" (Baselines) विफल रहे।
जब उन्होंने विशेष "क्रमबद्ध" गणित (CORAL) के बिना, या स्मार्ट "चीट शीट" प्रॉम्ट्स के बिना समान AI मॉडल्स का परीक्षण किया, तो वे उतने अच्छे नहीं रहे। यह साबित करता है कि आप केवल एक जेनेरिक AI को ग्रेडिंग की समस्या पर नहीं फेंक सकते; आपको इसे सिखाना होगा कि रूब्रिक्स (rubrics) वास्तव में कैसे काम करते हैं।
मुख्य निष्कर्ष
पेपर यह निष्कर्ष निकालता है कि निबंधों को प्रभावी ढंग से ग्रेड करने के लिए, आपको दो चीजों की आवश्यकता है:
- क्रम का सम्मान करें: आपको AI को यह सिखाना चाहिए कि ग्रेड एक सीढ़ी की तरह हैं (कम से उच्च), न कि केवल यादृच्छिक बकेट। यह AI को मनुष्यों के साथ अधिक सहमति दिलाता है।
- छोटा ही सुंदर है: अच्छे परिणाम प्राप्त करने के लिए आपको एक विशाल, महंगे सुपर-कंप्यूटर की आवश्यकता नहीं है। एक छोटा, स्मार्ट, ओपन-सोर्स मॉडल बहुत अच्छा काम कर सकता है यदि आप उसे स्पष्ट निर्देश और उदाहरण दें।
यह दृष्टिकोण हमें केवल एक संख्या प्राप्त करने से आगे ले जाता है और सहायक, विशिष्ट फीडबैक की ओर ले जाता है जिसे शिक्षक और छात्र लेखन में सुधार करने के लिए वास्तव में उपयोग कर सकते हैं, जबकि पूरी प्रक्रिया पारदर्शी और निजी रहती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।