← नवीनतम पेपर
💬 NLP

S-GRADES -- Studying Generalization of Student Response Assessments in Diverse Evaluative Settings

यह शोध पत्र S-GRADES को प्रस्तुत करता है, जो एक ओपन-सोर्स वेब-आधारित बेंचमार्क है जो मानकीकृत मूल्यांकन को सक्षम करने और ऑटोमेटेड एसे स्कोरिंग एवं शॉर्ट आंसर ग्रेडिंग कार्यों के बीच सामान्यीकरण अंतराल (जनरलाइजेशन गैप्स) को प्रकट करने के लिए 14 विविध छात्र प्रतिक्रिया मूल्यांकन डेटासेट्स को एकीकृत करता है।

मूल लेखक: Tasfia Seuti, Sagnik Ray Choudhury

प्रकाशित 2026-03-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tasfia Seuti, Sagnik Ray Choudhury

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक विशाल, अराजक पुस्तकालय की कल्पना करें जहाँ शिक्षक छात्रों के होमवर्क के ढेरों में डूब रहे हैं। कुछ असाइनमेंट लंबे, बहते हुए इतिहास या साहित्य के निबंध हैं, जबकि कुछ विज्ञान के प्रश्नों के छोटे, सटीक उत्तर हैं जैसे कि "फ्रांस की राजधानी क्या है?" या "पुल क्यों ढह गया?"

वर्षों से, कंप्यूटर वैज्ञानिकों ने इन कागजों को जांचने वाले रोबोट बनाने की कोशिश में दो अलग-अलग कमरों में काम किया है जो एक-दूसरे से बात नहीं करते हैं।

  • कमरा A (निबंध ग्रेडर): उन्होंने लंबी कहानियाँ पढ़ने वाले रोबोट बनाए। वे प्रवाह, भावना और इस बात पर ध्यान देते हैं कि छात्र ने अपनी बात कितनी अच्छी तरह रखी।
  • कमरा B (लघु-उत्तर ग्रेडर): उन्होंने तथ्यों की जाँच करने वाले रोबोट बनाए। वे इस बात पर ध्यान देते हैं कि उत्तर तकनीकी रूप से सही है या नहीं, चाहे लिखावट कितनी भी सुंदर क्यों न हो।

समस्या क्या है? इन दोनों समूहों के पास अलग-अलग नियम पुस्तिकाएं, अलग-अलग मापने वाले टेप और अलग-अलग भाषाएँ हैं। एक ऐसा रोबोट जो निबंध ग्रेड करने में जीनियस है, वह केमिस्ट्री के सवालों को ग्रेड करने में बहुत बुरा हो सकता है, और अब तक किसी को पता ही नहीं था कि क्यों

S-GRADES का आगमन: ग्रेडिंग के लिए एक "यूनिवर्सल ट्रांसलेटर"

इस पेपर के लेखक, तस्फिया सेउटी और सग्निक रे चौधरी ने एक विशाल, एकीकृत परीक्षण मैदान बनाने का निर्णय लिया जिसे S-GRADES कहा जाता है।

S-GRADES को एक विशाल, तटस्थ खेल के मैदान के रूप में सोचें। निबंध वाले रोबोटों को बास्केटबॉल खेलने और लघु-उत्तर वाले रोबोटों को फुटबॉल खेलने के बजाय, उन्होंने सभी को एक ही स्टेडियम में एक ही खेल खेलने के लिए रखा।

यहाँ बताया गया है कि उन्होंने इसे सरल चरणों में कैसे किया:

1. होमवर्क का "ऑल-यू-कैन-ईट" बुफे

उन्होंने हर जगह से 14 अलग-अलग प्रकार के छात्र असाइनमेंट एकत्र किए।

  • कुछ लंबे निबंध थे (जैसे संपादक को पत्र लिखना)।
  • कुछ छोटे विज्ञान के उत्तर थे (जैसे भौतिकी की किसी अवधारणा को समझाना)।
  • वे रसायन विज्ञान या कंप्यूटर विज्ञान जैसे विशिष्ट विषयों से भी जुड़े थे।
    उन्होंने उन सभी को साफ किया और एक बड़े, व्यवस्थित बॉक्स में रखा ताकि हर रोबोट को ठीक एक जैसी चुनौतियों का सामना करना पड़े।

2. "बिग थ्री" रोबोट

उन्होंने केवल एक रोबोट का परीक्षण नहीं किया; वे आज के तीन सबसे शक्तिशाली "मस्तिष्क" लेकर आए (GPT-4o mini, Gemini 2.5 Flash, और Llama 4 Scout) यह देखने के लिए कि कौन पूरे बुफे को संभाल सकता है।

3. "सोचने के तरीके" (तर्क रणनीतियाँ)

यह सबसे रचनात्मक हिस्सा है। शोधकर्ताओं ने केवल रोबोट को "इसे ग्रेड करो" नहीं कहा। उन्होंने उन्हें समस्या को हल करने के लिए अलग-अलग मानसिक उपकरण दिए, जैसे किसी जासूस को रहस्य सुलझाने के अलग-अलग तरीके देना:

  • "कॉपीकैट" (आगमनात्मक/Inductive): "यहाँ 5 उदाहरण दिए गए हैं कि कैसे एक शिक्षक ने समान पेपरों को ग्रेड किया। पैटर्न देखें और ग्रेड का अनुमान लगाएं।"
  • "नियम पुस्तिका पाठक" (निगमनात्मक/Deductive): "यहाँ सख्त नियम दिए गए हैं। उन्हें तार्किक रूप से इस उत्तर पर लागू करें।"
  • "शरलॉक होम्स" (अपवर्तनात्मक/Abductive): "इस उत्तर को देखें। सबसे संभावित कारण क्या है कि छात्र सही या गलत हुआ? सबसे अच्छा स्पष्टीकरण निकालें।"
  • "हाइब्रिड शेफ": इन उपकरणों को आपस में मिलाना (जैसे, "उदाहरण देखें और नियमों को लागू करें")।

उन्होंने क्या खोजा? (प्लॉट ट्विस्ट)

जब उन्होंने रोबोटों को इस एकीकृत मैदान से गुजारा, तो उन्हें कुछ आश्चर्यजनक बातें पता चलीं:

1. "एक-आकार-सभी-के-लिए-फिट" का मिथक मर चुका है
सिर्फ इसलिए कि एक रोबोट कविता लिखने में माहिर है, इसका मतलब यह नहीं है कि वह गणित का समीकरण हल करने में भी माहिर है। जो रोबोट लंबे निबंधों को ग्रेड करने में उत्कृष्ट थे, वे अक्सर तथ्यात्मक लघु उत्तरों का सामना करते समय लड़खड़ा गए। यह एक मिशलिन-स्टार शेफ को नल ठीक करने के लिए काम पर रखने जैसा है; उनके पास अलग-अलग कौशल होते हैं।

[संशोधन: मूल टेक्स्ट में 'Michelin-star chef to fix a leaky faucet' का संदर्भ है]

2. "सोचने का तरीका" उम्मीद से कहीं अधिक महत्वपूर्ण है
रोबोट का प्रदर्शन इस बात पर बहुत अधिक बदल गया कि उनसे कैसे सोचने के लिए कहा गया था।

  • कभी-कभी, रोबोट को "उदाहरण देखने" के लिए कहना सबसे अच्छा काम करता था।
  • अन्य समय में, उन्हें "नियमों का पालन करने" के लिए कहना बेहतर था।
  • विजेता: "हाइब्रिड" दृष्टिकोण (उदाहरणों और नियमों को मिलाना) आमतौर पर जीत गया। यह एक छात्र को बताने जैसा है, "यहाँ एक नमूना निबंध है, और यहाँ ग्रेडिंग के नियम हैं। अब, अपना उत्तर लिखने के लिए दोनों का उपयोग करें।"

3. "लघु उत्तर" का जाल
लघु उत्तरों को ग्रेड करना निबंधों की तुलना में AI के लिए बहुत कठिन साबित हुआ। यह एक मैराथन धावक को जज करने (जहाँ आप पूरी दौड़ देख सकते हैं) और एक स्प्रिंटर को जज करने के बीच के अंतर जैसा है जो पलक झपकते ही समाप्त हो जाता है (जहाँ एक छोटी सी गलती पूरे परिणाम को बिगाड़ देती है)। रोबोट लघु उत्तरों के साथ बहुत कम सुसंगत थे।

4. "कॉपीकैट" अस्थिर है
जब रोबोटों ने यादृच्छिक उदाहरणों को देखकर सीखने की कोशिश की ( "कॉपीकैट" विधि), तो उनके ग्रेड इधर-उधर उछलने लगे यदि उन्होंने थोड़े अलग उदाहरण चुने। यह एक छात्र की तरह है जिसे अध्याय 1 पढ़ने पर 'A' मिलता है, लेकिन अध्याय 2 पढ़ने पर 'C' मिलता है, भले ही टेस्ट वही हो।

यह क्यों मायने रखता है?

इस पेपर से पहले, यदि आप एक ग्रेडिंग रोबोट बनाना चाहते थे, तो आपको अनुमान लगाना पड़ता था कि आपको किस "कमरे" में निर्माण करना है। आप एक बेहतरीन निबंध ग्रेडर बना सकते थे, केवल यह महसूस करने के लिए कि यह विज्ञान परीक्षणों पर बुरी तरह विफल हो जाता है।

S-GRADES एक मानचित्र है। यह हमें दिखाता है:

  • कौन से रोबल्स वास्तव में इतने स्मार्ट हैं कि वे किसी भी प्रकार के होमवर्क को संभाल सकें।
  • कौन से "सोचने के तरीके" रोबोटों को स्मार्ट बनाते हैं।
  • वे कहाँ अभी भी विफल हो रहे हैं (विशेष रूप से लघु, ट्रिकी उत्तरों के साथ)।

निष्कर्ष

कल्पना कीजिए कि शिक्षा एक विशाल, अस्त-व्यस्त रसोई है। लंबे समय तक, हमारे पास एक "पिज्जा रोबोट" और एक "सुशी रोबोट" था, और वे कभी रेसिपी साझा नहीं करते थे। S-GRADES नया हेड शेफ है जो कहता है, "रुको! आइए हम सभी को एक ही रसोई में रखें, उन्हें एक जैसे सामग्रियां दें, और देखें कि वास्तव में कौन पूरा भोजन पका सकता है।"

परिणाम? अब हम जानते हैं कि हालांकि हमारे AI शेफ बेहतर हो रहे हैं, उन्हें अभी भी "पिज्जा मोड" और "सुशी मोड" के बीच स्विच करना सीखना होगा ताकि खाना जले नहीं। यह पेपर भविष्य के लिए बेहतर, अधिक विश्वसनीय ग्रेडिंग रोबोट बनाने के लिए हमारा ब्लूप्रिंट देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →