SEFORA: Student Essays with Feedback Corpus and LLM Feedback Evaluation Framework
यह शोध पत्र SEFORA का परिचय देता है, जो वास्तविक प्रशिक्षक फीडबैक के साथ छात्र निबंधों का एक बड़े पैमाने पर कॉर्पस है, और UniMatch, जो एक नवीन मूल्यांकन ढांचा है जो यह प्रकट करता है कि वर्तमान LLMs मानव प्रशिक्षक की प्राथमिकताओं के अनुरूप फीडबैक उत्पन्न करने में संघर्ष करते हैं, जो व्यापक प्रयोगों में केवल 0.4 का अधिकतम F1 स्कोर प्राप्त करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक शिक्षक हैं जो छात्रों के निबंधों का ढेर ग्रेड कर रहे हैं। आपको हर वाक्य को पढ़ना होगा, अच्छे हिस्सों को ढूंढना होगा, भ्रमित करने वाले हिस्सों की ओर इशारा करना होगा, और छात्र को सुधारने में मदद करने के लिए हाशिए (margins) में विशिष्ट नोट्स लिखने होंगे। यह कठिन काम है, और एक साथ सैकड़ों छात्रों के लिए ऐसा करना एक इंसान के लिए लगभग असंभव है।
हाल ही में, हमने इस काम को करने के लिए "AI शिक्षकों" (लार्ज लैंग्वेज मॉडल्स) का उपयोग करने की कोशिश की है। लेकिन एक समस्या है: हमें वास्तव में यह नहीं पता कि क्या AI अच्छी सलाह दे रहा है, और हमारे पास इसे मापने के लिए कोई अच्छा पैमाना नहीं है।
यह पेपर इन समस्याओं को ठीक करने के लिए दो चीजें पेश करता है: वास्तविक शिक्षक नोट्स का एक विशाल पुस्तकालय जिसे SEFORA कहा जाता है, और एक नया मापने वाला उपकरण जिसे UNIMATCH कहा जाता है।
1. पुस्तकालय: SEFORA (द "गोल्ड स्टैंडर्ड" कलेक्शन)
SEFORA को एक विशाल, व्यवस्थित स्क्रैपबुक की तरह समझें।
- इसके अंदर क्या है: इसमें वास्तविक कॉलेज कक्षाओं से छात्रों के निबंधों के 564 ड्राफ्ट शामिल हैं (कुछ एक बार लिखे गए हैं, कुछ कई बार दोबारा लिखे गए हैं)।
- विशेष हिस्सा: हर छात्र के निबंध के बगल में, इसमें वास्तविक मानव प्रोफेसरों द्वारा लिखे गए वास्तविक नोट्स हैं। ये केवल "गलत" कहने वाले लाल निशान नहीं हैं। ये वे स्टिकी नोट्स और हाइलाइट्स हैं जो कहते हैं जैसे, "यह पात्र वास्तविक लगता है," या "यहाँ 'वह' (that) का क्या संदर्भ है?"
- यह क्यों महत्वपूर्ण है: इससे पहले, अधिकांश AI डेटासेट में केवल स्कोर (जैसे "85/100") या सरल त्रुटि टैग होते थे। SEFORA विशेष है क्योंकि यह उस सूक्ष्मता (nuance) को पकड़ता है कि कैसे वास्तविक शिक्षक छात्रों से बात करते हैं, जिसमें टेक्स्ट के वे विशिष्ट हिस्से भी शामिल हैं जिनके बारे में वे बात कर रहे हैं।
2. पैमाना: UNIMATCH (द "फीडबैक डिटेक्टिव")
अब, कल्पना कीजिए कि आप एक AI को छात्र के निबंध पर फीडबैक लिखने के लिए कहते हैं। आप कैसे जानेंगे कि यह कितना अच्छा है?
- पुराना तरीका: आप AI के शब्दों की तुलना शिक्षक के शब्दों से कर सकते हैं यह देखने के लिए कि क्या वे समान दिखते हैं। लेकिन यह एक शेफ को यह परखने जैसा है कि क्या उसने रेसिपी के समान शब्दों का उपयोग किया है, बजाय इसके कि खाना कैसा बना है। यदि शिक्षक कहता है "इसे छोटा करें" और AI कहता है "अनावश्यक भाग हटा दें," तो एक साधारण शब्द-गणना जांच कह सकती है कि वे अलग हैं, भले ही उनका अर्थ एक ही हो।
- नया तरीका (UNIMATCH): यह टूल एक जासूस की तरह काम करता है। यह शिक्षक के नोट्स और AI के नोट्स दोनों को छोटे, व्यक्तिगत "फीडबैक यूनिट्स" (एक यूनिट में एक विशिष्ट विचार) में तोड़ देता है।
- चरण 1: यह नोट्स को टुकड़ों में विभाजित करता है।
- चरण 2: यह पूछता है, "क्या AI का यह टुकड़ा शिक्षक के एक टुकड़े के अर्थ से मेल खाता है?" (उदाहरण के लिए, क्या "अनावश्यक भाग हटा दें" का अर्थ "इसे छोटा करें" से मेल खाता है?)।
- चरण 3: यह एक स्मार्ट मैचिंग सिस्टम (जैसे मोजे की जोड़ी बनाना) का उपयोग करता है ताकि यह देखा जा सके कि शिक्षक के कितने महत्वपूर्ण बिंदुओं को AI ने खोज लिया और AI ने कितने अतिरिक्त, बेकार बिंदु खुद से बना लिए।
3. बड़ी खोज: "चैटरबॉक्स" (बड़बोलेपन) की समस्या
शोधकर्ताओं ने AI मॉडल को फीडबैक लिखने के लिए कहने के 74 अलग-अलग तरीकों का परीक्षण किया। परिणाम आश्चर्यजनक और थोड़े निराशाजनक थे:
- स्कोर: सबसे स्मार्ट AI मॉडल भी केवल 0.4 आउट ऑफ 1.0 का स्कोर प्राप्त कर पाए। इसका मतलब है कि वे उस विशिष्ट, उच्च-प्राथमिकता वाले फीडबैक को मिस कर रहे हैं जो एक मानव शिक्षक देगा।
- मुख्य अपराधी: कम स्कोर का सबसे बड़ा कारण वर्बोसिटी (ज़रूरत से ज़्यादा बोलना) था।
- उपमा: कल्पना कीजिए कि एक छात्र गणित की एक समस्या के लिए मदद मांगता है। एक अच्छा ट्यूटर एक स्पष्ट संकेत देता है। AI, हालांकि, एक घबराए हुए बड़बोले व्यक्ति की तरह व्यवहार करता है। वह एक संकेत देता है, लेकिन फिर पांच और सुझाव जोड़ देता है जो शिक्षक कभी नहीं देता, या एक ही बात को तीन अलग-अलग तरीकों से दोहराता है।
- परिणाम: क्योंकि AI बहुत अधिक "अतिरिक्त" शोर पैदा करता है, इसलिए इसकी सटीकता गिर जाती है। यह एक ऐसे छात्र की तरह है जो एक वाक्य के उत्तर के लिए 10 पन्नों का निबंध लिखता है; वह सही उत्तर तो दे सकता है, लेकिन उसने उसे इतनी अनावश्यक बातों के नीचे दबा दिया है कि वह मददगार नहीं रह जाता।
सारांश
यह पेपर बताता है कि जबकि AI टेक्स्ट जेनरेट कर सकता है, यह वर्तमान में एक विचारशील मानव शिक्षक की तरह कार्य करने में संघर्ष करता है। यह बहुत अधिक समझाने की कोशिश करता है और उन विशिष्ट, उच्च-मूल्य वाले बिंदुओं को मिस कर देता है जिन्हें वास्तविक शिक्षक प्राथमिकता देते हैं।
इसे ठीक करने के लिए, हमें चाहिए:
- बेहतर डेटा: वास्तविक उदाहरण कि शिक्षक वास्तव में कैसे बात करते हैं (जो SEFORA प्रदान करता है)।
- बेहतर मापन: यह जांचने का एक तरीका कि क्या AI सही बिंदुओं को हिट कर रहा है, न कि केवल सही शब्दों का उपयोग कर रहा है (जो UNIMATCH प्रदान करता है)।
जब तक AI संक्षिप्त होना और सही लक्ष्यों को भेदना नहीं सीख जाता, तब तक यह कक्षा में मानवीय स्पर्श की जगह लेने के लिए पूरी तरह तैयार नहीं है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।