← नवीनतम पेपर
💬 NLP

From Scoring to Explanations: Evaluating SHAP and LLM Rationales for Rubric-based Teaching Quality Assessment

यह शोध पत्र रूब्रिक-आधारित शिक्षण गुणवत्ता स्कोरिंग का मूल्यांकन करने के लिए SHAP एट्रिब्यूशंस और LLM-जनित तर्क (rationales) को संयोजित करने वाले एक ढांचे का प्रस्ताव करता है, जिसमें यह पाया गया है कि जबकि फाइन-ट्यून्ड PLMs उच्च सटीकता प्राप्त करते हैं, SHAP, LLM तर्कों की तुलना में अधिक निष्ठावान, सुसंगत और हस्तांतरणीय स्पष्टीकरण प्रदान करता है।

मूल लेखक: Ivo Bueno, Babette Bühler, Philipp Stark, Tim Fütterer, Ulrich Trautwein, Dorottya Demszky, Heather Hill, Enkelejda Kasneci

प्रकाशित 2026-06-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ivo Bueno, Babette Bühler, Philipp Stark, Tim Fütterer, Ulrich Trautwein, Dorottya Demszky, Heather Hill, Enkelejda Kasneci

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शिक्षक हैं जो छात्रों के निबंधों का ढेर चेक कर रहे हैं। आपके पास एक सख्त चेकलिस्ट (एक "रूब्रिक") है जिससे आप तय करते हैं कि निबंध में दिया गया फीडबैक अच्छा है, बुरा है, या बीच का है। अब, कल्पना कीजिए कि आपने यह ग्रेडिंग करने के लिए दो अलग-अलग प्रकार के "AI असिस्टेंट" नियुक्त किए हैं।

यह पेपर इस बारे में एक रिपोर्ट कार्ड है कि ये दो AI असिस्टेंट कितने अच्छे से काम करते हैं, और इससे भी महत्वपूर्ण बात यह है कि वे यह समझाने में कितने सक्षम हैं कि उन्होंने एक निश्चित ग्रेड क्यों दिया।

यहाँ सरल उपमाओं (analogies) का उपयोग करके अध्ययन का विवरण दिया गया है:

दो दावेदार

शोधकर्ताओं ने कक्षा की बातचीत (ट्रांसक्रिप्ट) को एक विशिष्ट रूब्रिक जिसे "फीडबैक की गुणवत्ता" कहा जाता है, के आधार पर ग्रेड करने के लिए दो प्रकार के AI मॉडल का परीक्षण किया।

  1. "विशेषज्ञ इंटर्न" (Fine-tuned PLMs): ये मानक AI मॉडल हैं जिन्हें विशेष रूप से इस सटीक ग्रेडिंग कार्य के हजारों उदाहरणों पर प्रशिक्षित किया गया है। ये उस छात्र की तरह हैं जिसने पाठ्यपुस्तक को रट लिया है और परीक्षा का सौ बार अभ्यास किया है।
  2. "स्मार्ट जनरललिस्ट" (Prompted LLMs): ये विशाल, शक्तिशाली AI मॉडल हैं (जैसे कि वे जिनसे आप ऑनलाइन चैट करते हैं) जिन्हें इस कार्य के लिए विशेष रूप से प्रशिक्षित नहीं किया गया है। इसके बजाय, शोधकर्ताओं ने उन्हें केवल निर्देशों (प्रॉम्प्ट) का एक सेट दिया: "यहाँ रूब्रिक है, इसे ग्रेड करें।" ये एक प्रतिभाशाली विशेषज्ञ की तरह हैं जिन्होंने पहले कभी यह विशिष्ट परीक्षा नहीं देखी है, लेकिन उनसे तुरंत इसे हल करने के लिए कहा गया है।

पहला परीक्षण: कौन सही ग्रेड प्राप्त करता है? (स्कोरिंग)

शोधकर्ताओं ने पूछा: कौन सबसे सटीक स्कोर देता है?

  • परिणाम: विशेषized इंटर्न बहुत अधिक सटीक था। इसने लगातार मानव विशेषज्ञों के बहुत करीब स्कोर दिए।
  • पेंच (The Catch): इंटर्न की एक अजीब आदत थी कि वह "सुरक्षित" खेलता था। इसने शायद ही कभी उच्चतम (7) या निम्नतम (1) स्कोर दिए। यह अपने ग्रेड को बीच (3, 4, या 5) में रखने की प्रवृत्ति रखता था। यह सटीक था लेकिन थोड़ा उबाऊ और जोखिम से बचने वाला था।
  • जनरललिस्ट: स्मार्ट जनरललिस्ट कुल मिलाकर कम सटीक था। हालाँकि, यह अधिक "साहसी" था। इसने बहुत अधिक विविधता वाले स्कोर दिए, जिनमें बहुत उच्च और बहुत निम्न स्कोर भी शामिल थे, भले ही वह हमेशा सही न हो।

निष्कर्ष: यदि आपको सबसे सटीक संख्या चाहिए, तो प्रशिक्षित मॉडल का उपयोग करें। यदि आप एक ऐसा मॉडल चाहते हैं जो अत्यधिक स्कोर देने से न डरे (भले ही वह अधिक गलतियाँ करे), तो बड़े चैटबॉट का उपयोग करें।

दूसरा परीक्षण: कौन सच बोलता है? (व्याख्या)

यह पेपर का सबसे महत्वपूर्ण हिस्सा है। शिक्षा में, आप केवल एक स्कोर नहीं चाहते; आप जानना चाहते हैं कि क्यों

  • विशेषज्ञ इंटर्न ने SHAP नामक एक गणितीय उपकरण का उपयोग किया। SHAP को एक फोरेंसिक अकाउंटेंट की तरह समझें। यह ट्रांसक्रिप्ट को वाक्य-दर-वाक्य देखता है और गणना करता है कि प्रत्येक वाक्य ने अंतिम स्कोर को वास्तव में कितना बदला। यह एक कैलकुलेटर की तरह है जो कहता है: "इस वाक्य ने 0.5 अंक जोड़े; उस वाक्य ने 0.2 अंक घटाए।"
  • स्मार्ट जनरललिस्ट ने बस बात की। इसने उन वाक्यों की एक सूची बनाई जिन्हें यह महत्वपूर्ण समझता था, और उन्हें प्राकृतिक भाषा में लिखा। यह एक छात्र की तरह है जो हाथ उठाकर कहता है, "मुझे लगता है कि यह हिस्सा महत्वपूर्ण है क्योंकि..."

शोधकर्ताओं ने यह परीक्षण करने के लिए कि कौन सच बोल रहा है, "डिलीट और देखें" (Delete and See) का खेल खेला।

  1. उन्होंने उन वाक्यों को लिया जिन्हें AI ने महत्वपूर्ण बताया था।
  2. उन्होंने उन वाक्यों को ट्रांसक्रिप्ट से हटा दिया।
  3. उन्होंने फिर से AI से खाली ट्रांसक्रिप्ट को ग्रेड करने के लिए कहा।

तर्क: यदि AI वास्तव में समझता था कि उसने एक स्कोर क्यों दिया, तो उन "महत्वपूर्ण" वाक्यों को हटाने से स्कोर गिर जाना चाहिए या नाटकीय रूप रूप से बदल जाना चाहिए। यदि AI केवल एक कहानी बना रहा था, तो उन वाक्यों को हटाने से स्कोर में ज्यादा बदलाव नहीं होना चाहिए था।

  • परिणाम: विशेषज्ञ इंटर्न (SHAP) ईमानदार था। जब शोधकर्ताओं ने उन वाक्यों को हटाया जिन्हें SHAP ने चिह्नित किया था, तो स्कोर में बहुत बदलाव आया। AI स्पष्ट रूप रूप से अपने निर्णय लेने के लिए उन विशिष्ट वाक्यों पर निर्भर था।
  • परिणाम: स्मार्ट जनरललिस्ट (LLM) अक्सर झूठ बोल रहा था। जब शोधकर्ताओं ने उन वाक्यों को हटाया जिन्हें LLM ने महत्वपूर्ण बताया था, तो स्कोर में बहुत कम बदलाव आया। LLM एक "तर्कसंगत लगने वाली" व्याख्या उत्पन्न कर रहा था, लेकिन वे वाक्य वास्तव में उसके निर्णय को संचालित करने वाले कारक नहीं थे। यह एक छात्र द्वारा यह बताने के समान था कि वह क्यों 'A' ग्रेड का हकदार है, लेकिन जब शोधकर्ताओं ने उसके द्वारा दिए गए सबूतों को हटा दिया, तो उसका ग्रेड वास्तव में नहीं बदला।

तीसरा परीक्षण: क्या वे नोट्स बदल सकते हैं? (Cross-Model)

शोधकर्ताओं ने यह देखने की कोशिश की कि क्या व्याख्याएं सार्वभौमिक थीं।

  • उन्होंने "महत्वपूर्ण वाक्यों" को लिया जिन्हें विशेषज्ञ इंटर्न द्वारा पहचाना गया था और उन्हें स्मार्ट जनरललिस्ट के इनपुट से हटा दिया। परिणाम: जनरललिस्ट का स्कोर काफी बदल गया। विशेषज्ञ इंटर्न का गणित जनरललिस्ट पर भी काम कर गया।
  • उन्होंने उन "महत्वपूर्ण वाक्यों" को लिया जिन्हें स्मार्ट जनरललिस्ट द्वारा पहचाना गया था और उन्हें विशेषज्ञ इंटर्न के इनपुट से हटा दिया। परिणाम: विशेषज्ञ इंटर्न का स्कोर बहुत कम हिला। जनरललिस्ट की "राय" का इंटर्न पर कोई प्रभाव नहीं पड़ा।

निष्कर्ष: गणितीय व्याख्या (SHAP) एक सार्वभौमिक सत्य है जो विभिन्न AI मस्तिष्क पर भी काम करती है। चैटबॉट की व्याख्या उस विशिष्ट चैटबॉट के लिए विशिष्ट है और अन्य के विरुद्ध परीक्षण करने पर टिक नहीं पाती है।

अंतिम निर्णय

पेपर निष्कर्ष निकालता है कि जबकि बड़े, शक्तिशाली चैटबॉट्स (LLMs) टेक्स्ट लिखने में बहुत अच्छे हैं जो एक अच्छी व्याख्या जैसा लगता है, वे शिक्षकों की ग्रेडिंग जैसे उच्च-दांव (high-stakes) वाली स्थितियों में यह समझाने के लिए कि निर्णय क्यों लिया गया, अविश्वसनीय हैं।

  • SHAP (गणित): एक पारदर्शी खिड़की की तरह है। आप देख सकते हैं कि कौन सी ईंटें दीवार को थामे हुए हैं। यह भरोसेमंद और सुसंगत है।
  • LLM Rationales (चैट): जादूगर के हाथ की सफाई की तरह है। वे प्रभावशाली और प्रेरक दिखते हैं, लेकिन यदि आप ध्यान से देखें, तो आप पाएंगे कि वे वास्तव में निर्णय का भार नहीं उठा रहे हैं।

संक्षेप में: यदि आपको स्कूल के माहौल में ग्रेड के लिए भरोसेमंद कारण की आवश्यकता है, तो गणित (SHAP) पर भरोसा करें, चैटबॉट की कहानी पर नहीं। चैटबॉट लिखने के लिए महान है, लेकिन वह अपने निर्णयों के लिए एक बुरा गवाह है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →