← नवीनतम पेपर
💬 NLP

EDIT: Evidence-Diagnosed Intervention Training for Rule-Faithful LLM Grading

यह शोध पत्र एविडेंस-डायग्नोस्ड इंटरवेंशन ट्रेनिंग (EDIT) का प्रस्ताव करता है, जो एक दो-चरणीय ढांचा है जो आंतरिक मॉडल संकेतों का उपयोग करके समस्यात्मक तर्क चरणों की पहचान करने और उन्हें संशोधित करने के बाद विश्वास-निर्देशित रिवॉर्ड शेपिंग (belief-guided reward shaping) के माध्यम से रूब्रिक-अनुपालक (rubric-faithful) LLM ग्रेडिंग को बढ़ाता है, जिससे यह वास्तविक दुनिया के ग्रेडिंग बेंचमार्क पर मौजूदा विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Zhihao Wu, Linhai Zhang, Taiyi Wang, Runcong Zhao, Peter Andrews, Cesare Aloisi, Yulan He

प्रकाशित 2026-06-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhihao Wu, Linhai Zhang, Taiyi Wang, Runcong Zhao, Peter Andrews, Cesare Aloisi, Yulan He

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शिक्षक हैं जो छात्रों के निबंधों का एक ढेर ग्रेड कर रहे हैं। आपके पास एक सख्त "उत्तर कुंजी" (रूब्रिक) है जो बताती है कि किसी छात्र को विशिष्ट विचारों के लिए कितने अंक मिलते हैं। आपका काम छात्र के उत्तर को पढ़ना, उसे कुंजी से मिलाना और एक स्कोर देना है।

अब, कल्पना कीजिए कि आपने इस ग्रेडिंग को करने के लिए एक सुपर-स्मार्ट रोबोट (एक लार्ज लैंग्वेज मॉडल) को काम पर रखा है। समस्या यह है कि रोबोट सही स्कोर का अनुमान लगाने में तो बहुत अच्छा है, लेकिन वह अक्सर इस बात में खो जाता है कि वह वहां कैसे पहुँचा। वह कह सकता है, "मुझे लगता है कि यह 5 में से 4 है," लेकिन उसके तर्क के चरण डगमगा रहे हैं, या वह अपने स्वयं के अंतर्ज्ञान के पक्ष में उत्तर कुंजी को अनदेखा कर देता है। यदि आप केवल उससे "अधिक प्रयास करने" के लिए कहते हैं, तो उसे पता नहीं चलता कि वह कहाँ गलत हुआ।

यह पेपर एक नई प्रशिक्षण विधि पेश करता है जिसे EDIT (एविडेंस-डायग्नोस्ड इंटरवेंशन ट्रेनिंग) कहा जाता है ताकि इस समस्या को ठीक किया जा सके। EDIT को एक दो-चरणीय कोचिंग कार्यक्रम के रूप में समझें जो रोबोट को एक "नियम-निष्ठ" (rule-faithful) ग्रेडर बनने के लिए सिखाता है।

समस्या: रोबोट का "भटकता हुआ मन"

मानक प्रशिक्षण में, यदि रोबोट गलत स्कोर देता है, तो सिस्टम बस कहता है, "यह गलत है, फिर से प्रयास करें।" यह एक छात्र को यह बताने जैसा है कि, "आपने गणित का सवाल गलत किया है," बिना यह बताए कि गणना के किस चरण में त्रुटि थी।

ग्रेडिंग के लिए, यह पेचीदा है क्योंकि:

  1. इसे नियमों का पालन करना होगा: रोबट केवल अपने विचार का उपयोग नहीं कर सकता; उसे छात्र के टेक्स्ट और आधिकारिक रूब्रिक का उपयोग करके अपने स्कोर को सिद्ध करना होगा।
  2. इसे ट्रैक पर रहना होगा: जैसे-जैसे रोबोट उत्तर के माध्यम से सोचता है, उसका "विश्वास" (confidence) धीरे-धीरे सही संख्या पर स्थिर होना चाहिए। कभी-कभी, रोबोट विचलित हो जाता है, जल्दी में एक गलत निष्कर्ष पर पहुँच जाता है, और फिर उबर नहीं पाता।

समाधान: दो-चरणीय EDIT कोचिंग

लेखकों ने इन समस्याओं को ठीक करने के लिए एक दो-चरणीय प्रशिक्षण शिविर डिजाइन किया है।

चरण 1: "गलती पहचानो" ड्रिल (EDIT-SFT)

कल्पना कीजिए कि रोबोट एक अभ्यास परीक्षा दे रहा है और एक प्रश्न गलत कर देता है। पूरे प्रयास को खारिज करने के बजाय, कोच एक विशेष "एक्स-रे विजन" टूल (आंतरिक संकेत) का उपयोग करके रोबोट के मस्तिष्क के अंदर देखने के लिए करता है।

  • एक्स-रे: कोच रोबोट के तर्क के हर चरण में दो चीजें जाँचता है:
    1. विश्वास की जाँच (Belief Check): "अभी आप अंतिम स्कोर के बारे में कितने आश्वस्त हैं?" यदि रोबोट अचानक एक गलत स्कोर के प्रति बहुत आश्वस्त हो जाता है, तो यह एक रेड फ्लैग है।
    2. साक्ष्य की जाँच (Evidence Check): "क्या आप वास्तव में छात्र के उत्तर और नियम पुस्तिका को देख रहे हैं, या आप केवल अनुमान लगा रहे हैं?"
  • सुधार: एक बार जब कोच यह पता लगा लेता है कि रोबोट ठीक किस चरण में पटरी से उतरा है (जैसे, "आह, यहाँ आपने इस तथ्य को अनदेखा कर दिया कि छात्र ने 'कोई केंद्रक नहीं' का उल्लेख किया है"), तो वे पूरे निबंध को फिर से नहीं लिखते। वे केवल उस एक वाक्य में एक छोटा, सर्जिकल सुधार करते हैं।
  • चीट शीट: रोबोट को उस एक वाक्य को ठीक करने में मदद करने के लिए, कोच उसे एक "रूबिक चेकलिस्ट" (उन बिंदुओं की सूची जो संभव हैं) देता है। यह रोबोट को नियमों को देखने में मदद करता है बिना उसे केवल नियमों को कॉपी-पेस्ट करने के लिए मजबूर किए।

उपमा: यह एक जीपीएस (GPS) की तरह है जिसे एहसास होता है कि आपने गलत मोड़ ले लिया है। पूरे सफर को फिर से शुरू करने के लिए कहने के बजाय, यह कहता है, "आपने पिछले चौराहे पर मोड़ छोड़ दिया। आइए बस वहीं से पुनर्गणना करें, यह सुनिश्चित करने के लिए कि आप सही रास्ते पर रहें कि आप मानचित्र का उपयोग कर रहे हैं।"

चरण 2: "पथ पर बने रहना" ड्रिल (EDIT-RL)

अब जब रोबोट जानता है कि विशिष्ट गलतियों को कैसे सुधारा जाए, तो दूसरा चरण इसे भटकने से बचने के लिए प्रशिक्षित करता है।

  • पुरस्कार प्रणाली: आमतौर पर, एक रोबोट को केवल अंत में पुरस्कार मिलता है यदि अंतिम स्कोर सही है। EDIT एक नया नियम जोड़ता है: "यदि आपकी प्रक्रिया के दौरान आपका विश्वास सच्चाई से बहुत दूर भटक जाता है, तो आपको दंडित किया जाएगा।"
  • सुरक्षा जाल: रोब सहित रोबोट को अन्वेषण करने और सोचने (शायद वह एक पल के लिए अनिश्चित हो) की अनुमति है, लेकिन यदि उसका "विश्वास" सही उत्तर से बहुत दूर चला जाता है, तो उसे दंडित किया जाता है। यह रोबोट को पूरे समय साक्ष्य पर आधारित रहने के लिए मजबूर करता है, न कि केवल अंत में।

उपमा: एक रस्सी पर चलने वाले (tightrope walker) की कल्पना करें। पुराने तरीके में, उन्हें केवल तभी पुरस्कार मिलता है जब वे दूसरी ओर पहुँच जाते हैं। नए तरीके में, यदि वे चलते समय बहुत अधिक डगमगाते हैं, तो उन्हें याद दिलाने के लिए हाथ पर एक हल्का सा थपकी दी जाती है, जिससे यह सुनिश्चित होता है कि वे खत्म करने से पहले ही गिर न जाएं।

परिणाम

लेखकों ने इसका परीक्षण इतिहास, भौतिकी और जीव विज्ञान जैसे विषयों के वास्तविक परीक्षा प्रश्नों पर किया। उन्होंने अपने "EDIT" रोबोट की तुलना अन्य स्मार्ट रोबोटों से की जिन्हें मानक तरीकों का उपयोग करके प्रशिक्षित किया गया था।

  • बेहतर सटीकता: EDIT रोबोट ने अधिक सटीक स्कोर दिए।
  • बेहतर सामान्यीकरण (Generalization): यह उन प्रश्नों पर भी अच्छी तरह से काम करता था जिन्हें उसने पहले कभी नहीं देखा था (out-of-domain), जिससे यह सिद्ध हुआ कि इसने ग्रेडिंग के नियमों को सीखा है, न कि केवल विशिष्ट प्रश्नों को रटा है।
  • सीक्रेट सॉस: जब उन्होंने "गलती पहचानो" उपकरणों (आंतरिक संकेतों) को हटा दिया, तो रोबोट का प्रदर्शन काफी गिर गया। इससे साबित हुआ कि रोबोट कहाँ भ्रमित था, यह जानना ही इसे ठीक करने की कुंजी थी।

सारांश

सरल शब्दों में, EDIT एआई ग्रेडर्स को न केवल सही उत्तर प्राप्त करना, बल्कि चरण-दर-चरण नियमों का पालन करना सिखाता है। यह यह करता है:

  1. निदान (Diagnosing) करना कि रोबोट का तर्क ठीक कहाँ टूटता है।
  2. नियम पुस्तिका का उपयोग करके केवल उस टूटे हुए हिस्से को सर्जिकल सुधार (Surgically fixing) करना।
  3. रोबोट को पूरी प्रक्रिया के दौरान अपने विश्वास को स्थिर और साक्ष्य पर आधारित रखने के लिए प्रशिक्षित (Training) करना।

परिणामस्वरूप, एक ऐसा एआई ग्रेडर मिलता है जो केवल अनुमान लगाने वाले की तरह नहीं, बल्कि एक सावधान, नियम का पालन करने वाले शिक्षक की तरह है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →