← नवीनतम पेपर
🤖 AI

From Rubrics to Reliable Scores: Evidence-Grounded Text Evaluation with LLM Judges

यह शोध पत्र 'रूलर्स' (Rulers) का परिचय देता है, जो एक तीन-चरणीय इन्फरेंस-टाइम फ्रेमवर्क है जो मानवीय रूब्रिक्स को लॉक किए गए विनिर्देशों (specifications) में परिवर्तित करता है, संरचित साक्ष्य ग्राउंडिंग (structured evidence grounding) को लागू करता है, और विविध टेक्स्ट मूल्यांकन कार्यों में अधिक विश्वसनीय और मानव-संरेखित (human-aligned) एलएलएम स्कोरिंग प्राप्त करने के लिए सामान्य विफलता मोड पर काबू पाने हेतु पोस्ट-हॉक अंशांकन (post-hoc calibration) लागू करता है।

मूल लेखक: Yihan Hong, Huaiyuan Yao, Bolin Shen, Wanpeng Xu, Hua Wei, Yushun Dong

प्रकाशित 2026-05-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yihan Hong, Huaiyuan Yao, Bolin Shen, Wanpeng Xu, Hua Wei, Yushun Dong

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शिक्षक हैं जो सैकड़ों छात्रों के निबंधों को ग्रेड कर रहे हैं। आपके पास एक विस्तृत रूब्रिक (नियमों की एक चेकलिस्ट) है जो कहता है, "एक शीर्ष-स्कोर वाले निबंध में एक स्पष्ट तर्क, अच्छा प्रमाण और कोई वर्तनी की त्रुटि नहीं होनी चाहिए।"

अब, कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट (AI) को काम में मदद करने के लिए काम पर रखते हैं। आप रोबोट को रूब्रिक और निबंध देते हैं, और वह एक स्कोर निकाल कर देता है।

समस्या यह है कि रोबोट थोड़ा "स्वतंत्र स्वभाव" (free spirit) का है। यदि आप उससे एक ही सवाल थोड़े अलग तरीके से पूछते हैं, या यदि आप नियमों का क्रम बदलते हैं, तो वह एक ही निबंध के लिए पूरी तरह से अलग स्कोर दे सकता है। यह वैसा ही है जैसे किसी इंसान से पूछना, "उस इमारत कितनी ऊँची है?" और जवाब मिलना जैसे "10 मंजिलें," "30 मीटर," या "काफी ऊँची" इस आधार पर कि आपने सवाल कैसे पूछा।

यह पेपर RULERS नामक एक नई प्रणाली पेश करता है ताकि इसे ठीक किया जा सके। RULERS को एक नए रोबोट के रूप में नहीं, बल्कि एक सख्त मैनेजर के रूप में समझें जो रोबोट को हर बार नियमों का पूरी तरह से पालन करना सिखाता है।

यहाँ बताया गया है कि RULERS कैसे काम करता है, जिसे तीन सरल चरणों में विभाजित किया गया है:

1. "लॉक्ड ब्लूप्रिंट" (चरण I)

आमतौर पर, जब आप AI को कुछ ग्रेड करने के लिए कहते हैं, तो आप बस हर बार चैट में रूब्रिक पेस्ट कर देते हैं। AI हर बार इसे नए सिरे से पढ़ता है, जिससे भ्रम की स्थिति पैदा होती है।

RULERS इसे बदल देता है। एक भी निबंध को ग्रेड करने से पहले, यह मानव रूब्रिक को एक लॉक्ड, अपरिवर्तनीय ब्लूप्रिंट में बदल देता है।

  • उपमा: कल्पना कीजिए कि आप केक बना रहे हैं। हर बार रेसिपी बुक पढ़ने के बजाय (जहाँ आप चीनी के एक कप को आटे के एक कप के रूप में गलत पढ़ सकते हैं), आप सटीक माप एक स्थायी कार्ड पर लिख देते हैं। आप उस कार्ड को एक कांच के केस में लॉक कर देते हैं। चाहे आप कितने भी केक बनाएं, आप उसी सटीक कार्ड का उपयोग करेंगे।
  • यह क्या करता है: यह अव्यवful, प्राकृतिक भाषा वाले रूब्रिक को एक सख्त चेकलिस्ट में बदल देता है जिसमें विशिष्ट बॉक्स (0, 1, या 2) होते हैं जिन्हें टिक करना होता है। एक बार जब यह "ब्लूप्रिंट" बन जाता है, तो यह उस विशिष्ट कार्य के लिए कभी नहीं बदलता है।

2. "एविडेंस डिटेक्टिव" (चरण II)

पुराने तरीके में, AI केवल यह कह सकता था, "यह निबंध अच्छा है क्योंकि यह अच्छा महसूस होता है।" यह भरोसेमंद नहीं है।

RULERS AI को एक डिटेक्टिव (जासूस) की तरह काम करने के लिए मजबूर करता है। वह केवल एक स्कोर नहीं दे सकता; उसे अपने तर्क को सिद्ध करने के लिए निबंध के सटीक वाक्य की ओर इशारा करना होगा।

  • उपमा: कल्पना कीजिए कि अदालत में एक जज है। जज केवल यह नहीं कह सकता कि "मुझे लगता है कि प्रतिवादी दोषी है।" उन्हें कहना होगा, "प्रतिवादी दोषी है क्योंकि इस विशिष्ट साक्ष्य के कारण, जो इस विशिष्ट पैराग्राफ में पाया गया है।"
  • यह क्या करता है: चेकलिस्ट के प्रत्येक आइटम के लिए, AI को छात्र के निबंध के उस सटीक हिस्से को उद्धृत (quote) करना होगा जो उसके निर्णय का समर्थन करता है। यदि AI कहता है, "निबंध में एक स्पष्ट तर्क है," तो उसे उस वाक्य को हाइलाइट करना होगा जहाँ वह तर्क दिखाई देता है। इससे ग्रेडिंग ऑडिटेबल (आप काम की जांच कर सकते हैं) हो जाती है।

3. "स्कोर ट्रांसलेटर" (चरण III)

भले ही एक लॉक्ड ब्लूप्रिंट और एक डिटेक्टिव हो, AI की आंतरिक "भावना" स्कोर के बारे में मानव से अलग हो सकती है। AI सोच सकता है कि "4" एक शानदार स्कोर है, जबकि इंसान सोचते हैं कि "4" औसत है।

RULERS एक अंतिम चरण जोड़ता है: कैलिब्रेशन (अंशांकन)

  • उपमा: कल्पना कीजिए कि AI "रोबोट" बोलता है और इंसान "मानव" बोलते हैं। AI कहता है, "यह निबंध 4.5 है!" लेकिन इंसान 3 या 5 की उम्मीद करते हैं। RULERS पहले से ही इंसानों द्वारा ग्रेड किए गए निबंधों के एक छोटे सेट का उपयोग करके एक ट्रांसलेटर बनाता है। यह सीखता है, "जब AI 4.5 कहता है, तो इंसान आमतौर पर 4 का अर्थ निकालते हैं।" फिर यह अंतिम स्कोर को मानव अपेक्षाओं से मेल खाने के लिए समायोजित करता है।
  • यह क्या करता है: यह AI के संरचित स्कोर लेता है और उन्हें गणितीय रूप से बदल देता है ताकि वे वास्तविक मानव शिक्षकों के ग्रेडिंग के साथ मेल खा सकें।

यह एक बड़ी बात क्यों है?

इस पेपर ने चार अलग-अलग प्रकार के लेखन कार्यों (जैसे छात्र निबंध, सारांश और रचनात्मक लेखन) पर विभिन्न AI मॉडल का उपयोग करके इस प्रणाली का परीक्षण किया।

  • परिणाम: RULERS ने AI के स्कोर को पिछले तरीकों की तुलना में मानव स्कोर के बहुत करीब पहुँचाया।
  • स्थिरता: यदि आपने रूब्रिक की शब्दावली थोड़ी बदल दी (जैसे "अच्छे लेखन" के बजाय "उच्च-गुणवत्ता वाले लेखन" कहना), तो भी RULERS लगातार समान स्कोर देता रहा। अन्य तरीके भ्रमित हो गए और अलग-अलग स्कोर दिए।
  • प्रमाण: क्योंकि AI को "साक्ष्य" (टेक्स्ट से उद्धरण) प्रदान करना पड़ता है, इसलिए आप वास्तव में देख सकते हैं कि उसने एक स्कोर क्यों दिया। यह अब कोई जादुई ब्लैक बॉक्स नहीं है; यह एक पारदर्शी प्रक्रिया है।

संक्षेप में

यह पेपर तर्क देता है कि एक विश्वसनीय AI जज प्राप्त करने के लिए, आपको केवल एक स्मार्ट रोबोट की आवश्यकता नहीं है। आपको एक सिस्टम की आवश्यकता है जो:

  1. नियमों को लॉक करे ताकि वे बदलें नहीं।
  2. रोबोट को उद्धरणों के साथ अपना काम दिखाने के लिए मजबूर करे।
  3. रोबोट के नंबरों को मानव मानकों से मेल खाने के लिए अनुवादित करे।

इन तीनों चीजों को करके, RULERS एक चंचल AI को एक सुसंगत, भरोसेमंद ग्रेडर में बदल देता है जिस पर इंसान वास्तव में भरोसा कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →