← नवीनतम पेपर
💬 NLP

Pair2Score: Pairwise-to-Absolute Transfer for LLM-Based Essay Scoring

यह शोध पत्र Pair2Score को प्रस्तुत करता है, जो एक पैरामीटर-कुशल दो-चरणीय ढांचा है जो LLaMA अनुकूलन के माध्यम से युग्मवार तुलनाओं (pairwise comparisons) को पूर्ण निबंध स्कोरिंग में स्थानांतरित करता है, और यह प्रदर्शित करता है कि विशिष्ट स्थानांतरण कॉन्फ़िगरेशन और सीमित युग्मवार प्रशिक्षण चरण, केवल पूर्ण-आधारित बेसलाइन की तुलना में स्कोरिंग सटीकता में महत्वपूर्ण सुधार करते हैं।

मूल लेखक: İbrahim Rıza Hallaç, Hasan Oğul

प्रकाशित 2026-05-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: İbrahim Rıza Hallaç, Hasan Oğul

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शिक्षक हैं जिसे सैकड़ों छात्रों के निबंधों को ग्रेड करना है। आपको प्रत्येक निबंध को एक विशिष्ट संख्या देनी होगी, जैसे व्याकरण के लिए "10 में से 7" या शब्दावली के लिए "10 में से 8"। इसे एब्सोल्यूट स्कोरिंग (absolute scoring) कहा जाता है। यह कठिन है क्योंकि "7" एक अस्पष्ट अवधारणा है; अलग-अलग शिक्षक इस बात पर असहमत हो सकते हैं कि वास्तव में एक "7" कैसा दिखता है।

हालाँकि, एक शिक्षक के लिए दो निबंधों को अगल-बगल रखकर यह कहना बहुत आसान है, "निबंध A निश्चित रूप से निबंध B से बेहतर है।" यह पेयरवाइज कंपैरिजन (pairwise comparison) है।

यह शोध पत्र Pair2Score नामक एक नई विधि पेश करता है। Pair2Score को एक AI (विशेष रूप से एक लार्ज लैंग्वेज मॉडल जिसे LLaMA कहा जाता है) के लिए एक दो-चरणीय प्रशिक्षण कार्यक्रम के रूप में सोचें, ताकि वह पहले आसान "A, B से बेहतर है" वाले खेल का अभ्यास करके उन पेचीदा "10 में से 7" वाले स्कोर देने के लिए सीख सके।

यह प्रक्रिया कैसे काम करती है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

दो-चरणीय प्रशिक्षण शिविर (The Two-Stage Training Camp)

चरण 1: "स्वाद परीक्षण" (Pairwise Ranking)
कल्पना कीजिए कि आप एक खाद्य समीक्षक (food critic) को प्रशिक्षित कर रहे हैं। उन्हें तुरंत एक बर्गर को "10 में से 7" रेटिंग देने के लिए कहने के बजाय, आप उन्हें दो बर्गर दिखाते हैं और पूछते हैं, "कौन सा बेहतर स्वाद वाला है?"

  • AI निबंधों के जोड़ों को देखता है।
  • यह अंतर पहचानना सीखता है: "इस निबंध का व्याकरण उस दूसरे निबंध से बेहतर है।"
  • यह अभी सटीक संख्या की चिंता नहीं करता; यह केवल गुणवत्ता की दिशा सीखता है।
  • ट्विस्ट: शोधकर्ताओं ने पाया कि आपको समीक्षक को हजारों तुलनाओं के लिए लंबे समय तक प्रशिक्षित करने की आवश्यकता नहीं है। वास्तव में, एक बहुत छोटा "स्वाद परीक्षण" सत्र (प्रशिक्षण का केवल एक दौर) अक्सर लंबे, थकाऊ सत्र से बेहतर होता है। यह AI को एक त्वरित "आहा!" क्षण देने जैसा है कि अच्छी लेखन कला क्या होती है, न कि इसे हफ्तों तक ड्रिल कराना।

चरण 2: "अंतिम परीक्षा" (Absolute Scoring)
अब, AI चरण 1 के ज्ञान को लेता है और व्यक्तिगत निबंधों को वास्तविक संख्याएँ (1 से 5) देने का प्रयास करता है।

  • शोधकर्ताओं ने चरण 1 से ज्ञान को चरण 2 में स्थानांतरित करने के दो तरीके आजमाए:
    1. वॉर्म-स्टार्ट (Warm-Start): कल्पना कीजिए कि AI एक छात्र है जिसने "स्वाद परीक्षण" कक्षा पूरी कर ली है। "अंतिम परीक्षा" के लिए, वे पहली कक्षा के अपने नोट्स और मानसिक अवस्था को शुरुआती बिंदु के रूप में रखते हैं। उन्हें बस "बेहतर/बदतर" को "10 में से 7" में अनुवाद करना सीखना है।
    2. फ्यूजन (Fusion): कल्पना कीजिए कि छात्र परीक्षा कक्ष में एक 'चीट शीट' (स्वाद परीक्षण का सारांश) लेकर जाता है। वह निबंध को देखता है, अपनी चीट शीट को देखता है, और दोनों सूचनाओं को मिलाकर स्कोर देता है।

उन्हें क्या पता चला?

शोधकर्ताओं ने इसे तीन विशिष्ट कौशलों पर परखा: व्याकरण (Grammar), शब्दावली (Vocabulary) और वाक्य संरचना (Syntax)। उन्होंने परिणामों की पुष्टि के लिए प्रयोग को कई बार चलाया ताकि यह सुनिश्चित हो सके कि परिणाम केवल भाग्य का खेल नहीं हैं।

यहाँ मुख्य निष्कर्ष दिए गए हैं, जिन्हें रोजमर्रा की भाषा में अनुवादित किया गया है:

  1. शॉर्टकट काम करता है: "स्वाद परीक्षण" (पेयरवाइज कंपैरिजन) को वार्म-अप के रूप में उपयोग करने से AI को शून्य से संख्याएँ सीखने की तुलना में बेहतर अंतिम स्कोर देने में मदद मिली।
  2. कम ही अधिक है (कभी-कभी): सबसे आश्चर्यजनक निष्कर्ष समय के बारे में था। AI को निबंधों की तुलना करने के लिए लंबे समय तक प्रशिक्षित करने से ज्यादा मदद नहीं मिली। वास्तव में, तुलनात्मक प्रशिक्षण को केवल एक पास (एक एपोक/epoch) के बाद रोक देना अक्सर अच्छे परिणाम प्राप्त करने का सबसे विश्वसनीय तरीका था। यह सुझाव देता है कि AI को केवल एक दिशा में एक त्वरित "धक्का" (nudge) देने की आवश्यकता थी, न कि गहराई से अध्ययन कराने की।
  3. यह केवल तुलना करने में अच्छा होने के बारे में नहीं है: आप सोच सकते हैं कि, "यदि AI निबंधों की तुलना करने में चैंपियन है, तो वह स्कोर देने में भी बेहतरीन होगा।" शोध पत्र कहता है कि नहीं। एक AI निबंधों की तुलना करने में चैंपियन हो सकता है लेकिन फिर भी अच्छे पूर्ण स्कोर देने में विफल हो सकता है। ज्ञान को स्थानांतरित करने की विधि (Warm-Start बनाम Fusion) तुलना प्रशिक्षण की गुणवत्ता जितनी ही महत्वपूर्ण थी।
  4. कोई जादुई समाधान नहीं (No Magic Bullet): ऐसा कोई एक एकल "परफेक्ट" सेटिंग नहीं था जो हर निबंध प्रकार के लिए काम करे। कभी-कभी "फ्यूजन" विधि सबसे अच्छा काम करती थी, तो कभी "वॉर्म-स्टार्ट" ने। यह विशिष्ट गुण (व्याकरण बनाम शब्दावली) और निबंधों के विशिष्ट बैच पर निर्भर करता है।

निचोड़ (The Bottom Line)

यह शोध पत्र तर्क देता है कि यदि आप किसी AI को एक विशिष्ट संख्या के साथ निबंधों को ग्रेड करने के लिए सिखाना चाहते हैं, तो आपको तुरंत संख्याएं उस पर नहीं थोपनी चाहिए। इसके बजाय, उसे पहले निबंधों की तुलना करने का अभ्यास करने दें।

हालाँकि, बहुत अधिक अभ्यास न करें। तुलना करने पर एक त्वरित, केंद्रित सत्र ही AI को सही "अंतर्ज्ञान" (intuition) देने के लिए पर्याप्त है। एक बार जब उसके पास यह अंतर्ज्ञान आ जाता है, तो आप उसे अंतिम संख्याएँ असाइन करना सिखा सकते हैं, और वह तुलना देखे बिना करने की तुलना में बेहतर काम करेगा।

महत्वपूर्ण नोट: लेखक बहुत सावधानी से कहते हैं कि यह निबंध ग्रेडिंग पर एक विशिष्ट प्रयोग है। वे यह दावा नहीं कर रहे हैं कि यह चिकित्सा निदान, कानूनी निर्णय या अन्य क्षेत्रों में भी काम करता है। वे केवल यह दिखा रहे हैं कि निबंध ग्रेडिंग के लिए, यह विशिष्ट दो-चरणीय "तुलना फिर स्कोर" विधि बेहतर परिणाम प्राप्त करने का एक आशाजनक तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →