← नवीनतम पेपर
💬 NLP

From Isolated Scoring to Collaborative Ranking: A Comparison-Native Framework for LLM-Based Paper Evaluation

यह शोध पत्र CNPE प्रस्तुत करता है, जो एक तुलना-नेटिव (comparison-native) फ्रेमवर्क है जो LLM-आधारित पेपर मूल्यांकन को पृथक पूर्ण स्कोरिंग (isolated absolute scoring) से सहयोगात्मक युग्म रैंकिंग (collaborative pairwise ranking) में स्थानांतरित करता है, जिससे विविध डेटासेटों में महत्वपूर्ण प्रदर्शन लाभ और मजबूत सामान्यीकरण प्राप्त होता है।

मूल लेखक: Pujun Zheng, Jiacheng Yao, Jinquan Zheng, Chenyang Gu, Guoxiu He, Jiawei Liu, Yong Huang, Tianrui Guo, Wei Lu

प्रकाशित 2026-03-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pujun Zheng, Jiacheng Yao, Jinquan Zheng, Chenyang Gu, Guoxiu He, Jiawei Liu, Yong Huang, Tianrui Guo, Wei Lu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अराजक विज्ञान मेले में एक जज हैं। हजारों छात्रों ने अपने प्रोजेक्ट जमा किए हैं, और आपको विजेता चुनने हैं।

पुराना तरीका (द "आइसोलेटेड स्कोरिंग" समस्या)
वर्तमान में, अधिकांश AI सिस्टम एक सख्त शिक्षक की तरह व्यवहार करने की कोशिश करते हैं जो शून्य में एक सिंगल टेस्ट पेपर को ग्रेड करता है। वे एक प्रोजेक्ट को देखते हैं, जैसे, "यह अच्छा लग रहा है, मैं इसे 10 में से 8 दूंगा," और फिर अगले पर बढ़ जाते हैं। "यह ठीक लग रहा है, मैं इसे 6 दूंगा।"

समस्या यह है कि ग्रेडिंग स्केल टूटा हुआ है।

  • एक कमरे में, एक "8" का मतलब "परफेक्ट" हो सकता है। दूसरे कमरे में, इसका मतलब "औसत" हो सकता है।
  • AI भ्रमित हो जाता है। यह इस विशिष्ट वर्ष या इस विशिष्ट सम्मेलन के लिए विशिष्ट नियमों को याद करना शुरू कर देता है, बजाय इसके कि वह वास्तव में यह सीखे कि विज्ञान को वास्तव में क्या अच्छा बनाता है। यह एक ऐसे छात्र की तरह है जो पिछले साल के गणित के टेस्ट के उत्तर रट लेता है लेकिन जब सवाल थोड़े बदल जाते हैं तो फेल हो जाता है।

नया तरीका (द "कोलेबोरेटिव रैंकिंग" समाधान)
यह पेपर CNPE नामक एक नया फ्रेमवर्क पेश करता है। अकेले पेपर को ग्रेड करने के बजाय, AI को "यह या वह" (This or That) का खेल खेलने के लिए सिखाया जाता है।

इसे कॉफी के लिए "टेस्ट-टेस्टिंग प्रतियोगिता" की तरह सोचें।

  • पुराना तरीका: आप एक कप चखते हैं और कहते हैं, "यह 10 में से 7 है।" फिर आप दूसरा कप चखते हैं और कहते हैं, "यह 10 में से 4 है।" आप गलत हो सकते हैं क्योंकि घूंट लेने के बीच आपका मूड बदल गया था।
  • नया तरीका (CNPE): आपके सामने दो कप अगल-बगल रखे जाते हैं। आप तुरंत कहते हैं, "मैं निश्चित रूप से कप A को कप B की तुलना में पसंद करता हूँ।" आप सैकड़ों जोड़ों (pairs) के लिए ऐसा करते हैं। अंततः, आपको स्कोर की आवश्यकता नहीं होती; आप बस क्रम जान जाते हैं: कप A सबसे अच्छा है, कप B दूसरे स्थान पर है, और कप C अंतिम है।

यह कैसे काम करता है (जादुई सामग्रियां)

  1. स्मार्ट पेयरिंग (द "मैचमेकर"):
    "क्वांटम फिजिक्स" के बारे में एक पेपर को "ब्रेड बेकिंग" के बारे में एक पेपर के साथ बेतरतीब ढंग से तुलना करना बहुत मददगार नहीं होगा। सिस्टम एक विशेष एल्गोरिदम (एक "ग्राफ-आधारित मैचमेकर") का उपयोग करके उन पेपर्स को खोजने के लिए करता है जो समान हैं। यह "AI इन मेडिसिन" के एक पेपर को "AI इन मेडिसिन" के ही एक अन्य पेपर के साथ जोड़ता है। यह AI को बारीक (fine-grained) निर्णय लेने के लिए मजबूर करता है, जिससे वह दो अच्छे विचारों के बीच सूक्ष्म अंतर को पहचान सके, न कि केवल स्पष्ट विजेता को चुन सके।

  2. तुलना द्वारा प्रशिक्षण (द "कोच"):
    AI को सिर्फ यह नहीं बताया जाता कि "यह अच्छा है।" इसे हजारों ऐसे "यह बनाम वह" के मुकाबलों को देखने के माध्यम से प्रशिक्षित किया जाता है। यह सीखता है: "जब पेपर A में पेपर B की तुलना में अधिक स्पष्ट स्पष्टीकरण होता है, तो मुझे A को चुनना चाहिए।" यह केवल नंबरों को नहीं, बल्कि गुणवत्ता के तर्क को सीखता है।

  3. अंतिम दौड़ (द "एग्रीगेशन"):
    एक बार जब AI ने हजारों छोटे "A, B से बेहतर है" के निर्णय ले लिए होते हैं, तो यह सभी उन छोटे-छोटे प्रेफरेंस को एक विशाल, निष्पक्ष लीडरबोर्ड में जोड़ने के लिए एक गणितीय सूत्र (जिसे ब्रैडली-टेरी मॉडल कहा जाता है) का उपयोग करता है।

यह एक बड़ी बात क्यों है

  • यह कम में अधिक स्मार्ट है: लेखकों ने इसे एक अपेक्षाकृत छोटे AI मॉडल (7 बिलियन पैरामीटर्स) का उपयोग करके बनाया है, फिर भी इसने बहुत बड़े, अधिक महंगे मॉडल्स (14 बिलियन पैरामीटर्स) को हरा दिया जो व्यक्तिगत रूप से पेपर्स को ग्रेड करने की कोशिश कर रहे थे। यह एक छोटी, फुर्तीली रेस कार द्वारा एक भारी ट्रक को हराने जैसा है।
  • यह सामान्यीकरण (Generalizes) करता है: क्योंकि इसने विशिष्ट स्कोर को याद करने के बजाय तुलना की अवधारणा को सीखा है, यह बिना पुन: प्रशिक्षित हुए नए, अनदेखे सम्मेलनों (जैसे ICML या NeurIPS) पर पूरी तरह से काम करता है। यह एक ऐसे शेफ की तरह है जो स्वाद और संतुलन बनाना जानता है, इसलिए वह किसी भी किचन में बेहतरीन खाना बना सकता है, न कि केवल उसी किचन में जिसके लिए उसे प्रशिक्षित किया गया था।
  • यह अधिक निष्पक्ष है: पेपर्स की सीधी तुलना करके, यह "पिछले पेपर को क्या स्कोर मिला था?" के पूर्वाग्रह को हटा देता है और पूरी तरह से इस पर ध्यान केंद्रित करता है कि "इन दोनों में से कौन सा बेहतर है?"

निष्कर्ष
यह पेपर सुझाव देता है कि हमें AI से यह पूछना बंद करना चाहिए कि, "यह पेपर कितना अच्छा है?" (जो कठिन और व्यक्तिपरक है) और इसके बजाय यह पूछना शुरू करना चाहिए कि, "क्या यह पेपर उस वाले से बेहतर है?" (जो AI के लिए बहुत आसान है)। मूल्यांकन को हेड-टू-हेड तुलनाओं की एक श्रृंखला में बदलकर, हमें वैज्ञानिक कार्य की अधिक सटीक, निष्पक्ष और विश्वसनीय रैंकिंग प्राप्त होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →