← नवीनतम पेपर
💬 NLP

FairJudge: An Adaptive, Debiased, and Consistent LLM-as-a-Judge

यह शोध पत्र FairJudge को प्रस्तुत करता है, जो एक एडेप्टिव (adaptive) LLM-as-a-Judge फ्रेमवर्क है, जो एडेप्टिविटी, बायस (bias) और कंसिस्टेंसी (consistency) की सीमाओं को दूर करने के लिए एक हाई-इन्फॉर्मेशन-डेंसिटी डेटासेट और एक करिकुलम-स्टाइल SFT-DPO-GRPO ट्रेनिंग प्रतिमान (paradigm) का उपयोग करता है, जिससे यह कई बेंचमार्क पर बड़े इंस्ट्रक्शन-ट्यून्ड मॉडल्स से बेहतर प्रदर्शन करता है।

मूल लेखक: Bo Yang, Lanfei Feng, Yunkui Chen, Yu Zhang, Xiao Xu, Shijian Li

प्रकाशित 2026-07-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bo Yang, Lanfei Feng, Yunkui Chen, Yu Zhang, Xiao Xu, Shijian Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास कहानियों का एक विशाल पुस्तकालय है, और आपको उनमें से सबसे अच्छी कहानी चुननी है। अतीत में, इंसान ऐसा करते थे। लेकिन अब, हम शक्तिशाली AI (लार्ज लैंग्वेज मॉडल्स) का उपयोग एक "जज" के रूप में करने के लिए करते हैं ताकि विजेता को स्वचालित रूप से चुना जा सके।

समस्या यह है कि वर्तमान AI जज वर्तमान में एक खेल के अविश्वसनीय रेफरी की तरह हैं। वे गलतियाँ इसलिए नहीं करते क्योंकि वे खेल को नहीं समझते, बल्कि इसलिए करते हैं क्योंकि वे मूर्खतापूर्ण, अप्रासंगिक चीजों से विचलित हो जाते हैं।

यहाँ FairJudge की कहानी है, जो इन रेफरीों को सुधारने के लिए बनाया गया एक नया सिस्टम है, जिसे सरल भाषा में समझाया गया है।

वर्तमान AI जजों के साथ तीन बड़ी समस्याएँ

लेखकों ने पाया कि वर्तमान AI जज तीन "बुरी आदतों" से ग्रस्त हैं:

  1. वे नियमों से भ्रमित हो जाते हैं (अनुकूलन क्षमता की कमी - Lack of Adaptivity):
    कल्पना कीजिए कि एक रेफरी जो फुटबॉल मैच का निर्णय लेने में सक्षम है, लेकिन जब उसे शतरंज के मैच का निर्णय लेने के लिए कहा जाता है, तो वह पूरी तरह से खो जाता है। वर्तमान AI जज संघर्ष करते हैं जब नियम बदलते हैं या जब उन्हें किसी विशिष्ट कार्य के लिए विशिष्ट विवरणों पर ध्यान केंद्रित करने की आवश्यकता होती है। वे हर खेल को एक ही तरह से देखते हैं, भले ही उन्हें ऐसा नहीं करना चाहिए।

  2. वे "मूर्खतापूर्ण" सुरागों से पक्षपाती होते हैं (व्यवस्थित पूर्वाग्रह - Systematic Bias):
    यह सबसे मजेदार हिस्सा है। AI जज अक्सर उन चीजों के आधार पर निर्णय लेते हैं जिनका उत्तर की गुणवत्ता से कोई लेना-देना नहीं होता।

  • पोजीशन बायस (Position Bias): यदि उत्तर A पहले लिखा गया है, तो AI उसे बेहतर समझता है। यदि आप उन्हें बदलकर उत्तर B को पहले रखते हैं, तो AI अचानक सोचता है कि B बेहतर है, भले ही शब्द बिल्कुल समान हों।
  • लेंथ बायस (Length Bias): AI सोचता है कि लंबा उत्तर अपने आप में अधिक स्मार्ट है, भले ही वह केवल बड़बड़ाना हो।
  • फॉर्मेट बायस (Format Bias): यदि उत्तर में बुलेट पॉइंट्स का उपयोग किया गया है, तो AI उसे पैराग्राफ वाले उत्तर की तुलना में अधिक पसंद करता है।
  • उपमा: यह एक शिक्षक की तरह है जो एक परीक्षा को ग्रेड देते समय केवल इसलिए 'A' दे देता है क्योंकि छात्र ने नीली स्याही से लिखा है, या क्योंकि उसका नाम ऊपर के पन्ने पर लिखा गया है।
  1. वे अपने आप में विरोधाभासी होते हैं (Inconsistency):
    कभी-कभी, AI एक स्कोर देता है जब उसे उत्तरों को एक-एक करके (Pointwise) ग्रेड करने के लिए कहा जाता है, लेकिन जब उसे दो उत्तरों की आमने-सामने तुलना (Pairwise) करने के लिए कहा जाता है, तो वह पूरी तरह से अलग परिणाम देता है।
  • उपमा: यह एक जज की तरह है जो कहता है, "मैं इस खिलाड़ी को 9/10 देता हूँ," लेकिन फिर जब उससे पूछा जाता है, "खिलाड़ी A और खिलाड़ी B में से कौन बेहतर है?", तो वह कहता है, "खिलाड़ी B बेहतर है," भले ही खिलाड़ी A को 9/10 मिले हों। यह एक तार्किक गड़बड़ी है।

समाधान: FairJudge

लेखक FairJudge का प्रस्ताव करते हैं, जो "जजिंग" को एक साधारण गणितीय गणना के रूप में नहीं, बल्कि एक सीखी जाने वाली व्यवहार (learnable behavior) के रूप में मानता है जिसे प्रशिक्षित और सुधारा जा सकता है। इसे एक कच्चे, अनुभवहीन रेफरी को एक बहुत ही विशिष्ट, तीन-चरणीय प्रशिक्षण शिविर (training camp) से गुजारने के रूप में समझें।

चरण 1: "नियम पुस्तिका" प्रशिक्षण (SFT)

सबसे पहले, वे AI को स्पष्ट रूप से नियम सिखाते हैं। AI द्वारा नियमों का अनुमान लगाने के बजाय, वे AI को उत्तरों के साथ एक "नियम पुस्तिका" (जिसे रूब्रिक/Rubric कहा जाता है) देते हैं।

  • उपमा: खेल शुरू होने से पहले, रेफरी को एक लैमिनेटेड कार्ड दिया जाता है जिसमें लिखा होता है, "इस विशिष्ट खेल के लिए, हम गति के आधार पर निर्णय लेंगे, न कि ताकत के आधार पर।" AI निर्णय लेने के लिए हर बार उस कार्ड को देखना सीख जाता है।

चरण 2: "एंटी-बायस" अभ्यास (DPO)

इसके बाद, वे बुरी आदतों को तोड़ने के लिए अभ्यास कराते हैं। वे AI को बिल्कुल वही उत्तर दिखाते हैं जिन्हें इधर-उधर किया गया है, छोटा किया गया है, या अलग फॉर्मेट में रखा गया है।

  • अभ्यास: "यहाँ उत्तर A है जिसके बाद उत्तर B है। अब, यहाँ उत्तर B है जिसके बाद उत्तर A है। ये दोनों समान हैं! आपको इन्हें एक ही स्कोर देना होगा।"
  • परिणाम: AI क्रम, लंबाई और फ़ॉन्ट को अनदेखा करना सीख जाता है। वह केवल कंटेंट (विषय-वस्तु) पर ध्यान केंद्रित करना सीख जाता है।

चरण 3: "निरंतरता" की जाँच (GRPO)

अंत में, वे AI को अलग-अलग तरीकों से निर्णय लेने में सुसंगत (consistent) होना सिखाते हैं। वे AI को मजबूर करते हैं कि वह एक ही उत्तरों को दो अलग-अलग मोड में देखे (एक-एक करके और आमने-सामने) और उसे केवल तभी पुरस्कृत किया जाए जब तर्क समान रहे।

  • अभ्यास: "यदि आपने अलग-अलग देखते समय कहा कि A, B से बेहतर था, तो आपको यह भी कहना होगा कि A, B के साथ देखने पर भी बेहतर है। यदि आप अपनी बात बदलते हैं, तो आप अंक खो देंगे।"

परिणाम: एक बेहतर रेफरी

पेपर में इस नए "FairJudge" का अन्य मॉडलों के विरुद्ध परीक्षण किया गया और पाया गया कि:

  • यह अधिक निष्पक्ष है: इसने इस बात की परवाह करना बंद कर दिया कि कौन पहले आया या उत्तर कितना लंबा था।
  • यह सुसंगत है: इसने विरोधाभासी स्कोर देना बंद कर दिया।
  • यह अधिक स्मार्ट है: यह वास्तव में बहुत बड़े और अधिक शक्तिशाली AI मॉडलों की तुलना में भी मानवीय विचारों के साथ बेहतर तालमेल बिठाता है।
  • यह तेज़ है: उन्होंने एक "फास्ट मोड" बनाया जो लंबी व्याख्या को छोड़कर सीधे निर्णय देता है, जिससे बिना सटीकता खोए यह 12 से 13 गुना तेज़ हो जाता है।

निष्कर्ष

लेखकों ने एक नया डेटासेट (प्रशिक्षण उदाहरणों का एक बड़ा संग्रह) और एक नई प्रशिक्षण विधि बनाई है ताकि AI जज को एक भ्रमित, पक्षपाती रेफरी से एक निष्पक्ष, सुसंगत और नियम मानने वाले अधिकारी में बदला जा सके।

उन्होंने केवल AI को सामान्य रूप से "स्मार्ट" नहीं बनाया; उन्होंने इसे विशेष रूप से कैसे निर्णय लें इस पर प्रशिक्षित किया। परिणाम एक ऐसा सिस्टम है जो अन्य AI मॉडल्स के काम की जांच करने के लिए अधिक विश्वसनीय है, यह सुनिश्चित करता है कि "विजेता" वास्तव में सबसे अच्छा उत्तर है, न कि केवल वह जो सबसे लंबा था या जो संयोग से पहले लिखा गया था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →