← नवीनतम पेपर
🤖 machine learning

When LLM Judge Scores Look Good but Best-of-N Decisions Fail

यह शोध पत्र यह प्रदर्शित करता है कि बेस्ट-ऑफ-एन (best-of-n) चयन कार्यों के लिए एलएलएम (LLM) जजों का मूल्यांकन करने हेतु वैश्विक सहसंबंध मेट्रिक्स (global correlation metrics) पर निर्भर रहना भ्रामक है, क्योंकि उच्च वैश्विक स्कोर अक्सर खराब इन-प्रॉम्प्ट रैंकिंग प्रदर्शन और अत्यधिक टाई दरों को छिपा देते हैं, जिन्हें स्पष्ट युग्मवार निर्णय (explicit pairwise judging) का उपयोग करके महत्वपूर्ण रूप से सुधारा जा सकता है।

मूल लेखक: Eddie Landesberg

प्रकाशित 2026-03-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Eddie Landesberg

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "जब LLM जज के स्कोर अच्छे दिखते हैं लेकिन बेस्ट-ऑफ-N निर्णय विफल हो जाते हैं" (When LLM Judge Scores Look Good but Best-of-N Decisions Fail) पेपर का सरल, रोजमर्रा की भाषा में अनुवाद दिया गया है।

मुख्य विचार: "अच्छा औसत" का जाल (The "Good Average" Trap)

कल्पना कीजिए कि आप एक हायरिंग मैनेजर हैं। आपके पास एक नया AI असिस्टेंट है जो आपको नौकरी के आवेदकों को छाँटने में मदद करता है। आप AI से 100 अलग-अलग उम्मीदवारों को 1 से 100 के पैमाने पर रेटिंग देने के लिए कहते हैं।

आप अपनी अंतिम भर्ती निर्णयों के साथ AI के प्रदर्शन की तुलना करके इसकी जांच करते हैं। आप एक "कोरिलेशन स्कोर" (यह मापने का तरीका कि AI आपसे कितनी सहमति रखता है) की गणना करते हैं। स्कोर 0.47 है। डेटा की दुनिया में, यह "ठीक-ठाक" दिखता है। यह परफेक्ट नहीं है, लेकिन बहुत बुरा भी नहीं है। आप सोचते हैं, "शानदार, यह AI मुझे सबसे अच्छे उम्मीदवार को चुनने में मदद करने के लिए काफी अच्छा है!"

पेपर कहता है: रुकिए। आप धोखे में हैं।

हालाँकि AI औसतन आपसे सहमत है, लेकिन वास्तव में यह किसी विशिष्ट नौकरी के लिए एकल सर्वश्रेष्ठ उम्मीदवार को चुनने में बहुत खराब है। यदि आप इस AI का उपयोग 4 आवेदकों के समूह में से विजेता चुनने के लिए करते हैं, तो यह केवल 21% बार ही सफल होगा। बाकी 79% समय, यह मूल रूप से केवल अनुमान लगा रहा होता है।

उपमा (Analogy): "कक्षा का टेस्ट" बनाम "दौड़"

इसे समझने के लिए, आइए कक्षा की एक उपमा का उपयोग करें।

परिदृश्य:
आपके पास 5,000 अलग-अलग गणित के टेस्ट (प्रॉम्प्ट्स) हैं। प्रत्येक टेस्ट पर, 4 छात्र (उम्मीदवार) एक ही समस्या को हल करने की कोशिश कर रहे हैं।

  • ओरेकल (सत्य/Oracle): आप जानते हैं कि हर एक टेस्ट पर किसने सबसे अच्छा स्कोर किया।
  • जज (AI): AI हर टेस्ट पर हर छात्र को एक स्कोर देता है।

धोखा (ग्लोबल कोरिलेशन):
AI यह पहचानने में बहुत अच्छा है कि टेस्ट कितना कठिन है

  • एक आसान टेस्ट पर, सभी छात्रों के स्कोर बहुत अधिक होते हैं (90 के आसपास)। AI उन सभी को 90 देता है।
  • एक कठिन टेस्ट पर, सभी छात्रों के स्कोर कम होते हैं (40 के आसपास)। AI उन सभी को 40 देता है।

चूँकि AI सही ढंग से भविष्यवाणी करता है कि "आसान टेस्ट = उच्च स्कोर" और "कठिन टेस्ट = कम स्कोर", इसलिए इसके साथ आपका कुल समझौता (overall agreement) बहुत अच्छा दिखता है। यह एक मौसम पूर्वानुमानकर्ता की तरह है जो सही होने के लिए हर दिन बस "गर्मी का मौसम है" कहता है। वह मौसम के बारे में तो सही है, लेकिन वह आपको यह नहीं बता सकता कि आज बारिश होगी या नहीं।

विफलता (विथ-प्रॉम्प्ट रैंकिंग):
असली काम यह जानना नहीं है कि टेस्ट कठिन है या आसान। असली काम एक विशिष्ट टेस्ट पर उन 4 छात्रों को देखना और कहना है, "छात्र A, छात्र B से थोड़ा बेहतर है।"

पेपर के डेटा में, AI इसमें बहुत खराब है।

  • टाई (Tie) की समस्या: AI केवल लगभग 20 अलग-अलग स्कोर नंबरों (जैसे 1, 2, 3... से लेकर 20 तक) का उपयोग करता है। जब दो छात्र गुणवत्ता में बहुत करीब होते हैं, तो AI अक्सर उन्हें एक ही स्कोर (जैसे, दोनों को "15") दे देता है।
  • परिणाम: जब AI 'टाई' (बराबरी) देता है, तो वह विजेता नहीं चुन पाता। उसे सिक्का उछालना पड़ता है। चूंकि वह 67% बार टाई करता है, इसलिए वह ज्यादातर समय केवल रैंडम चांस (संयोग) से विजेता चुनता है।

"बेस्ट-ऑफ-N" की समस्या

वास्तविक दुनिया में, हम अक्सर बेस्ट-ऑफ-N चयन के लिए AI का उपयोग करते हैं। इसका अर्थ है:

  1. एक प्रश्न के 4 अलग-अलग उत्तर उत्पन्न करने के लिए AI से कहें।
  2. एक "जज AI" को उन्हें स्कोर देने के लिए कहें।
  3. उच्चतम स्कोर वाले उत्तर को चुनें।

पेपर ने पाया कि भले ही "जज AI" का एक "ठीक-ठाक" ग्लोबल स्कोर हो, लेकिन यह इस विशिष्ट कार्य में विफल रहता है क्योंकि यह एक ही प्रॉम्प्ट पर "अच्छे" उत्तरों और "बहुत अच्छे" उत्तरों के बीच अंतर नहीं कर पाता है। यह एक ऐसे जज की तरह है जो एक फेरारी और एक साइकिल के बीच अंतर तो बता सकता है, लेकिन एक फेरारी और थोड़ी तेज़ चलने वाली दूसरी फेरारी के बीच अंतर नहीं कर सकता।

समाधान: खेल बदलें

लेखकों ने इसे ठीक करने के कुछ तरीके आजमाए:

1. स्कोरिंग बंद करें, तुलना करना शुरू करें (पेयरवाइज जजिंग - Pairwise Judging)
AI से यह पूछने के बजाय कि, "इस उत्तर को 1 से 100 के बीच रेट करें," उससे पूछें, "A बेहतर है या B?"

  • परिणाम: इसने बहुत बेहतर काम किया! AI को सीधे चुनाव करने के लिए मजबूर करके, इसने 'टाई' देना बंद कर दिया। विजेता चुनने की इसकी क्षमता 21% से बढ़कर 61% हो गई।
  • क्यों: इंसानों (और AI) के लिए यह कहना कि "A, B से बेहतर है" आसान है, बजाय इसके कि A को एक सटीक नंबर और B को एक सटीक नंबर दिया जाए।

2. सही मेट्रिक्स की जाँच करें
केवल "ग्लोबल कोरिलेशन" (कुल समझौते) को न देखें। आपको निम्नलिखित को देखने की आवश्यकता है:

  • रिकवरी रेट (Recovery Rate): AI का चुनाव केवल रैंडम चुनाव की तुलना में कितना बेहतर है?
  • टाई रेट (Tie Rate): AI कितनी बार कहता है "मुझे नहीं पता, वे बराबर हैं"? यदि यह संख्या अधिक है, तो AI विजेता चुनने के लिए बेकार है।

सभी के लिए सीख

यदि आप AI सिस्टम बना रहे हैं या निर्णय लेने के लिए उनका उपयोग कर रहे हैं:

  • हेडलाइन नंबर पर भरोसा न करें। एक "अच्छा" कोरिलेशन स्कोर यह नहीं बताता कि AI सबसे अच्छा विकल्प चुनने में सक्षम है।
  • टाई (बराबरी) पर नज़र रखें। यदि आपका AI विभिन्न विकल्पों को एक ही स्कोर दे रहा है, तो वह वास्तव में निर्णय नहीं ले रहा है; वह केवल अनुमान लगा रहा है।
  • सही सवाल पूछें। यदि आपको एक विजेता चुनना है, तो AI से विकल्पों को व्यक्तिगत रूप से ग्रेड करने के बजाय सीधे तुलना (A बनाम B) करने के लिए कहें।

संक्षेप में: एक ऐसा जज जो परीक्षा की कठिनाई को ग्रेड करने में अच्छा है, वह जरूरी नहीं कि शीर्ष छात्र को चुनने में भी अच्छा हो। शीर्ष छात्र चुनने के लिए, आपको एक ऐसे जज की आवश्यकता है जो सर्वश्रेष्ठ उम्मीदवारों के बीच के सूक्ष्म अंतर देख सके, न कि केवल आसान और कठिन परीक्षाओं के बड़े अंतर को।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →