← नवीनतम पेपर
💬 NLP

Mediocrity is the key for LLM as a Judge Anchor Selection

यह शोध पत्र यह प्रदर्शित करता है कि "LLM-as-a-judge" मूल्यांकनों की विश्वसनीयता के लिए एक एंकर मॉडल का चयन महत्वपूर्ण है, जो यह प्रकट करता है कि चरम एंकर (सर्वश्रेष्ठ या सबसे खराब मॉडल) रैंकिंग सटीकता को कमजोर करते हैं और मजबूत परिणाम सुनिश्चित करने के लिए बड़े बेंचमार्क आकार के साथ "औसत" एंकरों के उपयोग की वकालत करते हैं।

मूल लेखक: Shachar Don-Yehiya, Asaf Yehudai, Leshem Choshen, Omri Abend

प्रकाशित 2026-03-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shachar Don-Yehiya, Asaf Yehudai, Leshem Choshen, Omri Abend

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ पेपर "Mediocrity is the key for LLM as a Judge Anchor Selection" का सरल, रोज़मर्रा की भाषा में अनुवाद दिया गया है, जिसमें कुछ रचनात्मक उपमाओं (analogies) का उपयोग किया गया है।

मुख्य विचार: क्यों "औसत" ही नया "सर्वश्रेष्ठ" है

कल्पना कीजिए कि आप एक प्रतियोगिता में 22 गायकों को रैंक करने की कोशिश कर रहे हैं एक टैलेंट स्काउट के रूप में। आप हर गायक की दूसरे गायक के साथ तुलना नहीं कर सकते (इसमें बहुत समय लगेगा और बहुत पैसा खर्च होगा)। इसलिए, आप एक गायक को "एंकर" (Anchor) के रूप में चुनने का निर्णय लेते हैं। आप हर अन्य गायक की तुलना केवल इसी एक एंकर से करेंगे।

AI की दुनिया में प्रचलित धारणा यह रही है: "अपने एंकर के रूप में सर्वश्रेष्ठ गायक को चुनें!" या "अपने एंकर के रूप में सबसे खराब गायक को चुनें!" विचार यह था कि यदि आप हर किसी की तुलना पूर्णतः सर्वश्रेष्ठ से करते हैं, तो आप देख पाएंगे कि कौन शीर्ष के करीब है। यदि आप हर किसी की तुलना सबसे खराब से करते हैं, तो आप देख पाएंगे कि कौन नीचे से बेहतर है।

यह पेपर कहता है: आप गलत हैं। वे दोनों विकल्प बहुत खराब हैं।

इसके बजाय, यह पेपर तर्क देता है कि "औसत दर्जे" (mediocre) का गायक—वह जो बस ठीक-ठाक है, जो बीच में है—वास्तव में एक आदर्श एंकर है।


समस्या: "सुपरस्टार" और "संघर्ष करने वाला" एंकर

आइए देखते हैं कि चरम सीमाओं (extremes) को चुनना क्यों विफल होता है, दो उपमाओं का उपयोग करते हुए:

1. सुपरस्टार एंकर (द "ओलंपियन")

कल्पना कीजिए कि आपका एंकर एक विश्व प्रसिद्ध ओलंपिक स्वर्ण पदक विजेता है।

  • परिदृश्य: आप जज से एक स्थानीय हाई स्कूल के गायक की तुलना ओलंपियन से करने के लिए कहते हैं।
  • परिणाम: जज तुरंत कहता है, "ओलंपियन जीत गया!" 100 में से 99 बार।
  • समस्या: यह आपको कोई उपयोगी जानकारी नहीं देता। आप पहले से ही जानते थे कि ओलंपियन बेहतर है। आपने उस तुलना पर अपना समय और पैसा बर्बाद कर दिया जिससे आपको अन्य गायकों के बारे में कुछ भी पता नहीं चला। आप यह नहीं बता सकते कि गायक A, गायक B से थोड़ा बेहतर है या नहीं, क्योंकि दोनों ही ओलंपियन के सामने भारी अंतर से हार गए।

2. संघर्ष करने वाला एंकर (द "एमेच्योर")

अब, कल्पना कीजिए कि आपका एंकर कोई ऐसा व्यक्ति है जो ठीक से सुर भी नहीं लगा सकता।

  • परिदृश्य: आप एक पेशेवर गायक की तुलना इस नौसिखिए (amateur) से करते हैं।
  • परिणाम: जज तुरंत कहता है, "प्रोफेशनल जीत गया!" 100 में से 99 बार।
  • समस्या: फिर से, कोई उपयोगी जानकारी नहीं। हर कोई नौसिखिए को हरा देता है। आप अभी भी यह नहीं जानते कि पेशेवरों में से सबसे अच्छा कौन है।

निष्कर्ष: जब आप एक ऐसा एंकर चुनते हैं जो बहुत अच्छा या बहुत बुरा हो, तो परिणाम "सैचुरेटेड" (saturated) हो जाते हैं। यह एक 10 फीट तक जाने वाले स्केल का उपयोग करके एक गगनचुंबी इमारत और एक गार्डन ग्नोम (बौने पुतले) की ऊंचाई मापने जैसा है। आप ऊँची चीजों के बीच अंतर नहीं कर सकते, और आप छोटी चीजों के बीच भी अंतर नहीं कर सकते।


समाधान: "गोल्डिलॉक्स" (Goldilocks) एंकर

पेपर ने पाया कि सबसे अच्छा एंकर औसत दर्जे का है—वह गायक जो औसत है।

  • यह क्यों काम करता है: जब आप एक अच्छे गायक की तुलना एक औसत एंकर से करते हैं, तो जज को गहराई से सोचना पड़ता है। "हम्म, यह वाला थोड़ा बेहतर है।"
  • परिणाम: जब आप एक खराब गायक की तुलना उसी औसत एंकर से करते हैं, तो जज को भी सोचना पड़ता है। "हम्म, यह वाला थोड़ा कमतर है।"
  • जादू: क्योंकि एंकर बीच में है, इसलिए परिणाम संतुलित होते हैं। कुछ लोग जीतते हैं, कुछ हारते हैं, और अंतर बहुत सूक्ष्म होते हैं। यह एक समृद्ध डेटासेट बनाता है जहाँ आप वास्तव में गायकों के बीच के सूक्ष्म अंतरों को देख सकते हैं।

उपमा: एंकर को एक थर्मोस्टेट के रूप में सोचें।

  • यदि थर्मोस्टेट 100°F (बहुत गर्म) पर सेट है, तो सबको ठंड लगेगी। आप यह नहीं बता सकते कि कौन थोड़ा ज्यादा कांप रहा है और कौन बहुत ज्यादा।
  • यदि थर्मोस्टेट 32°F (बहुत ठंडा) पर सेट है, तो सबको गर्मी लगेगी। वही समस्या।
  • यदि थर्मोस्टेट 70°F (आरामदायक तापमान) पर सेट है, तो आप स्पष्ट रूप से महसूस कर सकते हैं कि कौन थोड़ा अधिक गर्म है और कौन थोड़ा अधिक ठंडा। वह "गोल्डिलॉक्स" तापमान आपको सबसे अधिक डेटा देता है।

चौंकाने वाले निष्कर्ष

शोधकर्ताओं ने एक विशाल प्रयोग किया (8,50,000 से अधिक AI मॉडलों की तुलना की) और तीन चौंकाने वाली बातें पाईं:

  1. "इनवर्टेड U" आकार: यदि आप एंकर की "गुणवत्ता" और अन्य मॉडलों को रैंक करने की उसकी क्षमता के बीच ग्राफ बनाते हैं, तो आपको एक U-आकार प्राप्त होता है। सबसे अच्छे एंकर बीच में (U के निचले हिस्से में) होते हैं, और सबसे खराब एंकर बिल्कुल ऊपर और बिल्कुल नीचे होते हैं।
  2. यह जज से अधिक महत्वपूर्ण है: लोग इस बात पर बहुत बहस करते हैं कि किस AI मॉडल को जज बनना चाहिए (जैसे, "क्या GPT-4, Claude से बेहतर है?")। पेपर ने पाया कि सही एंकर चुनना सही जज चुनने जितना ही महत्वपूर्ण है। एक बुरा एंकर आपके परिणामों को खराब कर सकता है, भले ही आपके पास दुनिया का सबसे बुद्धिमान जज क्यों न हो।
  3. हम पैसा बर्बाद कर रहे हैं: वर्तमान बेंचमार्क (जैसे Arena-Hard) अक्सर बहुत छोटे होते हैं। क्योंकि "चरम" (extreme) एंकर बहुत सारा डेटा बर्बाद कर देते हैं (बहुत अधिक स्पष्ट जीत/हार पैदा करके), हमें विश्वसनीय परिणाम प्राप्त करने के लिए बहुत बड़े डेटासेट की आवश्यकता है। यदि आप एक बुरा एंकर उपयोग करते हैं, तो आपको समान सटीकता पाने के लिए दोगुना डेटा की आवश्यकता हो सकती है।

आपको क्या करना चाहिए? (चीट शीट)

यदि आप AI मूल्यांकन (evaluation) चला रहे हैं, तो यहाँ पेपर से दी गई सलाह है:

  • अपने एंकर के रूप में "सर्वश्रेष्ठ" मॉडल न चुनें। इसे हराना बहुत आसान है।
  • "सबसे खराब" मॉडल न चुनें। इससे हारना बहुत आसान है।
  • "बीच वाला" मॉडल चुनें। एक ऐसा मॉडल खोजें जो उन मॉडलों के लगभग समान स्मार्ट हो जिनका आप परीक्षण कर रहे हैं। यह आपको सबसे सटीक रैंकिंग देगा।
  • पहले अपने डेटा की जाँच करें। एक बड़ा, महंगा टेस्ट चलाने से पहले, एक छोटा टेस्ट चलाकर देखें कि क्या आपका एंकर "सूचनात्मक" (informative) है (क्या यह जीत और हार का मिश्रण पैदा करता है?)। यदि यह बहुत एकतरफा है, तो एक अलग एंकर चुनें।

मुख्य बात (Takeaway)

AI मूल्यांकन की दुनिया में, औसत दर्जे का होना एक सुपरपावर है। एक "परफेक्ट" या "भयानक" एंकर के बजाय एक "काफी अच्छा" एंकर चुनकर, आप वास्तव में AI मॉडल एक-दूसरे की तुलना में कैसे हैं, इसकी अधिक स्पष्ट, निष्पक्ष और सटीक तस्वीर प्राप्त करते हैं। यह एक धुंधली फोटो और एक हाई-डेफिनिशन फोटो के बीच का अंतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →