← नवीनतम पेपर
💻 computer science

Who Defines "Best"? Towards Interactive, User-Defined Evaluation of LLM Leaderboards

यह शोध पत्र LMArena डेटासेट में पूर्वाग्रहों का विश्लेषण करके स्थिर LLM लीडरबोर्ड की सीमाओं की आलोचना करता है और एक इंटरैक्टिव विज़ुअलाइज़ेशन टूल प्रस्तावित करता है जो उपयोगकर्ताओं को कस्टम मूल्यांकन प्राथमिकताएं परिभाषित करने में सक्षम बनाता है, जिससे पारदर्शिता बढ़ती है और संदर्भ-विशिष्ट मॉडल मूल्यांकन में सहायता मिलती है।

मूल लेखक: Minji Jung, Minjae Lee, Yejin Kim, Sarang Choi, Minsuk Kahng

प्रकाशित 2026-04-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Minji Jung, Minjae Lee, Yejin Kim, Sarang Choi, Minsuk Kahng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Who Defines 'Best'?" नामक शोध पत्र (paper) का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ हिंदी अनुवाद दिया गया है।

समस्या: "एक ही आकार सबके लिए" वाला स्कोरकार्ड (The "One-Size-Fits-All" Scorecard)

कल्पना कीजिए कि आप एक कार खरीदने की कोशिश कर रहे हैं। आप एक ऐसी वेबसाइट पर जाते हैं जो कारों को एक एकल संख्या के आधार पर रैंक करती है: "सबसे अच्छी कार का स्कोर।"

यह स्कोर कार प्रेमियों के एक छोटे से समूह द्वारा निकाला जाता है जिन्हें ट्रैक पर रेसिंग करना पसंद है। वे "टॉप स्पीड" और "कॉर्नरिंग" जैसी चीजों को बहुत अधिक महत्व देते हैं। इस कारण, एक फॉर्मूला 1 रेस कार का स्कोर 100/100 होता है, जबकि एक फैमिली मिनीवैन का स्कोर 40/100 होता है।

समस्या: आप कोई रेस कार ड्राइवर नहीं हैं। आप एक माता-पिता हैं जिन्हें तीन बच्चों, एक कुत्ते और किराने के सामान को ले जाने के लिए एक कार की जरूरत है। आप "सुरक्षा," "सामान रखने की जगह," और "ईंधन दक्षता" (fuel efficiency) की परवाह करते हैं।

यदि आप "सबसे अच्छी कार" (रेस कार) खरीदते हैं क्योंकि उसका स्कोर सबसे अधिक है, तो आप दुखी रहेंगे। उस स्कोर ने आपको सच्चाई नहीं बताई; इसने केवल वही बताया जो उस स्कोर के डिजाइनरों को पसंद था।

AI के साथ भी बिल्कुल यही हो रहा है।
वर्तमान में, हम लार्ज लैंग्वेज मॉडल्स (LLMs) को रैंक करने के लिए "लीडरबोर्ड" (जैसे LMArena) का उपयोग करते हैं। ये लीडरबोर्ड प्रत्येक AI को एक एकल स्कोर देते हैं कि वह प्रश्नों के एक विशिष्ट सेट पर कितनी अच्छी तरह प्रदर्शन करता है। लेकिन जिन लोगों ने ये प्रश्न तैयार किए हैं, वे अक्सर डेवलपर्स या तकनीकी उत्साही होते हैं। वे बहुत सारे कोडिंग प्रश्न और लॉजिक पहेलियाँ पूछते हैं।

यदि आप एक शिक्षक, डॉक्टर या कस्टमर सर्विस मैनेजर हैं, तो वह एकल स्कोर आपके लिए पूरी तरह से बेकार हो सकता है। यह इस तथ्य को छिपा देता है कि एक AI आपके विशिष्ट काम के लिए बहुत खराब हो सकता है, भले ही वह लीडरबोर्ड पर "नंबर एक" हो।

जांच: हुड के नीचे झाँकना (Peeking Under the Hood)

इस पेपर के लेखकों ने यह देखने के लिए कि वास्तव में क्या हो रहा है, सबसे लोकप्रिय AI लीडरबोर्ड (LMArena) की जांच करने का निर्णय लिया। उन्होंने डेटासेट को रंग (विषय) के आधार पर छाँटने के लिए एक विशाल मार्बल्स (कंचों) के थैले की तरह माना।

उन्होंने क्या पाया:

  1. थैला पक्षपाती है: थैला "कोडिंग" और "AI" के सवालों से भरा है (डेटा का लगभग 30%)। यह एक ऐसी कार समीक्षा साइट की तरह है जो केवल स्पोर्ट्स कारों की समीक्षा करती है।
  2. रैंकिंग बदल जाती है: जब उन्होंने डेटा के विशिष्ट हिस्सों को देखा, तो रैंकिंग उलट गई।
    • उपमा: कल्पना कीजिए कि एक "सर्वश्रेष्ठ एथलीट" प्रतियोगिता है। यदि प्रतियोगिता 100% तैराकी है, तो तैराक जीतेगा। यदि प्रतियोगिता 100% वेटलिफ्टिंग है, तो वेटलिफ्टर जीतेगा। लेकिन लीडरबोर्ड केवल तैराक को नंबर 1 के रूप में दिखाता है। यदि आपको एक वेटलिफ्टर की आवश्यकता है, तो लीडरबोर्ड आपसे झूठ बोल रहा है।
  3. "टाई" (Tie) की समस्या: कभी-कभी, दो AI गणित की समस्या का बिल्कुल सही उत्तर देते हैं। लेकिन इंसान फिर भी एक को दूसरे के ऊपर चुन लेते हैं क्योंकि एक उत्तर अधिक सुंदर तरीके से लिखा गया था या दिखने में बेहतर था। लीडबोर्ड इसे सत्य के बजाय "स्टाइल" (शैली) की जीत के रूप में गिनता है।
  4. "राजनीति" का जाल: जब लोग संवेदनशील राजनीतिक विषयों के बारे में पूछते हैं, तो कोई एक "सही" उत्तर नहीं होता। कुछ लोग तटस्थ उत्तर चाहते हैं; अन्य एक मजबूत राय चाहते हैं। लीडरबोर्ड इन परस्पर विरोधी विचारों को एक स्कोर में औसत (average) कर देता है, जो किसी के लिए भी तर्कसंगत नहीं है।

समाधान: "अपना खुद का रिपोर्ट बनाएँ" टूल (The "Build-Your-Own-Report" Tool)

एक निश्चित स्कोर देने के बजाय, लेखकों ने एक प्रोटोटाइप टूल (एक विज़ुअलाइज़ेशन इंटरफ़ेस) बनाया है जो आपको जज बनने की अनुमति देता है।

यह कैसे काम करता है (उपमा):
यह एक पहले से तैयार भोजन के बजाय एक कस्टमाइज़ेबल बुफे (Buffet) की तरह है।

  • पुराना तरीका: शेफ आपको 50% ब्रोकली और 50% स्टेक वाली एक प्लेट देता है। आपको पूरा भोजन करना पड़ता है और भोजन को रेट करना पड़ता है।
  • नया तरीका: शेफ आपको सामग्रियों (विषय जैसे "गणित," "इतिहास," "कोडिंग," "रचनात्मक लेखन") का एक मेनू देता है। आपको एक प्लेट और चिमटा (tongs) मिलता है।
    • आप कहते हैं, "मुझे केवल गणित और इतिहास की परवाह है।"
    • आप कहते हैं, "मुझे इतिहास का दोगुना हिस्सा चाहिए।"
    • आप कहते हैं, "मुझे कोडिंग नहीं चाहिए।"

इसके बाद टूल तुरंत केवल आपके विकल्पों के आधार पर रैंकिंग की पुनर्गणना करता है।

यह टूल आपको क्या दिखाता है:

  • "स्लाइस" (Slice) दृश्य: आप देख सकते हैं कि मॉडल A कोडिंग में अद्भुत है लेकिन इतिहास में बहुत खराब है। मॉडल B इसके विपरीत है।
  • "क्यों" (Why) दृश्य: आप किसी विशिष्ट परिणाम पर क्लिक करके वास्तविक प्रश्न और उत्तर देख सकते हैं। आप देख सकते हैं कि मॉडल A क्यों जीता (उदाहरण के लिए, "इसने एक बहुत ही संरचित सूची दी," या "यह संक्षिप्त था")।
  • "ट्रेड-ऑफ" (Trade-off) दृश्य: आप देख सकते हैं कि यदि आप "गति" (Speed) को प्राथमिकता देते हैं, तो आप "सटीकता" (Accuracy) खो सकते हैं। टूल आपको यह तय करने में मदद करता है कि आप किस समझौते के लिए तैयार हैं।

प्रयोग: क्या यह काम करता है?

शोधकर्ताओं ने 10 वास्तविक पेशेवरों (इंजीनियरों, शिक्षकों, डेटा विश्लेषकों) के साथ इस टूल का परीक्षण किया।

क्या हुआ:

  • आश्चर्य: लोग अक्सर हैरान थे। एक व्यक्ति ने सोचा कि "मॉडल X" सबसे अच्छा है क्योंकि वह प्रसिद्ध है। लेकिन जब उन्होंने अपनी विशिष्ट आवश्यकताओं (जैसे, "कस्टमर सर्विस") के लिए डेटा को फ़िल्टर किया, तो एक छोटा, कम प्रसिद्ध मॉडल वास्तव में बेहतर प्रदर्शन कर रहा था।
  • आत्मविश्वास: बिना सोचे-समझे एक नंबर पर भरोसा करने के बजाय, लोग अपने विकल्पों के बारे में आश्वस्त महसूस कर रहे थे क्योंकि वे साक्ष्य देख सकते थे। वे कह सकते थे, "मैंने मॉडल Y को इसलिए चुना क्योंकि यह बच्चों को गणित समझाने में बहुत अच्छा है, जो मेरी ज़रूरत है।"
  • क्रिटिकल थिंकिंग (Critical Thinking): उन्होंने "सबसे अच्छा कौन है?" पूछना बंद कर दिया और "मेरे लिए सबसे अच्छा कौन है?" पूछना शुरू कर दिया।

मुख्य निष्कर्ष (The Big Takeaway)

यह पेपर तर्क देता है कि कोई एक अकेला "सर्वश्रेष्ठ" AI नहीं है। "सर्वश्रेष्ठ" एक ऐसा प्रश्न है जो पूरी तरह से इस पर निर्भर करता है कि पूछने वाला कौन है और उसे क्या चाहिए

  • पुरानी मानसिकता: "लीडरबोर्ड कहता है कि मॉडल A नंबर 1 है, इसलिए हमें मॉडल A का उपयोग करना चाहिए।"
  • नई मानसिकता: "लीडरबोर्ड एक मानचित्र (map) है। लेकिन मुझे अपने गंतव्य के आधार पर अपना स्वयं का मार्ग बनाना है। मैं इस टूल का उपयोग उस AI को खोजने के लिए करूँगा जो मेरी विशिष्ट यात्रा के अनुकूल है।"

संक्षेप में: लोगों के एक छोटे समूह को यह तय करने न दें कि सबके लिए "अच्छा" क्या है। उपयोगकर्ताओं को अपने लिए "अच्छा" को परिभाषित करने के उपकरण दें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →