Who Defines "Best"? Towards Interactive, User-Defined Evaluation of LLM Leaderboards
यह शोध पत्र LMArena डेटासेट में पूर्वाग्रहों का विश्लेषण करके स्थिर LLM लीडरबोर्ड की सीमाओं की आलोचना करता है और एक इंटरैक्टिव विज़ुअलाइज़ेशन टूल प्रस्तावित करता है जो उपयोगकर्ताओं को कस्टम मूल्यांकन प्राथमिकताएं परिभाषित करने में सक्षम बनाता है, जिससे पारदर्शिता बढ़ती है और संदर्भ-विशिष्ट मॉडल मूल्यांकन में सहायता मिलती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "Who Defines 'Best'?" नामक शोध पत्र (paper) का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ हिंदी अनुवाद दिया गया है।
समस्या: "एक ही आकार सबके लिए" वाला स्कोरकार्ड (The "One-Size-Fits-All" Scorecard)
कल्पना कीजिए कि आप एक कार खरीदने की कोशिश कर रहे हैं। आप एक ऐसी वेबसाइट पर जाते हैं जो कारों को एक एकल संख्या के आधार पर रैंक करती है: "सबसे अच्छी कार का स्कोर।"
यह स्कोर कार प्रेमियों के एक छोटे से समूह द्वारा निकाला जाता है जिन्हें ट्रैक पर रेसिंग करना पसंद है। वे "टॉप स्पीड" और "कॉर्नरिंग" जैसी चीजों को बहुत अधिक महत्व देते हैं। इस कारण, एक फॉर्मूला 1 रेस कार का स्कोर 100/100 होता है, जबकि एक फैमिली मिनीवैन का स्कोर 40/100 होता है।
समस्या: आप कोई रेस कार ड्राइवर नहीं हैं। आप एक माता-पिता हैं जिन्हें तीन बच्चों, एक कुत्ते और किराने के सामान को ले जाने के लिए एक कार की जरूरत है। आप "सुरक्षा," "सामान रखने की जगह," और "ईंधन दक्षता" (fuel efficiency) की परवाह करते हैं।
यदि आप "सबसे अच्छी कार" (रेस कार) खरीदते हैं क्योंकि उसका स्कोर सबसे अधिक है, तो आप दुखी रहेंगे। उस स्कोर ने आपको सच्चाई नहीं बताई; इसने केवल वही बताया जो उस स्कोर के डिजाइनरों को पसंद था।
AI के साथ भी बिल्कुल यही हो रहा है।
वर्तमान में, हम लार्ज लैंग्वेज मॉडल्स (LLMs) को रैंक करने के लिए "लीडरबोर्ड" (जैसे LMArena) का उपयोग करते हैं। ये लीडरबोर्ड प्रत्येक AI को एक एकल स्कोर देते हैं कि वह प्रश्नों के एक विशिष्ट सेट पर कितनी अच्छी तरह प्रदर्शन करता है। लेकिन जिन लोगों ने ये प्रश्न तैयार किए हैं, वे अक्सर डेवलपर्स या तकनीकी उत्साही होते हैं। वे बहुत सारे कोडिंग प्रश्न और लॉजिक पहेलियाँ पूछते हैं।
यदि आप एक शिक्षक, डॉक्टर या कस्टमर सर्विस मैनेजर हैं, तो वह एकल स्कोर आपके लिए पूरी तरह से बेकार हो सकता है। यह इस तथ्य को छिपा देता है कि एक AI आपके विशिष्ट काम के लिए बहुत खराब हो सकता है, भले ही वह लीडरबोर्ड पर "नंबर एक" हो।
जांच: हुड के नीचे झाँकना (Peeking Under the Hood)
इस पेपर के लेखकों ने यह देखने के लिए कि वास्तव में क्या हो रहा है, सबसे लोकप्रिय AI लीडरबोर्ड (LMArena) की जांच करने का निर्णय लिया। उन्होंने डेटासेट को रंग (विषय) के आधार पर छाँटने के लिए एक विशाल मार्बल्स (कंचों) के थैले की तरह माना।
उन्होंने क्या पाया:
- थैला पक्षपाती है: थैला "कोडिंग" और "AI" के सवालों से भरा है (डेटा का लगभग 30%)। यह एक ऐसी कार समीक्षा साइट की तरह है जो केवल स्पोर्ट्स कारों की समीक्षा करती है।
- रैंकिंग बदल जाती है: जब उन्होंने डेटा के विशिष्ट हिस्सों को देखा, तो रैंकिंग उलट गई।
- उपमा: कल्पना कीजिए कि एक "सर्वश्रेष्ठ एथलीट" प्रतियोगिता है। यदि प्रतियोगिता 100% तैराकी है, तो तैराक जीतेगा। यदि प्रतियोगिता 100% वेटलिफ्टिंग है, तो वेटलिफ्टर जीतेगा। लेकिन लीडरबोर्ड केवल तैराक को नंबर 1 के रूप में दिखाता है। यदि आपको एक वेटलिफ्टर की आवश्यकता है, तो लीडरबोर्ड आपसे झूठ बोल रहा है।
- "टाई" (Tie) की समस्या: कभी-कभी, दो AI गणित की समस्या का बिल्कुल सही उत्तर देते हैं। लेकिन इंसान फिर भी एक को दूसरे के ऊपर चुन लेते हैं क्योंकि एक उत्तर अधिक सुंदर तरीके से लिखा गया था या दिखने में बेहतर था। लीडबोर्ड इसे सत्य के बजाय "स्टाइल" (शैली) की जीत के रूप में गिनता है।
- "राजनीति" का जाल: जब लोग संवेदनशील राजनीतिक विषयों के बारे में पूछते हैं, तो कोई एक "सही" उत्तर नहीं होता। कुछ लोग तटस्थ उत्तर चाहते हैं; अन्य एक मजबूत राय चाहते हैं। लीडरबोर्ड इन परस्पर विरोधी विचारों को एक स्कोर में औसत (average) कर देता है, जो किसी के लिए भी तर्कसंगत नहीं है।
समाधान: "अपना खुद का रिपोर्ट बनाएँ" टूल (The "Build-Your-Own-Report" Tool)
एक निश्चित स्कोर देने के बजाय, लेखकों ने एक प्रोटोटाइप टूल (एक विज़ुअलाइज़ेशन इंटरफ़ेस) बनाया है जो आपको जज बनने की अनुमति देता है।
यह कैसे काम करता है (उपमा):
यह एक पहले से तैयार भोजन के बजाय एक कस्टमाइज़ेबल बुफे (Buffet) की तरह है।
- पुराना तरीका: शेफ आपको 50% ब्रोकली और 50% स्टेक वाली एक प्लेट देता है। आपको पूरा भोजन करना पड़ता है और भोजन को रेट करना पड़ता है।
- नया तरीका: शेफ आपको सामग्रियों (विषय जैसे "गणित," "इतिहास," "कोडिंग," "रचनात्मक लेखन") का एक मेनू देता है। आपको एक प्लेट और चिमटा (tongs) मिलता है।
- आप कहते हैं, "मुझे केवल गणित और इतिहास की परवाह है।"
- आप कहते हैं, "मुझे इतिहास का दोगुना हिस्सा चाहिए।"
- आप कहते हैं, "मुझे कोडिंग नहीं चाहिए।"
इसके बाद टूल तुरंत केवल आपके विकल्पों के आधार पर रैंकिंग की पुनर्गणना करता है।
यह टूल आपको क्या दिखाता है:
- "स्लाइस" (Slice) दृश्य: आप देख सकते हैं कि मॉडल A कोडिंग में अद्भुत है लेकिन इतिहास में बहुत खराब है। मॉडल B इसके विपरीत है।
- "क्यों" (Why) दृश्य: आप किसी विशिष्ट परिणाम पर क्लिक करके वास्तविक प्रश्न और उत्तर देख सकते हैं। आप देख सकते हैं कि मॉडल A क्यों जीता (उदाहरण के लिए, "इसने एक बहुत ही संरचित सूची दी," या "यह संक्षिप्त था")।
- "ट्रेड-ऑफ" (Trade-off) दृश्य: आप देख सकते हैं कि यदि आप "गति" (Speed) को प्राथमिकता देते हैं, तो आप "सटीकता" (Accuracy) खो सकते हैं। टूल आपको यह तय करने में मदद करता है कि आप किस समझौते के लिए तैयार हैं।
प्रयोग: क्या यह काम करता है?
शोधकर्ताओं ने 10 वास्तविक पेशेवरों (इंजीनियरों, शिक्षकों, डेटा विश्लेषकों) के साथ इस टूल का परीक्षण किया।
क्या हुआ:
- आश्चर्य: लोग अक्सर हैरान थे। एक व्यक्ति ने सोचा कि "मॉडल X" सबसे अच्छा है क्योंकि वह प्रसिद्ध है। लेकिन जब उन्होंने अपनी विशिष्ट आवश्यकताओं (जैसे, "कस्टमर सर्विस") के लिए डेटा को फ़िल्टर किया, तो एक छोटा, कम प्रसिद्ध मॉडल वास्तव में बेहतर प्रदर्शन कर रहा था।
- आत्मविश्वास: बिना सोचे-समझे एक नंबर पर भरोसा करने के बजाय, लोग अपने विकल्पों के बारे में आश्वस्त महसूस कर रहे थे क्योंकि वे साक्ष्य देख सकते थे। वे कह सकते थे, "मैंने मॉडल Y को इसलिए चुना क्योंकि यह बच्चों को गणित समझाने में बहुत अच्छा है, जो मेरी ज़रूरत है।"
- क्रिटिकल थिंकिंग (Critical Thinking): उन्होंने "सबसे अच्छा कौन है?" पूछना बंद कर दिया और "मेरे लिए सबसे अच्छा कौन है?" पूछना शुरू कर दिया।
मुख्य निष्कर्ष (The Big Takeaway)
यह पेपर तर्क देता है कि कोई एक अकेला "सर्वश्रेष्ठ" AI नहीं है। "सर्वश्रेष्ठ" एक ऐसा प्रश्न है जो पूरी तरह से इस पर निर्भर करता है कि पूछने वाला कौन है और उसे क्या चाहिए।
- पुरानी मानसिकता: "लीडरबोर्ड कहता है कि मॉडल A नंबर 1 है, इसलिए हमें मॉडल A का उपयोग करना चाहिए।"
- नई मानसिकता: "लीडरबोर्ड एक मानचित्र (map) है। लेकिन मुझे अपने गंतव्य के आधार पर अपना स्वयं का मार्ग बनाना है। मैं इस टूल का उपयोग उस AI को खोजने के लिए करूँगा जो मेरी विशिष्ट यात्रा के अनुकूल है।"
संक्षेप में: लोगों के एक छोटे समूह को यह तय करने न दें कि सबके लिए "अच्छा" क्या है। उपयोगकर्ताओं को अपने लिए "अच्छा" को परिभाषित करने के उपकरण दें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।