DualEval: Joint Model-Item Calibration for Unified LLM Evaluation
DualEval एक संयुक्त मॉडल-आइटम अंशांकन (calibration) ढांचे को पेश करता है जो विश्वसनीय मॉडल रैंकिंग और कई डोमेन में आइटम-स्तरीय निदान (diagnostics) उत्पन्न करने के लिए स्थिर बेंचमार्क और एरिना-शैली के प्राथमिकता डेटा को एक साझा लेटेंट स्पेस में एकीकृत करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल रसोई में 18 अलग-अलग शेफ के कौशल का आकलन करने की कोशिश कर रहे हैं। पारंपरिक रूप से, आपके पास इसे करने के दो तरीके थे, लेकिन वे दो अलग-अलग भाषाओं की तरह थे जो कभी आपस में मिल नहीं पाते थे:
- बहुविकल्पीय प्रश्नोत्तरी (स्थिर बेंचमार्क): आप उन्हें एक परीक्षण देते हैं जिसमें स्पष्ट सही और गलत उत्तर होते हैं। यह वस्तुनिष्ठ है और ग्रेडिंग करना आसान है, लेकिन अंततः शेफ उत्तरों को रट लेते हैं, या प्रश्न इतने आसान हो जाते हैं कि सभी उन्हें पास कर लेते हैं, जिससे यह बताना कठिन हो जाता है कि वास्तव में सबसे अच्छा कौन है।
- स्वाद प्रतियोगिता (एरिना-शैली): लोग दो व्यंजनों को अगल-बगल रखकर चखते हैं और वोट देते हैं कि उन्हें कौन सा अधिक पसंद आया। यह वास्तविक जीवन जैसा लगता है, लेकिन यह अव्यवधित है। लोग असहमत होते हैं, कुछ जज बहुत नखरेबाज होते हैं, और यह जानना कठिन होता है कि "जीत" इसलिए हुई क्योंकि व्यंजन वास्तव में बेहतर था या केवल इसलिए क्योंकि जज अच्छे मूड में था।
DualEval एक नया फ्रेमवर्क है जो एक मास्टर अनुवादक और एक स्मार्ट स्केल की तरह काम करता है, जो इन दोनों दुनियाओं को एक एकीकृत प्रणाली में जोड़ता है। यह इस प्रकार काम करता है, सरल उपमाओं का उपयोग करते हुए:
1. साझा "कौशल पैमाना" (Shared Skill Scale)
प्रत्येक शेफ को क्विज़ और टेस्टिंग के लिए अलग-अलग स्कोर देने के बजाय, DualEval सभी को क्षमता की एक ही सीढ़ी पर रखता है।
- यह केवल यह नहीं पूछता, "कौन जीता?"
- यह पूछता है, "यह विशिष्ट व्यंजन कितना कठिन था, और एक अच्छे शेफ और एक महान शेफ के बीच का अंतर कितना गहरा है?"
इसे एक वीडियो गेम रेटिंग सिस्टम की तरह समझें। एक गेम में, कुछ स्तर इतने आसान होते हैं कि एक नौसिखिया भी उन्हें जीत लेता है (वे कौशल के बारे में बहुत कुछ नहीं बताते)। कुछ इतने कठिन होते हैं कि कोई भी उन्हें जीत नहीं पाता (वे भी बहुत कुछ नहीं बताते)। DualEval यह पता लगाता है कि कौन से "स्तर" (प्रश्न) "गोल्डिलॉक्स ज़ोन" (Goldilocks zone) में हैं—इतने कठिन कि शीर्ष शेफ को चुनौती दें, लेकिन इतने आसान भी नहीं कि कमजोर लोग भी पास हो जाएं। ये वे प्रश्न हैं जो वास्तव में बताते हैं कि सबसे अच्छा कौन है।
2. दो प्रकार का फीडबैक, एक मस्तिष्क
DualEval क्विज़ और टेस्टिंग दोनों से एक साथ सीखता है।
- क्विज़ इसे कठोर तथ्य (सही/गलत) देता है।
- टेस्टिंग इसे "कोमल" भावनाएं (मुझे यह थोड़ा अधिक पसंद आया) देती है।
जादू यह है कि वे एक-दूसरे की मदद करते हैं। यदि टेस्टिंग जज भ्रमित या शोर वाले हैं, तो क्विज़ के कठोर तथ्य रैंकिंग को स्थिर रखते हैं। यदि क्विज़ के प्रश्न बहुत पुराने या रटे हुए हैं, तो ताज़ा टेस्टिंग डेटा कमियों को भर देता है। यह एक सख्त गणित शिक्षक और एक रचनात्मक कला समीक्षक द्वारा एक ही छात्र की ग्रेडिंग करने जैसा है; साथ मिलकर, वे अकेले किसी भी एक की तुलना में छात्र की प्रतिभा की कहीं अधिक सच्ची तस्वीर पेश करते हैं।
3. "शोर" को खोजना (विसंगति का पता लगाना - Anomaly Detection)
चूंकि DualEval को ठीक-ठीक पता है कि एक प्रश्न कितना कठिन है और एक शेफ को कितना अच्छा होना चाहिए, इसलिए यह पहचान सकता है कि कब कुछ अजीब हो रहा है।
- उपमा: कल्पना कीजिए कि एक शेफ जो आमतौर पर टोस्ट जला देता है, अचानक एक ऐसा कठिन सूफ़ले (soufflé) बनाता है जो बेहद मुश्किल सवाल पर आधारित है।
- परिणाम: DualEval इसे एक "संदिग्ध आउटलायर" (suspicious outlier) के रूप में चिह्नित करता है। यह यह नहीं कहता कि शेफ एक जीनियस है; यह कहता है, "रुको, यह परिणाम पैटर्न में फिट नहीं बैठता। क्या उन्होंने नकल की? क्या उन्होंने उत्तर रट लिए? या क्या डेटा खराब है?" यह डेटा लीकेज या धोखाधड़ी (contamination) को पकड़ने में मदद करता है इससे पहले कि वह लीडरबोर्ड को खराब कर दे।
4. "स्मार्ट फ़िल्टर" (बेंचमार्क संपीड़न - Benchmark Compression)
पेपर में पाया गया कि यह जानने के लिए कि सबसे अच्छा कौन है, आपको शेफ को हर एक प्रश्न पर टेस्ट करने की आवश्यकता नहीं है।
- उपमा: यदि आपके पास 1,000 प्रश्न हैं, तो उनमें से 900 शायद बहुत आसान होंगे (सभी पास हो जाते हैं) या बहुत कठिन (कोई पास नहीं हो पाता)। वे केवल "फिलर" हैं।
- परिणाम: DualEval उन शीर्ष 10% प्रश्नों की पहचान कर सकता है जो सबसे अधिक "सूचनात्मक" हैं। यदि आप शेफ का परीक्षण केवल इन 10% उच्च-गुणवत्ता वाले प्रश्नों पर करते हैं, तो आपको वही रैंकिंग मिलेगी जो 1,000 प्रश्नों के परीक्षण से मिलती। इससे समय और पैसे की भारी बचत होती है।
सारांश
DualEval एक ऐसा टूल है जो टेस्ट प्रश्नों को बदलने योग्य वस्तुओं के रूप में मानना बंद करता है। इसके बजाय, यह प्रत्येक प्रश्न को अपनी कठिनाई और "तीक्ष्णता" के साथ एक अद्वितीय उपकरण के रूप में मानता है। कठोर टेस्ट स्कोर को मानवीय प्राथमिकताओं के साथ जोड़कर, यह लार्ज लैंग्वेज मॉडल्स (LLMs) को रैंक करने का एक अधिक निष्पक्ष, अधिक स्थिर और अधिक कुशल तरीका बनाता है, जबकि यह धोखाधड़ी या खराब डेटा का पता लगाने के लिए एक जासूस के रूप में भी कार्य करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।