← नवीनतम पेपर
📊 statistics

LLM Evaluation as Tensor Completion: Low Rank Structure and Semiparametric Efficiency

यह शोध पत्र LLM मूल्यांकन में लो-रैंक टेंसर कंप्लीशन के लिए एक सेमीपैरामेट्रिक इन्फरेंस फ्रेमवर्क स्थापित करता है, जो एफिशिएंसी बाउंड्स को व्युत्पन्न करता है और एक स्कोर-व्हाइटनिंग विधि पेश करता है ताकि शोर युक्त, स्पार्स पेयरवाइज़ तुलनाओं से मॉडल क्षमताओं के एसिम्प्टोटिकली नॉर्मल, अनसर्टेन्टी-क्वांटिफाइड अनुमान को सक्षम बनाया जा सके।

मूल लेखक: Jiachun Li, David Simchi-Levi, Will Wei Sun

प्रकाशित 2026-09-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiachun Li, David Simchi-Levi, Will Wei Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की तेजी से बदलती दुनिया में, एक नए प्रकार की सांख्यिकीय चुनौती उभर कर आई है। जैसे-जैसे लार्ज लैंग्वेज मॉडल्स अधिक सक्षम होते जा रहे हैं, सवाल अब केवल उन्हें बनाने के बारे में नहीं रह गया है, बल्कि यह जानने के बारे में है कि वे वास्तव में कितने अच्छे हैं। इसका उत्तर देने के लिए, प्लेटफॉर्म्स ने एक ऐसी विधि को अपनाया है जो इस बात की नकल करती है कि इंसान कैसे सीखते हैं: दो प्रतिक्रियाओं की आमने-सामhi तुलना करना और बेहतर के लिए वोट देना। यह प्रक्रिया डेटा का एक विशाल प्रवाह उत्पन्न करती है, लेकिन यह अव्यवस्थित है। कुछ मॉडल्स की हजारों बार तुलना की जाती है, जबकि कुछ को शायद ही कभी देखा जाता है। कुछ प्रश्न लगातार पूछे जाते हैं, जबकि कुछ को अनदेखा कर दिया जाता है। परिणाम एक ऐसा लीडरबोर्ड है जो एक स्पष्ट रैंकिंग जैसा दिखता है, लेकिन वास्तव में यह असमान, शोरयुक्त और अपूर्ण जानकारी की नींव पर बना है। इन रैंकिंग्स में अनिश्चितता को मापने का तरीका जाने बिना, यह जानना कठिन है कि क्या किसी मॉडल में वास्तव में सुधार हुआ है या यह केवल डेटा का एक संयोग मात्र है।

MIT और पर्ड्यू यूनिवर्सिटी के शोधकर्ताओं ने इन AI मॉडल्स के मूल्यांकन को 'लापता टुकड़ों' की एक पहेली के रूप में मानकर इस समस्या का समाधान किया है। उन्होंने महसूस किया कि एक मॉडल की क्षमता एक एकल संख्या नहीं है, बल्कि एक जटिल प्रोफाइल है जो कार्य, भाषा या उपयोगकर्ता के आधार पर बदलती रहती है। इसे समझने के लिए, उन्होंने हर संभव परिदृश्य में हर मॉडल के प्रदर्शन की कल्पना एक विशाल, बहु-आयामी ग्रिड (multi-dimensional grid) के रूप में की, जिसमें छिपे हुए स्कोर होते हैं। इनमें से अधिकांश स्कोर सीधे तौर पर देखे नहीं जा सकते क्योंकि हम एक इंसान से हर स्थिति में हर मॉडल की तुलना करने के लिए नहीं कह सकते। इसके बजाय, हमें केवल विशिष्ट, यादृच्छिक (random) मुकाबलों के परिणाम दिखाई देते हैं। शोधकर्ताओं ने इन लापता स्कोर को भरने के लिए एक नया गणितीय ढांचा विकसित किया, जो केवल अनुमान लगाने के बजाय, सबसे संभावित मूल्यों की गणना करता है और साथ ही यह भी सटीक रूप से मापता है कि हम उन अनुमानों को लेकर कितने आश्वस्त हो सकते हैं।

उनका मुख्य कार्य उस विशिष्ट कठिनाई को संबोधित करता है जिसे पिछले तरीकों ने छोड़ दिया था: डेटा की असमान प्रकृति। एक आदर्श दुनिया में, प्रत्येक तुलना समान रूप से सूचनात्मक होती है, लेकिन वास्तविकता में, दो बहुत समान मॉडल्स के बीच का मुकाबला बहुत उपयोगी जानकारी प्रदान करता है, जबकि एक शीर्ष-स्तरीय मॉडल और एक कमजोर मॉडल के बीच का मुकाबला हमें बहुत कम बताता है। इसके अलावा, डेटा एकत्र करने का तरीका अक्सर लोकप्रिय मॉडल्स या ट्रेंडिंग विषयों की ओर झुका हुआ होता है। शोधकर्ताओं ने पाया कि मानक सांख्यिकीय उपकरण इस वातावरण में विफल हो जाते हैं क्योंकि वे मानते हैं कि डेटा समान है। उन्होंने पाया कि इन स्कोरों का अनुमान लगाने वाली गणितीय मशीनरी तब अस्थिर हो जाती है जब जानकारी असंतुलित होती है, जिससे अविश्वसनीय रैंकिंग और भ्रामक कॉन्फिडेंस इंटरवल (confidence intervals) पैदा होते हैं।

इसे हल करने के लिए, टीम ने एक तकनीक पेश की जिसे वे "स्कोर व्हाइटनिंग" (score whitening) कहते हैं। इसे रेडियो पर वॉल्यूम एडजस्ट करने की तरह समझें, ताकि हर स्टेशन, चाहे वह स्पष्ट रूप से प्रसारित कर रहा हो या शोर के साथ, अंतिम ध्वनि में समान रूप से योगदान दे सके। प्रत्येक तुलना को गणितीय रूप से पुनर्गठित (rescale) करके, जिसमें वास्तव में कितनी जानकारी शामिल है, उन्होंने अराजक, असमान डेटा को एक संतुलित प्रवाह में बदल दिया। इसने उन्हें एक नए प्रकार का एस्टिमेटर (estimator) बनाने की अनुमति दी जो AI मूल्यांकन की वास्तविक दुनिया की अव्यवस्था को संभाल सकता है। उन्होंने सिद्ध किया कि यह विधि ऐसे कॉन्फिडेंस इंटरवल बनाने की अनुमति देती है जो सटीक और कुशल दोनों हैं, जिसका अर्थ है कि वे विश्वसनीयता से समझौता किए बिना यथासंभव सुदृढ़ हैं।

उनके निष्कर्ष बताते हैं कि डेटा की 'लो-रैंक संरचना' (low-rank structure) को ध्यान में रखकर—जिसका अर्थ है कि मॉडल का प्रदर्शन रैंडम शोर के बजाय तर्क क्षमता या कोडिंग कौशल जैसे कुछ अंतर्निहित कारकों द्वारा संचालित होता है—विभिन्न कार्यों और मॉडल्स के बीच सूचना का आदान-प्रदान करना संभव है। सूचना का यह आदान-प्रदान तब अत्यंत महत्वपूर्ण होता है जब डेटा विरल (sparse) हो। शोधकर्ताओं ने प्रदर्शित किया कि उनका दृष्टिकोण न केवल सरल प्रश्नों के लिए काम करता है, जैसे कि "मॉडल A, मॉडल B से कितना बेहतर है?", बल्कि जटिल, गैर-रेखीय (non-linear) प्रश्नों के लिए भी, जैसे कि "एक विशिष्ट श्रेणी में मॉडल A के जीतने की क्या संभावना है?"।

सिंथेटिक डेटा और लोकप्रिय 'एरिना' (Arena) प्लेटफॉर्म के वास्तविक डेटा दोनों का उपयोग करते हुए किए गए प्रयोगों में, नई विधि ने अपनी उपयोगिता सिद्ध की। उन मौजूदा दृष्टिकोणों की तुलना में जो प्रत्येक कार्य को अलग से देखते हैं या असमान सैंपलिंग को अनदेखा करते हैं, नए एस्टिमेटर ने काफी कम त्रुटि मार्जिन के साथ रैंकिंग प्रस्तुत की। इसने अपने कॉन्फिडेंस लेवल को सफलतापूर्वक कैलिब्रेट किया, जिसका अर्थ है कि जब इसने सही होने की 95% संभावना का दावा किया, तो यह 95% बार सही था। अध्ययन इस बात की पुष्टि करता है कि हालांकि मानव प्राथमिकताओं से प्राप्त डेटा स्वाभाविक रूप से शोरयुक्त और पक्षपाती होता है, लेकिन मॉडल के प्रदर्शन की एक स्पष्ट, सांख्यिकीय रूप से सुदृढ़ तस्वीर निकालना संभव है। यह डेवलपर्स और उपयोगकर्ताओं के लिए न केवल यह समझने का एक सिद्धांतपूर्ण तरीका प्रदान करता है कि कौन जीत रहा है, बल्कि यह भी कि हम उस जीत के बारे में कितने निश्चित हो सकते हैं, जिससे वोटों के शोरयुक्त संग्रह को आर्टिफिशियल इंटेलिजेंस की क्षमता के एक विश्वसनीय माप में बदला जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →