← नवीनतम पेपर
💬 NLP

From Benchmarks to Skills: Low-Rank Factors for LLM Evaluation

यह शोध पत्र बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) के लिए एक नए मूल्यांकन प्रतिमान का प्रस्ताव करता है जो बेंचमार्क प्रदर्शन में अंतर्निहित निम्न-रैंक संरचना (लो-रैंक स्ट्रक्चर) को प्रकट करने के लिए फैक्टर एनालिसिस लागू करता है, जो यह प्रदर्शित करता है कि व्याख्या योग्य गुप्त कौशल कारकों की एक छोटी संख्या अधिकांश क्षमताओं को समाहित करती है और अनावश्यक कार्यों की पहचान करने, नए मॉडलों की कुशलतापूर्वक प्रोफाइलिंग करने और विशिष्ट कौशल प्रोफाइल के आधार पर मॉडलों का चयन करने के लिए व्यावहारिक उपकरण सक्षम करती है।

मूल लेखक: Aviya Maimon, Amir DN Cohen, Gal Vishne, Shauli Ravfogel, Reut Tsarfaty

प्रकाशित 2026-06-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aviya Maimon, Amir DN Cohen, Gal Vishne, Shauli Ravfogel, Reut Tsarfaty

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

समस्या: "एक-संख्या" का जाल (The "One-Number" Trap)

कल्पना कीजिए कि आप 60 अलग-अलग एथलीटों की गुणवत्ता को आंकने की कोशिश कर रहे हैं। वर्तमान में, खेल जगत ऐसा इसलिए करता है क्योंकि वह हर एथलीट को 44 अलग-अलग स्पर्धाओं (जैसे दौड़ना, तैराकी, वजन उठाना आदि) में उनके प्रदर्शन के आधार पर एक एकल, समग्र स्कोर देता है।

यदि किसी एथलीट का स्कोर अधिक है, तो हम मान लेते हैं कि वह एक "बेहतरीन ऑल-राउंडर" है। लेकिन यह भ्रामक है।

  • खामी: एक जिम्नास्ट संतुलन बनाने में अद्भुत हो सकता है लेकिन दौड़ने में बहुत खराब। एक धावक इसके विपरीत हो सकता है। यदि आप केवल उनके स्कोर का औसत निकालते हैं, तो वे एक ही "समग्र" संख्या प्राप्त कर सकते हैं, भले ही उनकी वास्तविक क्षमताएं पूरी तरह से अलग हों।
  • वास्तविकता: वर्तमान लार्ज लैंग्वेज मॉडल्स (LLMs) का मूल्यांकन भी इसी तरह किया जा रहा है। हम उन्हें दर्जनों परीक्षणों (बेंचमार्क) पर चलाते हैं और उन्हें एक औसत स्कोर देते हैं। यह पेपर तर्क देता है कि यह सच्चाई को छिपाता है: कुछ मॉडल गणित में बेहतरीन हैं लेकिन लेखन में खराब, जबकि अन्य बातचीत में अच्छे हैं लेकिन तर्क (logic) में खराब। एकल स्कोर हमें यह नहीं बताता कि वे वास्तव में किस चीज़ में अच्छे हैं।

समाधान: "मनोवैज्ञानिक का दृष्टिकोण" (The "Psychologist's Approach")

लेखक इन मॉडल्स को देखने का एक नया तरीका प्रस्तावित करते हैं, जो इस बात से प्रेरित है कि मनोवैज्ञानिक मानव व्यक्तित्व का अध्ययन कैसे करते हैं।

उपमा: "बिग फाइव" व्यक्तित्व परीक्षण (The Analogy: The Big Five Personality Test)
जब मनोवैज्ञानिक मनुष्यों का अध्ययन करते हैं, तो वे केवल यह नहीं पूछते, "क्या आप एक अच्छे व्यक्ति हैं?" वे व्यक्तित्व के कई विशिष्ट आयामों (dimensions) को खोजने के लिए कई प्रश्नों को देखते हैं, जैसे बहिर्मुखता (Extroversion) या कर्तव्यनिष्ठा (Conscientiousness)। उन्होंने महसूस किया कि भले ही व्यवहार करने के हजारों तरीके हों, अधिकांश व्यवहार केवल कुछ मूल गुणों पर आधारित होते हैं।

लेखकों ने AI के लिए यही तर्क लागू किया:

  1. डेटा: उन्होंने 60 अलग-अलग AI मॉडल्स के लिए 44 विभिन्न कार्यों (जैसे चिकित्सा संबंधी प्रश्नों के उत्तर देना, समाचारों का सारांश बनाना, या गणित की समस्याओं को हल करना) के प्रदर्शन डेटा को एकत्र किया।
  2. जादुई उपकरण (फैक्टर एनालिसिस): उन्होंने फैक्टर एनालिसिस (Factor Analysis) नामक एक सांख्यिकीय पद्धति का उपयोग किया। इसे एक "पैटर्न डिटेक्टर" के रूप में सोचें। यह बिखरे हुए डेटा को देखता है और पूछता है: "क्या ये 44 परीक्षण वास्तव में 44 अलग-अलग चीजें माप रहे हैं, या क्या वे बार-बार केवल कुछ छिपे हुए कौशल को ही माप रहे हैं?"

खोज: "8 छिपे हुए कौशल" (The Discovery: The "8 Hidden Skills")

पैटर्न डिटेक्टर ने कुछ आश्चर्यजनक पाया। वे 44 अलग-अलग परीक्षण वास्तव में 44 अलग चीजें नहीं थे। वे वास्तव में केवल 8 मुख्य "कौशलों" को माप रहे थे जो मॉडल्स के पास मौजूद हैं।

स्कोरों की एक लंबी सूची के बजाय, लेखकों ने एक नया "कौशल-आधारित लीडरबोर्ड" बनाया जो मॉडल्स को इन 8 छिपे हुए आयामों पर रेटिंग देता है:

  1. सामान्य NLU (General NLU): रोजमर्रा की भाषा और व्याकरण की बुनियादी समझ।
  2. अनुमान और पूर्वाग्रह (Entailment & Bias): तार्किक संबंधों का पता लगाना और पूर्वाग्रह को पहचानना।
  3. लंबे दस्तावेज़ों की समझ (Long-Document Comprehension): लंबे टेक्स्ट को पढ़ना और याद रखना।
  4. निर्देशों का पालन (Instruction Following): जैसा कि आपसे कहा जाए, ठीक वैसा ही करना।
  5. डोमेन ज्ञान (Domain Knowledge): चिकित्सा या कानून जैसे विशिष्ट क्षेत्रों में विशेषज्ञता।
  6. सामाजिक और नैतिक निर्णय (Social & Ethical Judgment): यह जानना कि क्या विनम्र, सुरक्षित या नैतिक है।
  7. सटीकता और निष्ठा (Precision & Fidelity): संख्याओं और तथ्यों के साथ सटीक होना (भ्रम/hallucinations न होना)।
  8. ग्रेजुएट-लेवल तर्क (Grad-Level Reasoning): जटिल, स्नातक-स्तर के विज्ञान और तर्क की समस्याओं को हल करना।

"आहा!" क्षण (The "Aha!" Moment):
यह पेपर दिखाता है कि दो मॉडल्स का बिल्कुल समान "कुल स्कोर" (जैसे लीडरबोर्ड पर 1320 बनाम 1316) हो सकता है, लेकिन वे अंदर से पूरी तरह से अलग हो सकते हैं।

  • मॉडल A गणित और विज्ञान में जीनियस हो सकता है लेकिन कहानियाँ लिखने में बहुत खराब।
  • मॉडल B एक महान कहानीकार हो सकता है लेकिन गणित में खराब।
    पुराना "औसत स्कोर" कहेगा कि वे समान हैं। नया "कौशल प्रोफाइल" दिखाता है कि वे अलग-अलग कामों के लिए अलग-अलग उपकरण हैं।

यह क्यों मायने रखता है: तीन व्यावहारिक उपकरण (Why This Matters: Three Practical Tools)

लेखकों ने केवल ये कौशल ढूंढकर ही नहीं छोड़ा; उन्होंने इस नए मानचित्र का उपयोग करने में मदद करने के लिए तीन उपकरण बनाए:

  1. "रिडंडेंसी डिटेक्टर" (The "Redundancy Detector"):

    • समस्या: लोग लगातार नए परीक्षण बना रहे हैं, लेकिन उनमें से कई केवल पुराने कौशलों का ही पुन: परीक्षण कर रहे हैं।
    • उपकरण: यह टूल एक नए परीक्षण की जांच करता है कि क्या वह वास्तव में हमें कुछ नया सिखा रहा है या क्या वह केवल एक मौजूदा कौशल की "नकल" है। यदि एक नया परीक्षण पुराने वाले से 90% समान है, तो वह अनावश्यक (redundant) है और शायद उस पर प्रयास करने की आवश्यकता नहीं है।
  2. "फास्ट-ट्रैक प्रोफाइलर" (The "Fast-Track Profiler"):

    • समस्या: एक नए AI मॉडल का सभी 44 कार्यों पर परीक्षण करने में बहुत समय और पैसा लगता है।
    • उपकरण: आपको केवल कुछ चुनिले कार्यों (लगभग 12) पर नए मॉडल का परीक्षण करने की आवश्यकता है। सिस्टम फिर "कौशल मानचित्र" का उपयोग करके यह भविष्यवाणी करेगा कि वह मॉडल शेष 32 कार्यों पर कैसा प्रदर्शन करेगा। यह एक छात्र के कुछ प्रमुख होमवर्क असाइनमेंट को देखकर उसके अंतिम ग्रेड का अनुमान लगाने जैसा है।
  3. "बेस्ट फिट फाइंडर" (The "Best Fit Finder"):

    • समस्या: आपके पास एक विशिष्ट कार्य है (जैसे, "मुझे कानूनी अनुबंधों का सारांश देने के लिए एक मॉडल चाहिए"), लेकिन आपको नहीं पता कि कौन सा मॉडल चुनें।
    • उपचार: अनुमान लगाने के बजाय, आप सिस्टम को बताते हैं कि आपके काम को किन "कौशलों" की आवश्यकता है। सिस्टम उपलब्ध मॉडल्स के स्किल प्रोफाइल को स्कैन करता है और उस मॉडल को चुनता है जो उन विशिष्ट क्षेत्रों में सबसे मजबूत है, न कि केवल उसे चुनता है जिसका उच्चतम समग्र औसत हो।

निष्कर्ष (The Bottom Line)

यह पेपर तर्क देता है कि हमें AI मॉडल्स को लीडरबोर्ड पर एक एकल संख्या के रूप में देखना बंद करने की आवश्यकता है। इसके बजाय, हमें उन्हें एक टूलबॉक्स (औजारों के डिब्बे) की तरह देखना चाहिए। कुछ उपकरण हथौड़े हैं, कुछ पेचकश हैं, और कुछ रिंच (wrench) हैं। इस "कौशल-आधारित" दृष्टिकोण का उपयोग करके, हम अंततः देख सकते हैं कि प्रत्येक मॉडल किस काम में अच्छा है, दोहराव वाले परीक्षणों पर समय बर्बाद करना बंद कर सकते हैं, और काम के लिए सही उपकरण चुन सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →