← नवीनतम पेपर
💻 computer science

Cost-Efficient Estimation of General Abilities Across Benchmarks

यह शोध पत्र वाइड-स्केल आइटम लेवल डेटासेट (WILD) प्रस्तुत करता है और यह प्रदर्शित करता है कि एक संशोधित बहुआयामी आइटम रिस्पॉन्स थ्योरी मॉडल को लागत-जागरूक अनुकूलन योग्य आइटम चयन के साथ संयोजित करके, केवल 16 आइटम्स का उपयोग करके विविध अनदेखे कार्यों में LLM प्रदर्शन की उच्च सटीकता (7% से कम MAE) के साथ भविष्यवाणी की जा सकती है, जिससे मूल्यांकन लागत में 85% की कमी आती है।

मूल लेखक: Michael Krumdick, Adam Wiemerslage, Seth Ebner, Charles Lovering, Chris Tanner

प्रकाशित 2026-04-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Michael Krumdick, Adam Wiemerslage, Seth Ebner, Charles Lovering, Chris Tanner

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नया कर्मचारी नियुक्त करने की कोशिश कर रहे हैं, लेकिन आपके पास एक ऐसा उम्मीदवार है जो सब कुछ कर सकता है: कोड लिख सकता है, गणित की समस्याओं को हल कर सकता है, बीमारियों का निदान कर सकता है और चुटकुले सुना सकता है।

आर्टिफिशियल इंटेलिजेंस (LLMs) की दुनिया में, हम वर्तमान में यह पता लगाने की कोशिश करते हैं कि ये मॉडल कितने "स्मार्ट" हैं (यह जानकर कि वे कितने बुद्धिमान हैं) उन्हें हजारों अलग-अलग परीक्षणों (बेंचमार्क) से गुजारते हैं। यह एक व्यक्ति को 50 अलग-अलग विषयों की 10 घंटे की परीक्षा देने जैसा है। यह महंगा, धीमा और अक्सर अनावश्यक है। यदि वे गणित वाले भाग में उत्कृष्ट प्रदर्शन करते हैं, तो संभावना है कि वे भौतिकी (physics) वाले भाग में भी अच्छा करेंगे, क्योंकि दोनों के लिए तर्क (logic) की आवश्यकता होती है।

यह शोध पत्र इन AI मॉडलों के मूल्यांकन करने का एक स्मार्ट, सस्ता और तेज़ तरीका प्रस्तावित करता है। यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: "अनंत परीक्षा" (The "Endless Exam")

अभी, शोधकर्ताओं के पास AI के लिए हजारों अलग-अलग परीक्षण (बेंचmarks) हैं।

  • समस्या: इनमें से कई परीक्षण बिल्कुल एक ही चीज़ को माप रहे हैं। यह किसी को "सेब जोड़ने" का टेस्ट देने, फिर "संतरे जोड़ने" का टेस्ट देने, और फिर "केले जोड़ने" का टेस्ट देने जैसा है। यदि वे सेब जोड़ सकते हैं, तो आप पहले से ही जानते हैं कि वे फल जोड़ सकते हैं।
  • लागत: इन परीक्षणों को चलाने में बहुत पैसा ( "टोकन" में, जो AI कंप्यूटिंग की मुद्रा है) खर्च होता है। कुछ प्रश्न छोटे और सस्ते होते हैं; अन्य लंबे, जटिल और महंगे होते हैं।

2. समाधान: "मनोवैज्ञानिक का दृष्टिकोण" (The "Psychologist's Approach")

लेखक AI मॉडलों के साथ मानव छात्रों की तरह व्यवहार करते हैं और साइकोमेट्रिक्स (Psychometrics) (मानव क्षमताओं को मापने का विज्ञान) नामक क्षेत्र का उपयोग करते हैं।

हर एक कौशल का परीक्षण करने के बजाय, वे पूछते हैं: "वे कौन सी कुछ मुख्य 'सुपरपावर्स' (क्षमताएं) हैं जो यह समझाती हैं कि यह मॉडल लगभग हर चीज़ पर कैसा प्रदर्शन करता है?"

उन्होंने पाया कि AI की क्षमताएं लो-रैंक (low-rank) हैं। यह एक फैंसी तरीका है यह कहने का कि: पूरी तस्वीर जानने के लिए आपको सब कुछ टेस्ट करने की ज़रूरत नहीं है। ठीक वैसे ही जैसे एक डॉक्टर को यह जानने के लिए आपके शरीर की हर एक कोशिका का परीक्षण करने की आवश्यकता नहीं है कि आप स्वस्थ हैं; वे बस आपकी हृदय गति, तापमान और रक्तचाप की जांच करते हैं।

3. नया टूल: "WILD" (द जाइंट लाइब्रेरी)

यह साबित करने के लिए कि यह काम करता है, टीम ने WILD (Wide-scale Item Level Dataset) नामक एक विशाल डेटासेट बनाया।

  • उपमा: एक विशाल पुस्तकालय की कल्पना करें जिसमें 163 अलग-अलग विषयों से 109,000 विभिन्न प्रश्न शामिल हैं, जिनका उत्तर 65 अलग-अलग AI मॉडलों द्वारा दिया गया है।
  • यह क्यों महत्वपूर्ण है: यह पहली बार है जब किसी ने पैटर्न देखने के लिए प्रत्येक प्रश्न और प्रत्येक मॉडल को एक साथ देखा है।

4. जादुई ट्रिक: "स्मार्ट क्विज़" (अनुकूली चयन - Adaptive Selection)

यह सबसे दिलचस्प हिस्सा है। यह पेपर केवल यादृच्छिक (random) प्रश्न चुनने के बजाय, सर्वश्रेष्ठ प्रश्न चुनने की विधि पेश करता है।

  • पुराना तरीका (Random Sampling): एक शिक्षक द्वारा यादृच्छिक रूप से 100 प्रश्नों का ढेर बांटने जैसा। कुछ बहुत आसान हैं, कुछ बहुत कठिन हैं, और कुछ समय की बर्बादी हैं।
  • नया तरीका (Adaptive Selection): एक ट्यूटर की कल्पना करें जो आपके उत्तर देने के तरीके को देखता है।
    • यदि आप एक प्रश्न सही हल करते हैं, तो ट्यूटर कहता है, "ठीक है, आप इसमें अच्छे हैं, चलिए कुछ कठिन प्रयास करते हैं।"
    • यदि आप गलत करते हैं, तो वे कहते हैं, "आइए एक अलग कोण (angle) आजमाते हैं।"
    • लक्ष्य: वे "गोल्डिलॉक्स" (Goldilocks) प्रश्न खोजते हैं—ऐसे प्रश्न जो ठीक इतने कठिन हैं कि वे सटीक रूप से बता सकें कि मॉडल कितना स्मार्ट है, बिना उन प्रश्नों पर समय बर्बाद किए जो बहुत आसान या बहुत कठिन हैं।

5. "बजट" हैक: सस्ते प्रश्न

शोध पत्र ने यह भी महसूस किया कि सभी प्रश्नों की लागत समान नहीं होती है।

  • उपमा: कल्पना कीजिए कि आप एक जासूस को काम पर रख रहे हैं।
    • प्रश्न A: "2+2 क्या है?" (पूछने की लागत $0.0001)।
    • प्रश्न B: "एक काल्पनिक हत्या के मामले के बारे में 50 पन्नों का कानूनी दस्तावेज़ लिखें।" (पूछने की लागत $5.00)।
  • नवाचार: लेखकों ने एक ऐसी प्रणाली बनाई जो न केवल "गोल्डिलॉक्स" प्रश्न चुनती है, बल्कि सस्ते वाले प्रश्नों को प्राथमिकता भी देती है। यह कहने जैसा है कि, "आइए सबसे जानकारीपूर्ण प्रश्न खोजें, लेकिन यह भी सुनिश्चित करें कि वे वे हों जो हमारे बजट को नुकसान न पहुँचाएँ।"

परिणाम: तेज़, सस्ता और सटीक

इन विचारों को मिलाकर, लेखकों ने कुछ अद्भुत हासिल किया:

  1. सटीकता (Accuracy): वे भविष्यवाणी कर सके कि एक AI 112 नए परीक्षणों (जिन्हें उन्होंने पहले कभी नहीं देखा था) पर कैसा प्रदर्शन करेगा, और वह भी बहुत उच्च सटीकता के साथ।
  2. दक्षता (Efficiency): एक विश्वसनीय स्कोर प्राप्त करने के लिए उन्हें केवल 16 प्रश्नों की आवश्यकता थी।
  3. लागत बचत (Cost Savings): सही प्रश्न चुनकर, उन्होंने मूल्यांकन की लागत में 85% की कमी की।
    • पहले: एक अच्छा स्कोर प्राप्त करने के लिए 141,000 "टोकन" (मुद्रा की इकाइयाँ) खर्च होते थे।
    • बाद में: इसके लिए केवल 22,000 टोकन की आवश्यकता थी।

बड़ी तस्वीर (The Big Picture)

इस शोध पत्र को जाल से मछली पकड़ने (सब कुछ पकड़ने की कोशिश करना, छोटी मछलियों पर समय बर्बाद करना, और बड़ी मछलियों को मिस कर देना) से सोनार (Sonar) से मछली पकड़ने (यह पता लगाना कि मछलियाँ वास्तव में कहाँ हैं और केवल उन्हीं को पकड़ना जिनकी आपको आवश्यकता है) की ओर बढ़ने के रूप में देखें।

यह शोधकर्ताओं को AI मॉडलों पर महंगे, दोहराव वाले मैराथन परीक्षण चलाने के बजाय, छोटे, स्मार्ट और लक्षित चेक-अप चलाने की अनुमति देता है जो हमें बताते हैं कि AI किस चीज़ में अच्छा है, जिससे बेहतर डेटा प्राप्त करने के साथ-साथ समय और पैसे की बचत होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →