← नवीनतम पेपर
💬 NLP

Large Language Model Selection with Limited Annotations

यह शोध पत्र SELECT-LLM प्रस्तुत करता है, जो एक नवीन ढांचा है जो एनोटेशन के लिए प्रश्नों के एक न्यूनतम सेट को सक्रिय रूप से चुनने के लिए युग्मवार (pairwise) मॉडल आउटपुट समानताओं से प्राप्त अपेक्षित सूचना लाभ (expected information gain) का लाभ उठाता है, जिससे मॉडल वेट्स (weights) तक पहुंच की आवश्यकता के बिना, किसी दिए गए कार्य के लिए सर्वश्रेष्ठ लार्ज लैंग्वेज मॉडल की प्रभावी ढंग से पहचान करते हुए मूल्यांकन लागत को काफी कम किया जा सकता है।

मूल लेखक: Yavuz Durmazkeser, Patrik Okanovic, Andreas Kirsch, Torsten Hoefler, Nezihe Merve Gürel

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yavuz Durmazkeser, Patrik Okanovic, Andreas Kirsch, Torsten Hoefler, Nezihe Merve Gürel

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक हायरिंग मैनेजर हैं जो एक बहुत ही विशिष्ट काम के लिए एकदम सही कर्मचारी खोजने की कोशिश कर रहे हैं। आपके पास 156 उम्मीदवारों का एक विशाल समूह है (ये लार्ज लैंग्वेज मॉडल्स, या LLMs हैं)। आप जानते हैं कि वे सभी बुद्धिमान हैं, लेकिन आप यह नहीं जानते कि उनमें से वास्तव में आपके विशिष्ट कार्य के लिए सबसे अच्छा कौन सा है।

आमतौर पर, यह पता लगाने के लिए कि कौन सा सबसे अच्छा है, आप प्रत्येक उम्मीदवार को एक पूर्ण, 100-प्रश्नों का परीक्षण देने के लिए कहेंगे और फिर हर एक उत्तर को ग्रेड करने के लिए महंगे मानव विशेषज्ञों की एक टीम को काम पर रखेंगे। यह धीमा, महंगा और थका देने वाला है।

यह पेपर एक नया तरीका पेश करता है जिसे SELECT-LLM कहा जाता है। SELECT-LLM को एक सुपर-स्मार्ट हायरिंग असिस्टेंट की तरह समझें जो आपको टेस्ट का केवल एक छोटा सा हिस्सा पूछकर—शायद 100 के बजाय केवल 5 या 10 प्रश्न—सबसे अच्छे उम्मीदवार को खोजने में मदद कर सकता है।

यह कैसे काम करता है, यहाँ सरल उपमाओं (analogies) का उपयोग किया गया है:

समस्या: "ब्लाइंड टेस्ट टेस्ट" (The Blind Taste Test)

कल्पना कीजिए कि आपके पास 156 अलग-अलग शेफ (AI मॉडल) हैं और आप जानना चाहते हैं कि सबसे अच्छा पिज्जा कौन बनाता है।

  • पुराना तरीका: आप हर शेफ को 100 पिज्जा बनाने के लिए कहते हैं। आप हर पिज्जा को चखने और रिपोर्ट लिखने के लिए 100 फूड क्रिटिक्स को काम पर रखते हैं। इसमें समय और पैसा बहुत खर्च होता है।
  • रैंडम तरीका: आप शेफ को केवल 5 पिज्जा बनाने के लिए कहते हैं, लेकिन आप उन 5 प्रश्नों को रैंडम तरीके से चुनते हैं। हो सकता है कि वे सभी 5 शेफ चीज़ पिज्जा बनाने में माहिर हों लेकिन पेपरोनी पिज्जा में बहुत खराब हों। आप केवल बुरी किस्मत के कारण गलत विजेता चुन सकते हैं।

समाधान: SELECT-LLM (द स्मार्ट क्विज़)

SELECT-LLM एक जासूस की तरह है जो जानता है कि कौन से प्रश्न सच को उजागर करेंगे। यह केवल रैंडम प्रश्न नहीं चुनता; यह सबसे अधिक जानकारीपूर्ण प्रश्न चुनता है।

यहाँ इसकी चरण-दर-चरण प्रक्रिया दी गई है:

  1. सेटअप: आपके पास संभावित प्रश्नों का एक "पूल" (टेस्ट बैंक) है और उम्मीदवारों की एक सूची है।
  2. अनुमान लगाने का खेल: सिस्टम देखता है कि यदि सभी मॉडल किसी प्रश्न का उत्तर देते हैं (अभी किसी इंसान द्वारा उसे ग्रेड किए बिना), तो वे क्या कहेंगे।
  3. "असहमति" डिटेक्टर (The Disagreement Detector): सिस्टम पूछता है: "यदि मैं यह प्रश्न पूछता हूँ, तो क्या शीर्ष उम्मीदवार बहुत अलग उत्तर देंगे?"
    • यदि सभी शीर्ष शेफ बिल्कुल एक जैसा उत्तर देते हैं, तो वह प्रश्न उन्हें एक-दूसरे से अलग पहचानने के लिए बहुत उपयोगी नहीं है।
    • यदि सबसे अच्छे शेफ बहुत अलग-अलग उत्तर देते हैं, तो वह प्रश्न सोना (gold) है। यह वही प्रश्न है जो आपको यह समझने में मदद करेगा कि वास्तव में सबसे अच्छा कौन है।
  4. चयन: सिस्टम उस "गोल्ड" प्रश्न को चुनता है और एक मानव विशेषज्ञ (ओरेकल/Oracle) से केवल उस एक उत्तर को ग्रेड करने के लिए कहता है।
  5. अपडेट: उस एकल ग्रेड के आधार पर, सिस्टम शेफ की रैंकिंग को अपडेट करता है। यह कह सकता है, "ओह, शेफ A ने वह सही बताया, लेकिन शेफ B ने गलत बताया। अब शेफ A के विजेता होने की संभावना अधिक है।"
  6. दोहराना: यह प्रक्रिया दोहराता रहता है, हमेशा अगला ऐसा प्रश्न चुनता है जो शेष शीर्ष दावेदारों के बीच सबसे अधिक "असहमति" पैदा करेगा, जब तक कि वह विजेता चुनने के लिए पर्याप्त आश्वस्त न हो जाए।

यह एक बड़ी बात क्यों है?

इस पेपर ने 23 अलग-अलग प्रकार के कार्यों (जैसे गणित, समाचारों का सारांश बनाना, भाषाओं का अनुवाद करना और विज्ञान के सवालों के जवाब देना) और 156 अलग-अलग AI मॉडलों पर इस पद्धति का परीक्षण किया।

  • परिणाम: SELECT-LLM ने अगले सबसे अच्छे तरीके की तुलना में 84% तक कम मानव ग्रेड का उपयोग करके सबसे अच्छे मॉडल को खोज निकाला।
  • उपमा: 100 पिज्जा चखने के लिए 100 आलोचकों को काम पर रखने के बजाय, यह विधि ठीक उसी विजेता को खोजने के लिए केवल 15 आलोचकों को 15 पिज्जा चखने की आवश्यकता महसूस कर सकती है।

मुख्य विशेषताएं

  • यह "ब्लैक-बॉक्स" के अनुकूल है: आपको यह जानने की आवश्यकता नहीं है कि AI मॉडल अंदर से कैसे बने हैं (जैसे उनका कोड या वेट्स)। आपको बस यह देखने की आवश्यकता है कि वे क्या कहते हैं। यह ओपन-सोर्स मॉडल और महंगे, क्लोज्ड कमर्शियल मॉडल (जैसे जिन्हें आप API के माध्यम से भुगतान करते हैं) दोनों के लिए काम करता है।
  • यह मॉडल-अज्ञेयवादी (Model-Agnostic) है: इसे इससे फर्क नहीं पड़ता कि मॉडल बड़े हैं या छोटे, या वे कौन सी भाषा बोलते हैं। यह केवल उनके उत्तरों की समानता को देखता है।
  • यह सुरक्षित है: भले ही यह बिल्कुल नंबर #1 मॉडल न चुने, लेकिन यह लगभग हमेशा एक ऐसा मॉडल चुनता है जो सबसे अच्छे के बहुत करीब होता है, ताकि आप एक खराब परिणाम के साथ न बचें।

संक्षेप में

SELECT-LLM अनावश्यक परीक्षणों पर पैसा बर्बाद करने से बचने की एक स्मार्ट रणनीति है। हर AI को पूरा एग्जाम देने और इंसानों द्वारा सब कुछ ग्रेड करवाने के बजाय, यह केवल सही कुछ प्रश्न पूछकर जल्दी से सुपरस्टार मॉडल की पहचान करता है। यह एक विशाल, महंगे सर्च को एक त्वरित, कुशल खोज में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →