← नवीनतम पेपर
📊 statistics

Instance-Optimal Estimation with Multiple LLM Judges on a Budget

यह शोध पत्र बजटयुक्त हेटेरोस्केडास्टिक मल्टी-जज अनुमान (budgeted heteroskedastic multi-judge estimation) को सूत्रबद्ध करके लागत-प्रभावी एलएलएम (LLM) मूल्यांकन की समस्या को संबोधित करता है, एक अनुकूलनशील एल्गोरिदम (EST-IVWE) प्रस्तावित करता है जो आशावादी रूप से पक्षपाती विचरण अनुमानों (optimistically biased variance estimates) का लाभ उठाकर इंस्टेंस-इष्टतम स्कोर अनुमान प्राप्त करता है, और इसकी सैद्धांतिक इष्टतमता को सिद्ध करने के लिए एक मिलान स्थानीय मिनिमैक्स निचली सीमा (matching local minimax lower bound) स्थापित करता है।

मूल लेखक: Junghyun Lee, Sanghwa Kim, Yassir Jedra, Alexandre Proutière, Se-Young Yun

प्रकाशित 2026-05-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junghyun Lee, Sanghwa Kim, Yassir Jedra, Alexandre Proutière, Se-Young Yun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मैनेजर हैं जो 1,000 अलग-अलग कर्मचारियों (प्रॉम्प्ट्स या प्रश्नों) के प्रदर्शन का ग्रेड देने की कोशिश कर रहे हैं। आपके पास इन ग्रेडों को प्राप्त करने के लिए खर्च करने के लिए एक सीमित बजट है।

इसे करने के लिए, आप 10 अलग-अलग "जजों" (ये लार्ज लैंग्वेज मॉडल्स या LLMs हैं) की एक टीम को काम पर रखते हैं। यहाँ एक पेच है:

  1. उनकी लागत अलग-अलग है: कुछ जज सस्ते हैं (जैसे एक जूनियर इंटर्न), जबकि कुछ महंगे हैं (जैसे एक सीनियर एक्सपर्ट)।
  2. वे अलग-अलग तरीकों से अविश्वसनीय हैं: कुछ जज बहुत सुसंगत (consistent) हैं लेकिन धीमे/महंगे हैं। अन्य तेज़/सस्ते हैं लेकिन गलत और असंगत अनुमान लगाते हैं।
  3. प्रश्न अलग-अलग हैं: कुछ प्रश्न उत्तर देने में आसान हैं (कम वेरिएंस), जबकि कुछ पेचीदा और भ्रमित करने वाले हैं (उच्च वेरिएंस)।

बड़ा सवाल यह है कि यह पेपर पूछता है: आप अपने पैसे का सबसे सटीक समग्र ग्रेड प्राप्त करने के लिए इसे कैसे खर्च करते हैं?

पुराना तरीका: "फेयर शेयर" की गलती

ज्यादातर लोग बस यही कहेंगे, "आइए निष्पक्ष रहें।" वे हर जज को समान संख्या में प्रश्न ग्रेड करने के लिए कहेंगे।

  • समस्या: यह बर्बादी है। आप एक 100केविशेषज्ञकोवहप्रश्नग्रेडकरनेकेलिएभुगतानकरसकतेहैंजिसेएक100 के विशेषज्ञ को वह प्रश्न ग्रेड करने के लिए भुगतान कर सकते हैं जिसे एक 1 के इंटर्न द्वारा पूरी तरह से ग्रेड किया जा सकता था। या, आप एक सस्ते, अविश्वसनीय जज को एक बहुत कठिन प्रश्न ग्रेड करने के लिए कह सकते हैं, जिससे आपका पैसा खराब डेटा पर बर्बाद हो जाएगा।

पेपर का समाधान: "स्मार्ट शॉपिंग"

लेखक एक स्मार्ट रणनीति प्रस्तावित करते हैं जिसे EST-IVWE कहा जाता है। इसे एक दो-चरणीय शॉपिंग ट्रिप के रूप में समझें ताकि आपके पैसे का सर्वोत्तम मूल्य प्राप्त किया जा सके।

चरण 1: "टेस्ट टेस्ट" (एक्सप्लोरेशन/अन्वेषण)

अपना पूरा बजट खर्च करने से पहले, आप हर प्रकार के प्रश्न पर हर जज को "टेस्ट ड्राइव" करने के लिए बहुत कम पैसा खर्च करते हैं।

  • आप सस्ते इंटर्न और महंगे विशेषज्ञ दोनों को कुछ एक जैसे प्रश्न ग्रेड करने के लिए कहते हैं।
  • लक्ष्य: आप अभी अंतिम ग्रेड प्राप्त करने की कोशिश नहीं कर रहे हैं। आप केवल यह पता लगाने की कोशिश कर रहे हैं कि: यह विशिष्ट प्रकार के प्रश्न के लिए वास्तव में कौन अच्छा है?
  • ट्रिक: पेपर एक चतुर गणितीय "सेफ्टी नेट" पेश करता है। यदि कोई जज परीक्षण के दौरान बहुत अधिक सटीक (शून्य वेरिएंस) दिखता है, तो एल्गोरिदम यह मान लेता है कि वे केवल भाग्यशाली हो सकते हैं और उनके स्कोर में थोड़ा सा "संदेह" जोड़ देता है। यह सिस्टम को भाग्यशाली दौर (lucky streaks) से भ्रमित होने से रोकता है।

चरण 2: "रणनीतिक खर्च" (एक्सप्लोइटेशन/दोहन)

अब जब आप जानते हैं कि कौन किस काम में अच्छा है, तो आप अपना बाकी बजट बुद्धिमानी से खर्च करते हैं।

  • नियम: प्रत्येक विशिष्ट प्रश्न के लिए, आप केवल एक जज को काम पर रखते हैं जो सबसे अच्छा "कीमत-से-गुणवत्ता" (price-to-quality) अनुपात प्रदान करता है।
  • उपमा: कल्पना करें कि आपको एक विशिष्ट उपकरण खरीदने की आवश्यकता है। आप 50 सस्ते हथौड़े और 50 महंगे स्क्रूड्राइवर नहीं खरीदेंगे। इसके बजाय, आप यह पता लगाएंगे कि कौन सा उपकरण सबसे कम कीमत पर सबसे अच्छा काम करता है, और फिर केवल वही उपकरण खरीदेंगे।
  • एल्गोरिदम ठीक से गणना करता है कि सबसे सटीक परिणाम प्राप्त करने के लिए उस विशिष्ट "सर्वश्रेष्ठ जज" को उस विशिष्ट प्रश्न को कितनी बार ग्रेड करने के लिए कहना चाहिए।

यह क्यों मायने रखता है (द "इंस्टेंस-ऑप्टिमल" दावा)

पेपर दावा करता है कि यह विधि "इंस्टेंस-ऑप्टिमल" (Instance-Optimal) है।

  • इसका अर्थ है: यह केवल औसत पर अच्छा काम नहीं करता है; यह आपकी विशिष्ट स्थिति के लिए पूरी तरह से काम करता है। यदि आपके जजों के अजीब व्यवहार हैं या आपके प्रश्न असामान्य रूप से कठिन हैं, तो यह विधि उस सटीक परिदृश्य के अनुकूल हो जाती है ताकि सर्वोत्तम स्कोर प्राप्त किया जा सके।
  • प्रमाण: लेखकों ने केवल यह अनुमान नहीं लगाया कि यह अच्छा है। उन्होंने यह साबित करने के लिए उन्नत गणित (जैसे "लोकल मिनिमैक्स लोअर बाउंड") का उपयोग किया कि आप इस पद्धति से बेहतर नहीं कर सकते। यह दक्षता की सैद्धांतिक सीमा है।

"फैनो बनाम असौड" उपमा

पेपर एक तकनीकी बहस का उल्लेख करता है कि यह साबित करने के लिए कि यह सबसे अच्छी विधि है, कैसे किया जाए।

  • "फैनो" (Fano) दृष्टिकोण ऐसा है जैसे पूरे घास के ढेर को एक साथ देखकर सुई खोजने की कोशिश करना। यह बहुत धुंधला है और यह देखने में चूक जाता है कि कौन सा विशिष्ट जज किस विशिष्ट प्रश्न के लिए सबसे अच्छा है।
  • "असौड" (Assouad) दृष्टिकोण (जिसका उपयोग लेखकों ने किया) ऐसा है जैसे घास के ढेर के एक समय में एक छोटे से वर्ग इंच को देखना। यह स्थानीय विवरणों को सुरक्षित रखता है, जिससे उन्हें यह साबित करने की अनुमति मिलती कि बजट को पाई-पाई तक कैसे विभाजित किया जाना चाहिए।

परिणाम

लेखकों ने नकली डेटा और वास्तविक दुनिया के डेटा (प्रत्येक दूसरे को ग्रेड करने के लिए वास्तविक LLMs का उपयोग करके) पर परीक्षण किया।

  • परिणाम: उनकी "स्मार्ट शॉपिंग" विधि (EST-IVWE) लगातार "फेयर शेयर" विधि (यूनिफॉर्म एलोकेशन) से बेहतर रही।
  • टेकअवे: जैसे-जैसे बजट बढ़ता है, उनकी विधि एक "मैजिक ओरकल" (एक काल्पनिक देवता जो पहले से ही जानता है कि प्रत्येक प्रश्न के लिए कौन सा जज सबसे अच्छा है) के प्रदर्शन के करीब पहुंच जाती है।

सारांश

AI का मूल्यांकन करने की महंगी और जटिल दुनिया में, यह पेपर पैसे बर्बाद करने से बचने का एक नुस्खा प्रदान करता है। सभी जजों और सभी प्रश्नों के साथ एक जैसा व्यवहार करने के बजाय, यह कहता है: थोड़ा परीक्षण करें, प्रत्येक विशिष्ट कार्य के लिए सबसे अच्छी डील का पता लगाएं, और फिर अपना पैसा केवल उसी सबसे अच्छी डील पर खर्च करें। इससे आपको कम से कम नकदी में सबसे सटीक परिणाम मिलते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →