← नवीनतम पेपर
💬 NLP

Dynamically Allocating Evaluation Effort for Model Ranking

यह शोध पत्र एक मल्टी-आर्म्ड बैंडिट फ्रेमवर्क प्रस्तावित करता है जो सबसे प्रतिस्पर्धी मॉडलों को मानव मूल्यांकन प्रयास को गतिशील रूप से आवंटित करता है, जिससे थकाऊ मूल्यांकन प्रोटोकॉल की तुलना में शीर्ष-प्रदर्शन करने वाले एनएलपी (NLP) मॉडलों की पहचान करने की लागत कम होती है और दक्षता में सुधार होता है।

मूल लेखक: Vilém Zouhar, Julia Kreutzer, Alon Lavie, Tom Kocmi, Matt Post, Ondřej Bojar, Mrinmaya Sachan

प्रकाशित 2026-08-05
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vilém Zouhar, Julia Kreutzer, Alon Lavie, Tom Kocmi, Matt Post, Ondřej Bojar, Mrinmaya Sachan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, उच्च-दांव वाली कुकिंग प्रतियोगिता के मुख्य जज हैं। आपके पास बीस अविश्वसनीय शेफ हैं, लेकिन आपके पास केवल कुछ सीमित व्यंजनों को चखने के लिए ही समय और पैसा है। पुराने दिनों में, इस प्रतियोगिता को चलाने का मानक तरीका यह था कि हर शेफ से मेनू का हर एक व्यंजन बनवाया जाए, और फिर हर शेफ के हर एक प्लेट को चखा जाए। यह निष्पक्ष था, निश्चित रूप से, लेकिन यह अविश्वसनीय रूप से धीमा और महंगा भी था। बीस-वें शेफ के आखिरी प्लेट को चखने तक, हो सकता है कि आपका पैसा खत्म हो गया हो, और आप अभी भी इस बात को लेकर उलझे हुए हों कि शीर्ष तीन शेफों में से वास्तव में सबसे अच्छा कौन है, क्योंकि आपने उन शेफों के व्यंजन चखने में बहुत अधिक समय बिता दिया जो स्पष्ट रूप से जीत नहीं रहे थे।

यही वह समस्या है जिसका सामना वर्तमान में आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया कर रही है। वैज्ञानिक हर साल दर्जनों नए AI मॉडल बनाते हैं, लेकिन उन सभी का पूरी तरह से परीक्षण करना ऐसा ही है जैसे हर शेफ के हर व्यंजन को चखना। इसमें मानव समय और कंप्यूटिंग शक्ति का एक बड़ा खर्च आता है। आप जिस शोध पत्र को पढ़ने जा रहे हैं, वह इस "टेस्टिंग बजट" की समस्या पर प्रहार करता है। यह एक स्मार्ट तरीका सुझाता है: सभी के थोड़े-थोड़े हिस्से को चखने के बजाय—जिससे एक मोटा अंदाज़ा मिल सके—हमें अपनी शेष ऊर्जा उन शेफ के व्यंजनों को चखने में लगानी चाहिए जो जीतने वाले दिख रहे हैं। इस तरह, हम बिना उन शेफों पर संसाधन बर्बाद किए जो स्पष्ट रूप से हार रहे हैं, अधिक तेज़ी से, कम लागत में और अधिक आत्मविश्वास के साथ वास्तविक चैंपियन को खोज सकते हैं।


द ग्रेट AI टेस्ट-टेस्ट: विजेता चुनने का एक नया तरीका

तो, जब आपके पास एक सीमित बजट हो, तो आप सबसे अच्छे AI मॉडल को कैसे चुनते हैं? इस शोध पत्र के लेखक, जो ETH ज्यूरिख और माइक्रोसॉफ्ट जैसी जगहों के शोधकर्ताओं की एक टीम है, ने इस समस्या को एक स्लॉट मशीन के खेल की तरह हल करने का निर्णय लिया, जिसे गणितज्ञ "मल्टी-आर्म्ड बैंडिट" (multi-armed bandit) कहते हैं।

एक पंक्ति में स्लॉट मशीनों (द "आर्म्स") की कल्पना करें। प्रत्येक मशीन एक अलग AI मॉडल का प्रतिनिधित्व करती है। आपके पास खेलने के लिए सिक्कों की एक निश्चित संख्या (आपका "बजट") है। आपका लक्ष्य कुल मिलाकर सबसे अधिक पैसा जीतना नहीं है; आपका लक्ष्य यह पता लगाना है कि कौन सी मशीन उच्चतम निश्चितता के साथ सबसे अच्छी है। पारंपरिक तरीके में, आप हर लीवर को बिल्कुल समान संख्या में खींचेंगे। आप मशीन A को दस बार खींचेंगे, मशीन B को दस बार खींचेंगे, और इसी तरह। लेकिन यहाँ एक पेंच है: यदि मशीन A पहले कुछ खिंचावों में बड़ी जीत देना शुरू कर देती है, और मशीन B आपको कुछ नहीं देती है, तो भी आप केवल "निष्पक्ष" होने के लिए मशीन B पर अपने सिक्के बर्बाद कर रहे हैं।

लेखक एक गतिशील दृष्टिकोण का प्रस्ताव करते हैं। हर लीवर को समान रूप से खींचने के बजाय, आप मशीनों का अनुभव लेने के लिए हर लीवर को कुछ बार खींचना शुरू करते हैं। फिर, आप अपना ध्यान उन मशीनों पर केंद्रित करना शुरू करते हैं जो सबसे अधिक भुगतान करती हुई प्रतीत होती हैं। यदि कोई मशीन हारने वाली दिखती है, तो आप उसे खेलना बंद कर देते हैं। यदि कोई मशीन विजेता दिखती है, तो आप उसे खेलते रहते हैं ताकि यह सुनिश्चित हो सके कि वह वाकई सबसे अच्छी है।

क्रिया में "बैंडिट" रणनीति

यह पेपर यह तय करने के लिए कुछ चतुर तरीके पेश करता है कि अगली "मशीन" (AI मॉडल) का परीक्षण कब किया जाए। उनका एक पसंदीदा तरीका वेटेड सैंपलिंग (Weighted Sampling) है। इसे एक लोकप्रियता प्रतियोगिता की तरह समझें जहाँ जो मॉडल अधिक लोकप्रिय है, उसके और अधिक अवसर मिलने की संभावना अधिक होती है। लेकिन यह केवल इस बारे में नहीं है कि वर्तमान में कौन जीत रहा है; यह इस बारे में है कि कौन जीतने की संभावना रखता है।

उन्होंने गणितीय रूप से सिद्ध किया कि यदि आप शीर्ष रैंकिंग के बारे में वास्तव में आश्वस्त होना चाहते हैं, तो आपको केवल वर्तमान लीडर को नहीं चुनना चाहिए। इसके बजाय, आपको मॉडलों को एक विशिष्ट सूत्र के आधार पर चुनना चाहिए: किसी मॉडल को चुनने की संभावना उस रैंक के वर्गमूल (square root) से संबंधित होनी चाहिए जो कितनी महत्वपूर्ण है। सरल शब्दों में, इसका अर्थ है कि आप शीर्ष दावेदारों पर भारी ध्यान केंद्रित करते हैं, लेकिन आप दूसरों को पूरी तरह से नज़रअंदाज नहीं करते हैं। आप उन्हें बस इतना चेक करते रहते हैं ताकि यह सुनिश्चित हो सके कि वे गुप्त रूप से बेहतर नहीं हो गए हैं।

उन्होंने कन्फ्यूजन मिनिमाइजेशन (Confusion Minimization) नामक एक विधि भी आजमाई। कल्पना कीजिए कि आप दो धावकों के बीच निर्णय लेने की कोशिश कर रहे हैं जो बिल्कुल बराबरी पर हैं। आपको उस व्यक्ति का समय मापने की आवश्यकता नहीं है जो मीलों से आगे निकल रहा है; आपको उन दो लोगों के बीच अधिक दौड़ आयोजित करने की आवश्यकता है जो प्रथम स्थान के लिए लड़ रहे हैं ताकि यह देखा जा सके कि वास्तव में कौन जीतता है। यह एल्गोरिदम स्कोर में सबसे करीब के मॉडलों को देखता है और पूछता है, "मुझे भ्रमित होने से बचने के लिए इन दोनों में से किसकी अधिक परीक्षण करने की आवश्यकता है?" और फिर अपना बजट वहीं निर्देशित करता है।

उन्होंने क्या पाया (और क्या नहीं)

शोधकर्ताओं ने इन विचारों का परीक्षण वास्तविक दुनिया की अनुवाद प्रतियोगिताओं (जहाँ AI टेक्स्ट को भाषाओं के बीच अनुवाद करने की कोशिश करता है) के डेटा का उपयोग करके किया। उन्होंने बजट खर्च करने की प्रक्रिया का अनुकरण (simulate) किया।

यहाँ बड़ी खबर है: उन्होंने पाया कि वे बजट के केवल 40% का उपयोग करके शीर्ष मॉडलों की सटीक रैंकिंग प्राप्त कर सकते हैं।

अपने सिमुलेशन में, जब उन्होंने अपने नए गतिशील तरीके का उपयोग किया, तो वे 95% विश्वास के साथ बीस में से शीर्ष तीन मॉडलों के क्रम को विश्वसनीय रूप से निर्धारित कर सके, जिसमें सामान्य तरीके की तुलना में आधे से भी कम पैसा और समय लगा। पारंपरिक "निष्पक्ष" तरीका, जहाँ प्रत्येक को परीक्षणों की समान संख्या मिलती है, उन मॉडलों पर भारी प्रयास बर्बाद करता था जो स्पष्ट रूप से सर्वश्रेष्ठ नहीं थे।

हालाँकि, ध्यान रखने योग्य कुछ महत्वपूर्ण सीमाएँ भी हैं। यह पेपर यह नहीं कहता कि यह तरीका हर स्थिति में पूरी तरह से काम करता है।

  • यह एक सिमुलेशन है: परिणाम मौजूदा डेटा का उपयोग करके किए गए कंप्यूटर सिमुलेशन से आते हैं। उन्होंने अभी तक इस पद्धति के साथ कोई नया, वास्तविक समय का मुकाबला शुरू नहीं किया है (हालांकि वे योजना बना रहे हैं)।
  • यह जादू नहीं है: यह तरीका तब सबसे अच्छा काम करता है जब आप शीर्ष मॉडलों को खोजने में रुचि रखते हैं। यदि आप हर एक मॉडल को (सबसे अच्छे से सबसे खराब तक) समान सटीकता के साथ रैंक करने में रुचि रखते हैं, तो यह तरीका सबसे अच्छा विकल्प नहीं हो सकता है। यह विजेताओं को खोजने के लिए कुशल है, न कि बाकी सभी की एक पूर्ण सूची बनाने के लिए।
  • इसे वार्म-अप की आवश्यकता है: आप सीधे पसंदीदा मॉडलों पर नहीं कूद सकते। एल्गोरिदम को एक आधार रेखा प्राप्त करने के लिए पहले प्रत्येक मॉडल का कुछ बार परीक्षण करने की आवश्यकता होती है (एक "वार्मअप" चरण)। यदि आप इसे छोड़ देते हैं, तो आप गलती से एक ऐसे 'स्लो स्टार्टर' को अनदेखा कर सकते हैं जो विजेता बन सकता था।

यह क्यों मायने रखता है

यह दृष्टिकोण एक स्मार्ट शॉपिंग लिस्ट की तरह है। यह देखने के लिए कि कौन सा आइटम सबसे अच्छा स्वाद देता है, ग्रोसरी स्टोर की हर चीज़ खरीदने के बजाय, आप हर चीज़ का एक छोटा नमूना खरीदते हैं, उन्हें चखते हैं, और फिर उस चीज़ के तीन बैग वापस खरीदने जाते हैं जिसका स्वाद अद्भुत था। आप पैसा बचाते हैं, और फिर भी आपको सबसे अच्छा उत्पाद मिलता है।

AI की दुनिया के लिए, इसका अर्थ है कि हम उन मॉडलों के परीक्षण में लाखों डॉलर और मानव समय बर्बाद करना बंद कर सकते हैं जिन्हें हम पहले से ही जानते हैं कि वे खराब हैं। हम अपना ध्यान उन मॉडलों पर केंद्रित कर सकते हैं जो वास्तव में "सर्वश्रेष्ठ AI" के खिताब के लिए प्रतिस्पर्धा कर रहे हैं। यह AI को बेहतर बनाने की प्रक्रिया को तेज़, सस्ता और वास्तव में महत्वपूर्ण चीज़ पर केंद्रित बनाता है: काम के लिए सबसे अच्छे उपकरणों को खोजना।

लेखक यहाँ तक सुझाव देते हैं कि इसका उपयोग अन्य क्षेत्रों में भी किया जा सकता है, जैसे कि विकास के दौरान एक नए AI के लिए सबसे अच्छा कॉन्फ़िगरेशन चुनना, या यहाँ तक कि टूर्नामेंट-शैली की प्रतियोगिताओं में जहाँ मॉडल एक-दूसरे के सामने मुकाबला करते हैं। लेकिन फिलहाल, मुख्य संदेश सरल है: सभी AI मॉडलों के साथ एक जैसा व्यवहार करना बंद करें। विजेताओं को अधिक ध्यान दें, और आप वास्तविक चैंपियनों को बहुत पहले ही खोज लेंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →