← नवीनतम पेपर
💬 NLP

JudgeArena: A Unified Framework for Reproducible LLM-Judge Evaluation

JudgeArena एक ओपन-सोर्स फ्रेमवर्क है जो पुनरुत्पादकता (reproducibility) को बढ़ाने, मूल्यांकन डिजाइन विकल्पों के व्यवस्थित अध्ययन को सक्षम करने, और क्लोज्ड-मॉडल जजों तथा महंगी मानवीय एनोटेशन के विकल्प के रूप में ट्यून्ड ओपन मॉडल्स का उपयोग करके उच्च-सटीक एलो (Elo) स्कोर सिमुलेशन प्रदान करने के लिए प्रमुख LLM-जज बेंचमार्क को एक एकल इंटरफेस के तहत एकीकृत करता है।

मूल लेखक: Erlis Lushtaku, Bora Kargi, Ali Elganzory, Fabio Ferreira, Alejandro R. Salamanca, Julia Kreutzer, David Salinas

प्रकाशित 2026-08-05
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Erlis Lushtaku, Bora Kargi, Ali Elganzory, Fabio Ferreira, Alejandro R. Salamanca, Julia Kreutzer, David Salinas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह पता लगाने की कोशिश कर रहे हैं कि दो रोबोटों में से कौन चुटकुले सुनाने, कविता लिखने या पहेलियाँ सुलझाने में बेहतर है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इन रोबोटों को लार्ज लैंग्वेज मॉडल्स (LLMs) कहा जाता है। लंबे समय तक, यह जानने का एकमात्र तरीका कि कौन सबसे "मजेदार" या "स्मार्ट" था, असली इंसानों को जवाब पढ़ने और वोट करने के लिए कहना था। लेकिन इंसानों से पूछना धीमा, महंगा है, और कभी-कभी इंसान थक जाते हैं या इस बात पर बहस करने लगते हैं कि "मजेदार" का वास्तव में क्या मतलब है। इसलिए वैज्ञानिकों ने एक चतुर शॉर्टकट का उपयोग किया: उन्होंने एक सुपर-स्मार्ट एआई रोबट को दूसरे रोबोटों को ग्रेड देने के लिए एक जज के रूप में काम करने दिया। इसे "LLM-as-a-judge" कहा जाता है। यह एक रोबोट रेफरी को दो अन्य रोबोटों के बीच चल रहे खेल में सीटी बजाने के लिए काम पर रखने जैसा है।

हालाँकि, इन रोबोट रेफरीओं का खेल का मैदान काफी अव्यवस्थित रहा है। हर बार जब कोई नए रोबोट का परीक्षण करना चाहता था, तो उन्हें अपने स्वयं के नियमों, अपने स्वयं के रेफरी और अपनी स्वयं की स्कोरिंग प्रणाली के साथ अपना खुद का एक छोटा, अलग खेल का मैदान बनाना पड़ता था। कुछ रेफरी गुप्त, बंद-ऑफ रोबोट थे जिनके अंदर कोई झाँक नहीं सकता था, और यदि उस कंपनी ने अपने काम करने के तरीके को बदल दिया जो उनका मालिक था, तो पुराने सभी स्कोर अचानक बेकार हो जाते थे। यह दो कारों की गति की तुलना करने जैसा था जब एक को 2020 में एक ट्रैक पर मापा गया था और दूसरी को 2024 में एक अलग ट्रैक पर, अलग-अलग स्टॉपवॉच का उपयोग करके। इससे यह जानना अविश्वसनीय रूप से कठिन हो गया था कि क्या कोई रोबोट वास्तव में बेहतर हो रहा है या केवल नियम ही बदल गए थे।

यहाँ JudgeArena आता है, एक नया ओपन-सोर्स टूलकिट जो एक सार्वभौमिक अनुवादक और इन रोबोट परीक्षणों के लिए एक विशाल, निष्पक्ष अरीना (arena) के रूप में कार्य करता है। इस शोध पत्र के लेखकों ने एक एकल, एकीकृत ढांचा बनाया है जो एआई मॉडल के परीक्षण करने के सबसे लोकप्रिय तरीकों को एक स्थान पर लाता है। हर बार एक नया खेल का मैदान बनाने के बजाय, शोधकर्ता अब इस एक उपकरण का उपयोग कर सकते हैं ताकि वे विभिन्न जजों को बदल सकें, विभिन्न प्रकार के प्रश्न आजमा सकें, और अपने स्वयं के कंप्यूटरों या विभिन्न क्लाउड सेवाओं के माध्यम से परीक्षण चला सकें।

यह शोध पत्र पाता है कि इस एकीकृत प्रणाली का उपयोग करके, वे ओपन-सोर्स मॉडल्स (ऐसे रोबोट जिनके दिमाग खुले हैं ताकि कोई भी उन्हें देख सके) का उपयोग करके "ट्यून्ड" जज बना सकते हैं जो महंगे, गुप्त क्लोज्ड-मॉडल जजों के समान या उनसे भी बेहतर प्रदर्शन करते हैं। उन्होंने 33 अलग-अलग भाषाओं में इन सेटअपों का परीक्षण किया और पाया कि हालांकि कुछ भाषाएँ एआई जजों के लिए मूल्यांकन करना दूसरों की तुलना में कठिन बनाती हैं, फिर भी यह प्रणाली विश्वसनीय रूप से हमें बता सकती है कि कौन से मॉडल जीत रहे हैं। इसके अलावा, उन्होंने पाया कि इन एआई जजों को कुछ मानव वोटों के साथ जोड़कर, वे प्रसिद्ध "इलो रेटिंग" (Elo rating) प्रणाली (वही जिसका उपयोग शतरंज के खिलाड़ियों और वीडियो गेम गेमर्स को रैंक करने के लिए किया जाता है) को उच्च सटीकता के साथ सिम्युलेट कर सकते हैं। इसका अर्थ है कि डेवलपर्स अब यह अनुमान लगा सकते हैं कि उनका नया एआई मॉडल कितना अच्छा है, बिना किसी बड़े, महंगे मानव मतदान अभियान का इंतजार किए।

संक्षेप में, यह शोध पत्र सुझाव देता है कि एआई परीक्षण की अराजक, खंडित दुनिया को एक स्वच्छ, पुनरुत्पादनीय (reproducible) और पारदर्शी प्रणाली में व्यवस्थित किया जा सकता है। यह इस विचार के विरुद्ध तर्क देता है कि हमें अच्छे परिणाम प्राप्त करने के लिए अपारदर्शी, क्लोज्ड-सोर्स जजों पर निर्भर रहना ही होगा, यह दिखाते हुए कि सही सेटअप के साथ, खुले और सस्ते विकल्प भी वही काम ठीक से कर सकते हैं। लेखकों ने सिमुलेशन और मानव प्राथमिकताओं के विरुद्ध तुलनाओं का उपयोग करके इन परिणामों को मापा, जिससे पता चला कि उनका नया तरीका पुराने, कम लचीले तरीकों की तुलना में त्रुटियों को काफी कम करता है। यह एआई दुनिया को गुप्त क्लबों के संग्रह के बजाय एक निष्पक्ष, खुले स्पोर्ट्स लीग बनाने की दिशा में एक कदम है जहाँ सभी को नियम और स्कोर पता होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →