← नवीनतम पेपर
💬 NLP

(Towards) Scalable Reliable Automated Evaluation with Large Language Models

यह शोध पत्र एक स्केलेबल, डोमेन-अज्ञेय (domain-agnostic) ढांचे को प्रस्तुत करता है जो कई LLMs के बीच युग्मवार तुलनाओं (pairwise comparisons) और एक एलो रेटिंग सिस्टम (Elo rating system) का लाभ उठाता है ताकि समायोज्य आत्मविश्वास थ्रेसहोल्ड के साथ LLM आउटपुट के विश्वसनीय, विशेषज्ञ-स्तरीय मूल्यांकन उत्पन्न किए जा सकें, जिससे मानवीय हस्तक्षेप की आवश्यकता काफी कम हो जाती है।

मूल लेखक: Bertil Braun, Martin Forell

प्रकाशित 2026-07-31
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Bertil Braun, Martin Forell

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अराजक पुस्तकालय के संपादक हैं जहाँ रोबोटों की एक टोली द्वारा हर दिन हजारों नई पुस्तकें लिखी जा रही हैं। ये रोबोट, जिन्हें लार्ज लैंग्वेज मॉडल्स (LLMs) के रूप में जाना जाता है, अविश्वसनीय गति से कहानियाँ लिख सकते हैं, प्रश्नों के उत्तर दे सकते हैं और जटिल विचारों का सारांश निकाल सकते हैं। लेकिन इसमें एक पेच है: आपको कैसे पता चलेगा कि किस रोबोट ने सबसे अच्छी कहानी लिखी है? पुराने दिनों में, आपको हर एक पन्ने को पढ़ने, उनकी तुलना करने और इस पर बहस करने के लिए मानव पुस्तकालयाध्यक्षों की एक टीम की आवश्यकता होती कि कौन सबसे अच्छा था। इसमें बहुत समय लगता है, भारी लागत आती है, और अलग-अलग पुस्तकालयाध्यक्ष इस बात पर असहमत हो सकते हैं कि "अच्छा" होने का वास्तव में क्या अर्थ है। यह वही समस्या है जिसे आर्टिफिशियल इंटेलिजेंस के क्षेत्र में वैज्ञानिक हल करने की कोशिश कर रहे हैं: इन रोबलेट लेखन का मूल्यांकन करने का एक तरीका बनाना जो तेज़, निष्पक्ष हो और जिसमें हर शब्द को पढ़ने के लिए मानव की आवश्यकता न हो। इसे करने के लिए, वे कुछ चतुर तरकीबों का उपयोग करते हैं। पहले, वे रोबोट्स को एक-दूसरे का न्याय करने के लिए कहते हैं, जैसे कि आलोचकों का एक पैनल। दूसरा, वे शतरंज से लिया गया एक स्कोरिंग सिस्टम उपयोग करते हैं, जिसे एलो रेटिंग (Elo rating) कहा जाता है, जो खिलाड़ियों को आमने-सामने के मैचों में कौन किसे हराता है, इसके आधार पर रैंक करता है। अंत में, वे यह देखते हैं कि रोबोट जज वास्तविक मानव विशेषज्ञों के साथ कितनी अच्छी तरह सहमत होते हैं ताकि यह देखा जा सके कि क्या सिस्टम काम कर रहा है।

यह शोध पत्र इन एआई रोबोटों द्वारा उत्पन्न पाठ की गुणवत्ता का मूल्यांकन करने का एक नया, स्केलेबल तरीका पेश करता है। केवल एक रोबोट से स्कोर देने के लिए कहने के बजाय (जो पक्षपाती या असंगत हो सकता है), लेखक एक विशाल टूर्नामेंट आयोजित करते हैं। वे विभिन्न प्रकार के टेक्स्ट आउटपुट लेते हैं—जैसे कि वैज्ञानिक अनुसंधान के सारांश—और कई अलग-अलग एआई मॉडल्स को एक-दूसरे के खिलाफ "हेड-टू-हेड" मुकाबले खेलने के लिए रखते हैं। प्रत्येक मैच में, दो टेक्स्ट एक एआई जज को दिखाए जाते हैं, जिसे विशिष्ट नियमों के आधार पर यह तय करना होता है कि कौन सा बेहतर है। यह सुनिश्चित करने के लिए कि जज केवल उस टेक्स्ट को नहीं चुन रहा है जो अंत में आता है या जो अधिक लंबा है, सिस्टम टेक्स्ट का क्रम बदल देता है और विजेता घोषित करने के लिए कई अलग-अलग एआई मॉडल्स का उपयोग करता है।

एक बार जब सभी मैच खेले जाते हैं, तो परिणामों को एक एलो रेटिंग सिस्टम में फीड किया जाता है। इसे शतरंज के लीडरबोर्ड की तरह समझें: यदि कोई टेक्स्ट एक मजबूत प्रतिद्वंद्वी के विरुद्ध जीतता है, तो उसे बहुत अधिक अंक मिलते हैं; यदि वह हारता है, तो उसके अंक कम हो जाते हैं। समय के साथ, यह "सबसे अच्छे" से लेकर "सबसे खराब" तक के टेक्स्ट की एक स्पष्ट, रैंक की गई सूची बनाता है। लेखकों ने इसका परीक्षण करने के लिए एआई मॉडल्स से वैज्ञानिक एब्स्ट्रैक्ट्स के आधार पर "कॉम्पिटेंसी प्रोफाइल्स" (कि एक शोधकर्ता किस चीज़ में कुशल है) तैयार करवाए। फिर उन्होंने एआई-जनरेटेड रैंकिंग की तुलना 20 मानव विशेषज्ञों द्वारा बनाई गई रैंकिंग से की। परिणाम बताते हैं कि जब कई एआई मॉडल मिलकर वोट करते हैं, तो उनकी रैंकिंग मानव विशेषज्ञों के साथ आश्चर्यजनक रूप से मेल खाती है। वास्तव में, एक साधारण बहुमत वोट (जहाँ एआई को विजेता घोषित करने के लिए केवल 50% सहमति की आवश्यकता होती है) पूर्ण सर्वसम्मति की मांग करने की तुलना में बेहतर काम कर गया, क्योंकि पूर्ण सर्वसम्मति अक्सर बहुत अधिक "ड्रॉ" (बराबरी) की ओर ले जाती थी और कोई स्पष्ट विजेता नहीं मिलता था। यह अध्ययन दिखाता है कि यह तरीका मानवों के भारी श्रम की आवश्यकता को काफी कम कर सकता है, जो एआई-जनरेटेड सामग्री के विशाल भंडार को छाँटने का एक विश्वसनीय, स्वचालित तरीका प्रदान करता है। हालाँकि, लेखक नोट करते हैं कि यह प्रक्रिया अभी भी कम्प्यूटेशनल रूप से महंगी है, जिसमें कई तुलनाओं की आवश्यकता होती है, और यह तब सबसे अच्छा काम करती है जब एक-दूसरे की खामियों और पूर्वाग्रहों को संतुलित करने के लिए कई अलग-अलग एआई मॉडल्स का उपयोग किया जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →