← नवीनतम पेपर
💬 NLP

OpenCompass: A Universal Evaluation Platform for Large Language Models

यह शोध पत्र OpenCompass को प्रस्तुत करता है, जो एक ओपन-सोर्स, स्केलेबल और उच्च-समानांतरता (high-concurrency) वाला मूल्यांकन मंच है, जिसे विविध डोमेन में बड़े भाषा मॉडलों के व्यापक और कुशल मूल्यांकन के लिए एक मॉड्यूलर, एकीकृत ढांचे के माध्यम से पारंपरिक स्थिर बेंचमार्क की सीमाओं को दूर करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Maosong Cao, Kai Chen, Haodong Duan, Yixiao Fang, Tong Gao, Ge Jiaye, Mo Li, Hongwei Liu, Junnan Liu, Yuan Liu, Chengqi Lyu, Han Lyu, Ningsheng Ma, Zerun Ma, Yu Sun, Zhiyong Wu, Linchen Xiao, Jun Xu
प्रकाशित 2026-05-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Maosong Cao, Kai Chen, Haodong Duan, Yixiao Fang, Tong Gao, Ge Jiaye, Mo Li, Hongwei Liu, Junnan Liu, Yuan Liu, Chengqi Lyu, Han Lyu, Ningsheng Ma, Zerun Ma, Yu Sun, Zhiyong Wu, Linchen Xiao, Jun Xu, Haochen Ye, Zhaohui Yu, Yike Yuan, Songyang Zhang, Yufeng Zhao, Fengzhe Zhou, Peiheng Zhou, Dongsheng Zhu, Lin Zhu, Jingming Zhuo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया की कल्पना एक विशाल, हलचल भरे निर्माण स्थल (construction site) के रूप में करें। वर्षों तक, बिल्डरों ने एक समय में एक विशिष्ट चीज़ बनाने के लिए छोटे, विशेष उपकरणों का उपयोग किया। लेकिन हाल ही में, उन्होंने "विशाल मस्तिष्क" (लार्ज लैंग्वेज मॉडल्स या LLMs) बनाना शुरू कर दिया है जो लगभग कुछ भी कर सकते हैं: कविता लिख सकते हैं, गणित की समस्याओं को हल कर सकते हैं, कोड लिख सकते हैं और चिकित्सा संबंधी सलाह दे सकते हैं।

समस्या क्या है? आप कैसे जानेंगे कि ये विशाल मस्तिष्क वास्तव में स्मार्ट हैं, या सिर्फ भाग्यशाली हैं? आप उनसे सीधे यह नहीं पूछ सकते, "क्या तुम अच्छे हो?" क्योंकि वे झूठ बोल सकते हैं या भ्रमित हो सकते हैं। आपको एक कठोर परीक्षण की आवश्यकता है।

यहीं पर OpenCompass काम आता है। OpenCompass को एक एकल परीक्षण के रूप में नहीं, बल्कि एक विशाल, स्वचालित परीक्षण कारखाने के रूप में समझें।

समस्या: एक अव्यवस्थित कार्यशाला (A Messy Workshop)

OpenCompass से पहले, इन मॉडल्स का परीक्षण करना एक ऐसी अराजक कक्षा में परीक्षा ग्रेड करने जैसा था जहाँ हर शिक्षक एक अलग ग्रेडिंग प्रणाली का उपयोग कर रहा था।

  • अराजकता: कुछ शिक्षकों ने लाल पेन का उपयोग किया, दूसरों ने नीले का। कुछ ने सटीक वर्तनी (spelling) की जाँच की, दूसरों ने उत्तर की "भावना" को देखा। कुछ परीक्षण कागज पर थे, तो कुछ कंप्यूटर पर।
  • बाधा (Bottleneck): यदि आप किसी मॉडल का 100 अलग-अलग विषयों (जैसे इतिहास, कोडिंग और विज्ञान) पर परीक्षण करना चाहते थे, तो आपको 100 अलग-अलग, धीमी, मैनुअल प्रक्रियाओं को चलाना पड़ता था। यह धीमा, खंडित और तुलना करने में कठिन था।

समाधान: द OpenCompass फैक्ट्री

लेखकों ने OpenCompass को एक सार्व通用 (universal), वन-स्टॉप टेस्टिंग हब के रूप में बनाया है। उन्होंने इसे एक "लेगो" (Lego) दर्शन के साथ डिज़ाइन किया है: सब कुछ मॉड्यूलर है। आप अपनी ज़रूरत का सटीक परीक्षण बनाने के लिए विभिन्न हिस्सों को आपस में जोड़ सकते हैं।

यहाँ बताया गया है कि यह कारखाना कैसे काम करता है, जिसे सरल चरणों में विभाजित किया गया है:

1. ब्लूप्रिंट (कॉन्फ़िगरेशन सिस्टम)

कारखाना शुरू होने से पहले, आपको एक ब्लूप्रिंट की आवश्यकता होती है। OpenCompass में, यह कॉन्फ़िगरेशन सिस्टम है।

  • यह क्या करता है: आप सिस्टम को बताते हैं, "मैं मॉडल A का गणित के डेटासेट पर एक विशिष्ट शैली के प्रश्नों के साथ परीक्षण करना चाहता हूँ।"
  • जादू: यह एक सार्वभौमिक अनुवादक की तरह है। चाहे आप Hugging Face का मॉडल उपयोग कर रहे हों, एक तेज़ API, या एक कस्टम-निर्मित मस्तिष्क, OpenCompass उनकी भाषा बोलता है और नियम निर्धारित करता है ताकि वे सभी एक ही मानकों के तहत खेल सकें।

2. असेंबली लाइन (पार्टिशनिंग और पैरेललिज्म)

हजारों प्रश्नों पर एक विशाल मॉडल का परीक्षण करने में बहुत समय लगता है। यदि आप इसे एक-एक करके करते, तो इसमें अनंत समय लगता।

  • रणनीति: OpenCompass एक पार्टिशनर (Partitioner) का उपयोग करता है जो प्रश्नों के विशाल ढेर को छोटे, आसान टुकड़ों में काट देता है।
  • शक्ति: एक कार्यकर्ता (कंप्यूटर) के बजाय 100 कार्यकर्ताओं की टीम की कल्पना करें। रनर (Runner) इन छोटे टुकड़ों को एक ही समय में सभी 100 कार्यकर्ताओं को भेज देता है। इसे हाई कॉन्करेंसी (high concurrency) कहा जाता है। यह उस कार्य को जो शायद दिनों में पूरा होता, घंटों में बदल देता है।

3. वर्कर्स (टास्क)

एक बार जब टुकड़े तैयार हो जाते हैं, तो टास्क (Tasks) काम पर लग जाते हैं। दो मुख्य प्रकार के वर्कर्स होते हैं:

  • इन्फरेंस वर्कर (Inference Worker): यह वर्कर AI मॉडल को प्रश्न खिलाता है और उत्तर एकत्र करता है।
  • ग्रेडिंग वर्कर (Grading Worker): यह वर्कर AI के उत्तरों को लेता है और उनकी तुलना सही उत्तरों (या "गोल्ड स्टैंडर्ड") से करता है।

4. ग्रेडिंग सिस्टम (इवैल्यूएटर्स)

आप उत्तरों को कैसे ग्रेड करते हैं? OpenCompass के पास तीन चतुर तरीके हैं, जैसे अलग-अलग प्रकार के शिक्षकों वाला एक स्कूल:

  • नियम-आधारित शिक्षक (Rule-Based Teacher): गणित या बहुविकल्पीय प्रश्नों के लिए, यह शिक्षक सख्त नियमों का उपयोग करता है (जैसे कैलकुलेटर)। यदि उत्तर "42" है, तो यह सही है। यदि "43" है, तो यह गलत है। तेज़ और सस्ता।
  • "AI जज" शिक्षक: रचनात्मक लेखन या जटिल बहसों के लिए, कोई एक एकल "सही" उत्तर नहीं होता है। इसलिए, OpenCompass एक दूसरे AI को जज के रूप में काम करने के लिए काम पर रखता है। यह "जज AI" उत्तर को पढ़ता है और इस आधार पर स्कोर देता है कि वह कितना तार्किक, प्रवाहपूर्ण या सहायक है।
  • हाइब्रिड शिक्षक: यह दोनों का सबसे अच्छा मिश्रण है। पहले, नियम-आधारित शिक्षक आसान चीजों की जल्दी से जाँच करता है। यदि उत्तर कठिन है, तो वह इसे AI जज के पास भेज देता है। यह सटीकता बनाए रखते हुए पैसा और समय बचाता है।

5. रिपोर्ट कार्ड (विज़ुअलाइज़ेशन)

अंत में, सभी स्कोर एक विज़ुअलाइज़ेशन (Visualization) डैशबोर्ड में एकत्र किए जाते हैं।

  • एक बिखरी हुई स्प्रेडशीट के बजाय, आपको एक स्पष्ट, रंगीन रिपोर्ट कार्ड मिलता है। यह आपको स्पष्ट रूप से दिखाता है कि AI कहाँ जीनियस है (जैसे, "कोडिंग में महान!") और कहाँ उसे संघर्ष करना पड़ता है (जैसे, "लंबी कहानियों में खराब!")।

यह क्या टेस्ट कर सकता है?

OpenCompass परीक्षण के लिए एक स्विस आर्मी नाइफ (Swiss Army Knife) की तरह है। यह 100 से अधिक विभिन्न प्रकार के परीक्षणों का समर्थन करता है, जिनमें शामिल हैं:

  • ज्ञान (Knowledge): क्या AI इतिहास और विज्ञान के तथ्यों को जानता है?
  • तर्क (Reasoning): क्या यह तर्क पहेलियों को हल कर सकता है?
  • गणित और कोड (Math & Code): क्या यह कैलकुलस कर सकता है या सॉफ्टवेयर लिख सकता है?
  • भाषा (Language): क्या यह विभिन्न भाषाओं को धाराप्रवाह बोल सकता है?
  • लंबा टेक्स्ट (Long Text): क्या यह पूरी किताब पढ़ सकता है और विवरण याद रख सकता है?

निचोड़ (The Bottom Line)

पेपर का दावा है कि OpenCompass "अव्यवस्थित कार्यशाला" की समस्या को हल करता है। परीक्षण प्रक्रिया को मॉड्यूलर, तेज़ और मानकीकृत बनाकर, यह शोधकर्ताओं और कंपनियों को यह देखने का एक विश्वसनीय तरीका देता है कि उनके AI मॉडल वास्तव में कितने अच्छे हैं। यह केवल यह नहीं बताता कि एक मॉडल स्मार्ट है या नहीं; यह बताता है कि वह कहाँ स्मार्ट है और उसे कहाँ और अधिक अध्ययन करने की आवश्यकता है।

लेखकों ने इस "कारखाने" को ओपन-सोर्स बना दिया है, जिसका अर्थ है कि कोई भी इसे डाउनलोड कर सकता है, अपनी स्वयं की टेस्टिंग लाइन बना सकता है, और AI के भविष्य को बेहतर बनाने में मदद कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →