SciArena: An Open Evaluation Platform for Non-Verifiable Scientific Literature-Grounded Tasks
यह शोध पत्र SciArena को प्रस्तुत करता है, जो एक समुदाय-संचालित मूल्यांकन मंच है जो ओपन-एंडेड, साहित्य-आधारित वैज्ञानिक कार्यों पर फाउंडेशन मॉडलों को रैंक करने के लिए मानव शोधकर्ता मतदान का लाभ उठाता है, साथ ही SciArena-Eval को भी जारी करता है, जो मानव प्राथमिकताओं के विरुद्ध स्वचालित मूल्यांकन प्रणालियों की सटीकता का आकलन करने के लिए डिज़ाइन किया गया एक मेटा-बेंचमार्क है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक विशाल, उच्च-दांव वाला विज्ञान टैलेंट शो हो रहा है, लेकिन यहाँ गायन या नृत्य के बजाय, प्रतियोगी जटिल शोध प्रश्नों के उत्तर देने वाले AI रोबोट हैं। यह SciArena है, जो येल (Yale), NYU और एलन इंस्टीट्यूट फॉर AI (Allen Institute for AI) के शोधकर्ताओं द्वारा बनाया गया एक नया प्लेटफॉर्म है।
यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:
1. समस्या: "लाइब्रेरी" बहुत बड़ी है
आज के वैज्ञानिक सूचनाओं के ढेर में डूब रहे हैं। हर दिन नए शोध पत्र (research papers) प्रकाशित होते हैं, जिससे इंसानों के लिए सब कुछ पढ़ना असंभव हो जाता है। उन्हें इस विशाल लाइब्रेरी में सारांश निकालने और उत्तर खोजने के लिए मदद की आवश्यकता है। AI इसमें बहुत अच्छा है, लेकिन हमें यह कैसे पता चलेगा कि कौन सा AI सबसे अच्छा लाइब्रेरियन है?
पारंपरिक परीक्षण बहुविकल्पीय क्विज़ (multiple-choice quizzes) की तरह होते हैं। वे स्थिर होते हैं, और अक्सर प्रकाशित होने तक पुराने हो जाते हैं, और वे वैज्ञानिक अनुसंधान की वास्तविक दुनिया की जटिलता को नहीं पकड़ पाते।
2. समाधान: विज्ञान के लिए एक "ब्लाइंड टेस्ट"
SciArena एक अलग दृष्टिकोण अपनाता है, जो लोकप्रिय "चैटबॉट एरिना" (Chatbot Arena) से प्रेरित है। इसे कॉफी या वाइन के लिए किए जाने वाले "ब्लाइंड टेस्ट" की तरह समझें, लेकिन वैज्ञानिक उत्तरों के लिए।
- सेटअप: एक मानव शोधकर्ता एक वास्तविक, खुले प्रश्न (जैसे, "क्वांटम कंप्यूटिंग में नवीनतम सफलताएँ क्या हैं?") पूछता है।
- रिट्रीवल (Retrieval): सिस्टम केवल AI को अनुमान लगाने नहीं देता। यह पहले एक विशाल डिजिटल लाइब्रेरी (जिसमें 1 करोड़ से अधिक पेपर शामिल हैं) में जाता है ताकि सबसे प्रासंगिक दस्तावेज़ खोजे जा सकें। यह उन दस्तावेज़ों को दो अलग-अलग AI मॉडल्स को सौंप देता है।
- प्रतियोगिता: दोनों AI केवल उन्हीं दस्तावेज़ों के आधार पर विस्तृत उत्तर लिखते हैं, जिसमें साइटेशन (जैसे कि फुटनोट्स) भी शामिल होते हैं।
- वोट: मानव शोधकर्ता दोनों उत्तरों को पढ़ता है बिना यह जाने कि कौन सा उत्तर किस AI ने लिखा है। वे उस उत्तर को चुनते हैं जो अधिक मददगार, सटीक और बेहतर तरीके से लिखा गया हो।
3. स्कोरबोर्ड: "Elo" रेटिंग
हर बार जब एक AI वोट जीतता है, तो उसे अंक मिलते हैं। यदि वह हारता है, तो उसके अंक कट जाते हैं। इसे Elo रेटिंग सिस्टम कहा जाता है (वही सिस्टम जिसका उपयोग शतरंज के खिलाड़ियों को रैंक करने के लिए किया जाता है)।
- 8 महीनों में, इस प्लेटफॉर्म ने कई क्षेत्रों (चिकित्सा से लेकर इंजीनियरिंग तक) के वास्तविक वैज्ञानिकों से 20,000 वोट एकत्र किए।
- परिणाम एक लीडरबोर्ड है। वर्तमान में, रसोई के शीर्ष "शेफ" o3, Claude-4.1-Opus, और GPT-5 जैसे मॉडल्स हैं।
4. "जज का जज": SciArena-Eval
शोधकर्ताओं को एहसास हुआ कि मनुष्यों से वोट करवाना महंगा और धीमा है। वे जानना चाहते थे: क्या एक AI, दूसरे AI के उत्तर की गुणवत्ता को परखने के लिए जज बन सकता है?
इसे परखने के लिए, उन्होंने एक नया बेंचमार्क बनाया जिसे SciArena-Eval कहा जाता है। उन्होंने मानव वोटों को लिया और विभिन्न AI मॉडल्स को जज के रूप में कार्य करने के लिए कहा, ताकि दो उत्तरों के बीच विजेता का चयन किया जा सके।
- परिणाम: यहाँ तक कि सबसे बुद्धिमान AI जज भी मानव विशेषज्ञों की तुलना में केवल लगभग 65% सही निर्णय ले पाए।
- रूपक (Metaphor): यह एक खाद्य समीक्षक (food critic) से यह पूछने जैसा है कि एक पेशेवर शेफ के बीच कौन सा व्यंजन पसंद करेगा। बेहतरीन समीक्षक भी एक-तिहाई समय गलत होते हैं। यह साबित करता है कि वैज्ञानिक उत्तरों का न्याय करना अविश्वसनीय रूप से कठिन है, यहाँ तक कि AI के लिए भी।
5. मुख्य निष्कर्ष और खेल के नियम
पेपर AI और मनुष्यों के कुछ दिलचस्प व्यवहारों पर प्रकाश डालता है:
- साइटेशन मायने रखते हैं (लेकिन मात्रा से अधिक गुणवत्ता): कुछ अन्य AI परीक्षणों में, लोग उन उत्तरों को पसंद करते थे जिनमें अधिक फुटनोट्स होते थे, भले ही वे गलत हों। SciArena में, वैज्ञानिक अधिक समझदार हैं। वे उन उत्तरों को पसंद करते हैं जहाँ फुटनोट्स वास्तव में दावे का समर्थन करते हैं। यदि कोई AI फर्जी संबंध बनाता है, तो वैज्ञानिक उसे खारिज कर देते हैं।
- "फ्लफ" (Fluff) का अभाव: शोधकर्ताओं ने यह सुनिश्चित किया कि AI फैंसी फॉर्मेटिंग (जैसे बोल्ड टेक्स्ट, इमोजी, या बुलेट पॉइंट्स) का उपयोग करके न जीतें। उन्होंने यह सुनिश्चित करने के लिए सब कुछ हटा दिया कि वोट सामग्री (content) पर आधारित हो, न कि शैली (style) पर।
- "सर्वश्रेष्ठ" मॉडल: o3 मॉडल को सबसे सुसंगत विजेता पाया गया। यह जटिल विचारों को स्पष्ट रूप से समझाने, सटीक वैज्ञानिक भाषा का उपयोग करने और जानकारी को तार्किक रूप से व्यवस्थित करने में उत्कृष्ट था।
सारांश
SciArena एक सामुदायिक-संचालित एरिना है जहाँ वास्तविक वैज्ञानिक इस बात पर वोट देते हैं कि वैज्ञानिक साहित्य को पढ़ने और समझने में कौन सा AI सबसे अच्छा है। यह साबित करता है कि हालांकि AI बेहतर हो रहा है, लेकिन जटिल वैज्ञानिक कार्यों के मूल्यांकन में मानव विशेषज्ञों की पूरी तरह से जगह लेने से पहले इसे अभी भी एक लंबा रास्ता तय करना है। प्लेटफॉर्म, डेटा और "जज का जज" बेंचमार्क सभी के लिए उपयोग हेतु खुले हैं ताकि बेहतर AI टूल्स बनाने में मदद मिल सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।