← नवीनतम पेपर
💬 NLP

SciArena: An Open Evaluation Platform for Non-Verifiable Scientific Literature-Grounded Tasks

यह शोध पत्र SciArena को प्रस्तुत करता है, जो एक समुदाय-संचालित मूल्यांकन मंच है जो ओपन-एंडेड, साहित्य-आधारित वैज्ञानिक कार्यों पर फाउंडेशन मॉडलों को रैंक करने के लिए मानव शोधकर्ता मतदान का लाभ उठाता है, साथ ही SciArena-Eval को भी जारी करता है, जो मानव प्राथमिकताओं के विरुद्ध स्वचालित मूल्यांकन प्रणालियों की सटीकता का आकलन करने के लिए डिज़ाइन किया गया एक मेटा-बेंचमार्क है।

मूल लेखक: Yilun Zhao, Kaiyan Zhang, Tiansheng Hu, Sihong Wu, Ronan Le Bras, Charles McGrady, Taira Anderson, Jonathan Bragg, Joseph Chee Chang, Jesse Dodge, Matt Latzke, Yixin Liu, Xiangru Tang, Zihang Wang, Ch
प्रकाशित 2026-01-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yilun Zhao, Kaiyan Zhang, Tiansheng Hu, Sihong Wu, Ronan Le Bras, Charles McGrady, Taira Anderson, Jonathan Bragg, Joseph Chee Chang, Jesse Dodge, Matt Latzke, Yixin Liu, Xiangru Tang, Zihang Wang, Chen Zhao, Hannaneh Hajishirzi, Doug Downey, Arman Cohan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक विशाल, उच्च-दांव वाला विज्ञान टैलेंट शो हो रहा है, लेकिन यहाँ गायन या नृत्य के बजाय, प्रतियोगी जटिल शोध प्रश्नों के उत्तर देने वाले AI रोबोट हैं। यह SciArena है, जो येल (Yale), NYU और एलन इंस्टीट्यूट फॉर AI (Allen Institute for AI) के शोधकर्ताओं द्वारा बनाया गया एक नया प्लेटफॉर्म है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. समस्या: "लाइब्रेरी" बहुत बड़ी है

आज के वैज्ञानिक सूचनाओं के ढेर में डूब रहे हैं। हर दिन नए शोध पत्र (research papers) प्रकाशित होते हैं, जिससे इंसानों के लिए सब कुछ पढ़ना असंभव हो जाता है। उन्हें इस विशाल लाइब्रेरी में सारांश निकालने और उत्तर खोजने के लिए मदद की आवश्यकता है। AI इसमें बहुत अच्छा है, लेकिन हमें यह कैसे पता चलेगा कि कौन सा AI सबसे अच्छा लाइब्रेरियन है?

पारंपरिक परीक्षण बहुविकल्पीय क्विज़ (multiple-choice quizzes) की तरह होते हैं। वे स्थिर होते हैं, और अक्सर प्रकाशित होने तक पुराने हो जाते हैं, और वे वैज्ञानिक अनुसंधान की वास्तविक दुनिया की जटिलता को नहीं पकड़ पाते।

2. समाधान: विज्ञान के लिए एक "ब्लाइंड टेस्ट"

SciArena एक अलग दृष्टिकोण अपनाता है, जो लोकप्रिय "चैटबॉट एरिना" (Chatbot Arena) से प्रेरित है। इसे कॉफी या वाइन के लिए किए जाने वाले "ब्लाइंड टेस्ट" की तरह समझें, लेकिन वैज्ञानिक उत्तरों के लिए।

  • सेटअप: एक मानव शोधकर्ता एक वास्तविक, खुले प्रश्न (जैसे, "क्वांटम कंप्यूटिंग में नवीनतम सफलताएँ क्या हैं?") पूछता है।
  • रिट्रीवल (Retrieval): सिस्टम केवल AI को अनुमान लगाने नहीं देता। यह पहले एक विशाल डिजिटल लाइब्रेरी (जिसमें 1 करोड़ से अधिक पेपर शामिल हैं) में जाता है ताकि सबसे प्रासंगिक दस्तावेज़ खोजे जा सकें। यह उन दस्तावेज़ों को दो अलग-अलग AI मॉडल्स को सौंप देता है।
  • प्रतियोगिता: दोनों AI केवल उन्हीं दस्तावेज़ों के आधार पर विस्तृत उत्तर लिखते हैं, जिसमें साइटेशन (जैसे कि फुटनोट्स) भी शामिल होते हैं।
  • वोट: मानव शोधकर्ता दोनों उत्तरों को पढ़ता है बिना यह जाने कि कौन सा उत्तर किस AI ने लिखा है। वे उस उत्तर को चुनते हैं जो अधिक मददगार, सटीक और बेहतर तरीके से लिखा गया हो।

3. स्कोरबोर्ड: "Elo" रेटिंग

हर बार जब एक AI वोट जीतता है, तो उसे अंक मिलते हैं। यदि वह हारता है, तो उसके अंक कट जाते हैं। इसे Elo रेटिंग सिस्टम कहा जाता है (वही सिस्टम जिसका उपयोग शतरंज के खिलाड़ियों को रैंक करने के लिए किया जाता है)।

  • 8 महीनों में, इस प्लेटफॉर्म ने कई क्षेत्रों (चिकित्सा से लेकर इंजीनियरिंग तक) के वास्तविक वैज्ञानिकों से 20,000 वोट एकत्र किए।
  • परिणाम एक लीडरबोर्ड है। वर्तमान में, रसोई के शीर्ष "शेफ" o3, Claude-4.1-Opus, और GPT-5 जैसे मॉडल्स हैं।

4. "जज का जज": SciArena-Eval

शोधकर्ताओं को एहसास हुआ कि मनुष्यों से वोट करवाना महंगा और धीमा है। वे जानना चाहते थे: क्या एक AI, दूसरे AI के उत्तर की गुणवत्ता को परखने के लिए जज बन सकता है?

इसे परखने के लिए, उन्होंने एक नया बेंचमार्क बनाया जिसे SciArena-Eval कहा जाता है। उन्होंने मानव वोटों को लिया और विभिन्न AI मॉडल्स को जज के रूप में कार्य करने के लिए कहा, ताकि दो उत्तरों के बीच विजेता का चयन किया जा सके।

  • परिणाम: यहाँ तक कि सबसे बुद्धिमान AI जज भी मानव विशेषज्ञों की तुलना में केवल लगभग 65% सही निर्णय ले पाए।
  • रूपक (Metaphor): यह एक खाद्य समीक्षक (food critic) से यह पूछने जैसा है कि एक पेशेवर शेफ के बीच कौन सा व्यंजन पसंद करेगा। बेहतरीन समीक्षक भी एक-तिहाई समय गलत होते हैं। यह साबित करता है कि वैज्ञानिक उत्तरों का न्याय करना अविश्वसनीय रूप से कठिन है, यहाँ तक कि AI के लिए भी।

5. मुख्य निष्कर्ष और खेल के नियम

पेपर AI और मनुष्यों के कुछ दिलचस्प व्यवहारों पर प्रकाश डालता है:

  • साइटेशन मायने रखते हैं (लेकिन मात्रा से अधिक गुणवत्ता): कुछ अन्य AI परीक्षणों में, लोग उन उत्तरों को पसंद करते थे जिनमें अधिक फुटनोट्स होते थे, भले ही वे गलत हों। SciArena में, वैज्ञानिक अधिक समझदार हैं। वे उन उत्तरों को पसंद करते हैं जहाँ फुटनोट्स वास्तव में दावे का समर्थन करते हैं। यदि कोई AI फर्जी संबंध बनाता है, तो वैज्ञानिक उसे खारिज कर देते हैं।
  • "फ्लफ" (Fluff) का अभाव: शोधकर्ताओं ने यह सुनिश्चित किया कि AI फैंसी फॉर्मेटिंग (जैसे बोल्ड टेक्स्ट, इमोजी, या बुलेट पॉइंट्स) का उपयोग करके न जीतें। उन्होंने यह सुनिश्चित करने के लिए सब कुछ हटा दिया कि वोट सामग्री (content) पर आधारित हो, न कि शैली (style) पर।
  • "सर्वश्रेष्ठ" मॉडल: o3 मॉडल को सबसे सुसंगत विजेता पाया गया। यह जटिल विचारों को स्पष्ट रूप से समझाने, सटीक वैज्ञानिक भाषा का उपयोग करने और जानकारी को तार्किक रूप से व्यवस्थित करने में उत्कृष्ट था।

सारांश

SciArena एक सामुदायिक-संचालित एरिना है जहाँ वास्तविक वैज्ञानिक इस बात पर वोट देते हैं कि वैज्ञानिक साहित्य को पढ़ने और समझने में कौन सा AI सबसे अच्छा है। यह साबित करता है कि हालांकि AI बेहतर हो रहा है, लेकिन जटिल वैज्ञानिक कार्यों के मूल्यांकन में मानव विशेषज्ञों की पूरी तरह से जगह लेने से पहले इसे अभी भी एक लंबा रास्ता तय करना है। प्लेटफॉर्म, डेटा और "जज का जज" बेंचमार्क सभी के लिए उपयोग हेतु खुले हैं ताकि बेहतर AI टूल्स बनाने में मदद मिल सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →